☆ حفظ Output Embedding Shifted Right — ما الفرق بين Shift و Causal Masking؟
05/24/2026
Output Embedding Shifted Right هو أسلوب في Transformer Decoder يتم فيه إزاحة تسلسل الهدف خطوة واحدة إلى اليمين قبل استخدامه كإدخال. تمنع هذه البنية النموذج من رؤية الإجابة الحالية مباشرة، وتجبره على الاعتماد فقط على التوكنات السابقة للتنبؤ بالتوكن التالي. بهذه الطريقة يصبح التدريب autoregressive ممكناً بصورة صحيحة.
ببساطة: عند كتابة جملة، يجب اختيار الكلمة التالية اعتماداً فقط على الكلمات التي كُتبت مسبقاً. في جملة مثل “أنا أحب الذكاء الاصطناعي”، يجب أن يرى النموذج “أنا” فقط قبل أن يتوقع “أحب”. إذا كانت كلمة “أحب” موجودة بالفعل داخل الإدخال، فلن يتعلم النموذج التنبؤ، بل سيتعلم نسخ الإجابة. Output Embedding Shifted Right يمنع هذه المشكلة ويجعل النموذج يتعلم فعلياً مهمة next token prediction.
يتم إزاحة الإدخال خطوة واحدة إلى اليمين مع الحفاظ على محاذاة الإخراج مع التوكن الهدف الحالي.
آلية العمل والخصائص
-
بنية Shifted Input
- إذا كان تسلسل الهدف هو “أنا، أحب، الذكاء الاصطناعي”، فإن إدخال الـ Decoder يصبح “<start>، أنا، أحب” بعد الإزاحة خطوة واحدة إلى اليمين.
- يبقى هدف الإخراج هو التسلسل الأصلي نفسه: “أنا، أحب، الذكاء الاصطناعي”.
- لذلك، عند الموضع الذي يتوقع “أحب”، لا يرى النموذج إلا “أنا”.
- هذه المحاذاة تجعل النموذج يتنبأ بالتوكن التالي اعتماداً على السياق السابق، لا على الإجابة الحالية.
-
منع نسخ الإجابة
- إذا لم تُستخدم الإزاحة، تصبح مواضع الإدخال والإخراج متطابقة.
- عندها يستطيع النموذج تعلّم trivial mapping عبر رؤية yₜ في الإدخال ثم إعادة إنتاج yₜ في الإخراج.
- قد يبدو خطأ التدريب منخفضاً، لكن قدرة التوليد الحقيقية لا تتكوّن فعلياً.
- Output Embedding Shifted Right يحوّل هدف التدريب من “النسخ” إلى “التنبؤ”.
-
محاذاة الإدخال والإخراج
- في بنية Shift، يمثل الإدخال عند الموضع t السياق السابق للإخراج عند الموضع t.
- أي أن النموذج عند توقع yₜ لا يستطيع استخدام إلا y₁ حتى yₜ₋₁.
- وبما أن محاذاة الإدخال والهدف محددة مسبقاً، يستطيع Transformer حساب جميع التوقعات بالتوازي.
- ولهذا لا يحتاج Transformer إلى معالجة التوكنات واحداً تلو الآخر كما في RNN أثناء التدريب.
-
Teacher Forcing
- أثناء التدريب تُستخدم التوكنات الصحيحة كإدخال بدلاً من توقعات النموذج السابقة.
- على سبيل المثال، عند توقع “الذكاء الاصطناعي”، يدخل إلى النموذج السياق الصحيح “أنا، أحب”.
- هذا الأسلوب يجعل التدريب أسرع وأكثر استقراراً.
- لكن أثناء الاستدلال يجب على النموذج استخدام التوكنات التي ولّدها بنفسه كإدخال لاحق.
-
الفرق بين Shift و Causal Masking
- Shift يحدد ما الذي يدخل إلى الـ Decoder كإدخال.
- Causal Masking يحدد إلى أي موضع يمكن لآلية Attention أن تنظر.
- إذا وُجد Shift من دون Masking، فقد تظل Attention قادرة على رؤية التوكنات المستقبلية.
- وإذا وُجد Masking من دون Shift، فسيبقى التوكن الصحيح الحالي داخل الإدخال، مما يؤدي إلى مشكلة النسخ.
- لذلك فإن Shift و Causal Masking ليسا بديلين لبعضهما، بل آليتان متكاملتان.
-
\[ P(y_1,\dots,y_T)=\prod_{t=1}^{T} P(y_t \mid y_1,\dots,y_{t-1}) \]
\[ \hat{y}_t = f(y_1,\dots,y_{t-1}) \]
يتم توقع التوكن عند الموضع t اعتماداً فقط على التوكنات من الموضع الأول حتى الموضع t-1. تجعل بنية Shifted Right هذا الشرط الاحتمالي متحققاً فعلياً في محاذاة الإدخال والإخراج.
-
الفرق بين التدريب والاستدلال
- أثناء التدريب، تُزاح التوكنات الصحيحة إلى اليمين، لذلك يتعلم النموذج دائماً من سياق نظيف.
- أثناء الاستدلال، لا تكون الإجابة الصحيحة متاحة، لذلك يعتمد النموذج على التوكنات التي ولّدها بنفسه.
- إذا حدث خطأ مبكر في التوقعات، فقد تنتقل هذه الأخطاء إلى الخطوات اللاحقة وتتراكم تدريجياً.
- تُعرف هذه المشكلة باسم Exposure Bias، وهي من أسباب تراجع جودة النصوص الطويلة.
-
مثال عملي في GPT
- إذا كانت الجملة “Deep learning is”، فقد يتوقع النموذج التوكن التالي مثل “powerful”.
- رغم أن الجملة الكاملة متاحة أثناء التدريب، يتم دائماً إزاحة إدخال الـ Decoder بحيث يرى النموذج التوكنات السابقة فقط.
- عند توقع “powerful”، لا يرى النموذج سوى “Deep·learning·is”.
- وهذه البنية هي أيضاً الأساس الذي تعتمد عليه نماذج Decoder-only Language Model مثل GPT.
الأهمية والقيود
يُعد Output Embedding Shifted Right بنية أساسية تمنع الـ Decoder من رؤية الإجابة الحالية مباشرة، مما يحوّل توليد التسلسل إلى مشكلة حقيقية للتنبؤ بالتوكن التالي. تقوم عملية Shift بمحاذاة الإدخال والإخراج عبر إزاحة التوكنات خطوة واحدة إلى اليمين، بينما يقوم Causal Masking بحجب المعلومات المستقبلية داخل Attention. يجب أن يعمل الاثنان معاً حتى يتم تدريب Transformer Decoder بطريقة autoregressive صحيحة. يتيح هذا للنموذج تعلّم التسلسل كاملاً بالتوازي مع الحفاظ على التوليد التدريجي من اليسار إلى اليمين أثناء الاستدلال. ومع ذلك، فإن الفرق بين استخدام الإجابات الصحيحة أثناء التدريب واستخدام التوكنات المولدة أثناء الاستدلال يؤدي إلى مشكلة Exposure Bias، حيث يمكن أن تستمر الأخطاء المبكرة في التأثير على جودة التوليد اللاحقة.
قراءات تمهيدية مقترحة (3/5)
+2
- 7.2 Attention and Language Modeling Basics — التنبؤ بالـ token التالي والمبدأ الأساسي لـ Query–Key–Value
- Causal Masking — لماذا تُعد جزءًا أساسيًا من Autoregressive Language Model؟
- من RNN إلى Transformer: كيف تطورت طريقة معالجة البيانات المتسلسلة؟
- تصنيف التسلسلات (Sequence Classification) — لماذا تؤثر طريقة تلخيص التسلسل في الأداء النهائي؟ الجزء 1 من 3
- Packed Sequence — طريقة تقليل هدر Padding في نماذج RNN
قراءات مقترحة للمتابعة (5/15)
+5
- 7.5 مُفكك Transformer، رأس نمذجة اللغة، واستراتيجيات فك الترميز — طريقة تحويل الرموز إلى احتمالات واختيارها
- Variable-Length Mapping — مواءمة التسلسلات ذات الأطوال المختلفة بين الإدخال والإخراج
- Variable-Length Sequence — كيف تتعامل النماذج مع التسلسلات المختلفة الطول
- Decoupled RoPE — لماذا نفصل دوران الموضع في السياقات الطويلة؟
- Long Sequence Degradation (تدهور الأداء في التسلسلات الطويلة) — مشكلة ضعف المعلومات المهمة في السياقات الممتدة
- Autoregressive vs Non-Autoregressive — التوليد التسلسلي والتوليد المتوازي في نماذج التوليد
- Short-Term vs Long-Term Dependency — الاعتماد قصير المدى مقابل الاعتماد طويل المدى
- Long-Term Dependency (الاعتماد طويل المدى) — التحدي الأساسي للنماذج التسلسلية حيث تؤثر المعلومات القديمة على التنبؤات الحالية
- Sequence-to-Sequence Model (Seq2Seq Model) — نموذج يحوّل تسلسلاً من المدخلات إلى تسلسل من المخرجات
- Transformer-XL — لماذا يفقد Transformer ذو الطول الثابت السياق الطويل؟
- Sequence Length vs Context Window — ما الفرق بينهما في نماذج LLM
- Deterministic Decoding — لماذا ينتج الإدخال نفسه المخرجات نفسها دائماً؟
- Decoding في نماذج اللغة — لماذا يختلف الناتج رغم استخدام النموذج نفسه؟
- Error Propagation — لماذا تتراكم الأخطاء في نماذج Autoregressive؟ الجزء 1/3
- Local Dependency — مبدأ اعتماد النماذج التسلسلية على المعلومات القريبة
مقالات حول الموضوع نفسه (2/2)
- Sequence Labeling — فهم بنية النص من خلال تصنيف كل Token واستخدام CRF
- Special Tokens — رموز خاصة للتحكم في حدود التسلسل والمدخلات الاستثنائية
مفاهيم ذات صلة (0/0)
لا توجد مقالات عن مفاهيم ذات صلة بعد.
📍 موقع هذا المفهوم في خريطة تعلّم الذكاء الاصطناعي
تعرّف على موقع هذا المفهوم ضمن AI Universe بالكامل.
📍 موقعك الحالي في AI Universe
☰
إعادة تعيين إظهار المكتمل · تسجيل الدخول مطلوب جارٍ التحميل…
🌌 AI Universe
‹
›
⭐ المفهوم
اختر نجمة.
« Next-Token Prediction —…|توليد النصوص (Text Gener… »
🔖 الوسوم: Autoregressive Learning · causal masking · Deep Learning · GPT · next-token prediction · Transformer Decoder