☆ حفظ Output Embedding Shifted Right — ما الفرق بين Shift و Causal Masking؟

05/24/2026

Output Embedding Shifted Right هو أسلوب في Transformer Decoder يتم فيه إزاحة تسلسل الهدف خطوة واحدة إلى اليمين قبل استخدامه كإدخال. تمنع هذه البنية النموذج من رؤية الإجابة الحالية مباشرة، وتجبره على الاعتماد فقط على التوكنات السابقة للتنبؤ بالتوكن التالي. بهذه الطريقة يصبح التدريب autoregressive ممكناً بصورة صحيحة.

ببساطة: عند كتابة جملة، يجب اختيار الكلمة التالية اعتماداً فقط على الكلمات التي كُتبت مسبقاً. في جملة مثل “أنا أحب الذكاء الاصطناعي”، يجب أن يرى النموذج “أنا” فقط قبل أن يتوقع “أحب”. إذا كانت كلمة “أحب” موجودة بالفعل داخل الإدخال، فلن يتعلم النموذج التنبؤ، بل سيتعلم نسخ الإجابة. Output Embedding Shifted Right يمنع هذه المشكلة ويجعل النموذج يتعلم فعلياً مهمة next token prediction.

يتم إزاحة الإدخال خطوة واحدة إلى اليمين مع الحفاظ على محاذاة الإخراج مع التوكن الهدف الحالي.

آلية العمل والخصائص

الأهمية والقيود

يُعد Output Embedding Shifted Right بنية أساسية تمنع الـ Decoder من رؤية الإجابة الحالية مباشرة، مما يحوّل توليد التسلسل إلى مشكلة حقيقية للتنبؤ بالتوكن التالي. تقوم عملية Shift بمحاذاة الإدخال والإخراج عبر إزاحة التوكنات خطوة واحدة إلى اليمين، بينما يقوم Causal Masking بحجب المعلومات المستقبلية داخل Attention. يجب أن يعمل الاثنان معاً حتى يتم تدريب Transformer Decoder بطريقة autoregressive صحيحة. يتيح هذا للنموذج تعلّم التسلسل كاملاً بالتوازي مع الحفاظ على التوليد التدريجي من اليسار إلى اليمين أثناء الاستدلال. ومع ذلك، فإن الفرق بين استخدام الإجابات الصحيحة أثناء التدريب واستخدام التوكنات المولدة أثناء الاستدلال يؤدي إلى مشكلة Exposure Bias، حيث يمكن أن تستمر الأخطاء المبكرة في التأثير على جودة التوليد اللاحقة.

قراءات تمهيدية مقترحة (3/5)

+2

قراءات مقترحة للمتابعة (5/15)

+5

مقالات حول الموضوع نفسه (2/2)

مفاهيم ذات صلة (0/0)

لا توجد مقالات عن مفاهيم ذات صلة بعد.

📍 موقع هذا المفهوم في خريطة تعلّم الذكاء الاصطناعي

تعرّف على موقع هذا المفهوم ضمن AI Universe بالكامل.

📍 موقعك الحالي في AI Universe

إعادة تعيين إظهار المكتمل · تسجيل الدخول مطلوب جارٍ التحميل…

🌌 AI Universe

⭐ المفهوم

اختر نجمة.

عرض AI Universe بالكامل

« Next-Token Prediction —…|توليد النصوص (Text Gener… »

🔖 الوسوم: Autoregressive Learning · causal masking · Deep Learning · GPT · next-token prediction · Transformer Decoder