☆ حفظ Masked Self-Attention — لماذا لا يُسمح للـ Decoder برؤية الرموز المستقبلية

05/23/2026

Masked Self-Attention هو آلية داخل Transformer Decoder تقيّد نطاق الـ attention بحيث لا يستطيع الرمز الحالي رؤية الرموز المستقبلية. بهذه الطريقة يتعلم النموذج التنبؤ بالرمز التالي اعتمادًا فقط على الرموز التي ظهرت حتى الآن، من دون أن يطّلع على إجابة لم يكن ينبغي أن تكون متاحة بعد.

ببساطة: إذا طُلب من شخص تخمين الكلمة التالية، لكنه استطاع رؤية الإجابة في الجزء اللاحق من النص، فلن يكون ذلك قياسًا حقيقيًا للفهم. يقوم Masked Self-Attention بإخفاء الكلمات التي لم يتم توليدها بعد، حتى يعتمد النموذج على السياق السابق فقط عند توقع الرمز التالي.

يحجب Masked Self-Attention الرموز المستقبلية حتى يتنبأ النموذج بالرمز التالي اعتمادًا فقط على السياق المتاح.

آلية العمل (المبدأ والخصائص)

الأهمية والقيود

يُعد Masked Self-Attention البنية الأساسية التي تمكّن Transformer Decoder من التنبؤ بالرمز التالي من دون رؤية المعلومات المستقبلية. بفضل هذه الآلية، تبقى ظروف التدريب قريبة من ظروف التوليد الحقيقية، كما تشكل الأساس الذي تعتمد عليه autoregressive language models مثل GPT. ومع ذلك، فإن حساب attention على جميع الرموز السابقة يجعل التكلفة ترتفع كلما طال السياق. لذلك تستخدم الأنظمة الحديثة KV Cache لتسريع الاستدلال، إلى جانب Sliding Window Attention أو Sparse Attention لتقليل تكلفة معالجة long context.

قراءات تمهيدية مقترحة (3/4)

+1

قراءات مقترحة للمتابعة (5/19)

+5

مقالات حول الموضوع نفسه (4/4)

مفاهيم ذات صلة (0/0)

لا توجد مقالات عن مفاهيم ذات صلة بعد.

📍 موقع هذا المفهوم في خريطة تعلّم الذكاء الاصطناعي

تعرّف على موقع هذا المفهوم ضمن AI Universe بالكامل.

📍 موقعك الحالي في AI Universe

إعادة تعيين إظهار المكتمل · تسجيل الدخول مطلوب جارٍ التحميل…

🌌 AI Universe

⭐ المفهوم

اختر نجمة.

عرض AI Universe بالكامل

« Vocabulary Projection —…|النمذجة الانحدارية التلق… »

🔖 الوسوم: Attention Mechanism · autoregressive-modeling · causal mask · gpt-architecture · Masked Self-Attention · Transformer Decoder