☆ حفظ Masked Self-Attention — لماذا لا يُسمح للـ Decoder برؤية الرموز المستقبلية
05/23/2026
Masked Self-Attention هو آلية داخل Transformer Decoder تقيّد نطاق الـ attention بحيث لا يستطيع الرمز الحالي رؤية الرموز المستقبلية. بهذه الطريقة يتعلم النموذج التنبؤ بالرمز التالي اعتمادًا فقط على الرموز التي ظهرت حتى الآن، من دون أن يطّلع على إجابة لم يكن ينبغي أن تكون متاحة بعد.
ببساطة: إذا طُلب من شخص تخمين الكلمة التالية، لكنه استطاع رؤية الإجابة في الجزء اللاحق من النص، فلن يكون ذلك قياسًا حقيقيًا للفهم. يقوم Masked Self-Attention بإخفاء الكلمات التي لم يتم توليدها بعد، حتى يعتمد النموذج على السياق السابق فقط عند توقع الرمز التالي.
يحجب Masked Self-Attention الرموز المستقبلية حتى يتنبأ النموذج بالرمز التالي اعتمادًا فقط على السياق المتاح.
آلية العمل (المبدأ والخصائص)
-
قاعدة حجب المستقبل داخل Self-Attention
- في Self-Attention التقليدي، يمكن لجميع الرموز داخل التسلسل الرجوع إلى بعضها بحرية.
- لكن إذا استُخدمت هذه البنية مباشرة داخل Decoder، فسيتمكن الموضع الحالي من رؤية رموز لاحقة لم يتم توليدها بعد.
- لذلك يُضاف mask إلى attention score matrix لمنع الاتصالات المتجهة نحو المستقبل.
- ونتيجة لذلك، لا يرى كل رمز إلا نفسه والرموز السابقة له.
-
Causal Mask
- Causal Mask هو قيد ترتيبي يمنع المعلومات المستقبلية من التأثير في التنبؤات السابقة.
- عادةً ما يُمثَّل كمصفوفة مثلثية سفلية تحجب الخانات الموجودة يمين الموضع الحالي.
- على سبيل المثال، لا يستطيع الرمز الثالث رؤية إلا الرموز من الأول حتى الثالث.
- تحافظ هذه البنية على توليد النص من اليسار إلى اليمين.
-
\[ \text{Attention}(Q·K·V)=\text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}+M\right)V \]
\[ M_{ij}=\begin{cases}0 & j \le i \\ -\infty & j > i\end{cases} \]
يمثل i الموضع الحالي، ويمثل j الموضع المراد الرجوع إليه. إذا كان j أكبر من i، فهذا يعني أنه رمز مستقبلي، ولذلك تصبح احتمالية attention بعد softmax مساوية للصفر.
-
منع تسرّب المعلومات
- يجب أن يتنبأ نموذج اللغة بالرمز التالي اعتمادًا على السياق السابق فقط.
- أثناء التدريب تُمرَّر الجملة الهدف كاملة دفعة واحدة، ولذلك يستطيع النموذج من دون mask رؤية الإجابة المستقبلية.
- قد يؤدي ذلك إلى خفض training loss ظاهريًا، لكنه يضعف الأداء عند التوليد الفعلي.
- يمنع Masked Self-Attention هذا النوع من Target Leakage على مستوى البنية نفسها.
-
تطابق ظروف التدريب والتوليد
- أثناء التدريب يمكن معالجة التسلسل الكامل دفعة واحدة باستخدام الحوسبة المتوازية.
- لكن بفضل mask، لا يستخدم كل موضع إلا المعلومات السابقة، كما يحدث في التوليد الحقيقي.
- أثناء التوليد أيضًا يعتمد النموذج فقط على الرموز التي أنشأها بالفعل.
- بهذا يقل الفرق بين ظروف التدريب وظروف الاستدلال.
-
الأساس الذاتي التوليد داخل Transformer Decoder
- يعتمد Transformer Decoder على Masked Self-Attention لتنفيذ Autoregressive Modeling.
- في Autoregressive Modeling يتم توليد الرمز التالي واحدًا تلو الآخر بناءً على الرموز السابقة.
- تعتمد نماذج GPT على هذه البنية لتكوين النص عبر تكرار التنبؤ بالرمز التالي.
- لذلك يُعد Masked Self-Attention العنصر الأساسي الذي يجعل Decoder يعمل كنموذج توليدي.
-
تكلفة الحساب في السياقات الطويلة
- تزداد تكلفة attention في Masked Self-Attention مع زيادة عدد الرموز.
- عند التعامل مع مستندات طويلة، يجب مقارنة جميع الرموز السابقة باستمرار، مما يزيد استهلاك الذاكرة والوقت.
- في مرحلة الاستدلال يُستخدم KV Cache لإعادة استخدام key وvalue السابقين.
- في نماذج long context تُستخدم تقنيات مثل Sliding Window Attention أو Sparse Attention لتقليل نطاق الحساب.
الأهمية والقيود
يُعد Masked Self-Attention البنية الأساسية التي تمكّن Transformer Decoder من التنبؤ بالرمز التالي من دون رؤية المعلومات المستقبلية. بفضل هذه الآلية، تبقى ظروف التدريب قريبة من ظروف التوليد الحقيقية، كما تشكل الأساس الذي تعتمد عليه autoregressive language models مثل GPT. ومع ذلك، فإن حساب attention على جميع الرموز السابقة يجعل التكلفة ترتفع كلما طال السياق. لذلك تستخدم الأنظمة الحديثة KV Cache لتسريع الاستدلال، إلى جانب Sliding Window Attention أو Sparse Attention لتقليل تكلفة معالجة long context.
قراءات تمهيدية مقترحة (3/4)
+1
- 7. Transformer — من Self-Attention إلى أحدث معماريات LLM
- QKV Projection في Transformer — لماذا يتعلّم النموذج Query وKey وValue بشكل منفصل؟
- Neural Network Building Blocks — بناء التمثيلات بالمجموع الموزون ودالة التفعيل للتنبؤ الاحتمالي المتسلسل
قراءات مقترحة للمتابعة (5/19)
+5
- Decoder Layer — لماذا يتنبأ LLM بالـ token التالية اعتمادًا على الـ tokens السابقة فقط؟
- Encoder–Decoder Transformer — بنية Attention التي تفهم المدخلات وتولد تسلسلات جديدة
- 7.1 Transformer Architecture and Core Components — نموذج Sequence-to-Sequence وبنية Encoder–Decoder
- Self-Attention وCross-Attention — بناء السياق داخل المدخل مقابل استرجاع المعلومات من مدخل آخر
- Transformer Encoder — كيف غيّرت Self-Attention حدود البنية التسلسلية؟
- Causal vs Non-causal Self-Attention — كيف يحدد اتجاه قراءة السياق الفرق بين التوليد والفهم
- Encoder–Decoder Architecture — بنية عصبية لتحويل التسلسلات
- 7.9 Modern Transformer Blocks in Large Language Models — أهم تغييرات Transformer Architecture في عصر 2024
- Attention Mask — لماذا يجب إزالة «الاتصال نفسه» قبل Softmax؟
- BigBird — مبادئ تصميم Sparse Attention لمعالجة السياقات الطويلة
- Longformer — لماذا نحتاج إلى Sparse Attention لمعالجة السياقات الطويلة
- مصفوفة أوزان الانتباه (Attention Weight Matrix) — ما الفرق بين Score وWeight؟
- Context Length — لماذا يؤدي توسيع السياق الطويل إلى زيادة التكلفة وتشتت الانتباه بدلاً من تحسين الأداء؟
- Context Bottleneck — لماذا تضعف المعلومات في مدخلات Seq2Seq الطويلة
- Cross-Attention (الانتباه المتقاطع) — ربط المعلومات ومحاذاة التسلسلات المختلفة داخل Transformer
- 7.4 الانتباه متعدد الرؤوس، الترميز الموضعي، و Add & Norm — البنية الأساسية التي تُكمل وحدة Transformer
- Padding Mask — لماذا يجب على Transformer تجاهل Padding Token؟
- Long Context — لماذا تعد القدرة على استخدام السياق الطويل أهم من مجرد إدخال نصوص طويلة في LLM؟
- Long-Context Degradation — لماذا يفقد Transformer المعلومات الأساسية عند التعامل مع السياقات الطويلة؟
مقالات حول الموضوع نفسه (4/4)
- Hierarchical Softmax — مبدأ تحسين كفاءة Softmax في التعامل مع Vocabulary الضخمة
- Attention Mechanism (آلية الانتباه) — كيف يحدد النموذج العلاقات بين المدخلات ويركّز على المعلومات المهمة
- Bidirectional Context (السياق ثنائي الاتجاه) — فهم المعنى من خلال دمج السياق السابق واللاحق
- Masking Mechanism — كيفية التحكم في نطاق وصول Attention إلى المعلومات
مفاهيم ذات صلة (0/0)
لا توجد مقالات عن مفاهيم ذات صلة بعد.
📍 موقع هذا المفهوم في خريطة تعلّم الذكاء الاصطناعي
تعرّف على موقع هذا المفهوم ضمن AI Universe بالكامل.
📍 موقعك الحالي في AI Universe
☰
إعادة تعيين إظهار المكتمل · تسجيل الدخول مطلوب جارٍ التحميل…
🌌 AI Universe
‹
›
⭐ المفهوم
اختر نجمة.
« Vocabulary Projection —…|النمذجة الانحدارية التلق… »
🔖 الوسوم: Attention Mechanism · autoregressive-modeling · causal mask · gpt-architecture · Masked Self-Attention · Transformer Decoder