Grouped-Query Attention — تقليل اختناق KV Cache مع الحفاظ على الأداء

Grouped-Query Attention (GQA) هو تصميم في آلية Attention داخل Transformer يهدف إلى تقليل اختناق الذاكرة الناتج عن KV cache. تقوم الفكرة على الإبقاء على Query مستقلاً لكل head، مع مشاركة Key/Value على مستوى المجموعات. بهذا الأسلوب يمكن تحسين كفاءة الذاكرة بدرجة كبيرة، مع الحفاظ على القدرة التمثيلية للنموذج قدر الإمكان.

05/22/2026