Grouped-Query Attention — KV Cache Bottleneck घटाकर Performance कैसे बनाए रखता है
Grouped-Query Attention (GQA) Transformer में इस्तेमाल होने वाली Attention संरचना है, जिसे KV cache से पैदा होने वाले memory bottleneck को कम करने के लिए डिज़ाइन किया गया है। इसका मूल विचार है कि Query को हर head के लिए अलग रखा जाए, जबकि Key/Value को group स्तर पर साझा किया जाए। इससे memory efficiency काफी बेहतर होती है और model की representation क्षमता में होने वाला नुकसान सीमित रहता है।
05/22/2026