2024-युग का Transformer Architecture — अब Computation नहीं, Memory क्यों असली Bottleneck है
2024-युग का Transformer Architecture Transformer के मूल generative सिद्धांत को बनाए रखते हुए Attention, KV Cache·RoPE·Normalization·FFN और MoE को एक साथ optimize करने वाली आधुनिक design दिशा है। इसका लक्ष्य memory bottleneck और inference cost को कम करना है।
05/22/2026
7.6 Efficient Attention Mechanisms for Transformer LLMs — फुल अटेंशन, स्पार्स अटेंशन और फ्लैशअटेंशन
इस लेख में हम Transformer LLM में attention computation एक बड़ा bottleneck क्यों बनता है, और इसे कम करने के लिए उपयोग किए जाने वाले Efficient Attention, Local Attention, Sparse Attention और FlashAttention के मुख्य सिद्धांतों को समझेंगे। लंबे Context Length में हर token का हर token से संबंध निकालने वाला Full Attention बहुत तेज़ी से महँगा हो जाता है, इसलिए आधुनिक LLM में computation और memory movement को optimize करना आवश्यक हो जाता है।
06/15/2026
FlashAttention — Attention में असली Bottleneck Computation नहीं, Memory क्यों है
FlashAttention Transformer के Attention computation के लिए एक optimization technique है, जो बड़े intermediate Attention matrix को memory में store किए बिना computation order को reorganize करती है। यह Attention की मूल mathematics को नहीं बदलती, बल्कि GPU के सबसे धीमे bottleneck — memory read और write — को कम करने पर केंद्रित है।
05/22/2026
FlashAttention IO-Awareness — Attention मेमोरी मूवमेंट में बॉटलनेक क्यों बनता है
FlashAttention IO-Awareness एक optimization approach है जो दिखाता है कि Transformer के Attention operation में GPU memory movement (IO) कई बार computation amount (FLOPs) से भी बड़ा bottleneck बन जाता है। पारंपरिक Attention बड़े Attention matrix और softmax result को बार-बार GPU memory में store करता है और फिर read करता है। FlashAttention इन्हें छोटे blocks में सीधे compute करके memory access को कम करता है।
05/22/2026
IO-aware Tiling — FlashAttention HBM data movement को कैसे कम करता है
IO-aware Tiling एक Optimization तकनीक है जिसका मुख्य लक्ष्य GPU पर केवल computation की संख्या घटाना नहीं, बल्कि memory movement (Input/Output, IO) को कम करना है। Transformer Attention जैसे workloads में बड़े matrices को बार-बार पढ़ना और लिखना पड़ता है। ऐसे मामलों में कई बार Tensor Core की computation speed से ज्यादा समय HBM से data लाने और वापस लिखने में खर्च होता है, और यही पूरी performance को सीमित करने लगता है। IO-aware Tiling बड़े data को छोटे tiles में बाँटता है, उन्हें तेज SRAM में लाता है और वहीं कई calculations में दोबारा इस्तेमाल करता है। इससे HBM तक बार-बार जाने की जरूरत कम हो जाती है।
08/29/2026
Online Softmax — सारे Scores Store किए बिना Softmax कैसे निकालें?
Online Softmax में पूरे score vector को पहले memory में जमा करने और फिर उस पर Softmax चलाने की जरूरत नहीं होती। Attention Scores जिस क्रम में मिलते हैं, उसी क्रम में running max और normalization sum को बनाए रखा जाता है। Transformer Attention में Query और Key के dot product से बनने वाला Attention Score Matrix लंबे sequence के साथ बहुत बड़ा हो सकता है। इसे GPU memory में लिखने और फिर वापस पढ़ने से memory traffic बढ़ता है, जो लंबे context में एक बड़ा bottleneck बन सकता है। Online Softmax intermediate scores की पूरी matrix को अलग से store किए बिना पारंपरिक Softmax जैसा ही परिणाम देता है। इसी विचार पर FlashAttention जैसे memory-efficient Attention implementations भी निर्भर करते हैं।
09/02/2026
Streaming Softmax — FlashAttention Softmax को स्टोर किए बिना कैसे गणना करता है
Streaming Softmax में सभी Attention scores को एक साथ memory में रखने की जरूरत नहीं होती। Scores को छोटे Blocks में बाँटकर क्रम से गणना की जाती है और हर चरण पर केवल वही state रखी जाती है जो आगे की Softmax computation के लिए जरूरी है। सामान्य Attention पहले सभी Query-Key scores से पूरी Attention Matrix बनाता है और फिर उस पर Softmax लागू करता है। इसके विपरीत, Streaming Softmax पूरी Matrix को बनाए रखने के बजाय जरूरी intermediate state के साथ आगे बढ़ता है। इससे अंतिम गणना बदले बिना GPU memory के बीच data movement घटाया जा सकता है। FlashAttention की efficiency के पीछे यही मूल विचार काम करता है।
08/29/2026
Streaming Weighted Sum — FlashAttention पूरी Attention Matrix को स्टोर किए बिना कैसे काम करता है
Streaming Weighted Sum को समझने का सबसे आसान तरीका यह है कि Transformer Attention में पूरी Attention Score सूची या Attention Matrix को GPU memory में रखने की जरूरत ही क्यों हो। आखिर में हमें matrix नहीं, Attention output चाहिए। इसलिए computation को छोटे blocks में बांटकर हर block से मिलने वाली जरूरी जानकारी को उसी समय आगे की गणना में शामिल किया जा सकता है। यहां Attention का mathematical definition वही रहता है; सिर्फ गणना करने का क्रम बदलता है। Online Softmax और Streaming Softmax Softmax के लिए जरूरी state को बनाए रखते हैं, और उसी के साथ Value का weighted sum भी धीरे-धीरे जमा होता जाता है। इस तरह पूरी Attention Matrix को materialize किए बिना standard Softmax Attention वाला ही final result निकाला जा सकता है।
09/02/2026