☆ सहेजें GoogLeNet क्या है? Inception Module से Multi-scale Features सीखने वाली CNN
06/06/2026
GoogLeNet (Inception v1, 2014) image classification के लिए विकसित एक प्रसिद्ध CNN architecture है, जिसने ILSVRC 2014 जीता। इसे समझने का सबसे अच्छा तरीका है कि इसे Inception Module पर आधारित multi-branch CNN design के रूप में देखा जाए। उस समय अधिकांश models केवल depth बढ़ाने पर ध्यान दे रहे थे, जबकि GoogLeNet ने network depth के साथ computational efficiency पर भी जोर दिया।
आसान शब्दों में: GoogLeNet image को अलग-अलग zoom levels से देखता है, ताकि छोटे texture, मध्यम pattern और बड़े shape जैसे multi-scale features एक ही stage पर capture हो सकें।
Inception Module अलग-अलग convolution और pooling branches के feature maps को channel dimension में concatenate करके एक unified feature map बनाता है।
📚 यह लेख इन हब में शामिल है
Deep Learning Architecture — CNN, RNN और Transformer की तुलना और प्रमुख Models की पूरी गाइडCNN — Convolution, Pooling संरचना और ResNet जैसे प्रमुख Models की विस्तृत समझ
कार्यप्रणाली और मुख्य विशेषताएँ
-
Inception Module:
- Inception Module का goal था: अलग-अलग receptive field sizes को एक ही layer में combine करना।
- इसमें 1×1 Convolution, 3×3 Convolution, 5×5 Convolution और Max Pooling branch को parallel तरीके से process किया जाता है।
- हर branch image को अलग receptive field से देखती है, इसलिए small texture से लेकर larger shape तक multi-scale features capture किए जा सकते हैं।
- अंत में सभी branch feature maps को channel dimension में concatenate करके अगले layer को एक unified feature map के रूप में भेजा जाता है।
-
1×1 Convolution as Bottleneck:
- Computationally expensive 3×3 और 5×5 Convolution से पहले 1×1 Convolution channels की संख्या घटाता है।
- यह dimensionality reduction या bottleneck layer की तरह काम करता है: पहले channel reduction, फिर lower-cost convolution।
- इस compressed feature representation के बाद बड़ा convolution लगाना काफी सस्ता हो जाता है।
- इसी design की वजह से GoogLeNet लगभग 22 layers deep होने के बावजूद AlexNet की तुलना में बहुत कम, लगभग 6–7M parameters रखता था।
-
\[ \text{Parameters} = k \times k \times C_{in} \times C_{out} \]
Kernel size या input channels बढ़ने पर parameter count तेजी से बढ़ता है।
-
\[ 1 \times 1 \times C_{in} \times C_{mid} \ll 3 \times 3 \times C_{in} \times C_{out} \]
Computationally expensive convolution से पहले channels घटाने पर cost काफी कम हो जाती है।
-
Depth और efficiency का balance:
- GoogLeNet लगभग 22 layers deep architecture है, लेकिन इसका parameter count AlexNet से काफी कम था।
- सिर्फ layers बढ़ाने के बजाय, यह एक ही layer में कई receptive field sizes का उपयोग करके feature extraction को अधिक flexible बनाता है।
- Inception Module ने CNN design को एक नया दृष्टिकोण दिया, जहाँ accuracy और efficiency दोनों को साथ में optimize किया गया।
-
Training stabilization:
- GoogLeNet में training के दौरान intermediate points पर Auxiliary Classifiers लगाए गए।
- इनका काम gradient signal को intermediate layers तक बेहतर तरीके से पहुँचाना था।
- Auxiliary Classifier inference-time feature extraction का core हिस्सा नहीं है; यह मुख्य रूप से training को stabilize करने वाला सहायक component है।
-
Global Average Pooling:
- GoogLeNet ने large Fully Connected Layers पर dependence कम करने के लिए Global Average Pooling का उपयोग किया।
- इससे FC layers को काफी हद तक replace किया गया, parameters घटे और model अधिक lightweight बना।
- GoogLeNet और Inception Module आधुनिक efficient CNN designs की नींव माने जाते हैं।
महत्त्व और सीमाएँ
GoogLeNet ने Inception Module के जरिए multi-scale features को compact और efficient तरीके से extract करके अपने समय के लिए state-of-the-art image classification performance दिखाई। यही वजह है कि GoogLeNet CNN architecture के इतिहास में एक महत्वपूर्ण milestone माना जाता है। हालांकि Inception Module की internal branch structure VGG जैसे models की तुलना में complex है, इसलिए implementation और tuning आसान नहीं होती। बाद में ResNet जैसी architectures ने simpler design rules के साथ network depth बढ़ाना आसान बना दिया, इसलिए GoogLeNet लंबे समय तक standard architecture के रूप में नहीं बना रहा।
पहले पढ़ने के लिए सुझाए गए लेख (3/5)
+2
- Inception Module — अलग-अलग receptive field को समानांतर रूप से उपयोग करके कई spatial scale की विशेषताओं को एक साथ सीखने वाली CNN architecture
- VGGNet क्या है? 3×3 Convolution से बनी Deep CNN Architecture
- CNN Parameter Count (CNN के पैरामीटर की संख्या) — मॉडल की जटिलता और अभिव्यक्ति क्षमता को निर्धारित करने वाला प्रमुख मापदंड
- Stride (स्ट्राइड) — convolutional filter के इनपुट पर आगे बढ़ने का अंतराल
- SegNet — Pooling Index की मदद से स्थान जानकारी को पुनः प्राप्त करने का सिद्धांत
आगे पढ़ने के लिए सुझाए गए लेख (5/19)
+5
- MoE Router (Router Network, Gating Network) — Sparse Expert Selection कैसे काम करता है
- Model Expressivity — Neural Network जटिल Functions को कैसे represent करता है
- Transformer Block — RNN के बाद यह Architecture Standard क्यों बना
- Decoder Stack — Transformer में कई Decoder Layers क्यों आवश्यक होती हैं
- Stack of Encoders — एक Encoder से पर्याप्त समझ क्यों नहीं बनती?
- 7. Transformer — सेल्फ-अटेंशन से लेकर आधुनिक LLM आर्किटेक्चर तक
- 7.4 Multi-Head Attention, Positional Encoding, and Add & Norm — Transformer Block को पूरा करने वाली मुख्य संरचना
- 7.1 Transformer Architecture and Core Components — Sequence-to-Sequence मॉडल और Encoder–Decoder संरचना
- 5.2 CNN के उद्भव की पृष्ठभूमि और उसके डिज़ाइन सिद्धांत
- Quadratic Complexity — Attention में n² bottleneck क्यों पैदा होता है
- Hybrid Attention — लंबे Context को कुशलता से जोड़ने की Attention रणनीति
- Strided Attention — लंबे Context में गणना घटाने वाला Sparse Attention Pattern
- Reformer — लंबी sequence में Attention की लागत कैसे घटाई जाती है
- Linformer — Low-Rank Attention से Attention की लागत घटाने का सिद्धांत
- Top-K Sparse Routing — MoE मॉडल बड़े Scale पर Efficient तरीके से कैसे काम करते हैं
- Switch Transformer — MoE को Top-1 Routing के माध्यम से सरल बनाने का सिद्धांत
- GShard — Automatic Sharding के साथ विस्तृत MoE Transformer
- Routing — हर Input के लिए सही Computational Path कैसे चुना जाता है
- MoE Transformer — FFN को कई Expert में क्यों बाँटा जाता है
इसी विषय के लेख (5/5)
- Causal Local Attention — लंबे वाक्य बनाते समय गणना की रुकावट कैसे कम होती है
- Softmax-Free Attention — Softmax के बिना भी महत्वपूर्ण जानकारी कैसे चुनी जा सकती है
- Attention Collapse — LLM कुछ ही tokens पर क्यों केंद्रित हो जाते हैं
- Sliding Window Attention — Long Context में Full Attention की सीमाएँ क्यों बढ़ जाती हैं
- Multiplicative vs Additive Mask — Softmax से पहले Masking क्यों ज़रूरी है
संबंधित अवधारणाएँ (1/1)
📍 AI सीखने के नक्शे में इस अवधारणा की जगह
देखें कि यह अवधारणा पूरे AI Universe में कहाँ स्थित है।
📍 AI Universe में वर्तमान स्थान
☰
रीसेट पूर्ण किए गए दिखाएँ · लॉगिन आवश्यक लोड हो रहा है…
🌌 AI Universe
‹
›
⭐ अवधारणा
कोई तारा चुनें।
« Global Pooling — Feature…|Inception Module — अलग-अ… »
🔖 टैग: computer vision · Convolutional Neural Network · Deep Learning · GoogLeNet · Image Classification · Inception Module