☆ Enregistrer Residual Block : stabiliser les réseaux neuronaux profonds grâce à l’apprentissage résiduel
07/18/2026
Residual Block est une architecture conçue pour faciliter l’entraînement des réseaux neuronaux profonds en apprenant non pas une transformation complète, mais uniquement la variation nécessaire à partir d’une représentation existante. Avec une skip connection, l’entrée x est conservée comme point de référence et le bloc apprend une fonction résiduelle F(x) qui correspond aux ajustements à appliquer. Cette approche réduit les difficultés d’optimisation liées aux réseaux très profonds et favorise une meilleure circulation des informations pendant le forward pass ainsi que du gradient pendant le backward pass.
Pour comprendre l’idée : lorsqu’une solution est déjà proche du résultat attendu, il est généralement plus simple de corriger les écarts restants que de repartir de zéro. Le Residual Block applique ce principe aux réseaux neuronaux : au lieu’abandonner la représentation existante, il apprend uniquement les modifications utiles à ajouter. Les couches profondes peuvent ainsi enrichir progressivement les informations déjà extraites, ce qui rend l’apprentissage plus stable lorsque le réseau devient plus complexe.
En conservant directement l’entrée et en ajoutant uniquement les variations nécessaires, le Residual Block stabilise l’apprentissage des réseaux neuronaux profonds.
Méthode (principe de fonctionnement, caractéristiques, etc.)
-
Apprentissage résiduel (Residual Learning)
- Dans une couche traditionnelle, le modèle cherche à apprendre directement la transformation complète qui convertit l’entrée x en sortie H(x).
- Le Residual Block adopte une approche différente : il apprend F(x), c’est-à-dire l’écart entre la représentation actuelle et la transformation souhaitée, plutôt que de reconstruire entièrement H(x).
- Par exemple, si une représentation d’image contient déjà les contours principaux d’un chat, la couche suivante n’a pas besoin de reconstruire toute l’image. Elle peut simplement ajouter les informations manquantes, comme les détails des oreilles ou les motifs du pelage.
- Le rôle du Residual Block est donc d’affiner une représentation existante plutôt que de la remplacer complètement.
-
\[ y = F(x) + x \]
\[ F(x) = H(x) – x \]
x représente l’entrée du bloc, F(x) correspond à la variation résiduelle par rapport à cette entrée, et y représente la sortie finale. Si H(x) correspond à la transformation complète recherchée, le Residual Block apprend uniquement la différence F(x) entre H(x) et x.
-
Identity Mapping et réduction du Degradation Problem
- Un Residual Block intègre une voie directe qui permet à l’entrée d’être transmise sans transformation importante.
- Lorsque conserver l’information initiale est suffisant, le modèle peut apprendre un F(x) proche de zéro et maintenir une identity mapping.
- Dans les réseaux très profonds, ajouter davantage de couches peut parfois augmenter l’erreur d’entraînement : ce phénomène correspond au degradation problem et provient principalement des difficultés d’optimisation plutôt que d’un simple overfitting.
- En fournissant une référence stable à travers le réseau, le Residual Block limite la dégradation des performances lorsque la profondeur augmente.
-
Préservation du flux de gradient
- La skip connection permet aux informations d’entrée d’atteindre les couches suivantes sans passer uniquement par le chemin de transformation principal pendant le forward pass.
- Lors du backward pass, le gradient peut également circuler directement à travers cette voie au lieu de traverser toutes les transformations non linéaires successives.
- Cette propriété réduit les effets du vanishing gradient et permet aux signaux d’apprentissage d’atteindre plus efficacement les couches profondes.
-
Le Residual Block comme mécanisme de Feature Refinement
- Un Residual Block peut être interprété comme un mécanisme qui améliore progressivement les features existantes plutôt qu’une structure qui crée de nouvelles représentations à chaque couche.
- Les premières couches extraient généralement des features simples comme les edges ou les textures. Les blocs suivants enrichissent ensuite ces représentations avec des informations plus proches des object parts ou des features utiles pour la classification.
- Dans cette vision, un réseau profond ne reconstruit pas continuellement ses représentations : il les affine étape par étape.
-
Alignement des dimensions et shortcut de projection
- Comme un Residual Block additionne x et F(x), les dimensions des deux tenseurs doivent être compatibles.
- Lorsque le nombre de canaux ou la résolution diffèrent, un shortcut de projection utilisant par exemple une convolution 1×1 permet d’adapter la dimension de l’entrée.
- Par exemple, si l’entrée possède 64 canaux alors que le chemin de transformation produit une sortie de 128 canaux, le shortcut de projection transforme également l’entrée en une représentation à 128 canaux avant l’addition.
- Le shortcut de projection sert donc de mécanisme d’alignement permettant d’effectuer une residual addition même lorsque les dimensions des tenseurs sont différentes.
-
Rôle du Residual Block dans ResNet
- Le Residual Block est l’unité fondamentale de ResNet. Il associe un chemin de transformation basé sur des convolutions et une skip connection, puis cette structure est répétée dans l’ensemble du réseau.
- Les détails d’implémentation peuvent varier selon les versions de l’architecture, mais le principe reste le même : combiner un chemin de transformation avec une voie de transmission directe.
- Grâce à cette conception, ResNet n’est pas simplement un modèle auquel on ajoute un grand nombre de couches. Il s’agit d’une architecture permettant aux couches profondes de corriger et d’affiner progressivement les représentations apprises auparavant.
Intérêt et limites
Le Residual Block est une idée majeure dans la conception des réseaux neuronaux profonds, car il apporte une réponse structurelle aux problèmes d’optimisation qui apparaissent avec l’augmentation de la profondeur. En prenant l’entrée comme référence et en apprenant uniquement les variations nécessaires, il facilite le maintien d’une identity mapping et stabilise le flux du gradient. Cette approche a rendu possible l’entraînement de réseaux beaucoup plus profonds et a fortement influencé de nombreuses architectures modernes de Deep Learning après ResNet.
Cependant, l’utilisation d’une connexion résiduelle ne garantit pas automatiquement de meilleures performances. Son efficacité dépend de plusieurs éléments : la quantité de données disponibles, la nature de la tâche, le choix de la normalization, l’organisation des activation functions, la conception des Residual Blocks ainsi que la profondeur et la largeur du réseau. Même avec cette architecture, les réseaux extrêmement profonds restent soumis à des contraintes de calcul, de mémoire, de complexité et d’efficacité. Le Residual Block doit donc être considéré non comme une solution universelle, mais comme un principe architectural puissant pour rendre l’apprentissage des modèles profonds plus stable.
Lectures préalables recommandées (3/5)
+2
- 4. Perceptron multicouche (MLP) — architecture de base des réseaux de neurones et principes d’apprentissage
- 7.4 Multi-Head Attention, Positional Encoding et Add & Norm — structures clés pour compléter le Transformer Block
- 5.4 Fonctionnement spatial de la convolution et hyperparamètres
- 5.3 Comprendre les composants essentiels et l’architecture des réseaux de neurones convolutionnels
- 5.2 Pourquoi les CNN sont apparus et quels principes structurent leur architecture
Lectures recommandées pour la suite (5/19)
+5
- Transformer Block — La structure fondamentale qui a remplacé les RNN dans les modèles de séquence modernes
- 7.9 Blocs Transformer modernes dans les grands modèles de langage — les changements clés de l’architecture Transformer de l’ère 2024
- Hybrid Attention — Une stratégie d’Attention efficace pour relier les informations dans les longs contextes
- Reformer — rendre l’Attention plus efficace sur les longues séquences
- Switch Transformer — Comment le Top-1 Routing simplifie les MoE
- GShard — faire évoluer les Transformer MoE avec Automatic Sharding
- Sliding Window Attention — Pourquoi le Full Attention devient inefficace avec les Long Context
- 7.1 Transformer Architecture and Core Components — modèles Sequence-to-Sequence et architecture Encoder–Decoder
- Top-K Sparse Routing — Comment les MoE passent à l’échelle en limitant le coût de calcul
- Attention Collapse — Pourquoi les LLM se concentrent-ils parfois sur quelques tokens ?
- Stack of Encoders — Pourquoi un seul Encoder ne suffit pas ?
- Routing — Comment choisir un chemin de calcul différent pour chaque entrée ?
- Nombre de paramètres du CNN (CNN Parameter Count) — un indicateur clé de la complexité du modèle et de sa capacité d’expression
- Strided Attention — Réduire le coût des longs contextes avec un motif d’Attention clairsemé
- Linformer — Réduire le coût de l’Attention avec une approche Low-Rank
- MoE Transformer — Pourquoi diviser le FFN en plusieurs Experts ?
- Softmax-Free Attention — comment identifier l’information importante sans Softmax
- 7. Transformer — du Self-Attention aux architectures LLM modernes
- Model Expressivity — Comment un réseau de neurones représente des fonctions complexes
Articles sur le même sujet (5/5)
- Quadratic Complexity — Pourquoi Attention devient un goulot d’étranglement en n²
- Causal Local Attention — Comment réduire le goulot d’étranglement du calcul lors de la génération de longues séquences
- Multiplicative vs Additive Mask — pourquoi le masquage avant Softmax est essentiel
- Stack of Decoders — Pourquoi empiler plusieurs couches de Decoder dans un Transformer ?
- MoE Router (Router Network, Gating Network) — Comment fonctionne la sélection sparse des Experts
Concepts associés (2/2)
- Sparse Model (Sparse Activation) — Pourquoi les modèles Dense atteignent leurs limites à grande échelle
- Padding Mask — Pourquoi le Transformer doit ignorer les Padding Tokens
📍 Place de ce concept dans la carte d’apprentissage de l’IA
Découvrez où se situe ce concept dans l’ensemble d’AI Universe.
📍 Position actuelle dans AI Universe
☰
Réinitialiser Afficher les éléments terminés · Connexion requise Chargement…
🌌 AI Universe
‹
›
⭐ Concept
Sélectionnez une étoile.
« DeepNorm — stabiliser le…|Residual Scaling — Stabi… »
🔖 Tags: Deep Learning · gradient · Neural Network · Optimization · residual-block · ResNet · Skip Connection