☆ Guardar Add & Norm — Por qué se combinan la conexión residual y la normalización por capa
05/06/2026
Add & Norm es la estructura del Transformer que conserva la información de entrada mediante una conexión residual y estabiliza la distribución de los valores mediante normalización por capa. Su función central es permitir que el modelo construya una nueva representación sin destruir la información original ni debilitar el flujo del gradiente.
De forma intuitiva: es como reescribir una oración sin borrar por completo la versión original. La oración original queda disponible junto a la versión modificada. Si la nueva representación crece demasiado, se desequilibra o se vuelve inestable, la normalización vuelve a ajustar su escala. Así, Add conserva la señal original y Norm mantiene el equilibrio numérico.
La conexión residual mantiene disponible la información original, mientras que la normalización por capa estabiliza la escala de la representación acumulada.
Cómo funciona
-
Estructura básica
- Add & Norm suma la entrada al resultado de una subcapa y después aplica normalización.
- No utiliza únicamente la nueva representación producida por la autoatención o por la FFN; también conserva la entrada original.
- Luego, la normalización por capa ajusta la media y la varianza en la dimensión de características.
- Como resultado, la representación puede hacerse más profunda sin que la escala de los valores se vuelva inestable.
-
\[ y = \text{LayerNorm}(x + \text{Sublayer}(x)) \]
\[ \hat{x} = \frac{x – \mu}{\sqrt{\sigma^2 + \epsilon}} \]
x es la entrada de la subcapa, y Sublayer(x) es la salida de la autoatención o de la FFN. μ es la media de los valores de las características, σ2 es la varianza y ε es una pequeña constante que evita la división por cero.
-
Conexión residual
- Una conexión residual es una ruta corta que envía la entrada x directamente hacia la salida.
- Gracias a esta ruta, aunque la salida de la subcapa esté distorsionada, la información original de entrada sigue avanzando.
- El gradiente también puede fluir directamente por la ruta de identidad, lo que facilita el entrenamiento de redes profundas.
- Sin esta ruta residual, al aumentar la profundidad crecen los problemas de pérdida de información y desvanecimiento del gradiente.
-
Normalización por capa
- La normalización por capa normaliza los valores dentro de la dimensión de características de cada token.
- Por ejemplo, si los valores de la representación de un token se vuelven demasiado grandes, la normalización los devuelve a un rango más estable.
- Este proceso no depende del tamaño del batch, por lo que funciona de forma estable aunque cambien la longitud de las oraciones o la composición del batch.
- Sin LayerNorm, las sumas residuales pueden acumular valores capa tras capa y hacer que la distribución se vuelva inestable.
-
Efecto combinado
- La conexión residual por sí sola conserva bien la información original, pero la escala de los valores puede crecer o volverse inestable.
- LayerNorm por sí sola estabiliza los valores, pero no ofrece una ruta directa para que la información original y el gradiente atraviesen muchas capas.
- Por eso, Add & Norm conserva la información y al mismo tiempo controla la distribución de la representación acumulada.
- Esta combinación ayuda a que los Transformers sigan siendo entrenables incluso cuando se apilan muchas capas.
-
Pre-LN frente a Post-LN
- Post-LN aplica LayerNorm después de sumar la salida de la subcapa y la entrada.
- La arquitectura Transformer original se acerca al diseño Post-LN, pero en modelos muy profundos el flujo del gradiente puede volverse inestable.
- Pre-LN coloca LayerNorm antes de la subcapa, lo que suele mejorar la estabilidad del gradiente.
- Muchas arquitecturas Transformer modernas usan variantes tipo Pre-LN para entrenar modelos profundos con mayor estabilidad.
-
Repetición dentro del bloque Transformer
- Add & Norm suele aplicarse dos veces dentro de un bloque Transformer: una vez después de la autoatención y otra después de la FFN.
- El primer Add & Norm estabiliza la salida de atención que contiene información contextual.
- El segundo Add & Norm estabiliza la transformación no lineal aplicada a cada token.
- Gracias a esta repetición, el Transformer refina sus representaciones de forma continua sin perder estabilidad durante el entrenamiento.
Importancia y limitaciones
Add & Norm es un mecanismo esencial de estabilización que permite a un Transformer conservar la información de entrada y el flujo del gradiente incluso cuando el modelo se vuelve más profundo. La conexión residual reduce la pérdida de información al mantener disponible la representación original, mientras que la normalización por capa controla la escala de los valores acumulados y evita dinámicas de entrenamiento inestables. Gracias a esta combinación, un Transformer puede repetir capas de autoatención y FFN mientras sigue refinando sus representaciones de manera estable. Sin embargo, la posición de LayerNorm cambia el comportamiento de entrenamiento en arquitecturas Pre-LN y Post-LN, y si la ruta residual domina demasiado, el efecto de transformación de la subcapa puede quedar relativamente debilitado. Por eso, Add & Norm no es un simple paso de posprocesamiento, sino una pieza clave en el diseño de Transformers profundos y estables.
Lecturas previas recomendadas (3/5)
+2
- 2.8 Elementos fundamentales de las redes neuronales
- 7.4 Multi-Head Attention, Positional Encoding y Add & Norm — Estructura clave que completa el Transformer Block
- 7.1 Arquitectura de Transformer y componentes principales — estructura Sequence-to-Sequence y Encoder–Decoder
- 7. Transformer — Desde Self-Attention hasta las arquitecturas modernas de LLM
- Self-Attention — El Mecanismo que Construye Representaciones Contextuales al Modelar Directamente las Relaciones Dentro de una Secuencia
Lecturas recomendadas para continuar (5/17)
+5
- 4. Perceptrón multicapa (MLP) — Estructura básica de las redes neuronales y principios de aprendizaje
- 7.9 Bloques Transformer modernos en modelos de lenguaje grandes — cambios clave en la arquitectura Transformer de la era 2024
- 5.2 Origen de las CNN y principios de diseño
- Multiplicative vs Additive Mask — Por qué es importante bloquear antes de Softmax
- Stack of Decoders — Por qué los Transformers apilan múltiples capas Decoder
- Stack of Encoders — ¿Por qué un solo Encoder no es suficiente?
- Skip Connection (Residual Connection) — Un atajo que preserva la información y los gradientes en redes neuronales profundas
- MoE Transformer — Por qué dividir la FFN en Experts
- Transformer Block — Por qué se convirtió en la arquitectura estándar que reemplazó a las RNN
- Red Neuronal Profunda (DNN) — Aprender patrones complejos apilando muchas capas
- Strided Attention — cómo reducir el coste de los contextos largos mediante conexiones dispersas
- Quadratic Complexity — Por qué Attention genera un cuello de botella de n²
- Función de activación lineal — La activación más simple donde la salida es proporcional a la entrada
- Hybrid Attention — Cómo combinar distintos patrones de Attention para trabajar con contextos largos
- Reformer — cómo reducir el coste de Attention en secuencias largas
- Softmax-Free Attention — Cómo identificar información relevante sin depender de Softmax
- Attention Collapse — Por qué un LLM puede concentrarse demasiado en unos pocos tokens
Artículos del mismo tema (8/9)
+1
- Model Expressivity — Cómo una red neuronal representa funciones complejas
- Linformer — Cómo reducir el coste de Attention mediante Low-Rank Attention
- Top-K Sparse Routing — Cómo los modelos MoE escalan reduciendo el coste computacional
- Switch Transformer — Cómo simplificar MoE mediante Top-1 Routing
- GShard — Escalado de MoE Transformer con Automatic Sharding
- Routing — Cómo elegir la ruta de cálculo adecuada para cada entrada
- Causal Local Attention — Cómo reducir el coste de generación en secuencias largas
- Sliding Window Attention — cómo reducir el coste de Attention en Long Context
Conceptos relacionados (2/2)
- BigBird — Cómo diseña Sparse Attention para procesar contextos largos
- Por qué Longformer necesita Sparse Attention para procesar contextos largos
📍 Dónde encaja este concepto en el mapa de aprendizaje de IA
Consulta dónde se ubica este concepto dentro de AI Universe.
📍 Posición actual en AI Universe
☰
Restablecer Mostrar completados · Inicia sesión Cargando…
🌌 AI Universe
‹
›
⭐ Concepto
Selecciona una estrella.
« X-to-X Translation — una…|Decoder-only Transformer… »
🔖 Etiquetas: Add & Norm · Autoatención · Conexión residual · Normalización por capa · Transformer · 深度学习