☆ Guardar Add & Norm — Por qué se combinan la conexión residual y la normalización por capa

05/06/2026

Add & Norm es la estructura del Transformer que conserva la información de entrada mediante una conexión residual y estabiliza la distribución de los valores mediante normalización por capa. Su función central es permitir que el modelo construya una nueva representación sin destruir la información original ni debilitar el flujo del gradiente.

De forma intuitiva: es como reescribir una oración sin borrar por completo la versión original. La oración original queda disponible junto a la versión modificada. Si la nueva representación crece demasiado, se desequilibra o se vuelve inestable, la normalización vuelve a ajustar su escala. Así, Add conserva la señal original y Norm mantiene el equilibrio numérico.

La conexión residual mantiene disponible la información original, mientras que la normalización por capa estabiliza la escala de la representación acumulada.

Cómo funciona

Importancia y limitaciones

Add & Norm es un mecanismo esencial de estabilización que permite a un Transformer conservar la información de entrada y el flujo del gradiente incluso cuando el modelo se vuelve más profundo. La conexión residual reduce la pérdida de información al mantener disponible la representación original, mientras que la normalización por capa controla la escala de los valores acumulados y evita dinámicas de entrenamiento inestables. Gracias a esta combinación, un Transformer puede repetir capas de autoatención y FFN mientras sigue refinando sus representaciones de manera estable. Sin embargo, la posición de LayerNorm cambia el comportamiento de entrenamiento en arquitecturas Pre-LN y Post-LN, y si la ruta residual domina demasiado, el efecto de transformación de la subcapa puede quedar relativamente debilitado. Por eso, Add & Norm no es un simple paso de posprocesamiento, sino una pieza clave en el diseño de Transformers profundos y estables.

Lecturas previas recomendadas (3/5)

+2

Lecturas recomendadas para continuar (5/17)

+5

Artículos del mismo tema (8/9)

+1

Conceptos relacionados (2/2)

📍 Dónde encaja este concepto en el mapa de aprendizaje de IA

Consulta dónde se ubica este concepto dentro de AI Universe.

📍 Posición actual en AI Universe

Restablecer Mostrar completados · Inicia sesión Cargando…

🌌 AI Universe

⭐ Concepto

Selecciona una estrella.

Ver AI Universe completo

« X-to-X Translation — una…|Decoder-only Transformer… »

🔖 Etiquetas: Add & Norm · Autoatención · Conexión residual · Normalización por capa · Transformer · 深度学习