Pre-Layer Normalization (Pre-LN) — Cómo LayerNorm antes de Attention estabiliza Transformers profundos

Pre-Layer Normalization (Pre-LN) es un esquema de normalización previa en Transformers donde LayerNorm se aplica antes de Self-Attention o de la Feed-Forward Network (FFN). Esta posición es importante porque los Transformers profundos apilan muchos bloques de forma repetida, y a medida que aumenta la profundidad pueden volverse inestables tanto la distribución de activaciones como el flujo de gradientes. LayerNorm mantiene las representaciones de tokens bien escaladas, mientras que Pre-LN mejora la estabilidad de la optimización al colocar la normalización antes de cada subcapa.

05/25/2026

Pre-LN vs Post-LN en Transformers — LayerNorm, conexiones residuales y estabilidad del gradiente

Pre-LN vs Post-LN compara dos formas de ubicar Layer Normalization (LayerNorm) dentro de un bloque Transformer. No se trata solo de un detalle de implementación. La posición de LayerNorm cambia directamente cómo la información y los gradientes atraviesan la Conexión Residual, convirtiéndose en una decisión clave para entrenar modelos Transformer profundos.

05/25/2026