Pre-LN vs Post-LN入門:なぜ深層TransformerではPre-LNが主流なのか
Pre-LN vs Post-LN は、Transformer Block における Layer Normalization(LayerNorm) の配置方法を表す2つの設計である。LayerNorm をサブレイヤーの前に置くか、それとも後ろに置くかによって、Residual Connection(残差接続) を通る情報フローと勾配伝播の安定性が変わる。特に深層 Transformer では、この違いが学習の安定性を大きく左右する。
05/25/2026
Pre-LN とは?LayerNorm の位置が Transformer 学習を安定させる理由
Pre-Layer Normalization(Pre-LN)とは、Transformer においてLayer Normalization(層正規化)を Self-Attention や Feed-Forward Network(FFN)の前に置く設計である。Pre-LN は、LayerNorm がなぜ Transformer に必要なのかを押さえると理解しやすい。Transformer は多数の層を積み重ねるため、活性化値の分布や特徴量のスケール、勾配伝播が不安定になりやすい。LayerNorm は各 token ベクトル内の特徴分布を整え、こうした不安定さを抑える。Pre-LN はその正規化をサブレイヤーの前に移すことで、深い Transformer の学習を安定させる。
05/25/2026