☆ 저장 MHA Output Projection Matrix — 왜 Head를 concat만 하면 표현력이 부족한가
05/03/2026
Multi-Head Attention (MHA) Output Projection Matrix는는 MHA의 여러 head의 출력을 단순히 이어 붙는 데서 끝내지 않고, 서로 다른 head 정보 간 상호작용을 학습해 하나의 통합된 표현으로 재구성하는 선형 변환이다. 이 단계가 없으면 attention head들은 독립적인 feature 묶음으로 남아, multi-head 구조의 핵심 이점이 제대로 작동하지 않는다.
쉽게 말해: 여러 전문가가 각자 분석을 끝낸 상태(concat)는 아직 “보고서 초안들”이다. Output Projection은 이 초안들을 단순히 묶는 게 아니라, 서로 비교하고 섞어서 하나의 최종 보고서로 만드는 과정이다. 이때 중요한 정보는 강조되고, 중복되거나 덜 중요한 정보는 자연스럽게 줄어든다.
단순 feature 나열을 넘어 서로 다른 정보가 결합된 하나의 표현으로 재구성된다.
방법 (작동 원리, 특징 등)
-
Concat의 구조적 한계
- Multi-Head Attention은 각 head가 서로 다른 관점(문법, 의미, 위치 등)을 학습한다.
- 하지만 concat은 이 결과를 단순히 나열하는 것에 불과하다.
- 이 상태에서는 head 간 정보가 서로 영향을 주지 못한다.
- 결과적으로 feature는 늘어나지만 표현은 결합되지 않는다.
-
Feature 나열 vs Feature 결합
- Concat은 feature를 병렬로 쌓는 구조다.
- Projection은 이 feature들을 가중치 기반으로 섞는 과정이다.
- 이 과정에서 서로 다른 정보 간 상호작용이 발생한다.
- 즉 “확장”이 아니라 “재구성”이다.
-
\[ \text{Output} = \text{Concat}(head_1, …, head_h) \cdot W_O \]
\[ W_O \in \mathbb{R}^{(h \cdot d_v) \times d_{model}} \]
concat된 head 출력이 WO를 통해 섞이며 최종 표현 공간으로 재구성된다.
-
선형 결합으로 이루어지는 정보 통합
- WO는 단순 차원 축소 행렬이 아니다.
- 각 head의 정보를 어떻게 결합할지 학습하는 가중치다.
- 중요한 feature는 강조되고, 덜 중요한 정보는 약화된다.
- 이 과정은 head 간 “선형 interaction”을 만든다.
-
표현 공간에서의 실제 변화
- 한 head는 문법 관계 feature를 만든다.
- 다른 head는 의미적 유사성 feature를 만든다.
- 또 다른 head는 위치 정보를 encoding한다.
- Projection은 이들을 결합해 “문법+의미+위치”가 섞인 feature로 재구성한다.
-
Feed-Forward Network와의 역할 분리
- Output Projection은 head 간 정보를 선형적으로 결합한다.
- 하지만 선형 변환만으로는 복잡한 관계를 충분히 표현하지 못한다.
- 이후 Feed-Forward Network가 비선형 변환을 수행한다.
- 즉 Projection은 “결합”, FFN은 “표현 확장”을 담당한다.
의의와 한계
Output Projection Matrix는 Multi-Head Attention의 핵심 가치를 완성하는 단계로, 서로 다른 attention head가 학습한 정보를 단순 병렬 구조에서 벗어나 실제로 결합된 표현으로 만든다. 이 과정이 있어야 다양한 관점이 의미 있게 통합되며 모델의 표현력이 증가한다. 다만 이 연산은 선형 결합에 기반하기 때문에 복잡한 비선형 관계까지 직접적으로 표현하지는 못하며, 이를 보완하기 위해 Feed-Forward Network가 뒤따라야 한다. 즉 Output Projection은 “정보를 섞는 단계”이고, 이후 계층이 “표현을 확장하는 단계”를 담당하는 구조다.
먼저 보면 좋은 글 (3/3)
- Transformer Attention Projection — QKV 분리와 Attention 계산 원리
- Attention Graph — 왜 Attention Matrix는 정보 흐름 네트워크가 되는가
- Attention Collapse (어텐션 붕괴) — 왜 LLM은 일부 토큰에만 집중하는가
이어서 보면 좋은 글 (2/2)
- Attention-based Architecture (어텐션 기반 아키텍처) — 입력 간 중요도를 동적으로 반영하는 신경망 구조
- QKV Projection Matrices — 왜 Q·K·V는 서로 다른 공간이 필요한가
같은 주제 글 (8/8)
- Attention Head — 왜 Multi-Head 구조가 필요한가
- Efficient Attention — 긴 문맥에서 Attention 병목은 어떻게 줄이는가
- Multi-Head Attention — 왜 여러 head가 문맥 표현을 더 풍부하게 만드는가
- Multi-hop Reasoning (멀티홉 추론) — 단서를 하나씩 이어가며 답을 찾는 사고 방식
- Sparse Attention — 왜 일부 토큰만 계산해도 문맥을 유지하는가
- All-to-All Communication — MoE Expert Parallelism의 통신 병목 원리
- BigBird — 긴 문맥 처리를 위한 Sparse Attention 설계 원리
- Causal Local Attention (인과적 로컬 어텐션) — 긴 문장 생성의 계산 병목을 줄이는 원리
관련 개념 글 (1/1)
📍 AI 학습 지도에서 현재 위치
이 개념이 AI Universe 전체 구조에서 어디에 있는지 확인할 수 있습니다.
📍 AI Universe에서 현재 위치
☰
초기화 학습 완료 표시 · 로그인 필요 불러오는 중…
🌌 AI Universe
‹
›
⭐ 개념
별을 선택하세요.
« Efficient Attention — 긴…|Multi-Head Attention — 왜… »
🔖 태그: Attention Mechanism · multi-head attention · Neural Network · output-projection · representation-learning · Transformer