☆ 저장 MHA Output Projection Matrix — 왜 Head를 concat만 하면 표현력이 부족한가

05/03/2026

Multi-Head Attention (MHA) Output Projection Matrix는는 MHA의 여러 head의 출력을 단순히 이어 붙는 데서 끝내지 않고, 서로 다른 head 정보 간 상호작용을 학습해 하나의 통합된 표현으로 재구성하는 선형 변환이다. 이 단계가 없으면 attention head들은 독립적인 feature 묶음으로 남아, multi-head 구조의 핵심 이점이 제대로 작동하지 않는다.

쉽게 말해: 여러 전문가가 각자 분석을 끝낸 상태(concat)는 아직 “보고서 초안들”이다. Output Projection은 이 초안들을 단순히 묶는 게 아니라, 서로 비교하고 섞어서 하나의 최종 보고서로 만드는 과정이다. 이때 중요한 정보는 강조되고, 중복되거나 덜 중요한 정보는 자연스럽게 줄어든다.

단순 feature 나열을 넘어 서로 다른 정보가 결합된 하나의 표현으로 재구성된다.

방법 (작동 원리, 특징 등)

의의와 한계

Output Projection Matrix는 Multi-Head Attention의 핵심 가치를 완성하는 단계로, 서로 다른 attention head가 학습한 정보를 단순 병렬 구조에서 벗어나 실제로 결합된 표현으로 만든다. 이 과정이 있어야 다양한 관점이 의미 있게 통합되며 모델의 표현력이 증가한다. 다만 이 연산은 선형 결합에 기반하기 때문에 복잡한 비선형 관계까지 직접적으로 표현하지는 못하며, 이를 보완하기 위해 Feed-Forward Network가 뒤따라야 한다. 즉 Output Projection은 “정보를 섞는 단계”이고, 이후 계층이 “표현을 확장하는 단계”를 담당하는 구조다.

먼저 보면 좋은 글 (3/3)

이어서 보면 좋은 글 (2/2)

같은 주제 글 (8/8)

관련 개념 글 (1/1)

📍 AI 학습 지도에서 현재 위치

이 개념이 AI Universe 전체 구조에서 어디에 있는지 확인할 수 있습니다.

📍 AI Universe에서 현재 위치

초기화 학습 완료 표시 · 로그인 필요 불러오는 중…

🌌 AI Universe

⭐ 개념

별을 선택하세요.

AI Universe 전체 보기

« Efficient Attention — 긴…|Multi-Head Attention — 왜… »

🔖 태그: Attention Mechanism · multi-head attention · Neural Network · output-projection · representation-learning · Transformer