6.7 Atenção e arquitetura Transformer — A mudança de paradigma na modelagem de sequências além da recorrência
Nesta aula, vamos entender por que o Mecanismo de Atenção e o Transformer surgiram para superar limitações importantes dos modelos sequenciais baseados em RNN. O foco será nas ideias centrais de Gargalo de informação, Alinhamento suave, Atenção cruzada, Autoatenção, Query–Key–Value e Atenção multi-head.
04/28/2026
Transformer Attention Projection — como a separação em QKV prepara o cálculo de Attention Parte 1
Transformer Attention Projection é a etapa em que o modelo transforma a representação de entrada em três papéis distintos: Query-Key-Value (QKV). Em vez de comparar diretamente os Embeddings originais, o Transformer aplica projeções lineares que criam espaços diferentes para consulta, comparação e transporte de informação. A Projection define como cada entrada será examinada; o Attention usa essas representações para calcular quais informações devem receber mais peso e ser propagadas adiante.
08/15/2026