6.7 Atenção e arquitetura Transformer — A mudança de paradigma na modelagem de sequências além da recorrência
Nesta aula, vamos entender por que o Mecanismo de Atenção e o Transformer surgiram para superar limitações importantes dos modelos sequenciais baseados em RNN. O foco será nas ideias centrais de Gargalo de informação, Alinhamento suave, Atenção cruzada, Autoatenção, Query–Key–Value e Atenção multi-head.
04/28/2026
7. Transformer — do Self-Attention à arquitetura moderna de LLMs
Neste artigo, explicamos como o Transformer resolveu as limitações dos modelos sequenciais tradicionais e como evoluiu do Self-Attention até as arquiteturas modernas de Large Language Models (LLM). Em vez de processar a frase palavra por palavra em sequência, o Transformer analisa todo o input simultaneamente, calculando relações entre tokens. Essa característica tornou o Transformer a base central do processamento de linguagem natural, geração de código, modelos multimodais e dos LLMs modernos.
06/15/2026
7.3 Mecanismo de Self-Attention — de Query–Key–Value até Computação em Matrizes
Este artigo explica como o Mecanismo de Self-Attention é realmente calculado, partindo da estrutura Query–Key–Value (QKV) até chegar à Computação em Matrizes. O Self-Attention vai além de uma ideia intuitiva de “consultar palavras relevantes”: ele descreve um processo no qual cada token calcula numericamente sua relação com todos os outros tokens, formando o núcleo do Transformer.
06/15/2026
7.8 Advanced Positional Embeddings — APE, RPE, and RoPE in Transformer Models
Este artigo explica a Positional Encoding usada em Transformers para representar a ordem dos tokens e suas extensões: Absolute Positional Embedding (APE), Relative Positional Embedding (RPE) e Rotary Positional Embedding (RoPE). Embora o Self-Attention seja poderoso para modelar relações entre tokens, ele não possui informação de ordem por si só. Por isso, a forma como a informação posicional é incorporada afeta diretamente o entendimento de contexto do modelo, o Context Length e o desempenho em Long-context Extrapolation.
06/15/2026
ALiBi — por que o Attention continua estável em contextos maiores do que os vistos no treinamento
ALiBi (Attention with Linear Biases) é uma técnica de representação posicional usada em Transformers para incorporar a distância entre tokens diretamente ao cálculo de Attention. Em arquiteturas tradicionais, Position Embedding fornece ao modelo informações sobre a posição de cada token. O problema é que posições muito além daquelas observadas durante o treinamento podem ser mais difíceis de generalizar. ALiBi evita adicionar um vetor separado de Position Embedding à entrada e, em vez disso, aplica um bias baseado na distância relativa diretamente ao Attention Score calculado pelo Self-Attention. Na prática, tokens próximos sofrem pouca penalização, enquanto tokens mais distantes recebem uma redução progressiva no score conforme a distância aumenta.
08/22/2026
Attention Dilution — por que informações importantes se perdem em contextos longos
Attention Dilution descreve a perda de foco que pode surgir em uma Transformer Architecture quando o contexto de entrada se torna muito extenso. O Self-Attention continua capaz de relacionar os Tokens do contexto, mas isso não garante que todas as informações recebam o mesmo peso nem que os trechos mais relevantes sejam aproveitados de forma consistente. Conforme mais conteúdo entra na disputa por atenção, uma instrução, um dado ou uma evidência importante pode exercer menos influência sobre o resultado. Esse efeito ajuda a explicar por que um Large Language Model (LLM) com Long Context pode ter a informação necessária disponível e, ainda assim, não utilizá-la adequadamente.
08/29/2026
BigBird — Como o Sparse Attention viabiliza o processamento de contextos longos
O BigBird reformula o Self-Attention do Transformer para lidar de forma mais eficiente com sequências muito longas. Em uma arquitetura baseada em Dense Attention, cada token pode interagir diretamente com todos os demais, o que oferece grande capacidade de representação, mas faz o custo computacional e o consumo de memória crescerem rapidamente com o tamanho da entrada. A proposta do BigBird não consiste apenas em eliminar cálculos de Attention: o modelo redefine quais conexões precisam existir para que informações relevantes continuem circulando pelo contexto mesmo quando nem todos os pares de tokens estão diretamente conectados.
08/31/2026
Decoder-only Transformer — O princípio da geração do próximo Token
O Decoder-only Transformer é uma arquitetura de geração autoregressiva que prevê o próximo Token com base nos Tokens anteriores. Em vez de analisar toda a sequência de entrada considerando informações futuras e passadas ao mesmo tempo, o modelo calcula a probabilidade do próximo Token usando apenas o contexto já gerado. Depois que um Token é selecionado, ele é incorporado novamente à sequência existente, e esse processo é repetido continuamente para produzir textos, códigos, diálogos e outros tipos de saída sequencial.
08/02/2026
Efficient Attention — Como os Transformers Escalam Attention para Contextos Longos
Efficient Attention reúne uma família de mecanismos de Attention criados para reduzir o gargalo computacional e de memória O(n²) do Self-Attention em Transformers. A ideia não é apenas baratear o cálculo, mas decidir quais relações entre tokens devem ser preservadas·aproximadas·comprimidas ou ignoradas ao lidar com sequências longas.
05/16/2026
Embedding Posicional Absoluto — Por que “somar a posição” tem um limite estrutural de generalização
O Embedding Posicional Absoluto (Absolute Positional Embedding, APE) é um método de codificação posicional usado em Transformers. Ele atribui um vetor único a cada posição da sequência e soma esse vetor ao embedding do token. Como o Self-Attention não entende a ordem dos tokens por conta própria, o APE fornece ao modelo uma forma básica de reconhecer onde cada token aparece.
05/06/2026