6.7 Atención y arquitectura Transformer — El cambio de paradigma en el modelado de secuencias más allá de la recurrencia

En esta clase veremos por qué el Mecanismo de Atención y el Transformer surgieron para superar limitaciones importantes de los modelos secuenciales basados en RNN. Nos centraremos en las ideas clave de Cuello de botella de información, Alineamiento suave, Atención cruzada, Autoatención, Query–Key–Value y Atención multi-cabeza.

04/28/2026

Transformer Attention Projection — cómo se separan Q, K y V y cómo se calcula Attention

Transformer Attention Projection transforma la representación de entrada en tres espacios con funciones distintas: Query, Key y Value (QKV). En lugar de comparar directamente los embeddings originales, el modelo genera proyecciones lineales que separan dos tareas: definir cómo se mide la relevancia entre posiciones y decidir qué información debe transmitirse. Projection prepara esas representaciones especializadas, mientras que Attention utiliza su relación para seleccionar y combinar el contexto más útil.

08/15/2026