6.7 Attention и архитектура Transformer — переход к новой парадигме моделирования последовательностей за пределами RNN
В этой статье мы разберём, почему Attention Mechanism и Transformer стали ключевым шагом за пределы RNN-подходов в моделировании последовательностей. Основное внимание уделим тому, как эти архитектуры решают ограничения рекуррентных моделей через Information Bottleneck, Soft Alignment, Cross-Attention, Self-Attention, Query–Key–Value и Multi-Head Attention. Содержание Information Bottleneck и проблема длинных последовательностей Neural Machine Translation и Soft Alignment Основная […]
05/17/2026
7. Transformer — от Self-Attention до современных архитектур LLM
В этой статье объясняется, как Transformer решает ограничения традиционных последовательных моделей и как он эволюционировал от Self-Attention до современных архитектур Large Language Model (LLM). Вместо последовательной обработки по одному слову Transformer рассматривает весь вход целиком и одновременно вычисляет связи между токенами. Благодаря этому Transformer стал базовой архитектурой для обработки естественного языка, генерации кода, мультимодальных моделей и современных LLM.
06/15/2026
7.1 Архитектура Transformer и ключевые компоненты — модель Sequence-to-Sequence и архитектура Encoder–Decoder
В этой статье объясняется, как устроен Transformer и почему он стал ключевой архитектурой нейронных сетей в обработке естественного языка. Transformer не обрабатывает предложение по одному слову последовательно — вместо этого он одновременно рассматривает весь вход и вычисляет зависимости между токенами. Здесь рассматриваются ключевые компоненты: Sequence-to-Sequence Model, Encoder–Decoder Architecture, Transformer Encoder, Transformer Decoder, Word Embedding и Context Length.
06/15/2026
7.3 Механизм Self-Attention — от Query–Key–Value к матричным вычислениям
В этой статье мы объясняем, как Self-Attention Mechanism вычисляется на практике — начиная с структуры Query–Key–Value (QKV) и доходя до представления в виде Matrix Computation. Self-Attention — это не просто интуитивная идея “обращения внимания” на важные слова, а процесс, в котором каждый токен численно оценивает связь со всеми остальными токенами. Именно этот механизм лежит в основе Transformer.
06/15/2026
7.4 Multi-Head Attention, Positional Encoding и Add & Norm — ключевая структура, завершающая Transformer Block
В этой статье мы простым языком объясняем, почему Multi-Head Attention использует несколько Attention Head, как Positional Encoding добавляет информацию о порядке в Self-Attention и как Add & Norm повышает стабильность обучения Transformer Block. Self-Attention — это мощная структура для вычисления отношений между токенами, но одного attention недостаточно, чтобы разделить различные типы зависимостей, и он сам по себе не понимает порядок входной последовательности. Multi-Head Attention, Positional Encoding, Residual Connection и Layer Normalization устраняют эти ограничения и вместе формируют полноценно работающий слой Transformer Encoder.
06/15/2026
Absolute Positional Embedding — почему простое добавление позиции плохо обобщается на новые длины
Absolute Positional Embedding (APE) — это один из самых прямых способов сообщить Transformer, в каком порядке расположены токены. Каждой позиции соответствует собственный вектор, который складывается с token embedding. В результате входное представление содержит сразу два вида информации: что обозначает токен и где именно он находится в последовательности. Такой дополнительный сигнал необходим, поскольку сам по себе Self-Attention не кодирует порядок элементов.
08/22/2026
ALiBi — почему Attention не теряет устойчивость при работе с контекстом длиннее обучающего
ALiBi (Attention with Linear Biases) — это метод представления позиции, который помогает Transformer учитывать расстояние между токенами при обработке длинных последовательностей. В классических Transformer-моделях для передачи информации о порядке токенов используется Position Embedding, однако при работе с контекстом, длина которого превышает диапазон, встречавшийся во время обучения, модели могут испытывать сложности с корректной обработкой новых позиций. ALiBi решает эту проблему иначе: вместо добавления отдельного Position Embedding в представление входных данных он непосредственно изменяет Attention Score в механизме Self-Attention, добавляя Bias, зависящий от относительного расстояния между токенами. Благодаря этому близкие токены получают более высокий приоритет, а удалённые токены постепенно теряют часть Attention Score в зависимости от расстояния. При этом дальняя информация не исключается полностью — модель всё ещё может учитывать её, если она является важной для текущей задачи.
08/29/2026
Attention Dilution — почему важная информация теряется в длинном контексте
Attention Dilution — эффект, возникающий в архитектуре Transformer при работе с длинным контекстом: по мере роста числа доступных токенов Attention приходится учитывать всё больше потенциально релевантных связей, поэтому вклад отдельных важных фрагментов может становиться менее выраженным. Self-Attention технически позволяет сопоставлять токены по всему входу, но большой объём доступной информации ещё не означает, что модель сможет одинаково надёжно использовать каждую его часть. Именно поэтому в LLM с Long Context важная инструкция или нужный фрагмент исходных данных иногда остаётся без достаточного влияния на результат, несмотря на то что физически присутствует в Context Window.
08/29/2026
Attention Head — зачем Multi-Head Attention использует несколько голов
Attention Head — это отдельная ветвь вычислений внутри Self-Attention, которая оценивает связи между токенами. Если использовать только одну голову, все зависимости приходится описывать в одном пространстве представлений. Multi-Head Attention решает эту проблему иначе: несколько голов работают параллельно, используют разные проекции входа и могут выделять разные аспекты одной и той же последовательности.
08/22/2026
Attention Mask — почему связи между токенами нужно исключать до Softmax
Attention Mask задаёт правила обмена информацией внутри Self-Attention: он определяет, какие токены могут учитывать друг друга, а какие связи должны быть недоступны. Поэтому Mask стоит рассматривать не как способ слегка скорректировать attention score, а как механизм, который напрямую задаёт структуру связей между токенами. Если определённое взаимодействие запрещено, соответствующий путь просто не участвует в вычислении Attention.
08/22/2026