Encoder-only Transformer — принцип кодирования двустороннего контекста
Encoder-only Transformer — это архитектура Transformer Encoder, которая анализирует всю входную последовательность целиком и создаёт контекстные представления, учитывая взаимосвязи между всеми токенами. Основная задача такой модели заключается не в генерации нового текста, а в понимании смысла входных данных, анализе отношений между словами и преобразовании их в информативные векторные представления. Благодаря bidirectional self-attention модель одновременно учитывает информацию из предыдущего и последующего контекста, формирует contextual embedding и обучается восстанавливать скрытые токены с помощью Masked Language Modeling (MLM).
07/18/2026
Masked Language Modeling (MLM) — принцип обучения двунаправленному контексту
Masked Language Modeling (MLM) — это метод self-supervised learning, при котором часть слов в предложении намеренно скрывается, а модель обучается восстанавливать исходные слова, используя одновременно контекст слева и справа. В этом подходе не требуется вручную создавать отдельные метки данных: скрытое исходное слово внутри предложения само становится целевым значением для обучения. Такой подход был разработан для преодоления ограничений однонаправленных языковых моделей, которые предсказывали слова только в одном направлении, и стал одной из основных задач предварительного обучения encoder-based моделей, таких как BERT.
07/18/2026