☆ 保存 基于注意力的架构——一种动态衡量输入重要性的神经网络结构

04/07/2026

基于注意力的架构是一种不会把所有输入元素都同等处理的神经网络结构。它会根据当前任务或上下文的需要,对更相关的输入部分赋予更大的权重,从而构造表示。它的核心思想是:模型会针对每一次输入重新计算“该重点看哪里”。因此,即使在很长的句子或很长的序列中,只要关键信息与当前位置相关,模型也可以直接建立联系并把它纳入当前表示。

**通俗地说:**当我们阅读一篇长文章时,并不会对每一句话都投入完全相同的注意力,而是会先去看和当前问题最相关的部分。注意力机制也是类似的。比如在句子“Cheolsu gave a book to Yeonghui”中,如果问题是“Who received the book?”, 模型就会比起“Cheolsu”更关注“Yeonghui”。也就是说,它会看整个输入,但每次都会重新计算其中哪一部分对当前预测更重要。

模型先计算输入元素之间的相关性,再对更重要的信息赋予更大的权重,最终形成上下文化表示。

工作方式(机制、特点与核心思路)

意义与局限

基于注意力的架构能够直接计算输入之间的关系,并有选择地强化重要信息,因此即使在长上下文中也能较好地保留关键线索。更重要的是,它会根据上下文动态重建表示,所以词或 token 不再被理解为固定不变的意义,而是被理解为由整句上下文共同决定的意义。同时,它天然适合并行计算,表示能力也很强,因此成为 Transformer 系列模型的核心基础。不过,随着输入长度增加,模型需要计算所有位置之间的关系,计算量和内存开销都会迅速上升。因此,在实际应用中,人们也在持续研究 sparse attention、linear attention、local attention 等更高效的变体。

建议先读 (3/5)

+2

接下来推荐阅读 (5/18)

+5

同一主题文章 (3/3)

相关概念 (2/2)

📍 这个概念在 AI 学习地图中的位置

查看这个概念在整个 AI Universe 中的位置。

📍 AI Universe 中的当前位置

重置 显示已完成 · 需要登录 加载中…

🌌 AI Universe

⭐ 概念

请选择一个节点。

查看完整 AI Universe

« 稠密向量表示 — 为什么意义可以用向量空间中的距…|注意力图 — 为什么词元之间的关注模式是理解模型… »

🔖 标签: Transformer · 上下文化表示 · 基于注意力的架构 · 注意力机制 · 神经网络 · 自注意力