注意力机制其实只有三步,用一个你每天都在做的动作就能讲完——顺便说一件学界至今还在吵的事
2026-07-26
一句话:「注意力」(attention)是今天所有大模型的核心零件,但它做的事情简单到你每天都在做:面对一大堆信息,先扫一眼各自是讲什么的,再决定重点看哪几条。这篇文章用班级群把它讲完,最后再说一件很多科普文章会讲错的事。
反幻觉声明:注意力机制出自 2017 年的论文《Attention Is All You Need》,作者与年份已核实。文末关于「注意力权重算不算解释」的学术争论,引用了正反双方三篇有明确标题的论文。
放学回家,班级群里 200 条未读。你想知道:周五体育课要带什么?
你会怎么做?
肯定不是从第 1 条一字不落读到第 200 条。你会飞快地往下扫,眼睛只在那些看起来跟「体育课」有关的地方停一下,然后细读那两三条。
恭喜,你刚刚执行了一次注意力机制。
AI 干的是同一件事,只是给三个角色起了名字:
然后三步走:
出来的结果,就是「我关注完这堆消息之后,脑子里剩下的东西」。
注意力机制的全部数学,就是这三步。 剩下的都是工程细节。
在它出现之前(2017 年之前),主流做法是让模型按顺序一个词一个词地读,像读磁带一样。这有两个大问题:
注意力把这两个问题一起解决了:任何两个词之间都可以直接「对上眼」,不管隔多远;而且所有比对可以同时算,特别适合用显卡跑。
2017 年那篇论文的标题就很有底气——《Attention Is All You Need》(你只需要注意力)1。今天几乎所有大模型,都建立在这个零件上。
实际用的时候不止一组 Q/K/V,而是好几组并排跑,这叫多头注意力(multi-head attention)。
还是班级群的例子:与其你一个人找,不如叫上几个同学一起——
每个人关注的角度不一样,最后把各自找到的合起来。这就是「多头」——同时从多个角度看同一堆信息。
你可能见过那种漂亮的图:一句话里的词之间连着深深浅浅的线,说这是「AI 的注意力分布」,仿佛能看到它在想什么。
这里要非常小心。
注意力权重看起来像解释,但它到底算不算解释,学界吵了很多年,而且吵得很凶:
还有研究发现,模型的注意力经常大量落在标点符号和分隔符这类看起来毫无意义的位置上2。
所以正确的说法是:
注意力权重告诉你信息是怎么流动的,但不等于告诉你模型为什么这么答。
看到注意力热力图时,把它当成一张「线路图」,别当成「口供」。
| 概念 | 大白话 | 一句话记住 |
|---|---|---|
| Query | 我在找什么 | 你的搜索条件 |
| Key | 每条内容的标签 | 贴在消息上的便签 |
| Value | 内容本身 | 真正要用的那段话 |
| 注意力权重 | 每条该分多少注意力 | 加起来等于 1 的比例 |
| 多头 | 几个人从不同角度同时找 | 分工协作 |
下一篇我们把注意力放回它所在的那条完整流水线里——Transformer。你会发现一个很多文章都讲错的点:Transformer 并不等于注意力,它还有好几个同样关键的零件。
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin (2017). Attention Is All You Need. arXiv:1706.03762。提出 Transformer 架构,用注意力机制取代循环与卷积结构。https://arxiv.org/abs/1706.03762↩︎
关于注意力可解释性的争论,正反双方代表作:Sarthak Jain & Byron C. Wallace (2019) Attention is not Explanation;Sofia Serrano & Noah A. Smith (2019) Is Attention Interpretable?;Sarah Wiegreffe & Yuval Pinter (2019) Attention is not not Explanation。后续研究亦指出注意力权重常集中于分隔符等语义贫乏的位置。↩︎