很多科普说「Transformer 就是注意力」——这是错的。少了另外几个零件,它连「今天我请你」和「今天你请我」都分不出来
2026-07-26
一句话:Transformer 是今天几乎所有大模型的骨架。它不是什么神秘的「电子大脑」,而是一条把同样几道工序重复几十遍的流水线。上一篇讲的注意力只是其中一道——而且如果只有它,模型连词的先后顺序都分不清。
反幻觉声明:架构描述基于 2017 年的原始论文《Attention Is All You Need》(作者、年份已核实)。本文不涉及任何厂商未公开的实现细节,也不引用未经核实的参数规模。
你可以把 Transformer 想成工厂里的一条传送带。文字从这头进去,经过几道固定的工序,重复很多遍,最后从那头出来一个预测:下一个词最可能是什么。
第一步,切词。 上一篇讲过:文字先被切成一块块 token(文字积木)。
第二步,变成数字。 每块积木被换成一串数字(几百到几千个数)。这串数字就是这个词的「坐标」——意思相近的词,坐标也靠得近。
到这里为止都还好懂。接下来是最容易被漏讲、但极其关键的第三步。
这是这篇文章最想让你记住的一点。
上一篇说,注意力做的事是「拿我在找什么,去和每一条的标签比一比」。
请你仔细想想这个操作:它跟顺序有关系吗?
没有。 比对第 1 条和比对第 100 条,用的是完全一样的算法,谁先谁后完全不影响结果。
也就是说,如果只有注意力,那么这两句话在模型眼里一模一样:
今天我请你 / 今天你请我
同样的词、同样的数量,只是顺序不同——而注意力对顺序视而不见。
所以必须额外给每块积木加一个「位置信息」,明确告诉模型「你是第 3 个」「你是第 7 个」。这一步叫位置编码(positional encoding)。
少了它,Transformer 就是个只会看「有哪些词」、不会看「什么顺序」的袋子。这也是为什么说「Transformer 就是注意力」是错的。
准备好之后,数据进入层。每一层做两件事,然后这一整层会重复几十次。
每块积木去看看别的积木,决定「我该参考谁」。这一步的本质是交流——让每个词的表示里融进上下文的信息。
同一个「苹果」,在「苹果很好吃」和「苹果发布会」里,经过这一步之后就变成了两个不同的东西。
交流完,每块积木单独再做一遍加工,这次不看别人。这一步叫前馈网络(FFN),本质是独立思考。
这里有个反直觉的事实:前馈网络的参数量通常比注意力还大。很多研究认为模型「记住的知识」主要就存在这部分里。所以「Transformer 的核心是注意力」这个说法,连在参数占比上都站不住。
这两个零件不产生新信息,但没有它们,深层网络根本训练不起来。
上面这一整套(注意力 → 前馈 → 残差 → 归一化)会原样重复几十遍。
最后一层出来,接一个输出,给出「下一个词是什么」的概率分布。然后挑一个词,把它接到后面,整条流水线再跑一遍——一个字一个字地,就这么写出来了。
2017 年之前的主流做法要按顺序一个词一个词读,没法并行。Transformer 把这件事变成了「所有词同时比对」1,特别适合显卡这种「一次算一大批」的硬件。
能并行 → 能用更多显卡 → 能训练更大的模型 → 效果更好。
这条路径基本解释了过去这些年 AI 的爆发。不是某个算法突然变聪明了,而是一个可以无限加机器的架构被找到了。
| 零件 | 干什么 | 少了会怎样 |
|---|---|---|
| 切词 + 向量 | 把文字变成数字 | 模型读不了文字 |
| 位置编码 | 告诉模型谁在前谁在后 | 「我请你」和「你请我」分不清 |
| 注意力 | 词之间互相交流 | 每个词只能孤立理解 |
| 前馈网络 | 各自独立加工(参数量最大) | 没地方存知识 |
| 残差连接 | 保留原样一起传下去 | 层一深信息就糊 |
| 归一化 | 把数值拉回正常范围 | 训练直接崩 |
| 重复几十层 | 从表面特征到抽象关系 | 只能学到浅层规律 |
下次再看到「Transformer 就是注意力机制」这种说法,你可以补一句:那它怎么知道词的顺序呢?
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin (2017). Attention Is All You Need. arXiv:1706.03762。Transformer 架构的原始论文,其中位置编码、前馈网络、残差连接与层归一化均为架构的组成部分,而非可选项。https://arxiv.org/abs/1706.03762↩︎