Transformer 不是一个机器人,是一条流水线

很多科普说「Transformer 就是注意力」——这是错的。少了另外几个零件,它连「今天我请你」和「今天你请我」都分不出来

leonardchow.work · 读物 | AI 与大模型 · 原理与实测

2026-07-26

一句话:Transformer 是今天几乎所有大模型的骨架。它不是什么神秘的「电子大脑」,而是一条把同样几道工序重复几十遍的流水线。上一篇讲的注意力只是其中一道——而且如果只有它,模型连词的先后顺序都分不清。

反幻觉声明:架构描述基于 2017 年的原始论文《Attention Is All You Need》(作者、年份已核实)。本文不涉及任何厂商未公开的实现细节,也不引用未经核实的参数规模。

一、先看一条流水线

你可以把 Transformer 想成工厂里的一条传送带。文字从这头进去,经过几道固定的工序,重复很多遍,最后从那头出来一个预测:下一个词最可能是什么

Transformer 的完整流水线:切词、变数字、加位置、然后是重复几十次的注意力+前馈层

二、进厂前的两步准备

第一步,切词。 上一篇讲过:文字先被切成一块块 token(文字积木)。

第二步,变成数字。 每块积木被换成一串数字(几百到几千个数)。这串数字就是这个词的「坐标」——意思相近的词,坐标也靠得近。

到这里为止都还好懂。接下来是最容易被漏讲、但极其关键的第三步

三、关键:注意力根本不知道谁在前谁在后

这是这篇文章最想让你记住的一点。

上一篇说,注意力做的事是「拿我在找什么,去和每一条的标签比一比」。

请你仔细想想这个操作:它跟顺序有关系吗?

没有。 比对第 1 条和比对第 100 条,用的是完全一样的算法,谁先谁后完全不影响结果。

也就是说,如果只有注意力,那么这两句话在模型眼里一模一样

今天 / 今天

同样的词、同样的数量,只是顺序不同——而注意力对顺序视而不见。

所以必须额外给每块积木加一个「位置信息」,明确告诉模型「你是第 3 个」「你是第 7 个」。这一步叫位置编码(positional encoding)。

少了它,Transformer 就是个只会看「有哪些词」、不会看「什么顺序」的袋子。这也是为什么说「Transformer 就是注意力」是错的。

四、一层里面发生什么

准备好之后,数据进入。每一层做两件事,然后这一整层会重复几十次。

① 注意力:大家互相看一眼

每块积木去看看别的积木,决定「我该参考谁」。这一步的本质是交流——让每个词的表示里融进上下文的信息。

同一个「苹果」,在「苹果很好吃」和「苹果发布会」里,经过这一步之后就变成了两个不同的东西。

② 前馈网络:各自回去消化

交流完,每块积木单独再做一遍加工,这次不看别人。这一步叫前馈网络(FFN),本质是独立思考

这里有个反直觉的事实:前馈网络的参数量通常比注意力还大。很多研究认为模型「记住的知识」主要就存在这部分里。所以「Transformer 的核心是注意力」这个说法,连在参数占比上都站不住。

③ + ④ 两个保命零件

这两个零件不产生新信息,但没有它们,深层网络根本训练不起来

五、然后重复几十次

上面这一整套(注意力 → 前馈 → 残差 → 归一化)会原样重复几十遍

最后一层出来,接一个输出,给出「下一个词是什么」的概率分布。然后挑一个词,把它接到后面,整条流水线再跑一遍——一个字一个字地,就这么写出来了。

六、为什么这个设计赢了

2017 年之前的主流做法要按顺序一个词一个词读,没法并行。Transformer 把这件事变成了「所有词同时比对」1,特别适合显卡这种「一次算一大批」的硬件。

能并行 → 能用更多显卡 → 能训练更大的模型 → 效果更好。

这条路径基本解释了过去这些年 AI 的爆发。不是某个算法突然变聪明了,而是一个可以无限加机器的架构被找到了。

七、小结

零件 干什么 少了会怎样
切词 + 向量 把文字变成数字 模型读不了文字
位置编码 告诉模型谁在前谁在后 「我请你」和「你请我」分不清
注意力 词之间互相交流 每个词只能孤立理解
前馈网络 各自独立加工(参数量最大) 没地方存知识
残差连接 保留原样一起传下去 层一深信息就糊
归一化 把数值拉回正常范围 训练直接崩
重复几十层 从表面特征到抽象关系 只能学到浅层规律

下次再看到「Transformer 就是注意力机制」这种说法,你可以补一句:那它怎么知道词的顺序呢?



  1. Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin (2017). Attention Is All You Need. arXiv:1706.03762。Transformer 架构的原始论文,其中位置编码、前馈网络、残差连接与层归一化均为架构的组成部分,而非可选项。https://arxiv.org/abs/1706.03762↩︎