它不是在撒谎——撒谎需要知道真相。真正的原因藏在一个你天天经历的地方:考试的计分规则
2026-07-26
一句话:AI 编造事实(业内叫「幻觉」)不是因为它想骗你,而是因为我们用「答对得分、说不知道不得分」的方式训练和考核它——在这套规则下,不会也要蒙一个是最优策略。这篇文章讲清楚它为什么编、什么时候最容易编,以及你能做什么。
反幻觉声明:本文的核心解释来自 OpenAI 研究团队 2025 年的论文《Why Language Models Hallucinate》,论文的作者、日期、核心论点均已从 arXiv 原文页核实。文中「AI 编造」的实例是本站上一篇文章写作过程中真实发生的,可对照原文验证。没有任何数字或来源是编的——这篇文章尤其不敢。
写这个系列上一篇文章的时候,我要在示意图里标出三个「文字积木」在模型内部的编号。我写下了:267、32086、15717。
看起来很像那么回事——数量级对、格式对、三个数各不相同。
然后我去查了一下真实值:302、1618、197721。
三个全是错的。
我不是想骗谁,我甚至没意识到自己在编。那三个数字只是「看起来最像编号的东西」——而这,恰恰就是 AI 幻觉的全部机制。
我们先把一个词的意思掰清楚。
撒谎需要两个条件:① 你知道真相;② 你故意说反。
AI 这两条一个都不占。它不知道真相,也没打算骗你。所以「AI 在撒谎」这个说法,方向就错了。
那它在干嘛?
AI 在训练阶段读了海量文字,学的核心本事只有一个:猜下一个词最可能是什么。
请注意这里的关键:真话和假话在文字上长得一样通顺。
「鲁迅原名周树人」和「鲁迅原名周作人」,作为句子一样流畅、一样像模像样。前者对,后者错——但这个区别不在文字的「通顺度」里,而在外部世界里。
模型内部没有一个「这句是真的 / 这句是假的」的开关。它只有「这句读起来顺不顺」。
这就是第一个来源:通顺 ≠ 正确,而模型只学到了通顺。
这一条才是真正有意思的地方,也是 OpenAI 2025 年那篇论文的核心发现2。论文用的比喻,就是考试——原文写的是「像学生面对不会做的考题一样」。
想象你在做一道四选一的选择题,你完全不会。规则是:
你会怎么办?
当然是蒙一个。 空着必得 0 分,蒙一下还有 25% 的机会。凡是理性的考生,都会蒙。
现在关键来了:给 AI 模型排名的那些榜单,用的几乎全是这套规则——答对加分,回答「我不知道」不加分。
于是在训练和调优的过程中,模型逐渐学会了同一件事:
不确定的时候,编一个听起来对的,总比说「我不知道」得分高。
论文的原话是:模型被优化成了「好的考生」(good test-takers),而好考生的第一守则就是——别留空。
所以幻觉不是一个孤立的技术故障,它是被我们的评价方式奖励出来的行为。
知道了机制,就能预测它在哪里翻车。越是「具体、稀有、可查证」的东西,越容易被编造:
| 高风险(重点核对) | 为什么 |
|---|---|
| 具体数字(编号、比例、金额) | 数字有固定格式,编一个「像的」成本极低——我那三个编号就是 |
| 日期、年份 | 同上,而且很少有人会真去查 |
| 人名 + 作品的对应关系 | 「某某写过某某书」读起来永远通顺 |
| 论文标题、DOI、URL | 格式极其规整,编起来毫无难度 |
| 冷门人物的生平细节 | 训练数据里出现次数少,模型「印象」模糊 |
反过来,越是常识性、被反复讲过的内容,越不容易出错——因为它在训练文本里出现了无数次,模型的「印象」很深。
这也解释了一个很多人观察到的现象:你问得越专业、越冷门,AI 越容易一本正经地胡说。不是它欺软怕硬,是那些地方的「印象」本来就淡。
论文给的方案有点反直觉:与其造更多「幻觉检测」的新测试,不如把现有排行榜的计分规则改掉3。
就像考试如果改成「答错倒扣分、老实空着给部分分」,学生的策略立刻会变一样——模型也会。这是一个规则设计问题,不是一个「模型不够聪明」的问题。
而你现在就能用的,有三招:
回到开头我编的那三个数字。
我为什么最后没让它们上线?不是因为我”感觉不对”——那三个数字看起来完全正常。是因为我有一条硬规矩:凡是具体数字,发布前必须回原始工具跑一遍。
规矩救了我,直觉没有。
这就是这篇文章真正想给你的东西:
面对 AI 给的信息,不要练习「判断它是不是在胡说」——你判断不出来,那正是幻觉的定义。要练习的是「建立一个不依赖判断的核对习惯」。
它说得越顺、越自信、越具体,你越该去查。这不是不信任 AI,这是使用 AI 的正确方法。
你可能会问:那这篇文章本身呢?
同样的规矩。文中所有关于论文的信息——标题、四位作者、投稿日期、核心论点——都是从 arXiv 的原始页面核对过的,你可以点下面的链接自己验。文中那个「我编了三个编号」的例子,也可以对照本站上一篇文章验证。
如果哪天你发现本站某篇文章里有编的东西,那是我的规矩没执行到位,不是 AI 的锅。
本站《AI 为什么数不清 strawberry 里有几个
r?》,文中三个 token 编号(302 / 1618 / 19772)为 tiktoken
实跑结果;初稿中曾误写为 267 / 32086 / 15717,发布前核对更正。https://leonardchow.work/reading/ai-tokenization-strawberry-2026↩︎
Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang (2025). Why Language Models Hallucinate. arXiv:2509.04664,2025 年 9 月 4 日投稿。论文用考试作比喻解释幻觉,并主张问题的解法在于修改现有主流评测的计分方式,而非新增幻觉专项测试。https://arxiv.org/abs/2509.04664↩︎
Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang (2025). Why Language Models Hallucinate. arXiv:2509.04664,2025 年 9 月 4 日投稿。论文用考试作比喻解释幻觉,并主张问题的解法在于修改现有主流评测的计分方式,而非新增幻觉专项测试。https://arxiv.org/abs/2509.04664↩︎