AI 一本正经胡说的时候,脑子里在发生什么?

它不是在撒谎——撒谎需要知道真相。真正的原因藏在一个你天天经历的地方:考试的计分规则

leonardchow.work · 读物 | AI 与大模型 · 原理与实测

2026-07-26

一句话:AI 编造事实(业内叫「幻觉」)不是因为它想骗你,而是因为我们用「答对得分、说不知道不得分」的方式训练和考核它——在这套规则下,不会也要蒙一个是最优策略。这篇文章讲清楚它为什么编、什么时候最容易编,以及你能做什么。

反幻觉声明:本文的核心解释来自 OpenAI 研究团队 2025 年的论文《Why Language Models Hallucinate》,论文的作者、日期、核心论点均已从 arXiv 原文页核实。文中「AI 编造」的实例是本站上一篇文章写作过程中真实发生的,可对照原文验证。没有任何数字或来源是编的——这篇文章尤其不敢。

一、先看一个真实的翻车现场

写这个系列上一篇文章的时候,我要在示意图里标出三个「文字积木」在模型内部的编号。我写下了:267、32086、15717

看起来很像那么回事——数量级对、格式对、三个数各不相同。

然后我去查了一下真实值:302、1618、197721

三个全是错的。

我不是想骗谁,我甚至没意识到自己在编。那三个数字只是「看起来最像编号的东西」——而这,恰恰就是 AI 幻觉的全部机制。

二、它不是在撒谎

我们先把一个词的意思掰清楚。

撒谎需要两个条件:① 你知道真相;② 你故意说反。

AI 这两条一个都不占。它不知道真相,也没打算骗你。所以「AI 在撒谎」这个说法,方向就错了。

那它在干嘛?

三、第一个原因:它学的是「像不像」,不是「对不对」

AI 在训练阶段读了海量文字,学的核心本事只有一个:猜下一个词最可能是什么

请注意这里的关键:真话和假话在文字上长得一样通顺

「鲁迅原名周树人」和「鲁迅原名周作人」,作为句子一样流畅、一样像模像样。前者对,后者错——但这个区别不在文字的「通顺度」里,而在外部世界里。

模型内部没有一个「这句是真的 / 这句是假的」的开关。它只有「这句读起来顺不顺」。

幻觉的两个来源:学的时候只学「像不像」,考的时候「蒙」比「认怂」划算

这就是第一个来源:通顺 ≠ 正确,而模型只学到了通顺。

四、第二个原因:我们的考法,逼它蒙

这一条才是真正有意思的地方,也是 OpenAI 2025 年那篇论文的核心发现2。论文用的比喻,就是考试——原文写的是「像学生面对不会做的考题一样」。

想象你在做一道四选一的选择题,你完全不会。规则是:

你会怎么办?

答对+1、答错0、空着也0,这套规则下「永远蒙一个」是理性的

当然是蒙一个。 空着必得 0 分,蒙一下还有 25% 的机会。凡是理性的考生,都会蒙。

现在关键来了:给 AI 模型排名的那些榜单,用的几乎全是这套规则——答对加分,回答「我不知道」不加分。

于是在训练和调优的过程中,模型逐渐学会了同一件事:

不确定的时候,编一个听起来对的,总比说「我不知道」得分高。

论文的原话是:模型被优化成了「好的考生」(good test-takers),而好考生的第一守则就是——别留空

所以幻觉不是一个孤立的技术故障,它是被我们的评价方式奖励出来的行为

五、它什么时候最容易编?

知道了机制,就能预测它在哪里翻车。越是「具体、稀有、可查证」的东西,越容易被编造

高风险(重点核对) 为什么
具体数字(编号、比例、金额) 数字有固定格式,编一个「像的」成本极低——我那三个编号就是
日期、年份 同上,而且很少有人会真去查
人名 + 作品的对应关系 「某某写过某某书」读起来永远通顺
论文标题、DOI、URL 格式极其规整,编起来毫无难度
冷门人物的生平细节 训练数据里出现次数少,模型「印象」模糊

反过来,越是常识性、被反复讲过的内容,越不容易出错——因为它在训练文本里出现了无数次,模型的「印象」很深。

这也解释了一个很多人观察到的现象:你问得越专业、越冷门,AI 越容易一本正经地胡说。不是它欺软怕硬,是那些地方的「印象」本来就淡。

六、怎么办

论文给的方案有点反直觉:与其造更多「幻觉检测」的新测试,不如把现有排行榜的计分规则改掉3

改计分规则:答错倒扣、诚实说不知道给部分分,最优策略就变了

就像考试如果改成「答错倒扣分、老实空着给部分分」,学生的策略立刻会变一样——模型也会。这是一个规则设计问题,不是一个「模型不够聪明」的问题。

而你现在就能用的,有三招:

  1. 明确告诉它可以说不知道。 一句「不确定就直说不知道,不要猜」往往真的有用——因为你临时改掉了它的「计分规则」。
  2. 要出处,然后真的去点开。 注意:出处本身也可能是编的。所以关键动作不是「让它给链接」,而是「你去点那个链接」。
  3. 对具体数字、日期、人名、论文标题额外警惕。 按上面那张表,这些是重灾区。

七、真正要记住的那件事

回到开头我编的那三个数字。

我为什么最后没让它们上线?不是因为我”感觉不对”——那三个数字看起来完全正常。是因为我有一条硬规矩:凡是具体数字,发布前必须回原始工具跑一遍

规矩救了我,直觉没有。

这就是这篇文章真正想给你的东西:

面对 AI 给的信息,不要练习「判断它是不是在胡说」——你判断不出来,那正是幻觉的定义。要练习的是「建立一个不依赖判断的核对习惯」。

它说得越顺、越自信、越具体,你越该去查。这不是不信任 AI,这是使用 AI 的正确方法。


顺便说一句

你可能会问:那这篇文章本身呢?

同样的规矩。文中所有关于论文的信息——标题、四位作者、投稿日期、核心论点——都是从 arXiv 的原始页面核对过的,你可以点下面的链接自己验。文中那个「我编了三个编号」的例子,也可以对照本站上一篇文章验证。

如果哪天你发现本站某篇文章里有编的东西,那是我的规矩没执行到位,不是 AI 的锅。



  1. 本站《AI 为什么数不清 strawberry 里有几个 r?》,文中三个 token 编号(302 / 1618 / 19772)为 tiktoken 实跑结果;初稿中曾误写为 267 / 32086 / 15717,发布前核对更正。https://leonardchow.work/reading/ai-tokenization-strawberry-2026↩︎

  2. Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang (2025). Why Language Models Hallucinate. arXiv:2509.04664,2025 年 9 月 4 日投稿。论文用考试作比喻解释幻觉,并主张问题的解法在于修改现有主流评测的计分方式,而非新增幻觉专项测试。https://arxiv.org/abs/2509.04664↩︎

  3. Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang (2025). Why Language Models Hallucinate. arXiv:2509.04664,2025 年 9 月 4 日投稿。论文用考试作比喻解释幻觉,并主张问题的解法在于修改现有主流评测的计分方式,而非新增幻觉专项测试。https://arxiv.org/abs/2509.04664↩︎