写出草稿确实能大幅提高正确率——但「它写的思考过程」和「它真的在想什么」,是两件不该混为一谈的事
2026-07-26
一句话:让 AI 先写出解题步骤再报答案,正确率会明显提高——这个发现叫「思维链」,是过去几年最重要的进展之一。但有两个坑:想得越久不是无限有效,而且它写出来的思路不等于它内部真实的运算过程。
反幻觉声明:思维链的原始论文(作者、年份、基准)已从 arXiv 原文核实。文中关于「可见思维链未必忠实反映内部过程」的说法,是当前研究界的普遍共识,本文以「不该混为一谈」的方式表述,未夸大为已被完全证实的定论。
2022 年,一组研究者做了个很朴素的尝试:在提问时,不直接要答案,而是先给模型看几个「带解题步骤」的例子1。
结果:模型在数学应用题上的正确率大幅提升。论文里用一个 5400 亿参数的模型、仅仅 8 个示范,就在小学数学应用题的标准测试集上刷到了当时的最好成绩——超过了专门为此微调过的模型。
这个方法被叫做思维链(Chain-of-Thought,简称 CoT)。
道理和你做数学题一模一样。
一支笔 3 元,买 7 支,付 50 元找回多少?
口算:你得在脑子里同时完成「3×7」和「50−21」两件事,容易乱。
写草稿:先写 3 × 7 = 21,再写
50 − 21 = 29。每一步都简单到几乎不可能错。
对 AI 来说还有一层额外的原因:模型是一个词一个词往外写的,每写一个词的计算量差不多是固定的。如果要求它直接吐答案,它就只有那么几步计算可用;而如果允许它先写一大段推理,它实际获得的计算量就多了很多倍。
换句话说:让它多写,就是给它多算的机会。
这也是为什么今天很多模型都有「思考强度」的档位(快答 / 中等 / 深思)——那本质上是在调「允许它打多少草稿」。
收益曲线是先陡后平的。
前期提升非常明显;但过了某个拐点之后,再增加思考预算,准确率基本不涨了,而时间和费用还在线性上涨。
更麻烦的是,「想太久」有时会变差——模型可能在长长的推理里绕进死胡同、自我说服、把一个原本对的答案改错。
所以正确的用法不是「永远开最高档」,而是针对你的题型试一下,找到那个拐点。简单任务开高档纯属浪费钱。
这条最重要,也最容易被误解。
当你看到模型输出「让我一步步想:首先……其次……」,很容易觉得这是它「内心活动的实况转播」。
不是的。
那段推理文字,本身也是被生成出来的文本——和它写的任何一句话一样,是「根据前文,下一个词最可能是什么」算出来的。它更像是一份事后写给你看的说明,而不是一段内部计算的录像。
这带来两个实际后果:
所以:看它的推理过程可以帮你发现问题,但不能替代你验算结论。
| 场景 | 建议 |
|---|---|
| 数学、逻辑、多步推理 | 明确要求「先写步骤再给答案」,收益最大 |
| 简单查询、改写、翻译 | 别开高思考档,纯浪费时间和钱 |
| 重要结论 | 只验算结论,别被漂亮的过程说服 |
| 发现它绕远了 | 打断它,把关键条件重述一遍再让它重来 |
| 想省钱 | 从低档开始,只在效果不够时才往上调 |
让它写草稿,是给它更多计算的机会——这确实有效。但草稿是写给你看的,不是它的脑电图。
会用的人,把思考档位当成一个旋钮去调;不会用的人,要么永远开最低(该想的不想),要么永远开最高(不该费的钱全费了)。
Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, Denny Zhou (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903。论文显示,仅用 8 个带推理步骤的示范,一个 5400 亿参数模型即在 GSM8K 数学应用题基准上取得当时最好成绩,超过经过微调并配验证器的 GPT-3。https://arxiv.org/abs/2201.11903↩︎