AI 的「记性」其实有四种,完全不是一回事

上下文、KV 缓存、检索、长期记忆——搞混这四个,你就会既高估它、又低估它

leonardchow.work · 读物 | AI 与大模型 · 原理与实测

2026-07-26

一句话:训练结束后,AI 模型的「脑子」就冻住了——你跟它说的任何话都不会改变它。所谓「它记得我」,其实是四种完全不同的机制在起作用,每一种的有效期、存放位置和失败方式都不一样。分不清这四样,你就会一会儿觉得它神通广大,一会儿又觉得它蠢得离谱。

反幻觉声明:本文涉及的三项技术均标注了原始论文(RAG、KV 缓存/PagedAttention、以及长上下文的位置效应),作者、年份、核心结论都从 arXiv 原文页核实过。文中没有引用任何厂商未公开验证的性能数字。

一、先破一个最大的误会

很多人以为:跟 AI 聊得越多,它就越了解你,像朋友一样慢慢「学会」你。

这是错的。

一个 AI 模型训练完成之后,它的参数(可以理解成「脑子里的连接方式」)就固定住了。你跟它聊一万句,它的参数一个都不会变。

那为什么它有时候确实”记得”事情?

因为有人在你看不见的地方,把资料重新塞回给它

二、四种「记性」,四种完全不同的东西

上下文、KV 缓存、检索、长期记忆——四种机制的位置、有效期和失败方式各不相同

① 上下文 = 摊开的书桌

上下文(context)就是这次对话里的所有文字:你发的每一句、它回的每一句,全都摊在一张「桌子」上。它每次回答,都会把整张桌子重新看一遍。

「怎么上一轮说过的事它就忘了」——多半就是桌子被收了,或者太长被挤掉了。

② KV 缓存 = 随手记的速记本

这个最容易被误解。

模型每写一个字,理论上都要把桌上所有资料重算一遍——太慢了。于是它把算过的中间结果暂存起来,下一个字直接用,这就是 KV 缓存(KV cache)。

这项技术之所以重要,是因为这个缓存非常占内存,而且长度会动态变化,管不好就浪费大量显存。2023 年有篇很有影响的论文(就是 vLLM 那套)专门解决这个问题,做法是把操作系统管内存的「分页」思路搬过来,让缓存的浪费接近零,吞吐量提升到原来的 2–4 倍1

但请记住关键一点

KV 缓存纯粹是为了快,它不增加任何新知识,也不会让模型「记住」什么。它是草稿纸,不是笔记本。

对话一结束,它就被丢掉了。

③ 检索(RAG)= 临时跑一趟图书馆

如果你想让 AI 回答「我们学校请假要走什么流程」,而校规根本不在它的训练数据里,怎么办?

办法是:先去找,再回答。系统先从一个外部资料库里搜出最相关的几段,搬到桌上,然后连同你的问题一起交给模型。

这套做法叫 RAG(检索增强生成),2020 年由 Lewis 等十二位研究者提出2。论文里的说法很精确:把模型自己的「参数化记忆」和外部的「非参数化记忆」结合起来——翻译成大白话就是:脑子里记不住的,就去书架上找

RAG 的好处是知识在模型外面,随时能更新(校规改了,换掉那份文件就行,不用重新训练模型)。

它的失败方式也很明确:可能找错书。搜出来的段落不对,后面答得再流畅也是错的。

④ 长期记忆 = 你的个人档案袋

「这个人是初二学生」「他不喜欢长篇大论」——这类关于的事实,被单独存进一个数据库。你每次提问,系统悄悄把它拼在你的问题前面。

所以「AI 记住我了」的真相是:

有个程序把你的资料存在别处,每次你提问时,把它重新喂给那个什么都不记得的模型。

三、一次问答里,四者分别在哪一步

一次「请假流程」问答中四种记忆的登场顺序,以及对话结束后各自的命运

对话结束后的命运完全不同,这张表最值得记住:

存在哪 对话关掉后 典型失败
① 上下文 这次请求里 全部清空 太长被挤掉、位置不好被忽略
② KV 缓存 显存里 立刻丢弃 只影响速度和成本,不影响对错
③ 检索库 外部数据库 原地不动 搜错段落,答案跟着错
④ 长期记忆 外部数据库 留下来 记了过时的事、或该记的没记

四、四个常见误解

误解 1:「上下文窗口越大=记性越好」

不对。桌子更大,不等于你能同时看清桌上每一样东西。2023 年斯坦福等机构的研究发现了一个著名现象:关键信息放在长文档的开头或结尾时模型表现最好,放在中间时性能明显下降——论文标题就叫《Lost in the Middle》(迷失在中间)3。这个问题在专门为长上下文设计的模型上同样存在。

误解 2:「KV 缓存是它的记忆库」

不对。它是草稿纸,用完即扔,不含任何你以为的「记住的知识」。

误解 3:「有了 RAG 就不会胡说了」

不对。RAG 能降低胡说的概率,因为它给了模型真实材料。但如果检索这一步找错了段落,模型会基于错误材料流畅地胡说——有时反而更难识破,因为它还煞有介事地引了「出处」。

误解 4:「它记住我,说明它学会我了」

不对。模型参数没变一个数。变的是每次发给它的那包资料。你随时可以删掉那个档案,它就立刻「失忆」——这也是为什么各家 AI 产品都能让你一键清除记忆。

五、这对你实际有什么用



  1. Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, Ion Stoica (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention. arXiv:2309.06180。论文提出把操作系统的分页机制用于 KV 缓存管理,使浪费接近零,吞吐量比当时最先进的系统提升 2–4 倍。https://arxiv.org/abs/2309.06180↩︎

  2. Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni, Vladimir Karpukhin, Naman Goyal, Heinrich Küttler, Mike Lewis, Wen-tau Yih, Tim Rocktäschel, Sebastian Riedel, Douwe Kiela (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401。RAG 的源头论文,把模型自身的参数化记忆与外部向量索引的非参数化记忆结合。https://arxiv.org/abs/2005.11401↩︎

  3. Nelson F. Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, Percy Liang (2023). Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172。发现关键信息位于长上下文中部时模型性能显著下降,且该现象在专门的长上下文模型上同样存在。https://arxiv.org/abs/2307.03172↩︎