Karpathy 的「LLM Wiki」:让 AI 替你养一个不会腐烂的知识库

——顺手给那篇《终结 RAG·9 条军规》的爆款文做一次逐条打假

leonardchow.work · 读物

2026-06-28

一句话:别让 AI 每次都「现查现拼」,而是让它帮你养一个「越用越聪明的笔记本」。这是 AI 研究者 Andrej Karpathy 在 2026 年 4 月真正提出的想法;至于网上流传的「9 条军规」「比 RAG 快 70 倍」「终结 RAG」,是自媒体加工出来的,原文里没有。

最近中文圈有一篇爆款文很火,标题大意是《Karpathy 掀翻 RAG!终结个人知识库腐烂的终极战略》,说他发布了一份叫 LLM-WIKI.md 的文件,列出「9 条核心军规」,还能「比 RAG 快 70 倍」。

这篇读物做两件事:

  1. 把真东西讲透——Karpathy 到底说了什么,用大白话,让没碰过技术的人也能完全看懂、甚至今天就能上手;
  2. 把假东西标出来——爆款文为了好传播,贴了一堆他根本没说过的标签,哪些是真、哪些是编的,逐条对照。

为了不传谣,本文所有「Karpathy 说……」的内容,都来自我逐字读过的原始文件(出处见文末),不采信任何二手转述。

全文核心一图看懂:你只管「找资料、问问题」,AI 把资料持续「消化」进一个不断长大的个人维基,以后查东西直接问这个维基。

一、先认识两个人和一份文件

Andrej Karpathy 是谁。 他是 AI 领域很有名的研究者:2015–2017 年是 OpenAI(做出 ChatGPT 的那家公司)的创始团队成员,2017–2022 年在特斯拉当 AI 总监(Director of AI),带队做自动驾驶的「看路」识别。

小纠正:爆款文说他是 OpenAI「联合创始人」。更准确的说法是「创始成员 / 创始团队成员」——他确实是公司一成立就在的元老之一,但正式被列为「联合创始人(co-founder)」的是 Altman、Musk、Brockman 等少数几个人。「前特斯拉 AI 总监」这半句则完全正确。这是个小差别,但既然要讲究,就讲究到底。

那份文件是什么。 2026 年 4 月 2 日,他在社交平台 X(原 Twitter)发了一帖讲这个想法,迅速火爆(约 1600 万次浏览);4 月 4 日,他把完整想法写成一个公开文件放了出来。

记住这个定性很重要:它是一页启发思路的随笔,不是一套铁律。 后面打假时你就明白,为什么「9 条军规」这种说法一开始就站不住。


二、知识库为什么会「腐烂」

很多人用过 Obsidian、Notion 这类笔记软件(都是用来记笔记、建「第二大脑」的工具),多半都经历过同一个过程:

疯狂收藏、高亮、标重点,却从来不整理。时间一长,笔记库变成一堆躺尸的文字:词条之间的链接断了,旧结论和新资料打架也没人发现,想查个东西翻半天翻不到。

Karpathy 一句话点破了病根——维护知识库真正烦人的,不是「读」和「想」,而是「记账」

更新交叉引用、让每条总结保持最新、发现新资料和旧说法矛盾时去标注、维护几十个页面之间的一致性……

这些「记账」活又多又枯燥,人会嫌烦、会半途而废。于是「维护的负担长得比价值还快」,知识库就烂掉了。这不是你不够自律,是这件事本身对人类不友好。

那谁来干这些苦活?他的答案是:AI。


三、核心思想:从「现查现拼」到「持续积累」

要讲清 Karpathy 的方案,得先讲清它想替代的东西——RAG

RAG(Retrieval-Augmented Generation,检索增强生成):现在主流的 AI 用资料方式。你把一堆文件丢给 AI,每次提问,AI 临时去这堆文件里翻出几段相关的、拼一个答案给你。你常用的 ChatGPT 传文件、NotebookLM 等,基本都是这个路子。

RAG 有个根本毛病,Karpathy 的原话是:

the LLM is rediscovering knowledge from scratch on every question. There’s no accumulation. (AI 每次提问都在从零重新发现知识,什么都没积累下来。)

也就是说——你上一次费劲让它理清的东西,这一次它一点都不记得,又从头翻一遍。知识不沉淀。

他的替代方案:让 AI 维护一个会「越长越厚」的个人维基。

「维基(wiki)」你可以理解成:一大堆互相链接的笔记(就像百度百科、维基百科那样,词条点一下就跳到相关词条)。关键在于「怎么往里加东西」:

每读进一份新资料,AI 不是简单存起来备查,而是当场「消化」它——

于是这个维基一天比一天厚、一天比一天聪明。以后你查东西,直接问这个维基,而不是问那一堆乱糟糟的原始文件。Karpathy 把这个维基叫做「持续积累的产物(a persistent, compounding artifact)」——「compounding」就是「利滚利」那个复利的意思:知识像钱生钱一样越滚越多。

上半:RAG 每次提问都临时翻原文、用完就忘,不积累。下半:LLM Wiki 把新资料一次消化进维基,维基越来越聪明,提问时直接查它。

两者的关键差别,他说得很清楚:用维基的方式,交叉引用早就建好了、矛盾早就标出来了、总结早就反映了你读过的一切——查的时候不用临时拼。

关于「编译」这个词(重要纠正)。 爆款文把这套方法叫「从 RAG 到编译(Compile)」,还说「原始笔记 = 源代码、AI = 编译器」。这是媒体替他总结的,不是他的原话,而且把比喻装反了。

他全文只顺带用过一次「compiled(编译)」,意思是「知识只编译一次、之后保持更新,而不是每次提问重新推导」——从没把方法命名为「编译范式」,也从没用过「编译器」这个名词。

真正的比喻是:「Obsidian 是 IDE(代码编辑器),大模型是程序员,维基是代码库(codebase)。」也就是说,在他眼里 AI 是「程序员」,不是「编译器」;产出的那个维基才相当于「代码」,原始资料他叫「事实来源」,不是「源代码」。


四、怎么搭:三层分工,别搞混

这部分是 Karpathy 原文逐字写明的,也是整套方法里最实在的骨架。一个知识库分成三层,各管各的:

三层分工:原始资料只读不改(人投喂),维基全归 AI 写(你只看),说明文件是你给 AI 定的规矩。
谁来写 是什么
① 原始资料 raw 人投喂,AI 只读不改 你收集的原文:文章、论文、图片、数据。这是「事实底稿」,将来要核对都靠它,所以绝不能动。
② 维基 wiki 全归 AI 写,你只看 AI 生成的那一堆互相链接的笔记:总结页、词条页、概念页、对比页、总览页。AI 负责建页、更新、维护链接、保持一致。
③ 说明文件 schema 你和 AI 一起定 一份告诉 AI「这套维基怎么组织、有什么约定、新资料进来按什么流程处理」的规矩书。

第三层值得多说一句。这份「说明文件」其实你可能已经见过——给 Claude 用的 CLAUDE.md、给 Codex 用的 AGENTS.md 就是这类东西(它们是放在项目里、告诉 AI「干活规矩」的配置文件)。Karpathy 说,正是这份说明文件,才让 AI 从一个普通聊天机器人,变成一个「守规矩的维基管理员」

小修正:爆款文说「人只负责输入」。前两层基本对(人找资料、AI 写维基);但第三层 schema 其实是人和 AI 一起打磨的,团队场景下他还提到人要审核 AI 的更新。所以不是「人完全不插手」。


五、怎么用:三个动作 + 定期「体检」

搭好了三层,日常就三个动作转圈圈:

日常三动作循环:录入(喂新资料让 AI 整理进维基)→ 提问(查维基,好答案再存回去)→ 体检(让 AI 自查矛盾、孤儿页、过时结论)。
  1. 录入(Ingest)——你丢一份新资料进去,让 AI 处理。它会读完、跟你聊聊要点、写一页总结、更新索引、顺手更新维基里相关的好几页(他说一份资料常常会动到 10–15 个页面),再记一条日志。Karpathy 自己偏好「一次只认真消化一份」,全程参与;但你也可以批量导入、少盯着点。

  2. 提问(Query)——你问问题,AI 去维基里找相关页、读、给带出处的答案。形式可以是一段文字、一张对比表、一套幻灯片、一张图表。有个关键窍门:好的答案别让它消失在聊天记录里,要「归档」回维基变成新的一页。 这样你每一次探索,也像新资料一样沉淀进知识库。

  3. 体检(Lint)——定期让 AI 给整个维基做个「健康检查」:

    Lint 这个词原本是程序员用的——指自动工具帮你「给代码挑毛病」。这里借来指「给笔记挑毛病、保持健康」。

    具体查什么:哪两页内容互相打架、哪条旧说法被新资料推翻了、哪一页成了没人链接的「孤儿页」、哪个重要概念还没有自己的词条、哪里缺交叉引用、哪个数据空白可以靠搜一下补上。AI 还很擅长反过来建议你「接下来该研究什么、该找什么新资料」


六、为什么这招行得通

讲到这你大概已经感觉到了:这套方法不靠「AI 有多聪明」,靠的是「AI 不嫌烦」

AI
读资料、做判断 ✅ 擅长、且应该由人来 辅助
更新链接、保持总结最新、标矛盾(「记账」) ❌ 嫌烦、会放弃 不无聊、不会忘、一次能改 15 个文件

所以维护成本几乎降到零,知识库就能一直保持鲜活,不再腐烂。Karpathy 给的分工很干脆:

人的活:找资料、定方向、问好问题、想清楚这一切意味着什么。AI 的活:其余全部。

还有个白送的好处:这个维基说白了就是一个装满文本文件的 git 仓库(git 是程序员管理文件版本的工具)。所以你白白获得了历史版本、可回滚、可多人协作——这些都是现成的。

最后,他把这个想法追溯到 1945 年——一位叫 Vannevar Bush 的科学家当年设想过一台叫 Memex 的机器:一个私人的、精心整理的知识库,文件之间用「关联线索」连起来。Karpathy 说,Bush 当年唯一没解决的问题就是「谁来做维护」——而现在,这个活由 AI 接手了。


七、爆款文逐条打假

下面是把那篇爆款文的关键说法,和原文逐条对照的结果。✅ 属实 / ⚠️ 半真被夸大 / ❌ 纯属编造:

把爆款文的说法和 Karpathy 原文逐条对照:左边是他真说的,右边是自媒体加的料。
爆款文说法 判定 真相
他 4 月初发文讲「AI 维护个人维基」 ✅ 属实 4/2 发帖、4/4 放文件,确为本人
三层分工 raw / wiki / schema、人投喂资料 ✅ 属实 原文逐字写明(schema 是人机共建,小修正)
「Obsidian 是 IDE,AI 是程序员,维基是代码库」 ✅ 属实 原文原话
想法源自 1945 年的 Memex 设想 ✅ 属实 原文结尾确有
引发了一波社区实践(几百页维基、自动化插件) ✅ 属实 真有开源框架和 Obsidian 插件(具体 star 数存疑,别当真)
「从 RAG 到编译」「原料 = 源代码、AI = 编译器」 ⚠️ 夸大+装反 他只顺带用过一次「compiled」,从没命名为「编译范式」;他的比喻里 AI 是程序员、维基才是代码
「OpenAI 联合创始人」 ⚠️ 不够准 他是 OpenAI 创始成员,不是正式 co-founder
文件名 LLM-WIKI.md(大写) ⚠️ 小错 真名是小写 llm-wiki.md
「9 条核心军规」 ❌ 编造 原文「规则(rule)」出现 0 次,没有任何编号清单(全文唯一的「9」在「1945」里)。真能数的是:3 层结构 + 3 个操作 + 6 条小技巧
「比 RAG 快 70 倍」 ❌ 编造 原文没有任何速度对比、跑分数字
「10 万 token 上限」 ❌ 编造 原文没有任何 token 数字;他只说用一个「索引文件」的招在「约 100 份资料、数百页」的中等规模下出奇好用
「打造第二大脑」 ❌ 编造 原文从没出现「second brain」一词,是转载者套的流行词
「Karpathy 终结了 RAG / RAG 已死」 ⚠️ 标题党 他只把维基当成「中等规模下省掉搭 RAG 的一个替代想法」,没说 RAG 已死——大规模、企业级、多人共享的场景,RAG 仍然合适

一句话总结打假:内核是真的、值得学;那些唬人的数字(9 条 / 70 倍 / 10 万 token)和「终结 RAG」是包装出来的。 看这类爆款文,记住一个习惯——凡是带精确数字和「终结某某」的耸动结论,回去翻一眼原文,十有八九是后人加的。


八、普通人今天怎么上手

不用懂编程,最小可行的玩法是这样:

  1. 挑一个 AI 助手——会读写文件的那种(如 Claude、Codex 等)。
  2. 建三个文件夹raw(放你收集的原文)、wiki(留给 AI 写)、再加一个说明文件(告诉 AI 规矩)。
  3. 把 Karpathy 那份 llm-wiki.md 原文直接发给你的 AI,让它照着帮你把具体做法定下来(他这份文件本来就是设计成「复制给 AI 用」的)。
  4. 从小开始,一次只喂一份好资料——别一上来就把几百个文件批量倒进去。先让维基长出十来个词条,像养盆栽一样慢慢长。
  5. 每隔一阵让 AI「体检」一次——查矛盾、查孤儿页、查过时结论。

中等规模(约一百份资料、几百页)这么玩,Karpathy 说连搭专门的检索数据库都省了——一个简单的「索引文件」就够 AI 找路了。


九、别神化它:边界在哪


十、出处与查证

本文事实以 Karpathy 本人公开的原始文件为准,写作时已逐字核对:

查证日期:2026-06-28。