书架上有不少读过的书。如果现在让我复述其中任何一本的论证,大概只能说出一句核心主张,外加一两个模糊的印象。书还在,知识取不出来。
问题不在记忆,在取回成本。读书的收益不在读的那一刻,而在之后无数次”想起来要用”。取回一条知识的成本只要高于一次网页搜索,人就会放弃翻书——我放弃过很多次。
传统解法是做读书笔记。它有两个老毛病:写的时候觉得”记下了就是我的”,之后基本没再打开;笔记是写给当时的自己的,没考虑过”以后要查”这个场景。
今年 8 月底,我把这件事整个交给 AI,搭了一套”书籍蒸馏”流程。到今天(2026-09-05),书库里蒸馏完 14 本。
一本书,六个文件
蒸馏的流程不长:提取全文和图片 → 按章节切块 → 逐块提取要点 → 重组 → 压缩 → 生成问答 → 抽检校验。全程 AI 执行,人只做一件事:交付前抽查引用,回原文核对。
每本书变成一个目录:
| 文件 | 内容 |
|---|---|
00_原文.txt |
全书全文 |
图片/ |
书里导出的全部图片,附清单 |
01_一页纸.md |
核心命题 + 全书骨架 + 关键数据 |
02_完整笔记.md |
章节级笔记,每条带出处 |
03_问答集.md |
100–300 条问答,分记忆/理解/应用三档 |
04_概念字典.md |
术语 → 定义 → 出处 |
05_行动清单.md |
可执行方法与适用边界 |
14 本书合计约 2100 条问答、近 1500 条概念定义、400 条方法(截至 2026-09-05,按书库索引累加)。这些数字不是手写笔记攒出来的,是流程批量产出的。
为什么这么干:三个理由
一,把取回成本降到”会真的去用”的程度。 原来的链路是:隐约记得某本书讲过 → 翻书 → 找不到 → 放弃。现在是问一句,答案带着出处回来。蒸馏产物是十几 KB 到两百 KB 的纯文本,AI 全文检索毫秒级完成。
二,AI 读得了一本笔记,读不了一书架。 大模型的上下文窗口放不下一本书,更放不下一个书架。蒸馏本质上是把书加工成 AI 可用的形态:概念、框架、推理链、关键数据保留,例子、修辞、重复删除。这是工程里常见的冷热分层——热数据用蒸馏产物,冷数据用原文 txt 兜底。
三,可信是被设计出来的,不是被期望出来的。 AI 最受质疑的是幻觉。这套流程有两道对冲:所有事实性引用强制带出处(电子书没有页码,就统一标”第几章·第几节”);流程最后一步是不可跳过的抽检——随机抽 5 处以上引用回源核对,不一致就修正,改完才归档。蒸馏产物里的每句”书里说 X”,理论上都能回到 00_原文.txt 里验证。它输出的不是”AI 觉得书里说了什么”,而是”书里说了什么,出处在这”。
关键设计:承认压缩有损,所以分三层
蒸馏是有损压缩,这点不回避——删掉的例子、叙事、修辞,有时恰恰是理解的一部分。所以一本书的目录里,蒸馏产物只是三层中的一层:
- 蒸馏产物层(01–05):日常问答走这层,快,覆盖观点、框架、概念类问题;
- 原文层(
00_原文.txt):蒸馏覆盖不到的边角,”原文到底怎么说”只有这层能答; - 图片层(
图片/):图表和流程图的本体。蒸馏时 AI 被强制看图转述成文字(《底层逻辑》60 张导图全部转完),交流时涉及图的细节,再打开原图对照。
实际用下来,大约九成的问题产物层就答完了,剩下的落到原文层和图片层。三层合起来,才等于”这本书”。
日常怎么用
三步:
- 扔书:电子版(PDF / txt / epub / mobi)放进
待整理/目录。扫描版也能处理,走 OCR——725 页的《爱比克泰德论说集》就是这么蒸出来的。 - 一句话启动:对 AI 说”处理待整理里的书”。剩下的不用管,从扔进去到归档,通常一天以内(扫描版 OCR 最慢)。
- 随便问。AI 检索蒸馏产物作答,并标注出处。
五种典型问法,都是真实场景:
- 单书问答:”《底层逻辑》里’三种对错观’分别是什么?”
- 跨书对比:”对比《爱比克泰德论说集》和《当下的力量》对’活在当下’的看法。”
- 情境咨询:”按《蛤蟆先生》的说法,我今天开会时是不是处在’儿童自我状态’?”
- 追溯原文:”这句话在书里哪一章?原文怎么说?”
- 看图问答:”《底层逻辑》讲’复利’的那张图,曲线大概长什么样?”
维护也省心:纯文本库,改哪个产物文件即时生效,没有索引重建这回事。嫌一本书太重,可以只留原文、一页纸、问答集三个文件。
对”理解和阅读”到底有没有帮助
有帮助,而且帮助的方式可以说明白:
骨架先行,第二遍阅读变得便宜。 先有骨架,细节才有地方挂。读一本书之前看一页纸,相当于出发前先拿地图;读到某一章,可以顺手问 AI”这一章在全书论证里处于什么位置”。
复习从”重读”变成了”检索练习”。 学习科学里被反复验证的结论是:测试自己比重读更能巩固记忆。以前复习一本书的唯一办法是重读,成本高到从不执行;现在让 AI 拿问答集拷问我,十几分钟过一章,记忆/理解/应用三档比例是配好的(约 4:4:2)。
图表第一次真正进了笔记。 书里的图往往是最浓缩的部分,却最容易在纸面阅读时被扫一眼放过。蒸馏流程强制看图转述,这部分信息不再流失。
但有两点局限,同样说明白:
它替代不了第一遍阅读。 蒸馏删掉的叙事和例子,正是阅读体验和情感记忆的载体。小说、传记、诗歌蒸出来只剩梗概,那不是读那本书。我的定位是:蒸馏产物是”第二遍的入口”,不是”第一遍的替身”。
警惕”存了就是会了”。 一页纸放在手边,容易产生已经掌握的错觉。一页纸是索引,不是理解;理解发生在带着问题去用、被问答拷打、把不同书的观点摆在一起对质的那些时刻。这套工具降低的是取回成本,不降低思考成本——思考成本本来也不该由工具来降。
结语
这套系统没有用任何前沿技术,就是”把书变成 AI 可检索、人可复核的纯文本库”,外加一套防幻觉的流程纪律。它改变的不是读书的速度,而是读过的书在生活里出现的方式:从书架上不再翻开的物件,变成一位随叫随到、说话带出处的顾问。