书架上有不少读过的书。如果现在让我复述其中任何一本的论证,大概只能说出一句核心主张,外加一两个模糊的印象。书还在,知识取不出来。

问题不在记忆,在取回成本。读书的收益不在读的那一刻,而在之后无数次”想起来要用”。取回一条知识的成本只要高于一次网页搜索,人就会放弃翻书——我放弃过很多次。

传统解法是做读书笔记。它有两个老毛病:写的时候觉得”记下了就是我的”,之后基本没再打开;笔记是写给当时的自己的,没考虑过”以后要查”这个场景。

今年 8 月底,我把这件事整个交给 AI,搭了一套”书籍蒸馏”流程。到今天(2026-09-05),书库里蒸馏完 14 本。

一本书,六个文件

蒸馏的流程不长:提取全文和图片 → 按章节切块 → 逐块提取要点 → 重组 → 压缩 → 生成问答 → 抽检校验。全程 AI 执行,人只做一件事:交付前抽查引用,回原文核对。

每本书变成一个目录:

文件 内容
00_原文.txt 全书全文
图片/ 书里导出的全部图片,附清单
01_一页纸.md 核心命题 + 全书骨架 + 关键数据
02_完整笔记.md 章节级笔记,每条带出处
03_问答集.md 100–300 条问答,分记忆/理解/应用三档
04_概念字典.md 术语 → 定义 → 出处
05_行动清单.md 可执行方法与适用边界

14 本书合计约 2100 条问答、近 1500 条概念定义、400 条方法(截至 2026-09-05,按书库索引累加)。这些数字不是手写笔记攒出来的,是流程批量产出的。

为什么这么干:三个理由

一,把取回成本降到”会真的去用”的程度。 原来的链路是:隐约记得某本书讲过 → 翻书 → 找不到 → 放弃。现在是问一句,答案带着出处回来。蒸馏产物是十几 KB 到两百 KB 的纯文本,AI 全文检索毫秒级完成。

二,AI 读得了一本笔记,读不了一书架。 大模型的上下文窗口放不下一本书,更放不下一个书架。蒸馏本质上是把书加工成 AI 可用的形态:概念、框架、推理链、关键数据保留,例子、修辞、重复删除。这是工程里常见的冷热分层——热数据用蒸馏产物,冷数据用原文 txt 兜底。

三,可信是被设计出来的,不是被期望出来的。 AI 最受质疑的是幻觉。这套流程有两道对冲:所有事实性引用强制带出处(电子书没有页码,就统一标”第几章·第几节”);流程最后一步是不可跳过的抽检——随机抽 5 处以上引用回源核对,不一致就修正,改完才归档。蒸馏产物里的每句”书里说 X”,理论上都能回到 00_原文.txt 里验证。它输出的不是”AI 觉得书里说了什么”,而是”书里说了什么,出处在这”。

关键设计:承认压缩有损,所以分三层

蒸馏是有损压缩,这点不回避——删掉的例子、叙事、修辞,有时恰恰是理解的一部分。所以一本书的目录里,蒸馏产物只是三层中的一层:

  • 蒸馏产物层(01–05):日常问答走这层,快,覆盖观点、框架、概念类问题;
  • 原文层(00_原文.txt:蒸馏覆盖不到的边角,”原文到底怎么说”只有这层能答;
  • 图片层(图片/:图表和流程图的本体。蒸馏时 AI 被强制看图转述成文字(《底层逻辑》60 张导图全部转完),交流时涉及图的细节,再打开原图对照。

实际用下来,大约九成的问题产物层就答完了,剩下的落到原文层和图片层。三层合起来,才等于”这本书”。

日常怎么用

三步:

  1. 扔书:电子版(PDF / txt / epub / mobi)放进 待整理/ 目录。扫描版也能处理,走 OCR——725 页的《爱比克泰德论说集》就是这么蒸出来的。
  2. 一句话启动:对 AI 说”处理待整理里的书”。剩下的不用管,从扔进去到归档,通常一天以内(扫描版 OCR 最慢)。
  3. 随便问。AI 检索蒸馏产物作答,并标注出处。

五种典型问法,都是真实场景:

  • 单书问答:”《底层逻辑》里’三种对错观’分别是什么?”
  • 跨书对比:”对比《爱比克泰德论说集》和《当下的力量》对’活在当下’的看法。”
  • 情境咨询:”按《蛤蟆先生》的说法,我今天开会时是不是处在’儿童自我状态’?”
  • 追溯原文:”这句话在书里哪一章?原文怎么说?”
  • 看图问答:”《底层逻辑》讲’复利’的那张图,曲线大概长什么样?”

维护也省心:纯文本库,改哪个产物文件即时生效,没有索引重建这回事。嫌一本书太重,可以只留原文、一页纸、问答集三个文件。

对”理解和阅读”到底有没有帮助

有帮助,而且帮助的方式可以说明白:

骨架先行,第二遍阅读变得便宜。 先有骨架,细节才有地方挂。读一本书之前看一页纸,相当于出发前先拿地图;读到某一章,可以顺手问 AI”这一章在全书论证里处于什么位置”。

复习从”重读”变成了”检索练习”。 学习科学里被反复验证的结论是:测试自己比重读更能巩固记忆。以前复习一本书的唯一办法是重读,成本高到从不执行;现在让 AI 拿问答集拷问我,十几分钟过一章,记忆/理解/应用三档比例是配好的(约 4:4:2)。

图表第一次真正进了笔记。 书里的图往往是最浓缩的部分,却最容易在纸面阅读时被扫一眼放过。蒸馏流程强制看图转述,这部分信息不再流失。

但有两点局限,同样说明白:

它替代不了第一遍阅读。 蒸馏删掉的叙事和例子,正是阅读体验和情感记忆的载体。小说、传记、诗歌蒸出来只剩梗概,那不是读那本书。我的定位是:蒸馏产物是”第二遍的入口”,不是”第一遍的替身”。

警惕”存了就是会了”。 一页纸放在手边,容易产生已经掌握的错觉。一页纸是索引,不是理解;理解发生在带着问题去用、被问答拷打、把不同书的观点摆在一起对质的那些时刻。这套工具降低的是取回成本,不降低思考成本——思考成本本来也不该由工具来降。

结语

这套系统没有用任何前沿技术,就是”把书变成 AI 可检索、人可复核的纯文本库”,外加一套防幻觉的流程纪律。它改变的不是读书的速度,而是读过的书在生活里出现的方式:从书架上不再翻开的物件,变成一位随叫随到、说话带出处的顾问。