不是哥们,AI公司现在已经不满足于爬互联网了。
我们一直以为,互联网上的文字多到用不完;现在却有人开始追踪那些网上没有、机器还没有充分吃过的人类文字。
最近读到一篇调查。他们把追踪设备放进一批约1000本的稀有书籍运输中,最后追到了亚马逊位于拉斯维加斯的VGT3设施。报道援引员工说法,那里会把书的装订拆掉,以便更快扫描,纸质书随后被销毁。
这件事很有画面感:一本书从仓库出发,路上被追踪,最后变成了一堆扫描数据。这些内容很可能被用来帮助开发和改进AI产品。
随着公开网页越来越多地混入AI生成内容,真正由人写作、经过编辑、拥有来源的文本会变得更有价值。
我反而觉得,新闻最值得普通人吸收的部分,不是去囤书,更不是开始恐慌互联网要没内容了。
真正的启示是:未来稀缺的不是文字,而是有来源、有过程、有判断的人类记录。
所以,旧书值钱,不只是因为书里面有字。
它至少有四个特征。
第一,来源相对清楚。作者、出版社、出版时间、编辑过程都能追溯。
第二,内容经过长时间组织。一本书不是随机句子的集合,它有论证顺序、取舍和结构。
第三,很多旧内容没有被大规模重复改写。它不一定正确,但至少不只是模型对模型的回声。
第四,它保留了低概率的人类细节。
Nature发表的研究指出,当模型反复使用前一代模型生成的数据进行训练时,可能出现模型坍缩:数据分布中的尾部信息逐渐消失,模型输出越来越集中,真实世界里那些少见但重要的细节会被抹平。
这才是旧书和普通网页真正的差别。
不是旧书天然高贵,而是它更可能保留一段没有被无限复制、没有被模型反复改写的人类经验。
普通人没有旧书,也有自己的语料。
说到这里,很多人会觉得这件事离自己很远。
亚马逊在处理稀有书,我只是每天用AI写文案、改方案、做表格,难道我也有什么语料吗?
有,而且比你想象中更有用。

你的语料不一定是发表过的文章,也不一定是漂亮的知识笔记。它可能藏在这些地方:
你删掉的那句话;
你否决的那个方案;
你坚持保留的一个细节;
客户反复问过的问题;
你最后采用的版本;
你做完以后发现原来判断错了的地方。
普通笔记记录的是我看到了什么。
真正有价值的工作语料,记录的是我为什么这样选。
这两者差别很大。
一篇公开文章可以告诉AI什么是反馈文档,但只有你的反馈记录,才能告诉AI你认为什么叫合格、什么叫太油、什么叫偏题、什么叫虽然正确但不能交付。
我在Obsidian里已经有几十位AI陪跑客户的独立档案,也有持续迭代的Skill记录。它们的价值不在于数量,而在于每一次交付都留下了一个判断链:
客户提出了什么问题,AI先怎么回答,我改了什么,为什么改,最后交付了哪一版。
让AI改变的不是一条更长的提示词,而是一份写清楚了用户原话、执行过程和否决理由的反馈文档。
这就是个人语料真正的价值。
它不是把你的隐私上传给模型,也不是重新训练一个大模型的权重。
它是让你的AI在每次干活前,先读取一份有出处的上下文,知道你是谁、你做过什么选择、哪些坑已经踩过。
一个真正有用的反馈文档,应该记录什么
很多人建AI知识库,第一步就是疯狂收藏。
收藏网页、收藏提示词、收藏模板、收藏别人的工作流,最后得到一个几百页的资料堆。
问题是,AI读完这些东西,依然不知道你要什么。
因为资料里没有你的裁决。
我建议每个Skill都建立一份独立的反馈文档,最小结构如下:
【1】任务:这次要让AI完成什么。
【2】用户原话:尽量保留原始表达,不要一开始就替用户润色。
【3】AI执行:AI做了什么,采用了什么假设,哪些地方没有完成。
【4】我的否决:哪句话、哪一步、哪种方向被删掉,具体为什么。
【5】最终采用:最后真正交付或发布的版本。
以后固定规则,这次经验能不能沉淀成下一次可复用的判断。
这里面最值钱的部分,往往不是最终采用,而是我的否决。
因为最终版本只能告诉AI应该变成什么样,否决记录才能告诉AI不要再走哪条路。
一个AI写作系统如果只有优秀范文,就像一个只看过满分答案、从来没看过错题的学生。它会模仿表面,会复制语气,但不理解边界。
AI反馈文档补上的,正是这部分边界。
你真正要保存的,从来不是AI说了什么。
而是你为什么没有听它的。
夜雨聆风