焚书,无论如何都是件招人骂的事。
秦始皇那把火被人骂了两千多年。而近来迁怒众人的“AI焚书”事件,没有明火,只有液压切割机沉闷的裁切声,高速扫描仪飞快的转动声,和成吨书页被粉碎后化为纸屑的沙沙声。

2021年,美国AI公司Anthropic从盗版网站下载了700万种图书,用来训练Claude大模型。2024年,版权方集体提起诉讼,Anthropic被迫拿出15亿美元和解。后来,Anthropic换了一种方式:花数千万美元,去市场上收购实体二手书。仅仅为了提升效率或独享资源,他们用液压切割机裁掉书脊,进行高速扫描,生成电子文档,再把实体书销毁。这个项目被媒体披露时,还有个代号叫"巴拿马计划"(Project Panama),涉及实体书达数百万册,甚至包括存世量极少的绝版古籍。
当然,除了Anthropic,别的AI公司估计也这么干过。从法律上讲,他们买的都是过了版权保护期的旧书,且适用于购买者"合理使用"原则。但在文明层面,书从来都不只是普通商品。 它是思想的容器,是知识的媒介,是跨越时间的精神对话。一本书的使命,是被翻阅、被批注、被传递,从一个人的书架到另一个人的书桌,让思想在不同的头脑里生长延续。而且书上的文字往往与封面设计、纸张、装订方式,甚至翻书留下的印记构成一个整体。但在数据饥渴的逻辑里,它被简化成了“文本载体”,信息抽取完毕,载体便失去价值,可以随意处置。
这种将人类共有的文化遗产进行私有化破坏的事,必然导致公众的愤慨。报道发酵后,马斯克在社交媒体上回应称,已要求自家AI团队以无损方式扫描、避免破坏书脊。

“AI焚书”如此荒诞粗暴,相信在舆论监督下会有所收敛,但它的深层动因并没有变,那就是全行业面临的“数据饥渴”。
2024年有一篇多国研究人员共写的论文《Will We Run Out of Data?(AI训练数据会耗尽吗)》就曾做过预判:到2026年,互联网上公开可用的高质量原生人类文本将基本耗尽。
并不是说互联网上产生的内容不够多,问题是论坛水帖、社交碎片、营销软文、SEO垃圾…这些每天海量产生的碎片化、低质化、甚至被AI反复浸染的内容,无法满足大模型的“营养需求”。
AI吃遍了全网的“残羹冷炙”,不得不将目光再次投向了人类文明的“数据富矿”:正式出版的纸质图书。 一本三百页的非虚构著作,背后是作者数年的研究考据,是编辑逐字逐句的打磨,是出版社整套流程的质量把关。它有完整的逻辑链条,有严谨的事实支撑,有自成体系的思想结构——这种文本密度与认知纯度,是一万条碎片化帖子也无法企及的。尤其是2022年之前出版的纸质书,几乎未受AI生成内容的污染,每一个字都带着人类思考的温度与褶皱,是训练大模型最珍贵的原生矿藏。于是数千万美元的采购与销毁成本,15亿美元的和解罚单,在独占这片数据金矿的商业价值面前,都成了一笔划算的买卖。
所谓的“巴拿马计划”让人“意难平”的是,科技巨头收购实体旧书,将其视为可供开采、独占、消耗的资源,榨干凝固的文字思想,还对实体书进行破坏和销毁。这场没有火光的焚书,烧的不是纸页,是人类“前AI时代”原创思想的存量土壤。
况且,数据的饥渴是没有尽头的。当互联网上新产出的文本都混杂着AI的痕迹,大模型的下一份“纯天然”养料又该从哪里来?

这让我想起作家尼尔·盖曼1999年为《黑客帝国》创作的官方衍生短篇《歌利亚》。作者补全了电影里“人类是机器的生物电池”的逻辑漏洞,将其描述为:
智能机器打造了一个名为“矩阵”的虚拟世界,将数十亿人类圈养在安稳的幻梦之中,目的是用亿万人脑组成分布式算力网络。因为人类独有的非线性思维、灵感直觉、情绪想象与创造性思考,恰恰是冰冷机器的先天短板。虚拟世界的温床,不过是为了让人类意识稳定运转,持续产出机器无法自行生成的智慧养分。
当然,这毕竟只是科幻小说。现实世界,这个“矩阵”或许就是新的互联网生态。就像早年的搜索引擎要提升用户体验就得给优质媒体导流、并资助维基百科一样,AI也需要反哺科研机构、出版社、机构媒体、优质作者,与内容生产者形成利益闭环。这其中,也包括以各种方式,去保护好那些旧书。
夜雨聆风