关注我们 |发现更多精彩内容

切书喂AI:当人类文明的纸页,成了算法的燃料
文||钟吟


AUTUMN TOURISM
想象这样一个画面:一本绝版的旧书,书脊被液压切割机整齐切开,书页送入高速工业扫描仪化作数字矩阵,剩下的纸浆被送进回收厂。整个过程干净、高效、合法。
然后,这本书就从世界上消失了。
这不是反乌托邦小说的情节。这是Anthropic公司“巴拿马计划”的真实操作。这家AI巨头斥资数百万美元,从图书馆、在线二手书店大量购入纸质图书。无论小说、教材还是专业书籍,来者不拒,切书、扫描、销毁,将内容用于训练Claude AI模型。内部文件白纸黑字写着:“我们不想让别人知道我们正在进行这项计划。”
而Anthropic并非孤例。调查媒体404 Media最新报道显示,多家AI公司正通过中间商大规模收购二手图书。订单规模从1000本到100万本不等。二手书商报告称,过去一周卖20本就算好业绩,如今每周能卖出数百本。买家对价格“完全不在乎”,唯一的共同点是:只要书上有ISBN编号。
一场针对人类文学遗产的“圈地运动”,正在悄然进行。
一、合法的“焚书”,比非法的更令人不安
从法律上看,这件事挑不出毛病。美国联邦法院裁定:购买实体书后扫描并销毁原件,属于“合理使用”。法官认为这属于“转化性使用”。就像用书教孩子,或者买书后可以随意处置。购买者对作为商品的书籍实体拥有绝对的处置权。但法律的逻辑与人类的文化经验在此处离散。
历史上的焚书,是为了消灭知识。而今天的“切书喂AI”,恰恰相反,是为了最大程度地“接纳”这些知识。然而,这种接纳的方式是:剥离其物理时空,封存于单一技术公司的黑盒子里。一本书被切碎、扫描、销毁,它的内容变成了训练数据,但那本具体的、可以触摸的、可以在旧书摊上被人偶然翻到的书,再也没有了。
实体书的物理存在,原本保证了知识具备某种分布式的、不可轻易抹除的社会性。一本书即使绝版,它依然可能存在于某个偏远小镇的图书馆或旧书摊上,保持着与潜在读者的随机连接。扫描并销毁的过程,是资本利用物理占有的合法性,取消了知识在物理世界中进行非资本化流通的可能性。
二、AI为什么要“吃”书?因为互联网已经“中毒”了
AI公司不傻。他们知道烧书会引发公愤。但他们更怕另一件事:模型崩溃。
什么是模型崩溃?简单说,就是用AI生成的内容去训练AI,一代代迭代下去,模型会逐渐失去对真实数据分布的记忆,输出质量越来越差。有人把这种现象比作“AI近亲结婚”。
近年来,大量由AI生成的低质量内容(俗称“AI垃圾内容”)充斥互联网。如果继续用这些被污染的数据训练AI,模型会越来越“蠢”。因此,AI公司开始重新寻找由人类原创的内容。尤其是2022年之前出版的纸质书籍。这些书“在结构上保证不含AI生成的污染”。
这是一个恐怖的循环:AI生成的内容污染了互联网;AI公司为了躲避污染,回过头来吞噬人类最后的“纯净”知识载体纸质书;纸质书被销毁后,人类失去了对知识的物理所有权;而AI,继续用它从这些书中提取的知识,生成更多内容……
循环往复,直到人类文明的知识源头被彻底抽干。
三、15亿美元的“赎罪券”买不回什么?
2026年7月,美国联邦法院最终批准Anthropic与作者群体达成15亿美元版权和解。这是迄今规模最大的生成式AI版权和解案之一。
但15亿买的是什么?买的是Anthropic非法获取和囤积盗版数据的惩罚。该公司曾长期保存一个包含700万本盗版图书的数据库。
法院的逻辑很微妙:合法购买正版书、扫描后销毁,可以免责;但从盗版网站批量爬取并永久囤积,必须重罚。前者是“合理使用”,后者是“侵权”。
可对于那本已经被切碎、回收、永远消失的绝版书来说,这15亿美元无论是“合法销毁”还是“非法囤积”,都买不回它曾经存在过的物理事实。
批评者指出,目前尚不清楚AI公司在数字化过程中,是否会区分普通图书与珍贵图书、绝版图书。如果稀有书籍被拆毁,它们将永久退出流通。
四、当知识成了AI的“私有财产”
这场争议中最荒诞的地方在于:AI公司一边销毁实体书,一边声称自己在“打破知识壁垒、实现信息民主”。
技术乐观主义者会说:大语言模型通过阅读人类千百年的文明结晶,以极低乃至免费的价格,将凝练后的知识反哺给公众。
但真相是,这些知识被剥离了物理载体、封存在技术公司的服务器里之后,就不再属于“公众”了。它变成了少数几家公司的私有资产。你可以向AI提问,但你不拥有它;你可以读到AI生成的内容,但你无法追溯它的来源;你可以消费知识,但你不再能“拥有”一本书。
这就是“数字圈地运动”。16世纪英国的圈地运动,剥夺了农民对公有土地的使用权。而今天的“切书喂AI”,剥夺的是人类对自身文明成果的物理所有权和解释权。
五、谁来守护文明?
埃隆·马斯克最近表态:他要求SpaceX AI团队“保留图书馆中的稀有书籍,花时间妥善扫描,而不是简单切掉书脊扫描”。
这当然是个好姿态。但问题在于:为什么保护书籍,需要靠一个亿万富翁的“仁慈”来决定?
当“切书喂AI”成为行业通行做法,当二手书商把成吨的书籍卖给匿名买家,当法院说“合法购买后销毁不侵权”,我们或许该停下来想一想:如果所有书都被数字化了,但所有实体书都被销毁了,我们真的“拥有”这些知识吗?
纸质书会发黄、会虫蛀、会绝版。但正因如此,它们才构成了文明的冗余备份。即便某家公司的服务器宕机、某个数据库被删除、某份版权协议到期,只要世界上还有一本纸质书存在,那段知识就还在。而“切书喂AI”正在做的,恰恰是消灭这个冗余备份。
它把人类千百年积累的知识,从分布式的、不可抹除的物理世界,搬进了少数几家公司的数据中心。表面上是在“保存”知识,实际上是在垄断知识。文明的载体从石头到竹简,从羊皮到纸张,每一次变革都让知识传播得更远。但这一次不同知识没有被传播得更远,而是被集中得更紧。
当最后一本纸质书被切碎、扫描、送进回收厂,当所有知识都变成了服务器里的比特流,到那时,谁来决定什么知识可以被访问?谁来决定哪些内容可以被遗忘?谁来决定AI生成的是“知识”还是“幻觉”?
我们正在把人类文明的钥匙,交给算法。而算法,从不读书。它只“吃”书。
点个赞与红心,与朋友们共勉。

分享

收藏

点赞

在看

夜雨聆风