乐于分享
好东西不私藏

AI时代的焚书坑儒:AI巨头正潜入东欧,把古老书籍送进碎纸机

AI时代的焚书坑儒:AI巨头正潜入东欧,把古老书籍送进碎纸机
《华氏451》(Fahrenheit 451)是美国著名作家雷·布拉德伯里(Ray Bradbury)在1953年出版的有名的反乌托邦科幻小说。
在这本书的世界中,阅读被视为犯罪,“消防员”的职业不再是灭火,而是四处搜寻藏书,然后付之一炬的“放火者”。书名“华氏451度”是指书籍的纸张自燃的温度(大约是233摄氏度)。在小说中的独裁者之所以要焚书,是为了彻底剥夺人类的自主思考的能力,希望能够用肤浅的娱乐填满人类的大脑。
但是布拉德伯里可能想不到的是在2026年,一场由AI巨头主导的“焚书”运动正在现实世界上演。
是的,很讽刺,正是那些主导人类智慧结晶的硅谷AI大厂在做着这些事情。这些大厂的“消防员们”不用火,他们在使用我们很少听过的“机械怪兽” ——液压动力切割机(Hydraulic Powered Cutting Machine)
我们一起打开看看。

液压切割机和“巴拿马项目”

“咔嚓。”

伴随着沉重的机械轰鸣声,锋利的钢刀在旧书的书脊旁瞬间切下。

就这样,一本厚重的在某东欧国家的图书馆静静躺了几个世纪的硬皮书籍,被这样整齐的把书脊切掉。

书页就像是几百张泛黄的扑克牌一样散落下来。随后这些书籍被自动的传送给高速馈纸扫描仪(自动进纸、双面速扫、智能矫正)。几分钟的时间,这本书就化作了服务器里的0和1。

而失去了书脊的书脊,变成了废纸一样的散页,就像是抽掉龙骨的巨龙,只剩下巨身和龙爪,再也无法腾空,像软泥一样成吨的被塞入卡车,送向工厂,在刺鼻的化学药剂的作用下被搅碎,融化为普通的纸浆。

上述的野蛮的高速工业化的操作流程,在AI业界有一个术语,叫做“破坏性扫描(Destructive Scanning)”

这种人类智慧结晶的破坏行为可不是不入流的小公司的动作。根据华盛顿邮报和美国联邦法庭公开文件的披露和解密了一份4000多页的内部文件显示,这正是Anthropic内部的一项名叫“巴拿马计划”的保密项目。这个保密项目的目标令人内心一颤,一位Anthropic的高管在邮件中恐怖的写到:“毁灭性地扫描全球所有书籍”(destructively scan all the books in the world),以此来训练其大语言模型 Claude。记住,我们绝对不能让外界知道我们在做这件事。”

Anthropic为了训练更加智能的模型,互联网上的高质量语料已经爬的差不多了。他们决定希望从没有被AI污染过的线下书籍入手,他们认为2022年前出版的书籍是黄金训练素材。于是他们全球疯狂扫货,斥资千万美金在Better World Books、World of Books 等二手书商及数据库平台秘密成吨购买数百万册实体书。然后使用上述的液压切割机强行去掉书籍,扫描,最后全部销毁,化为纸浆。

有几个问题也许你感兴趣:

大模型公司为什么最早盯上的是“东欧”?

因为东欧国家(例如波兰、罗马尼亚、匈牙利等)在冷战时期积累了很多多语言的著作和学术文献,工程技术手册,而且这些资料都是没有线上化的。而且东欧的图书馆大多是陷入在财政危机当中,硅谷的模型大厂可以成吨的低廉价格来购得这些书籍(几十万册这个量级)。而且相对于西欧(如德国法国等),东欧的监管相对放松,对于转移数字化的法律相对盲区更大,让这些书籍贩卖的二道贩子公司的法律风险减轻。

古书的知识是陈旧的,为什么大模型公司盯上这些?

首先他们盯上的根本不是知识本身,而是没有被AI污染过的信息。因为我们知道如今互联网上充斥着AI加工出来的内容,如果继续使用这些互联网数据来训练模型,会出现模型的“近亲繁殖”现象,会产生模型坍塌(Model Collapse),让模型的智商越来越低。

而这些古书有的是长句语法,复杂的修辞和多门冷门的语言之间的互相翻译,虽然书中的地理信息和观点是过时的,但是这对于模型训练语言流畅度、文本理解力和强大的推理能力是非常有好处的。

而且还可以补充一些冷门的视角来补充模型,例如一些区域民俗、地方方言、古老的技法等等,可以帮助AI来补充对于文明全貌的理解,在做一些小语种作业的时候会更加地道和聪明。

为什么是Anthropic?

从古书中压榨然后销毁的思路,其实我认为也是Anthropic在现实世界中训练行动的“增强学习”结果,简单说就是他们不是一上来就想到要这么做的,是在自己真金白银被罚过,而且极有可能是在做之前就看到美国法律的漏洞。

依据美国版权法律,如果AI公司从网上下载盗版电子书籍(如著名的“影子图书馆” LibGen),就会被作家和出版社起诉侵权并要求依法赔偿添加罚单。例如Bartz 诉 Anthropic 案,就是指控Anthropic从从一些盗版的途径下载70万册书籍,用于训练模型。最终在2026年7月美国联邦法院批准了15亿美金的天价集体和解协议。每一部被侵权的作品平均可以获得3000美金的现金赔偿。

而在美国联邦和欧洲现行的法律中,有一个原则叫作首次销售原则(First-sale doctrine),就是说当你购买一本正版实体书后,你就拥有了这本物理书籍的绝对处理权。你可以转赠、出借甚至销毁。所以套用这个法律,AI公司购买了这些实体书,属于版权中的“合理使用”(Fair Use)。因此,“买正版、撕掉、扫描、扔掉”成了最安全的法律洗白手段

以上这套就是完整的无耻的法律洗白逻辑。他们“购买一本”、“销毁一本”,并没有在市面上创造出更多盗版版本流通以及扩散。至少训练模型的场景在法律中还没有被写入。但这让这些古书在世界上消失。

这是一场AI时代的文化献祭。这个事情让我感到细思极恐,在之前绝大多数的知识在互联网上被集中化的储存,还有一些小众的去中心化的知识散落在全球的图书馆和旧书摊中。达成了一种微妙的平衡,一种在人们使用方便与没有被某一个强权所拥有的平衡中。

但现在大模型公司通过“破坏性扫描”打破了这种平衡,他们把这种去中性化的小众知识据为己有,变为他们模型中的参数,然后闭源,私有化。

恐怖之处在于,这些纸质书籍逐渐消失,人类未来再想要了解前辈的思想、某个小众的价值观、一个小语种的文化,就只能去询问他们的AI模型。这种独裁和垄断当然可耻,但先不说,重要的是,你读到的内容全部是这些公司经过“对齐”和“过滤”的内容,原版长什么样子,没有人再知道。

简直就是从“百家争鸣”变成“圈养的猪”,这无疑是某些个体自私导致的全人类的“作茧自缚”。

我们总以为数字化意味着永生,却没发现它正在带来一场物理上的清算。当最后一张纸质书被送进化浆池,当人类所有的记忆都被打包锁进硅谷的服务器,我们交付出去的,究竟是文明的火种,还是人类对历史的解释权?