一本厚书被推进液压切纸机,压板落下,刀片切下,书脊被干脆利落地削掉。
原本连接在一起的书页变成整齐的一沓纸张,送进高速扫描仪。
扫描完成后,这些书被统一粉碎、打成纸浆。
这不是科幻电影,这是正在发生的事。
做这件事的,是美国AI巨头Anthropic——开发大模型Claude的公司。
代号“巴拿马计划”。
为什么要销毁书?
AI大模型需要海量文本训练。
过去,它们从互联网上抓取数据。
但现在,互联网已经被AI自己“污染”了。
斯坦福大学2026年4月发布的《AI指数报告》显示:自2025年1月以来,新发布的互联网内容中,AI生成比例已超过半数。
如果AI用AI生成的内容继续训练自己,就会发生“模型坍塌”——模型逻辑能力持续退化、事实错误增多、表达逐渐同质化。
牛津、剑桥等机构的联合研究曾登上《Nature》封面:用AI数据训练AI,模型会逐渐崩坏。
于是,AI公司需要“干净”的数据——2022年以前出版的纸质书,成了最稀缺的资源。
怎么操作?
Anthropic自2024年初启动“巴拿马计划”,成立了一个专门的图书数字化项目。
第一步:买书。 公司花费数千万美元,通过二手书商匿名采购全球各地的纸质书籍。
第二步:拆书。 液压切割机切除书脊,拆分书页。
第三步:扫描。 高速工业扫描仪完成文字提取,每分钟可处理80至120页。
第四步:销毁。 所有实体书统一粉碎制浆,不再留存任何实物。
整个过程涉及书籍达数百万册,其中包括存世量极少的绝版古籍。
法律上合法吗?
合法。
美国联邦法院裁定:合法购买纸质书、扫描后销毁原件,属于“合理使用”。
法官认为,大模型读取一本书,不是为了复述或出售,而是从中学习语言和知识,具有“高度转化性”。
但有一个前提:书必须是合法买的。
Anthropic此前曾从盗版资源库下载超过700万本电子书,建立“中央图书馆”供模型训练使用。
法官认定:训练模型可能合法,但盗版获取不合法。
2026年7月,Anthropic与作家集体达成15亿美元(约101亿元人民币) 和解协议——美国版权法历史上和解金额最高的案件。
每部被侵权作品赔偿约3000美元。
但“买书—拆书—扫描—销毁”这一模式,没有被处罚。
争议在哪里?
合法,不等于合理。
第一,文化损失不可逆。 绝版书和孤本的价值不只在文字内容。纸张、版本、批注、装帧,都是出版史和文化史的一部分。扫描可以保存字符,却无法保存这些信息。
第二,知识验证依据消失。 原始载体一旦销毁,后世研究者若想核对一处引文、一个版本的原始出处,将无从入手。
第三,公共知识私有化。 扫描形成的语料库只掌握在少数公司手中,公共知识资源完成了一次私有化转移。
第四,珍稀书籍可能已被销毁。 目前没有确切证据表明绝版书已被销毁,但当范围涉及数百万册时,公众担心一些珍贵古籍可能已经消失在液压机里。
行业反应
消息曝光后,舆论迅速发酵。
马斯克在X平台表态:已要求旗下AI公司SpaceXAI保存所有珍稀书籍,采用无损扫描,避免破坏书脊。
“我已经要求SpaceXAI团队保存图书馆里的任何珍本书籍,并以费力但完整的方式扫描它们,而不是简单地切断书脊进行扫描。”
图书数据库公司ISBNdb曾被曝出为AI公司与图书供应商牵线搭桥,声称可从旧书店、图书馆和绝版书目录中一次采购1000至100万本纸质书。
舆论发酵后,ISBNdb紧急下架相关页面,声明自己“不训练AI模型,也从未从事过相关业务”。
有匿名图书卖家说:“这么做既能帮我清理库存,也能让我赚到钱。但另一方面,我并不喜欢这些图书最终的用途,也不愿意看到一些稀有图书被直接打成纸浆。”
国内会这样吗?
可能性较低。
制度层面:中国《生成式人工智能服务管理暂行办法》要求训练数据可追溯、可核查。“扫描即销毁”会灭失原始载体,与合规要求相抵触。
成本层面:国内有收藏价值的古籍孤本多保存在公立图书馆和私人藏家手中,价格高、流通少,批量收购再销毁既不经济也不现实。
监管层面:2026年6月,国家版权局等四部门启动“剑网2026”专项行动,重点之一就是“推动解决大模型训练语料版权合规问题”。
写在最后
AI公司销毁数百万册书,只为训练大模型。
合法,但争议巨大。
这件事暴露了一个更深层的矛盾:AI需要“干净”的人类知识,却在摧毁承载这些知识的实体载体。
扫描可以保存文字。
但扫描保存不了一本书的全部。
那本书的纸张、装帧、版本、批注、流传痕迹——以及它作为“一本书”存在过的全部意义——都消失在液压机里。
本文数据来源包括:404 Media、The Verge、路透社、华盛顿邮报、斯坦福大学《2026年AI指数报告》、Nature、IT之家、钛媒体、大众新闻、环球时报等公开报道与研究报告。所有数据均来自公开可查证的权威来源,仅供参考。
夜雨聆风