省流版:多家 AI 公司正通过中间商大量收购二手书,扫描后予以销毁,旨在获取 2022 年之前“未被机器污染”的训练数据。
Anthropic的“巴拿马项目”(Project Panama)在一桩 15 亿美元的版权和解案中被曝光。2024 年初,该公司启动了这一高度机密的项目,耗资数千万美元购买了数百万本纸质书,扫描并用于训练其Claude大语言模型,随后将这些书籍全部销毁。
令人愤慨的是,这一行为在美国法律上是被允许的,但在伦理上,却是对人类犯下的极严重罪行。
那么,为什么要销毁实体书?其背后是 AI 竞赛与资本利益的驱动:
防止这些书籍被竞争对手扫描并用于训练。 规避法律风险。 销毁式扫描的成本低于无损扫描。
AI 公司大规模扫描并销毁实体书后,便成为了世界上唯一拥有这些数字副本的机构。知识被永久垄断在私有服务器中。
AI 公司在承诺“让人类知识触手可及”的同时,却在拆解人类知识最坚实的载体。公众或许能获得更智能的 AI 助手,但代价却是海量知识资源从公共领域彻底消失。
正文:
很难想象都2026年了,我们能在主流媒体上看到这么像假新闻的真新闻。
是的,虽然ai界没有迎来它的秦始皇,但是有它自己的新型焚书。
整件事还得从一桩名为 Bartz v. Anthropic PBC的集体诉讼开始,诉讼的原告指控 Anthropic 在未经授权的情况下,使用其受版权保护的图书训练 Claude 大模型。
根据披露的资料,Anthropic 联合创始人 Ben Mann 在 2021 年初从 Books3 数据集下载了约 19.6 万册图书,随后又从 LibGen 下载了 500 万册以上。
2022 年 7 月,PiLiMi 上线后,Mann 立即下载了 200 万册,并向同事发送链接,附言:
"Just in time!!!"
(真是太及时了!!!)
且另一联合创始人、也是现任 CEO 的 Dario Amodei 对此知情。
在一封内部邮件中,Amodei 解释了为什么不去寻求正版授权:
"Legal/practice/business slog."
(法律/实践/商业上的繁琐工作。)
换句话就是正版授权太麻烦了。
法官对此的结论是Anthropic 知道这些是盗版。
"每一个已知是盗版的下载行为,都是一次侵权。"
最终,这部分被认定为" inherent, irredeemably infringing",不在合理使用保护范围内。
但是吧,这个事情跨度略长,案件在调查过程中发现了 Anthropic 2024 年启动的一项平行项目——Project Panama。
如果说 LibGen 下载是"主动盗版",那么巴拿马计划就是"合法洗白"。
根据一份内部规划文件显示,巴拿马项目的核心目标是:以工业化的方式获取海量书籍,用它们来训练 Claude 背后的 AI 模型。
操作流程如下: 采购:从 Better World Books、英国的 World of Books 等二手书零售商批量拿货,每次采购动辄数万册;
拆解:把采购回来的书运到仓库,用液压切割机把书脊"整齐地切掉";
扫描:将散开的书页送入高速、生产级扫描仪,转化为高清 PDF 文件;
销毁:把纸质残骸送交回收公司,化为纸浆。
整个流程的成本:根据文件披露,Anthropic 在该项目上花费数千万美元。
处理规模:首批约 50 万册,累计接近 200 万册。
404Media是这么说的,“采购几乎全部针对带有 ISBN 编号的图书,无主题、类型或作者偏好,买家对价格极不敏感。”
404 Media是美国记者集体所有的独立科技调查媒体,完全由记者持股的合作社式媒体,重大决策集体协商,不受企业资本、广告商主导编辑方向。
这意味着被销毁的不只是"非虚构类畅销书",也包括一些稀有、绝版、仅存数本的珍藏版本。
最让外界不安的不是销毁行为本身,而是 Anthropic 内部对保密的要求。
"We don't want it to be known that we are working on this." ——内部规划文件 一家公司把销毁 200 万本书当秘密来守,这已经不是"数据策略"问题,而是企业伦理问题。
试想一下: 如果巴拿马计划是"伟大的版权创新",Anthropic 为什么要保密? 如果销毁是"法律漏洞的合法利用",为什么不公开宣告? 如果扫描件真的"不替代原书市场",为什么要确保原书"永久消失"?
保密本身就是答案:Anthropic 自己也知道,公众一旦知道"合法买→拆解→销毁→装入私人模型"这条流水线,一定会愤怒。
传统的图书数字化项目(如 Google Books、Internet Archive)采用人工翻页、书脊保护式扫描,确保原书保存完整。
但巴拿马计划不一样。
他们采用的是液压切刀,也就是将整本书固定,使用工业级液压切割设备一次性切断书脊,批量处理书籍。
不管你是孤本还是珍藏本,统统都是一刀切。
这种做法的好处是,每次可处理数十本,效率是人工的 50-100 倍。
同样的,这个行为是不可逆的,这些切断的书脊无法复原,也就意味着原书已经结构性死亡。
可笑的是,最具"破坏性"的这一步却成了Anthropic法律辩护的关键。
Anthropic 律师在法庭上主张:既然书脊已被切断、原书已无法流通,就不存在"复制件替代原书"的版权损害。
在他们的逻辑中,书脊被切断的那一刻,就不存在任何保留的物理副本,也就 不会产生"二次流通"。
但是数字版本却会存在于 Anthropic 内部数据库。
这也是 Anthropic 律师的辩护核心:"我们不是在复制,我们是在'空间转换'(space-shifting)"。
但他们没说,Anthropic 内部数据库,公众不可访问
2025 年 6 月 23 日,主审法官 William Alsup 做出了一份"分裂式"判决:
合理使用部分:用版权作品训练 AI 模型属于"极具变革性的创作行为",受合理使用条款保护; 盗版部分:但 Anthropic 从 LibGen、PiLiMi 等"影子图书馆"下载数百万册图书并长期持有的行为,不在合理使用范围内。
他的核心推理是:
"格式转换说":Anthropic 把购买的纸质书转换为数字版本,属于"空间转换",就像把 CD 翻录为 MP3 一样; "内部使用说":扫描件仅用于内部 AI 训练,不对外分发,不替代原书市场; "变革性说":AI 模型"训练"不是为了复制原书,而是为了"创造不同的东西"。
法官写道:Anthropic 的模型"训练这些作品,不是为了加速追赶、复制或取代它们,而是为了转一个硬弯,创造不同的东西"。
2025 年 8 月,Anthropic 与原告方达成 15 亿美元和解——这是美国历史上金额最大的版权集体诉讼和解协议。
但故事远未结束。
最起码公众不买账。
发帖者 Hedgie 的反驳帖获得了超过 550 万次浏览。
"看着这些 AI 公司,尤其是 Anthropic,参与现代焚书来训练其大语言模型,这几乎是对人类犯下的战争罪行,堪比亚历山大图书馆的焚毁"。
为什么公众的愤怒这么强烈?
有三个层面的原因: 第一,稀缺性的不可逆。稀有书籍可能永久消失。当一本仅存数本的绝版书被切碎、扫描、销毁,数字化版本只存在于一家公司的私有模型中,公众再也无法读到。
第二,创作者被排除在利益链外。
Anthropic 通过 Claude 模型向用户收费,但原作者分文未得——尽管他们写的内容,正是模型的语言基础。
第三,公共文化资产被私有化。这是最深层的愤怒:旧书、二手书、绝版书,这些经过几十年积累的人类书写,正在被一车一车送进高速扫描仪,然后从公共领域消失,进入少数公司的私有训练数据库。
试想一下,那些在百年甚至千年前写下文字,留下思想的人再也无法跨越时间慰藉后世读者。
这怎么不让人心生遗憾呢?
更深层的问题是:为什么 AI 公司愿意花数千万美元买旧书?
答案是"模型坍缩"(model collapse)。
2022 年之后,AI 生成的低质量内容大量涌入互联网。用这些内容训练下一代模型,误差逐代累积,输出越来越空洞、越来越像样板文章。这种"近亲繁殖"会让模型能力快速退化。
而 2022 年之前出版的纸质书,成了仅剩的"干净数据源"——纯人类原创、经过编辑校对、无 AI 套路感。纸质书变成了 AI 时代的"纯净水"。
这就是为什么 2026 年 4 月之后,旧书采购规模突然激增——AI 行业已经无干净数据可用,只能回头向物理世界索取。
可十年二十年之后呢?没有新的“干净数据”产生,一直吃老本又能支撑多久呢?
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING
夜雨聆风