
2026年7月20日,美国加州北区联邦地区法院法官阿拉塞莉·马丁内斯-奥尔金(Araceli Martínez-Olguín)签署最终批准令,备受全球关注的“巴茨诉Anthropic案”(Bartz v.Anthropic)15亿美元集团诉讼和解正式生效,案件以“不得再诉”方式结案。
这次美国史上最大版权集体诉讼和解,不仅仅是一次巨额回款,更是一套关于训练数据来源、定价、付费和AI许可市场的新规则。
最终确认的作品清单涵盖482,460部图书。扣除律师费、诉讼开支和管理费用后,每部作品权利人预计实得约3000美元。
法官特别计算了这组数字的份量,它是故意侵权法定赔偿下限的四倍,是普通侵权最常见判赔额750美元的四倍,更是非故意侵权下限200美元的十五倍。
这也给未来的AI训练数据价值,在司法上提供了一个参考值。
另外,判决书提到盗版数据集必须销毁,但未来不被豁免。和解要求Anthropic在最终判决后三十天内,销毁从LibGen和PiLiMi下载的全部原始文件及其衍生副本,并向集团律师提交书面证明。
判决书同时确认,Anthropic已声明上述盗版数据集从未被纳入旗下商业化大语言模型的训练语料。
来龙去脉,一场关于 AI 训练数据来源的官司
2024年,三位作家——小说家 Andrea Bartz、Charles Graeber 及非虚构作家 Kirk Wallace Johnson——共同向加利福尼亚北区联邦地区法院提起集体诉讼(Bartz v. Anthropic PBC)。诉讼指控 Anthropic 在训练其大语言模型 Claude 的过程中,系统性地使用了从盗版网站非法下载的数百万部受版权保护的图书。
法庭文件显示,Anthropic联合创始人Ben Mann 亲自从 Library Genesis(LibGen)下载了至少 500 万本书,从Pirate Library Mirror(PiLiMi)下载了至少 200 万本,合计超过 700 万部作品。
而且内部邮件显示,管理层完全清楚这些数据的非法性质,但选择"窃取"而非合法授权,理由是避免"法律和商业层面的漫长流程"。
2025年6月23日,本案迎来了最具法律意义的时刻。时任加利福尼亚北区联邦地区法院资深法官 William Alsup 作出部分即决判决,做出了两个方向截然相反的裁定:
训练本身是合理使用,使用版权作品训练大语言模型属于"高度变革性使用"(exceedingly transformative),符合美国版权法第107条的合理使用条件。合法购买纸质书后扫描数字化同样属于合理使用。
盗版获取不享有保护,从盗版网站下载数百万部作品并建立永久性内部图书馆的行为,不属于合理使用的例外范畴——无论后续训练多么具有变革性,都无法为非法获取"洗白"。
法官Alsup 将"用数据做什么"和"数据怎么来的"切割成了两个独立的法律问题。
这一"二元切割"奠定了后续和解的法律基础——Anthropic 面临的 15 亿美元赔偿,源于数据获取方式而非训练行为本身。
2025年8月25日,Anthropic 与原告方达成具有约束力的和解协议,同意支付15亿美元解决这起集体诉讼。
9月5日,Anthropic 向 Alsup 法官提交了和解文件,但 Alsup 以和解方案"未能说明对于有多名索赔人的作品应如何管理赔偿金发放"为由拒绝初步批准,将听证会推迟。
2025年年底 Alsup 退休后,该案的最终批准移交至法官 Araceli Martínez-Olguín。2026年7月20日,Martínez-Olguín 签署最终批准令,驳回了关于和解金额过低以及律师费过高的反对意见,15亿美元和解正式定案。
AI训练数据的价值正在被重估
Anthropic 15亿美元和解案最深远的影响,不在于盗用数据训练AI要罚款的警示,更在于提醒整个产业,AI训练数据的来源要合规,AI训练数据的价值应当被正视、被定价、被买单。
3000美元/部的数字在法理上是盗版侵权赔偿,但在市场上,它是一个无法被忽视的价格信号,高质量的训练数据,值这个价格,甚至远远不止这个价格。
这个信号背后,是全球AI产业为优质数据付费的意识在加强、实践在推进、生态在完善。
去年8月28日,国家数据局局长刘烈宏曾在2025数博会上表示,当前各方都普遍认为,数据资源非常重要,现在大家都愿意为模型、算力买单,我们也希望各行各业在推动行业大模型的应用过程中,也加大对数据资源的投入。再次呼吁全社会强化数据要素的价值认同,加快价值共创,共同培育为优质数据买单的共识。
可以看出,全球市场的实践与我们国家层面的呼吁是高度吻合的。数据正在被重新定价,而且定价主体不再只是公司与公司主体之间,而是包括了数据生产者、内容创作者、交易市场和监管者在内的整个生态。
训练数据的价值重估不是终点,而是AI产业从野蛮生长走向高质量发展的起点。为优质数据买单,不是成本,而是投资——是对模型性能上限的投资,是对合规底线的投资,更是对内容创作者和数据生产者合理回报的确认。
数据,已经是重要的生产要素,在AI产业里也是最重要的核心资产。



夜雨聆风