从盗版库下载近50万部作品后,Anthropic收到了一张15亿美元的账单
15亿美元。
Claude背后的Anthropic,刚刚为一批从盗版库下载的书,拿出了这么多钱与作者和版权方和解。
7月20日,美国加州北区联邦地区法院正式批准了这笔集体和解。
法院文件里有几个数字,放在一起看,还是挺吓人的。
和解基金总额15亿美元。
作品清单里一共有482,460部作品。
截至今年4月,其中440,490部已经有人申领,占整个清单的91.3%。
粗略估算下来,每部符合条件的作品大约对应3000美元。当然,这不是每位作者确定能拿到手的钱,律师费、管理费用、作品权属和作者与出版方之间的分配,都会影响最终金额。
但即便如此,这依然是美国版权案件里极其罕见的一笔巨额和解。
看到这里,很多人的第一反应估计跟我一样。
AI公司偷偷拿作者的书训练模型,现在终于被罚了。
听起来很顺。
但并不准确。
这也是整件事最有意思、也最容易被中文互联网讲歪的地方。
这场官司真正划出的,不是一条「AI能不能读书」的线。
而是另一条更现实的线。
你的书,到底是从哪里来的?

事情还得往前倒一点。
2024年,包括作家Andrea Bartz在内的一批作者起诉Anthropic。他们认为,Anthropic在训练Claude的过程中,使用了大量未经许可取得的版权图书。
后来案件披露,Anthropic不只购买过纸质书,再拆掉书脊、扫描成电子版本。它也曾经从Library Genesis和Pirate Library Mirror这类盗版资源库,批量下载图书,并把它们保存到自己的数字资料库里。
这两件事看起来都在做同一件事。
让AI读书。
但法院把它们拆开了。
此前负责案件的法官William Alsup认为,Anthropic使用合法取得的图书训练模型,具有很强的转换性,可以构成合理使用。
哪怕公司买来纸质书,再把它们扫描成数字版本,只要用途和处理方式符合条件,也不当然构成侵权。
但从盗版资源库批量下载,并长期保存未经购买的图书,是另一个问题。
一个是模型怎么使用作品。
一个是公司怎么取得作品。
训练用途和资料来源,被拆成了两张完全不同的账单。
这个区别特别重要。
因为如果只看标题,大家很容易把这起案件理解成一场作者对AI的全面胜利,甚至得出一个很爽的结论,以后AI每读一本书,都得给作者交钱。
说真的,我很理解这种情绪。
一个作者可能花几年写完一本书。反复修改,跟编辑磨,等出版,等读者,最后发现自己的作品不知道什么时候进了某家科技公司的资料库,帮它训练出一个估值惊人的模型。
作者没有被问过,也不知道自己的作品去了哪里。
那种感觉,很难让人平静。
但如果反过来站到AI公司的角度,这件事也没有那么简单。
大模型需要海量语料。书籍里有完整的表达、复杂的逻辑、跨越几十年的知识和人类经验。如果每一份材料都要在训练前逐一找到权利人、谈价格、签合同,技术开发的成本和速度都会发生巨大变化。
所以争议从来都不只是科技公司好不好,作者惨不惨。
真正困难的问题是,当机器像人一样从作品中学习,却又能一次读完几百万本书时,我们还能不能继续用过去那套关于阅读、复制和合理使用的直觉?
这事儿,法院也没有一次性给出终极答案。
本案批准的是双方和解,不是一个宣布全世界AI训练都违法的判决。它覆盖的也是清单中的特定作品和特定的过去行为,并没有替未来所有模型、所有内容形式和所有国家统一定价。
但15亿美元依然把一个长期模糊的问题,直接砸到了所有AI公司的桌面上。
数据从哪里来。
以前这可能只是研发文档里的一行备注。
以后,它很可能是一笔需要被审计、被估值,甚至被写进风险报告的成本。

我看到这里时,脑子里突然冒出来一个特别朴素的画面。
一家公司买服务器,有采购合同。
买Claude、ChatGPT或者其他软件服务,有订阅记录。
请员工,有劳动合同。
租办公室,也有发票。
唯独到了训练数据和知识库资料这里,很多团队手里可能只剩下一个网盘链接。
谁传上来的,不知道。
从哪里下载的,不知道。
能不能用于模型训练,不知道。
客户要求删除时能不能找到,更不知道。
然后大家把几万份文件一股脑塞进知识库,接上RAG,连上智能体,看着它终于能回答公司内部问题,开心得不行。
我非常理解这种开心。
企业做AI落地,最先遇到的通常是效果问题。大家每天讨论的是召回率、幻觉、模型选型、回答速度和Token成本。项目好不容易跑起来,谁还有心情去追一份三年前行业报告的授权条款。
可这次Anthropic的和解,恰好提醒了我们一件很扎心的事。
模型回答得越好,不代表项目越安全。
有时候,它只是把来源不明的数据,利用得更充分了。
这一下就很尴尬。。。
回到企业智能体这块,真正需要补的,可能不是又一个更大的模型。
而是一条可以追溯的数据供应链。
你放进知识库的员工手册,当然可以使用。
但供应商交付的行业数据,授权范围是什么?
公司购买的研究报告,只允许内部阅读,还是允许被拆分、向量化并用于生成回答?
从公开网页抓下来的文章,可以索引,不代表可以永久保存,更不代表可以拿去微调模型。
员工从上一家公司带来的资料,哪怕内容再有用,也不能因为它躺在共享盘里,就自动变成公司的数据资产。
客户提供的项目文件,在合同结束后,是继续留在知识库里,还是应该连同向量索引一起删除?
你看,问题到了这里,已经不只是版权法了。
它开始碰到采购、合同、权限、数据治理、员工管理和客户信任。
AI把原本散落在公司各处的问题,一次性串到了一起。
这才是15亿美元真正让人后背发凉的地方。
软件行业里有一个大家很熟悉的词,叫技术债。
为了赶进度,代码先凑合写,架构先不重构,测试先欠着。产品上线的时候看不出问题,等用户变多、团队变大,每一次修改都开始付利息。
数据也会欠债。
今天从网上随手下载一份报告,没有登记来源,这是第一笔。
明天把报告切成几百个向量,混进企业知识库,这是第二笔。
后天智能体把里面的内容生成给客户,又多了一笔。
项目刚做Demo的时候,所有人看到的都是速度。两天接入资料,一周跑通流程,回答效果还挺好。
可一旦进入正式采购、融资尽调、客户审计或者海外业务,问题就会一起找上门。哪些内容是自有的,哪些来自供应商,哪些允许机器处理,哪些只能给员工阅读。团队可能要重新翻合同、找原文件、查日志,甚至把已经上线的知识库拆开重做。
早期省下来的那点时间,会连本带利还回去。
这就是数据债。
Anthropic当然不是一家普通公司,它有最好的律师、工程团队和融资能力。连这样的公司,都愿意用15亿美元结束这部分风险,普通企业更不应该觉得自己文件少、影响小,就可以一直把账欠着。
不是每家公司都会被作者集体起诉。
但每一家认真做企业AI的公司,迟早都会被客户、法务、投资人或者自己公司的管理层问一句。
你怎么证明,这些数据可以用?

我一直觉得,互联网过去二十年有一个很深的惯性。
只要一份内容能够被打开、被复制、被下载,大家就很容易觉得它可以被使用。
链接像空气一样在网络里流动。
可进入AI系统以后,内容不再只是一个供人阅读的链接。
它成了生产资料。
它会被切块,被向量化,被反复检索,被模型吸收,再变成产品能力的一部分。
这个变化有点像一个小作坊突然变成了现代工厂。
小作坊买来一袋原料,老板认识送货的人,闻一闻、尝一尝,差不多就用了。工厂不行。工厂需要供应商,需要批次,需要检测,需要入库单,还得在出问题时知道哪一批货去了哪条生产线。
数据也会走到这一步。
来源、授权、用途、版本、删除记录。
这些听着一点都不性感。
没有新模型发布那么兴奋,也没有一个漂亮Demo那么容易获得掌声。
甚至做起来特别烦。
但一个行业真正从野蛮生长走向成熟,靠的往往就是这些不性感的东西。
如果你正在做企业知识库、RAG或者智能体,我觉得今天就可以做一个很小的动作。
别急着审计整个公司的全部资料,那工程量可能大到直接把人劝退。
先从知识库里随机抽20份文件。
然后填一张这样的表。
|
|
|
|
|
|
|---|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
如果20份文件里,有3份说不清来源,先别忙着继续扩充知识库。
把缺失的记录补上。
这个动作看起来很笨,甚至会拖慢项目。
我说实话,真正开始做的时候,你大概率会发现公司的历史资料比想象中乱得多。很多内容找不到原始合同,很多网页早就打不开,很多人也记不清文件是谁传的。
别指望一周解决。
但只要开始记录,新进入系统的数据就不会继续欠账。
对于个人创作者也一样。
文章、课程、图片和视频,不要只发在平台上就算结束。保留原稿、创建时间、发布记录、合作合同和修改版本。可以授权别人阅读,不等于授权改编。可以授权平台展示,不等于授权拿去训练模型。
这些记录平时看起来没有流量,也赚不到钱。
真到需要证明作品属于谁、别人被允许做什么的时候,它们可能比阅读量截图更有用。
15亿美元不会替全世界解决AI版权问题。
它甚至没有宣布所有模型训练都应该逐本付费。
但它已经把两张账单摆到了我们面前。
一张是模型如何使用内容。
另一张是内容究竟从哪里来。
第一张账单,法律还会争论很久。
第二张账单,企业已经不能再假装看不见了。
未来,模型会更新,算力可能会越来越便宜,知识库也会越来越容易搭建。
可数据的来源不会自己变干净。
每一份进入系统的文件,都带着自己的历史。
谁写的,谁买的,谁允许使用,谁有权要求删除。
这些过去藏在链接背后的问题,现在正在一点一点浮出来。
开头那张15亿美元的账单,只是把它们印得特别大。
大到整个行业都能看见。
如果AI公司愿意付费,你愿意授权自己的文章、课程或书籍,用来训练模型吗?
如果你看到这里,脑子里想的已经不只是Anthropic,而是自己公司的知识库、智能体或者每天正在做的工作,那我想顺着这个话题,再多说几句。
我这几年接触企业AI项目,有一个特别强烈的感受。
很多人并不缺工具。
ChatGPT、Codex、WorkBuddy都知道,提示词也收藏了几百条。
真正卡住的,是怎么把一个真实问题拆开,选对工具,变成一套能持续使用的工作流。
所以我做的事情,也一直围绕这条线。
不是再给大家堆一百个新名词,而是陪你把手里那个具体问题,往前推一步。
我目前设计了两种不同的方式。
如果你已经有一个真实的工作场景,想用一天时间集中拆解,并且希望现场搭出自己的智能体工作流,更适合参加8月在北京五道口举办的AI驾驭者专属智能体实战营。
这个实战营不适合只想听趋势、记几个工具名字的人。
更适合带着调研、办公、内容创作、知识库或业务自动化中的一个具体问题来,现场动手,做出一套回去还能继续使用的东西。
一天当然解决不了企业AI转型的全部问题。
但如果能把一个高频场景真正跑通,知道后面的路怎么走,我觉得就值了。

如果你暂时不方便来北京,或者遇到的只是日常工作里的零散问题,不需要一整天集中训练,可以选择AI提效线上咨询会员。
它更像一个长期陪跑的公共答疑群。
遇到工具选择、提示词优化、知识库和智能体方法上的问题,可以在群里提出来,我会给出诊断思路、方法建议和案例参考。
这块需要把边界讲清楚。
会员提供的是365天群内公共图文答疑,不包含一对一咨询,也不承诺替你直接完成项目。
适合已经开始行动,只是偶尔卡住、需要有人帮你找方向的人。

我不希望大家因为看完一篇文章,冲动买一个自己并不需要的东西。
如果你还没有具体问题,先别报名。
先回到前面那张表,从自己的知识库里抽20份文件,或者从每天最耗时间的一项工作开始,看看问题到底卡在哪里。
当你能把问题讲清楚,再决定是自己继续研究、进群问一问,还是用一天时间把它跑通。
这样的选择,反而更容易买到真正适合自己的服务。
也欢迎把这篇文章转给正在做企业知识库和智能体的朋友。
也许他们现在最该补的,不是一个新模型。
而是一本旧账。
如果你觉得这篇文章还不错,或者对你有一点帮助,欢迎顺手点个赞、点个在看,也可以转发给身边正在学习AI、使用AI,或者正在探索个人成长与内容创作的朋友。
夜雨聆风