乐于分享
好东西不私藏

从盗版库下载近50万部作品后,Anthropic收到了一张15亿美元的账单

从盗版库下载近50万部作品后,Anthropic收到了一张15亿美元的账单

15亿美元。

Claude背后的Anthropic,刚刚为一批从盗版库下载的书,拿出了这么多钱与作者和版权方和解。

7月20日,美国加州北区联邦地区法院正式批准了这笔集体和解。

法院文件里有几个数字,放在一起看,还是挺吓人的。

和解基金总额15亿美元。

作品清单里一共有482,460部作品。

截至今年4月,其中440,490部已经有人申领,占整个清单的91.3%。

粗略估算下来,每部符合条件的作品大约对应3000美元。当然,这不是每位作者确定能拿到手的钱,律师费、管理费用、作品权属和作者与出版方之间的分配,都会影响最终金额。

但即便如此,这依然是美国版权案件里极其罕见的一笔巨额和解。

看到这里,很多人的第一反应估计跟我一样。

AI公司偷偷拿作者的书训练模型,现在终于被罚了。

听起来很顺。

但并不准确。

这也是整件事最有意思、也最容易被中文互联网讲歪的地方。

这场官司真正划出的,不是一条「AI能不能读书」的线。

而是另一条更现实的线。

你的书,到底是从哪里来的?

事情还得往前倒一点。

2024年,包括作家Andrea Bartz在内的一批作者起诉Anthropic。他们认为,Anthropic在训练Claude的过程中,使用了大量未经许可取得的版权图书。

后来案件披露,Anthropic不只购买过纸质书,再拆掉书脊、扫描成电子版本。它也曾经从Library Genesis和Pirate Library Mirror这类盗版资源库,批量下载图书,并把它们保存到自己的数字资料库里。

这两件事看起来都在做同一件事。

让AI读书。

但法院把它们拆开了。

此前负责案件的法官William Alsup认为,Anthropic使用合法取得的图书训练模型,具有很强的转换性,可以构成合理使用。

哪怕公司买来纸质书,再把它们扫描成数字版本,只要用途和处理方式符合条件,也不当然构成侵权。

但从盗版资源库批量下载,并长期保存未经购买的图书,是另一个问题。

一个是模型怎么使用作品。

一个是公司怎么取得作品。

训练用途和资料来源,被拆成了两张完全不同的账单。

这个区别特别重要。

因为如果只看标题,大家很容易把这起案件理解成一场作者对AI的全面胜利,甚至得出一个很爽的结论,以后AI每读一本书,都得给作者交钱。

说真的,我很理解这种情绪。

一个作者可能花几年写完一本书。反复修改,跟编辑磨,等出版,等读者,最后发现自己的作品不知道什么时候进了某家科技公司的资料库,帮它训练出一个估值惊人的模型。

作者没有被问过,也不知道自己的作品去了哪里。

那种感觉,很难让人平静。

但如果反过来站到AI公司的角度,这件事也没有那么简单。

大模型需要海量语料。书籍里有完整的表达、复杂的逻辑、跨越几十年的知识和人类经验。如果每一份材料都要在训练前逐一找到权利人、谈价格、签合同,技术开发的成本和速度都会发生巨大变化。

所以争议从来都不只是科技公司好不好,作者惨不惨。

真正困难的问题是,当机器像人一样从作品中学习,却又能一次读完几百万本书时,我们还能不能继续用过去那套关于阅读、复制和合理使用的直觉?

这事儿,法院也没有一次性给出终极答案。

本案批准的是双方和解,不是一个宣布全世界AI训练都违法的判决。它覆盖的也是清单中的特定作品和特定的过去行为,并没有替未来所有模型、所有内容形式和所有国家统一定价。

但15亿美元依然把一个长期模糊的问题,直接砸到了所有AI公司的桌面上。

数据从哪里来。

以前这可能只是研发文档里的一行备注。

以后,它很可能是一笔需要被审计、被估值,甚至被写进风险报告的成本。

我看到这里时,脑子里突然冒出来一个特别朴素的画面。

一家公司买服务器,有采购合同。

买Claude、ChatGPT或者其他软件服务,有订阅记录。

请员工,有劳动合同。

租办公室,也有发票。

唯独到了训练数据和知识库资料这里,很多团队手里可能只剩下一个网盘链接。

谁传上来的,不知道。

从哪里下载的,不知道。

能不能用于模型训练,不知道。

客户要求删除时能不能找到,更不知道。

然后大家把几万份文件一股脑塞进知识库,接上RAG,连上智能体,看着它终于能回答公司内部问题,开心得不行。

我非常理解这种开心。

企业做AI落地,最先遇到的通常是效果问题。大家每天讨论的是召回率、幻觉、模型选型、回答速度和Token成本。项目好不容易跑起来,谁还有心情去追一份三年前行业报告的授权条款。

可这次Anthropic的和解,恰好提醒了我们一件很扎心的事。

模型回答得越好,不代表项目越安全。

有时候,它只是把来源不明的数据,利用得更充分了。

这一下就很尴尬。。。

回到企业智能体这块,真正需要补的,可能不是又一个更大的模型。

而是一条可以追溯的数据供应链。

你放进知识库的员工手册,当然可以使用。

但供应商交付的行业数据,授权范围是什么?

公司购买的研究报告,只允许内部阅读,还是允许被拆分、向量化并用于生成回答?

从公开网页抓下来的文章,可以索引,不代表可以永久保存,更不代表可以拿去微调模型。

员工从上一家公司带来的资料,哪怕内容再有用,也不能因为它躺在共享盘里,就自动变成公司的数据资产。

客户提供的项目文件,在合同结束后,是继续留在知识库里,还是应该连同向量索引一起删除?

你看,问题到了这里,已经不只是版权法了。

它开始碰到采购、合同、权限、数据治理、员工管理和客户信任。

AI把原本散落在公司各处的问题,一次性串到了一起。

这才是15亿美元真正让人后背发凉的地方。

软件行业里有一个大家很熟悉的词,叫技术债。

为了赶进度,代码先凑合写,架构先不重构,测试先欠着。产品上线的时候看不出问题,等用户变多、团队变大,每一次修改都开始付利息。

数据也会欠债。

今天从网上随手下载一份报告,没有登记来源,这是第一笔。

明天把报告切成几百个向量,混进企业知识库,这是第二笔。

后天智能体把里面的内容生成给客户,又多了一笔。

项目刚做Demo的时候,所有人看到的都是速度。两天接入资料,一周跑通流程,回答效果还挺好。

可一旦进入正式采购、融资尽调、客户审计或者海外业务,问题就会一起找上门。哪些内容是自有的,哪些来自供应商,哪些允许机器处理,哪些只能给员工阅读。团队可能要重新翻合同、找原文件、查日志,甚至把已经上线的知识库拆开重做。

早期省下来的那点时间,会连本带利还回去。

这就是数据债。

Anthropic当然不是一家普通公司,它有最好的律师、工程团队和融资能力。连这样的公司,都愿意用15亿美元结束这部分风险,普通企业更不应该觉得自己文件少、影响小,就可以一直把账欠着。

不是每家公司都会被作者集体起诉。

但每一家认真做企业AI的公司,迟早都会被客户、法务、投资人或者自己公司的管理层问一句。

你怎么证明,这些数据可以用?

我一直觉得,互联网过去二十年有一个很深的惯性。

只要一份内容能够被打开、被复制、被下载,大家就很容易觉得它可以被使用。

链接像空气一样在网络里流动。

可进入AI系统以后,内容不再只是一个供人阅读的链接。

它成了生产资料。

它会被切块,被向量化,被反复检索,被模型吸收,再变成产品能力的一部分。

这个变化有点像一个小作坊突然变成了现代工厂。

小作坊买来一袋原料,老板认识送货的人,闻一闻、尝一尝,差不多就用了。工厂不行。工厂需要供应商,需要批次,需要检测,需要入库单,还得在出问题时知道哪一批货去了哪条生产线。

数据也会走到这一步。

来源、授权、用途、版本、删除记录。

这些听着一点都不性感。

没有新模型发布那么兴奋,也没有一个漂亮Demo那么容易获得掌声。

甚至做起来特别烦。

但一个行业真正从野蛮生长走向成熟,靠的往往就是这些不性感的东西。

如果你正在做企业知识库、RAG或者智能体,我觉得今天就可以做一个很小的动作。

别急着审计整个公司的全部资料,那工程量可能大到直接把人劝退。

先从知识库里随机抽20份文件。

然后填一张这样的表。

内容或数据
来源
权利人
允许用途
证明材料和删除机制
企业内部制度
自有文档库
企业
内部检索
文件版本和权限记录
购买的行业报告
第三方机构
出版方
依合同确认
订单和许可证
公开网页内容
外部网站
待确认
不默认可训练
链接、抓取时间和网站条款
员工提供的资料
员工或原单位
待确认
审核后使用
授权声明
客户项目文件
客户
依合同确认
限定项目使用
合同、期限和删除记录

如果20份文件里,有3份说不清来源,先别忙着继续扩充知识库。

把缺失的记录补上。

这个动作看起来很笨,甚至会拖慢项目。

我说实话,真正开始做的时候,你大概率会发现公司的历史资料比想象中乱得多。很多内容找不到原始合同,很多网页早就打不开,很多人也记不清文件是谁传的。

别指望一周解决。

但只要开始记录,新进入系统的数据就不会继续欠账。

对于个人创作者也一样。

文章、课程、图片和视频,不要只发在平台上就算结束。保留原稿、创建时间、发布记录、合作合同和修改版本。可以授权别人阅读,不等于授权改编。可以授权平台展示,不等于授权拿去训练模型。

这些记录平时看起来没有流量,也赚不到钱。

真到需要证明作品属于谁、别人被允许做什么的时候,它们可能比阅读量截图更有用。

15亿美元不会替全世界解决AI版权问题。

它甚至没有宣布所有模型训练都应该逐本付费。

但它已经把两张账单摆到了我们面前。

一张是模型如何使用内容。

另一张是内容究竟从哪里来。

第一张账单,法律还会争论很久。

第二张账单,企业已经不能再假装看不见了。

未来,模型会更新,算力可能会越来越便宜,知识库也会越来越容易搭建。

可数据的来源不会自己变干净。

每一份进入系统的文件,都带着自己的历史。

谁写的,谁买的,谁允许使用,谁有权要求删除。

这些过去藏在链接背后的问题,现在正在一点一点浮出来。

开头那张15亿美元的账单,只是把它们印得特别大。

大到整个行业都能看见。

如果AI公司愿意付费,你愿意授权自己的文章、课程或书籍,用来训练模型吗?

如果你看到这里,脑子里想的已经不只是Anthropic,而是自己公司的知识库、智能体或者每天正在做的工作,那我想顺着这个话题,再多说几句。

我这几年接触企业AI项目,有一个特别强烈的感受。

很多人并不缺工具。

ChatGPT、Codex、WorkBuddy都知道,提示词也收藏了几百条。

真正卡住的,是怎么把一个真实问题拆开,选对工具,变成一套能持续使用的工作流。

所以我做的事情,也一直围绕这条线。

不是再给大家堆一百个新名词,而是陪你把手里那个具体问题,往前推一步。

我目前设计了两种不同的方式。

如果你已经有一个真实的工作场景,想用一天时间集中拆解,并且希望现场搭出自己的智能体工作流,更适合参加8月在北京五道口举办的AI驾驭者专属智能体实战营。

这个实战营不适合只想听趋势、记几个工具名字的人。

更适合带着调研、办公、内容创作、知识库或业务自动化中的一个具体问题来,现场动手,做出一套回去还能继续使用的东西。

一天当然解决不了企业AI转型的全部问题。

但如果能把一个高频场景真正跑通,知道后面的路怎么走,我觉得就值了。

如果你暂时不方便来北京,或者遇到的只是日常工作里的零散问题,不需要一整天集中训练,可以选择AI提效线上咨询会员。

它更像一个长期陪跑的公共答疑群。

遇到工具选择、提示词优化、知识库和智能体方法上的问题,可以在群里提出来,我会给出诊断思路、方法建议和案例参考。

这块需要把边界讲清楚。

会员提供的是365天群内公共图文答疑,不包含一对一咨询,也不承诺替你直接完成项目。

适合已经开始行动,只是偶尔卡住、需要有人帮你找方向的人。

我不希望大家因为看完一篇文章,冲动买一个自己并不需要的东西。

如果你还没有具体问题,先别报名。

先回到前面那张表,从自己的知识库里抽20份文件,或者从每天最耗时间的一项工作开始,看看问题到底卡在哪里。

当你能把问题讲清楚,再决定是自己继续研究、进群问一问,还是用一天时间把它跑通。

这样的选择,反而更容易买到真正适合自己的服务。

也欢迎把这篇文章转给正在做企业知识库和智能体的朋友。

也许他们现在最该补的,不是一个新模型。

而是一本旧账。

如果你觉得这篇文章还不错,或者对你有一点帮助,欢迎顺手点个赞、点个在看,也可以转发给身边正在学习AI、使用AI,或者正在探索个人成长与内容创作的朋友。

我为什么搭建这个AI社群?这是我思考了半年的答案