ARTICLE · 1138381
第八十四讲:AI企业“数据投喂”的侵权风险与合规指引——从“雪球案”看数据爬取的法律边界
关键词:《反不正当竞争法》 数据投喂 数据侵权
AI训练需要“喂”海量数据,从网上爬取是最便捷的方式。但2025年《反不正当竞争法》修订后,爬来的数据如果“实质性替代”了原平台的服务,侵权赔偿可能高达1950万。
AI大模型的竞争,本质上是数据量的竞争。你的模型参数再多,没有高质量的训练数据也无济于事。于是,大量AI企业通过爬虫技术,从公开平台批量抓取数据“投喂”模型。
但这种“数据投喂”行为,正在成为AI企业最大的法律风险来源。 2025年新修订的《反不正当竞争法》首次对非法爬取数据作出了专门规定,司法判例也在不断划清边界。
两个真实判例:AI爬取数据的“代价”
判例一:雪球案——爬取组合调仓数据,赔1950万
雪某公司平台上有用户自主设立的模拟股票投资组合,平台按真实行情计算组合收益,形成了“雪球组合调仓数据集合”。深圳航某公司的AI理财平台,通过AI技术手段自动抓取这些调仓数据,为用户提供“克隆”交易服务——无需登录雪球、无需自己判断,就能跟随组合调仓自动交易。
深圳中院认定:航某公司通过规避技术保护措施、高频次请求数据接口的方式抓取数据,提供克隆交易服务,直接替代了雪球平台的下单功能,构成不正当竞争。最终判决:停止侵权、消除影响,赔偿1950万元及维权支出33万余元。
法官的核心逻辑是——“实质性替代”。航某公司的服务让用户可以完全脱离雪球平台完成投资决策,雪球的用户流量和交易机会因此减少,这就是“搭便车、不劳而获”。
判例二:AI语音数据集案——开源协议也是“商业道德”
A公司耗时近3年采集语音数据,形成了一个语音数据集。B公司将其中数据子集挂在自己官网供注册用户下载,声称“开源数据集可自由使用”。北京知识产权法院审理认为:A公司对数据的合法收集付出了大量技术、资金、劳动投入,在原始数据上添附了更多商业价值,属于反不正当竞争法保护的合法权益。
更关键的是:法院首次明确了数据开源协议是数据服务商领域商业道德的重要考量因素。B公司未经合法授权、未遵循开源协议获取使用数据集,违反商业道德,构成不正当竞争。A公司同期也获得了数据知识产权登记证书,法院确认了其数据收集过程的合法性。
“实质性替代”——判断爬取是否侵权的核心标尺
基于前述判例,法院在判断AI爬取数据是否构成不正当竞争时,会综合考量三个因素:
1. 是否违背商业道德与诚实信用原则——是否规避技术保护措施、是否高频次请求接口
2. 是否损害数据权利人的经营性利益——是否导致用户流失、交易机会减少
3. 是否破坏数据权利人的商业模式——是否构成了“实质性替代”
如果爬取的数据被用来提供与数据平台同质化的服务,让用户不再需要访问原平台——那这条红线就踩上了。1950万的判赔,就是这个逻辑的直观体现。
训练数据还可能侵犯著作权:法律适用存在分歧
除了不正当竞争风险,训练数据中的版权侵权是另一个悬而未决的问题。目前各地法院在这件事上的看法并不一致:
“杭州奥特曼案”中,杭州互联网法院认为:AI模型数据训练是将大量作品作为分析样本,目的是学习语言特征和表达规律,并非以“再现作品的独创性表达”为目的,在训练数据阶段通常不会展示作品给公众。因此,在无证据证明AI使用作品是为了“重现”或损害权利人合法利益的情形下,可以被认为是合理使用。
“美杜莎案”中,上海金山法院态度更严:用户截取《斗破苍穹》动漫美杜莎形象二十余张图片,用AI平台的“训练LoRA”功能生成LoRA模型,其他用户再通过该模型生成与美杜莎形象实质性相似的图片。
法院认定:用户以商业使用为目的,在素材截取及LoRA模型训练阶段再现在先作品的独创性表达,侵害了复制权和信息网络传播权。虽然法院未专门论述“合理使用”,但核心逻辑是——LoRA模型直接“复刻”了原作的独创性表达,这不是学习风格,而是抄袭内容。
两个案子的关键区别:
· 奥特曼案:模型训练阶段的泛化学习 → 法院倾向认定为“合理使用”
· 美杜莎案:LoRA微调直接复刻原作表达 → 法院认定构成侵权
给AI企业的四条合规建议
第一,评估数据爬取是否构成“实质性替代”。 如果爬取的数据用于提供与原平台功能相同的服务,大概率踩线。1950万的判罚不是吓唬人,是真判了。
第二,遵守数据开源协议的条款。 即使是开源数据集,也有使用条件。CC BY要求署名,GPL要求衍生作品开源——违反这些条件,仍可能被认定为不正当竞争。
第三,建立训练数据合规审查制度。 《生成式人工智能服务安全基本要求》要求训练数据来源可溯、授权合规。建议企业建立“三级权利清源机制”——数据获取层审查授权链条、预处理层过滤可疑内容、输出层设置相似性比对机制。
第四,区分“泛化学习”与“复刻表达”。 法律不禁止模型学习风格和语言规律,但禁止通过LoRA等微调技术“复刻”他人作品的独创性表达。
写在最后
“数据投喂”与“数据侵权”之间那条线,核心是“替代”还是“创造”。
如果你的AI模型学习数据后,生成的是新的、有创造性的内容——相对安全。如果你的微调模型能够“复刻”原作的核心表达——风险极高。
AI训练数据的合规,已经从“能做就做”变成了“能不做就不做”。在这场数据和法律的博弈中,谨慎不是保守,是生存。
免责声明: 本文仅为普法参考,不构成具体法律意见。每个企业情况不同,建议咨询专业律师量身定制方案。 如果你觉得这篇文章有用,欢迎点赞、收藏、转发,让更多创业者避开这个坑!