乐于分享
好东西不私藏

开源模型法律风险图谱——基于开源软件原理与大模型时代的合规展开

开源模型法律风险图谱——基于开源软件原理与大模型时代的合规展开

大模型的开源化浪潮,正重塑软件产业的协作与商业模式。自DeepSeek等开放权重模型引发广泛关注以来,“开源模型”已成为企业研发、产品集成与法律治理无法回避的命题。然而,传统开源(Open Source)范式以“源代码可得”为内核,而大模型时代的“开源”往往止步于“权重开放”(open-weight),二者在客体属性、许可逻辑与法律规制上差异显著。本文依循“原理—问题—主体风险与应对”的三层结构,系统梳理开源模型所涉法律风险,期为开源相关实务提供可落地的分析框架。

一、开源模型与开源软件的核心原理

(一)概念界定:从“开源软件”到“开源模型”

开源软件(Open Source Software, OSS)由开放源代码促进会(OSI)以“开源定义”(OSD)予以制度化,其核心在于:任何人得以自由地运行、复制、分发、研究、修改与再分发该软件,且许可证不得歧视任何领域或任何主体。开源的本质并非“免费”,而是“自由的再分发与修改权”以著作权许可为法律载体。

开源模型(Open Model)则是大模型时代的衍生概念。与开源软件披露“源代码”不同,开源模型通常披露三层次客体:其一为训练与推理代码;其二为模型权重(weights),即经训练得到的参数集合;其三为配套文档(含训练方法、评测、用途限制)。当前业界所称“开源模型”,多数仅开放权重与推理代码,训练数据与完整训练代码仍受控,故严格而言应称“开放权重模型”(open-weight model),而非 OSI 意义上的“开源”。为弥合此争议,OSI 于2024年发布《开放源代码人工智能定义》(OSAID),将开放训练数据信息、开放代码与开放权重并列作为“开源AI”的最低标准,但 OSAID 尚非具有法律约束力的规范,仅为行业自律基准。

(二)许可机制:附解除条件的著作权许可合同

开源许可证的法律性质,通说认为属于“附解除条件的著作权许可合同”。著作权人保留所有权,仅以许可证为据,在相对人遵守约定义务(如注明出处、开放衍生源代码、不主张专利)的前提下,授予其使用、修改与分发的权利;一旦相对人违约,许可条件成就解除,原被授予的权利溯及消灭,使用行为随之转化为对著作权的侵权。该“违约—侵权”的转化路径,是开源合规的核心法理:许可证既是授权依据,亦是追责开关。

在合同形式上,开源许可证多为格式合同(定型化条款),由许可人单方拟定、相对人点击或随附接受,通常成立“默示许可”。其解释应优先遵从许可证文本文义,并参照 OSI 对 OSD 的官方释义;对争议条款,可结合“开源社区合理预期”予以体系解释。此外,因我国《民法典》未设专门“开源许可”有名合同,其权利义务可归入无名合同,准用委托、许可等相关规则。

(三)分发与修改逻辑:Copyleft 的“传染性”

开源许可证依义务强度,可区分为三类。宽松许可证(Permissive,如 MIT、BSD、Apache-2.0)仅要求保留版权声明与免责,不强制开源衍生成果,商业友好。弱 Copyleft(如 LGPL、MPL)仅对受保护文件本身的修改课以开源义务,允许与专有代码动态链接共存。强 Copyleft(如 GPLv2/v3、AGPL)则具强“传染性”:任何基于原作的“衍生作品”一经“分发”(distribution),必须整体以相同许可证开源。AGPL 更将“网络交互式提供软件服务”视同分发,封堵以 SaaS 规避开源义务的空间。

“分发”与“修改”是触发义务的两大法律行为。其一,分发指向不特定第三人的提供(含网络下载、容器镜像、嵌入产品交付);纯内部使用通常不构成分发,不触发 Copyleft。其二,修改产生“衍生作品”的认定难题——静态链接、深度定制、模型微调是否构成衍生,传统以“是否形成独立受保护作品”的二元判断常失之武断。有论者提出以“实质性影响测试”替代:考察修改是否实质性改变了原作的表达或功能架构,再判定 Copyleft 的辐射范围。该测试对界定模型微调、LoRA 适配器、权重蒸馏是否触发开源义务,具有重要参考。

(四)模型开源的四要素与权重属性争议

模型开源较软件开源多出“训练数据”与“权重”两重要素,形成“代码—权重—数据—文档”的四层客体结构。其中权重的法律属性争议尤剧:权重是受著作权保护的“作品”,还是受专利法/商业秘密保护的“技术成果”,抑或仅系“不受典型知识产权覆盖的参数集合”?主流倾向认为,训练所得的权重若体现足够创造性选择可构成汇编或衍生作品,但更多情形下其保护倚赖许可证与商业秘密;而未公开训练数据的权重,则可能因“技术秘密”属性获得反不正当竞争法救济。权重属性的不确定,直接放大了许可条款的解释风险。

二、开源模型涉及的相关法律问题

(一)知识产权归属

一是代码与文档权属。模型推理代码、训练框架、配套文档一般构成计算机软件作品或文字作品,权属依《著作权法》确定:自然人开发者享有著作权;职务作品(员工为完成工作任务所创作)除另有约定外,著作权由单位享有,作者享有署名权;委托开发合同未约定权属的,著作权归受托人。企业引入开源模型时,应审查上游贡献者协议(CLA),确认权利链完整,避免“权利瑕疵”传导。

二是训练数据权属与侵权风险。训练语料常含受版权保护的作品、个人信息与商业秘密。未经许可抓取并用于训练,可能构成对复制权、改编权的侵害;含个人信息的,须满足《个人信息保护法》的合法性基础与告知义务;含商业秘密的,存在侵害商业秘密责任。数据权属不清,是开源模型最易被忽视的“隐性负债”。

三是权重权属。如前所述,权重属性未定,其归属多依赖许可证约定与训练方单方声明,缺乏统一裁判规则,构成权利确认的不稳定因素。

(二)许可合规与许可证兼容性

大模型时代出现明显的许可证“非标化”趋势。除传统标准许可证外,厂商普遍采用自定义许可证,如 Meta的 Llama Community License、BigScience 的 OpenRAIL、Google 的 Gemma 使用条款(ToU)、Modified MIT,以及兼具开源与商业限制的 SSPL、Elastic License、BSL 等。此类许可证常植入“用途限制”(如禁止高发犯罪、成人内容、特定规模以上商业使用须授权)与“行为义务”(如输出标识、下游分发限制),其与 OSD 的兼容性存疑,多不被 OSI 承认为“开源”。

由此衍生两大合规命题:其一,格式合同的解释与效力,尤其是超出 OSD 的用途限制条款,在我国法下是否因“免除己方责任、加重对方责任”而面临格式条款无效之争;其二,许可证兼容性(License Compatibility),即在同一产品中聚合不同许可证的代码/权重时,强 Copyleft 与宽松许可证、非标许可证之间可能发生冲突,须借助 SBOM(软件物料清单)与 SCA(软件成分分析)工具进行兼容性扫描,避免“混用即违约”。

(三)Copyleft 传染与专利风险

Copyleft 的“传染性”在模型场景下被放大。若企业基于 GPL/AGPL 权重或代码进行微调、蒸馏并对外提供(含 API 服务),可能触发整体开源义务,致核心资产被迫披露。AGPL 的“网络分发”条款,使以云端推理服务形式提供模型亦可能被认定为分发。

专利风险具双向性。一方面,部分许可证嵌入专利授权与“专利报复终止”条款(如 Apache-2.0 规定,若被许可人就该软件对任何人提起专利诉讼,其专利授权自动终止),企业须评估自身专利组合与诉讼策略的冲突。另一方面,模型本身可能侵害第三方专利权(如特定网络架构、训练方法专利),开源并不豁免专利侵权责任——开源许可证通常仅授予“著作权”维度的权利,专利维度多为“视情况授予”甚至明确保留,使用者须独立承担专利侵权风险。

(四)数据合规

数据合规贯穿训练、生成与标识全链条。训练侧:爬虫获取数据的合法性、个人信息处理的同意与目的限制、重要数据的出境与安全管理,分别受《网络安全法》《数据安全法》《个人信息保护法》规制。生成侧:模型生成内容须防范侵害他人人格权、名誉权与知识产权。标识侧:依据《互联网信息服务深度合成管理规定》《生成式人工智能服务管理暂行办法》及强制性国家标准 GB 45438-2025《人工智能生成合成内容标识办法》,服务提供者须对 AI 生成合成内容进行显式与隐式标识。开源模型的再分发者,若实际提供生成服务,亦可能落入标识义务主体范围。

(五)出口管制

开源模型亦进入地缘政治与出口管制的疆域,此点常被技术团队低估。美国《出口管理条例》(EAR)以 ECCN 编码对军民两用物项分类管制,并设“实体清单”(Entity List)等限制措施。传统上,公开的开源软件源代码可依 EAR 第734.3(b)(3)条之“公开可得”例外,免受 ECCN 5D002 的出口审批约束;但模型权重是否等同“源代码”而享受同等待遇,美国商务部迄未明确,OSAID 亦未解决此跨境法律冲突。2025年前后美国推出的“AI 扩散规则”对先进计算芯片与模型参数规模设限,更使高参数模型权重、训练框架与算力工具的跨境流动面临管制不确定性。

对于企业而言第一,接入境外开放权重模型时,应核查许可人是否位于受制裁实体清单、许可证是否含出口/再分发地域限制;第二,向境外提供自研模型或接受境外算力,须评估是否触发 EAR 及我国《出口管制法》《反外国制裁法》的双向合规义务;第三,所谓“开源即不受管制”系重大误判,权重与算力的管制属性独立于代码开源状态。

三、开发者与使用者立场下的法律风险及应对

(一)开源模型开发者(许可人)的风险与应对

    1、权利确认与瑕疵担保风险。

     开发者须确保自身对代码、权重、文档享有合法权利,训练数据来源合规,避免将他人专有代码或受版权数据混入而构成侵权。

    应对:建立数据来源台账与授权链审查,对关键训练数据采用清洁室(clean-room)开发或合法授权集;以 CLA(贡献者许可协议)固化和解贡献者权利让与,并留存开发日志、代码提交记录等“独立研发”证据,以备权属争议与刑事出罪之需。

     2、许可证选择失当风险。

误用强 Copyleft 可能使自身核心资产被迫开源;选用非标许可证则面临效力与兼容性争议。

应对:依商业目标择证——以生态扩散为目的可选宽松许可证或 OSAID 兼容之开放权重许可证;以商业控制为目的可采 OpenRAIL 等附义务许可证,但应预判其 OSD 兼容性及格式条款效力风险,并形成“许可证选型决策树”(生态目标→许可证类型→兼容性→商业控制强度)。

3、责任与免责风险。

开源并不免除开发者对产品缺陷、数据安全与生成侵权的潜在责任。

应对:在许可证中设置充分的免责(AS-IS)与责任限制条款,就高危用途设用途限制,并保留对违法使用的追责权利。刑事维度上,参考“开源无罪抗辩第一案”之裁判逻辑,在确属公开、正当、无窃取商业秘密故意的情形下,可主张构成要件不该当或基于法益的实质出罪;但开发者仍应避免在明知他人商业秘密的情形下以“开源”包装实施侵占。

(二)许可协议核心关注要点(许可人视角的条款清单)

从条款起草与审查角度,许可人应重点把控以下核心要点,并将其嵌入发布前的“开源发布检查表”(OSS Release Checklist):

核心关注要点

关注内容与实操建议

授权范围条款

明确授予的权利类型(使用、修改、再分发、再许可),是否包含专利实施许可与商标使用授权;避免“全权概括授予”导致对生态控制力丧失。

著作权保留与署名

保留版权声明,设定 attribution 义务(NOTICE 文件、保留 copyright/license 文本),防止署名被剥离。

Copyleft 义务条款

明确“衍生作品”界定与开源触发条件;强 Copyleft 下审慎评估核心资产被迫披露之商业后果,必要时以弱 Copyleft 或宽松许可证替代。

专利条款

依 Apache-2.0 第3条模式设置专利授权,并加入“专利报复终止”(patent retaliation termination)条款——若被许可人就该软件对任何人提起专利诉讼,其专利授权自动终止,防范反向狙击。

商标与商号限制

依 Apache-2.0 第6条模式禁止未经授权的商标/Logo 使用,防止品牌被搭便车。

用途限制(非标许可证)

对高危用途(武器、监控、违法内容)及超规模商业使用设门槛;但须预判其与 OSD 兼容性及在我国法下格式条款效力之争。

免责与责任限制

采 AS-IS 无担保表述,设定责任上限(liability cap),排除间接、附带损害。

终止与补救

违约终止须设书面通知与合理补救期(cure period,如30日),避免“瞬时终止”引发效力争议。

出口管制与制裁陈述

要求被许可人遵守 EAR 及适用制裁法,约定违规情形下的终止权。

训练数据来源声明

披露数据来源与合规处理(含个人信息、著作权、商业秘密的合法性基础),保留数据合法性抗辩证据。

贡献者协议(CLA/DCO)

以 CLA 固化贡献者权利让与,防范权属争议与“幽灵贡献”。

准据法与争议解决

选定管辖法院/仲裁机构与适用法律,降低跨境维权成本。

实操动作:将上述要点固化为发布前置清单——SBOM 生成 → 许可证兼容性扫描 → CLA 签署 → 数据来源审计 → 免责与限制条款嵌入 → 版本与再许可(relicense)策略确认,逐项勾选后方可对外发布。

(三)开源模型使用者(被许可人)的风险与应对

1、Copyleft 传染与资产暴露风险。

使用者若将 GPL/AGPL 组件引入专有产品并对外分发或提供云服务,可能被迫公开全部衍生源码。应对:在产品架构层面对开源组件作隔离(进程隔离、API 解耦),优先采用宽松许可证组件;建立 SBOM 与 SCA 常态化扫描,于准入环节即识别许可证类型与兼容矩阵。

2、许可证违约转化侵权风险。

违反署名、开源、用途限制等义务,将使许可解除、行为转为侵权并面临索赔。

应对:制定内部开源使用政策(OSS Policy),明确禁止项(如不得将 AGPL 直接嵌入对外 SaaS),留存合规证据;对非标许可证的用途限制,应经法务实质审查并评估格式条款效力。

3、数据、知识产权与监管合规风险。

使用开源模型生成内容可能侵害第三方权利,亦须履行标识、算法备案、大模型备案/登记等监管义务(《生成式人工智能服务管理暂行办法》第8、9、10、12、14、15、17、19、22条等)。

应对:在模型接入前完成知识产权侵权与数据合规尽职调查,部署内容安全与标识机制,落实算法与大模型备案;对境外模型,叠加出口管制与数据跨境合规审查。

4、供应链与持续合规风险。

开源项目可能停更、改证或曝出漏洞。

应对:锁定版本、镜像托管、跟踪 CVE与许可证变更,将开源治理纳入企业软件法律治理路线图,实现 IP、开源、SaaS 与 AI 编程的全链路合规。

(四)许可协议核心关注要点(被许可人视角的审查清单)

被许可人在接入前,应就以下要点逐项审查,并沉淀为《第三方开源/开放权重模型接入尽调表》:

核心关注要点

关注内容与实操建议

许可证类型识别

区分 permissive / weak copyleft / strong copyleft / non-standard,映射到内部兼容矩阵,预判聚合冲突。

分发 vs 内部使用边界

确认自身使用形态(嵌入式产品、SaaS/API、内部工具)是否构成“分发”;AGPL 下“网络交互式提供”亦视同分发,须重点核查。

衍生/修改认定

评估静态链接、动态链接、微服务解耦、LoRA 适配器与蒸馏是否触发开源义务;优先以架构隔离规避传染。

专利授权与报复终止

评估许可证专利条款(如 Apache-2.0 第3条)对自身专利组合与潜在诉讼策略的影响,防范“诉讼即失权”。

用途限制合规

核对是否落入禁止领域或超规模商业使用阈值;必要时取得许可人书面例外授权。

署名与开源义务履行

准备 NOTICE 文件、源码披露通道,留存履约证据,避免“沉默违约”。

终止与补救期

关注 cure period 条款,建立违约预警与快速整改机制,防止许可溯及消灭。

出口/制裁限制

核查许可人是否受实体清单(Entity List)约束、许可证是否含地域再分发限制,规避次级制裁连带风险。

免责与责任上限

评估 residual risk 与保险覆盖,对关键业务评估是否需另行责任分担安排。

供应链条款

锁定版本、镜像托管、CVE 跟踪,制定停更/改证(license change)应对预案。

实操动作:制定《开源软件使用政策》(OSS Policy)+ SBOM/SCA 自动化准入闸口 + 第三方模型接入尽调表(数据合规、算法/大模型备案、内容标识、出口审查四栏),将许可协议审查前置到研发立项而非上线前补票,从源头阻断“传染”与违约风险。

结语

开源模型并非“法外之地”,其法律风险图谱横跨著作权、专利、数据、合同、竞争与出口管制多个法域。对开发者而言,核心在于以恰当许可证实现“开放”与“控制”的平衡,并夯实权利与数据合规底座;对使用者而言,核心在于以 SBOM/SCA 与开源政策筑牢“传染性”与违约防线,并将监管与跨境合规前置。唯有在清晰的法律框架内善用开源,方能使大模型的开源红利真正转化为可持续的创新动能。

附:开源模型许可协议审查速查表

关注我,后台回复“开源”,获取完整版审查速查表~~~