ARTICLE · 1158525
拆解最高法AI纠纷意见第六条:依法认定人工智能训练过程中侵害个人信息权益的民事责任
训练大模型需要海量数据,其中不可避免地包含自然人的姓名、照片、工作经历、社交媒体内容等个人信息。
这些信息有些由个人主动公开,有些来自新闻报道、政府依法公开的信息或者其他合法公开渠道。
一个现实问题随之产生:模型开发者使用这些已公开个人信息进行训练,是否必须逐一取得本人同意?
最高人民法院《关于依法审理涉人工智能纠纷案件的意见》(以下简称《意见》)第六条对此作出了回应。
这条规定既没有确立“公开数据可以任意训练”的原则,也没有要求所有公开个人信息的训练使用都必须事先取得个人同意。
它真正划定的是一条有条件的使用边界:合法公开、合理范围、未明确拒绝,以及对个人权益有重大影响时依法取得同意。
对于AI企业而言,数据能否进入训练集,已经不能只由数据工程师根据技术可获取性作出决定。

01|核心判断:公开个人信息可以依法用于训练,但不是无条件的训练资源
《意见》第六条的核心内容是:
为人工智能模型训练,在合理范围内处理个人自行公开的或者其他已经合法公开的个人信息,且个人未明确拒绝的,一般不认定为侵害个人信息权益的行为。
条文同时明确,对个人权益有重大影响的,应当依照法律规定取得个人同意。
在认定合理范围时,需要综合考量处理目的与模型功能的必要性、适当性,信息类型及敏感程度、潜在影响,以及个人公开信息时的场景和可合理预期的使用范围。
这里最值得关注的是“一般不认定”。
这并不是为AI训练设置一项不受限制的免责规则,而是在既有个人信息保护法律框架内,对特定处理行为给出司法判断指引。
可以将第六条理解为三个层次。
第一,承认合理使用已合法公开个人信息进行模型训练的空间。
第二,通过合理范围和个人明确拒绝,限制这种使用空间。
第三,当处理活动对个人权益有重大影响时,进一步要求依法取得同意。
这三个层次共同构成第六条的规范逻辑。
02|第六条不是创造新的数据使用权,而是落实已有的个人信息处理规则
理解第六条,需要先回到《民法典》和《个人信息保护法》。
《民法典》第一千零三十六条规定,合理处理自然人自行公开或者其他已经合法公开的信息,符合相应条件的,行为人不承担民事责任;但自然人明确拒绝或者处理该信息侵害其重大利益的除外。
《个人信息保护法》第十三条第一款第六项,将依照该法规定在合理范围内处理个人自行公开或者其他已经合法公开的个人信息,列为个人信息处理的合法性基础之一。
第二十七条进一步规定了合理范围、明确拒绝以及对个人权益有重大影响时依法取得同意的要求。
最高法第六条并没有脱离这些法律重新创设一种AI训练特权。
它解决的是:当个人信息处理行为发生在模型训练场景中,如何适用既有法律规定。
这一点十分重要。
人工智能模型训练具有数据规模大、数据来源复杂、处理链条长等特点。
如果认为凡是训练数据中包含个人信息,都必须逐一取得个人同意,就可能忽视《个人信息保护法》已经规定的其他合法处理依据。
但如果认为数据只要来自公开互联网,就可以被无限制抓取、存储和训练,又会使个人信息保护规则失去实际意义。
第六条采取的不是上述任何一种极端立场。
它允许具有合法依据、符合合理范围的训练利用,同时保留个人对其信息处理的法定保护。
还需要特别强调:个人信息处理符合第六条,并不当然解决著作权、平台数据权益、商业秘密或者数据获取方式等其他法律问题。
一份公开发表的文章,可能同时包含作者的个人信息和受著作权保护的表达。
这两类法律问题需要分别判断。
03|已公开个人信息,不等于互联网中所有能够访问的数据
第六条适用的对象,是个人自行公开或者其他已经合法公开的个人信息。
这里有两个不同概念。
个人自行公开
例如,自然人主动在公开社交媒体页面发布个人简介、职业经历或者公开联系方式。
需要注意,是否属于自行公开,应当结合具体公开行为和访问场景判断。
某人向有限成员的内部群组提供信息,不当然等同于向社会公众公开。
其他已经合法公开
例如,依法公开的部分登记信息、政府公示信息或者合法新闻报道中涉及的个人信息。
这里的关键不是“搜索引擎能否搜到”,而是相关信息是否已经合法公开。
例如,某网站因配置错误暴露了用户数据库,或者有人将非法取得的个人信息上传至公开页面。
这些信息即使能够被搜索和下载,也不能仅凭网络可访问性就认定为“已经合法公开”。
对模型开发者来说,数据来源审查不能只记录一个URL。
还需要关注信息公开的性质、访问条件、取得方式以及是否存在明显违法来源。
技术上的公开可访问,不等于法律上的合法公开。
这一区分,是第六条适用的第一道边界。
04|“合理范围”是第六条真正需要个案判断的核心
相比数据是否公开,合理范围往往更加复杂。
《意见》第六条没有提供一份可以机械套用的训练数据目录,而是列出了综合判断因素。
这些因素可以归纳为三个维度。
第一,训练目的与模型功能是否具有必要性和适当性
假设一家企业开发面向公众的通用语言模型。
模型需要理解社会生活、职业活动和公开知识,其中可能不可避免地涉及部分已公开个人信息。
与此不同,如果企业专门收集特定群体的私人生活线索,用于训练能够识别、追踪或者分析个人隐私的系统,其处理目的和必要性就需要受到更严格的审查。
不能仅因为两者都属于“AI训练”,就认为其个人信息处理具有相同的合理性。
还需要注意,训练需要某类文本,不等于训练需要保留文本中的全部个人身份标识。
如果模型只需要学习一般语言表达,姓名、私人联系方式等信息是否可以删除、替换或者减少,应当纳入必要性判断。
第二,个人信息类型、敏感程度和潜在影响
《个人信息保护法》第二十八条规定了敏感个人信息的概念。
生物识别、宗教信仰、特定身份、医疗健康、金融账户、行踪轨迹等信息,以及不满十四周岁未成年人的个人信息,可能属于敏感个人信息。
对这些信息的处理,法律设有更严格的要求。
尤其需要注意,《个人信息保护法》第二十九条规定,处理敏感个人信息应当取得个人的单独同意;法律、行政法规规定应当取得书面同意的,从其规定。
因此,不能因为敏感个人信息曾经公开,就直接套用“未明确拒绝即可训练”的简化判断。
需要结合第六条、敏感个人信息保护规则以及具体合法处理依据进行审查。
第三,个人公开信息时的场景及合理预期
这是第六条中最具有现实意义的因素之一。
假设某位求职者在公开招聘网站展示个人简历,目的是寻找工作机会。
另一家企业将其简历用于训练通用文本理解模型,与利用这些简历训练专门针对个人进行职业评价、敏感推断的系统,可能产生不同的权益影响。
同样,一名医生在专业网站公开工作履历,并不当然意味着其可以合理预期这些资料被用于模拟其身份、生成虚假诊疗建议。
这里的关键,不是主观猜测个人是否愿意参与AI训练。
而是结合信息公开的具体场景,客观评价后续处理目的、方式及影响是否超出合理预期。
合理范围不是单纯的数据数量限制,而是对处理目的、数据性质、使用场景和权益影响的综合评价。
05|个人明确拒绝,是不能被训练效率忽略的法律边界
第六条明确将“个人未明确拒绝”作为一般不认定侵权的重要条件。
最高法官方《理解与适用》进一步说明:个人在公开信息时明确拒绝他人处理,或者知晓相关信息被用于模型训练后表示反对,都可能使继续依赖公开个人信息处理规则的行为失去正当性基础。
这意味着,企业不能把公开信息处理规则理解为一种永久有效、不可撤回的使用许可。
但在实际模型训练中,明确拒绝可能带来技术难题。
例如,一家企业已经完成数十亿条数据的收集和预处理。
其中某位自然人提出,不同意其公开个人信息继续用于模型训练。
企业需要识别哪些数据涉及该自然人,相关数据是否已经进入训练集,以及后续应如何依法处理。
如果企业只保存一个未经整理的海量文本文件,没有数据来源记录、主体关联能力或者处理记录,履行相关义务就可能面临实际困难。
因此,个人信息保护要求会反过来影响训练数据的工程设计。
训练数据越是大规模,企业越需要具备识别数据来源、处理异议和限制后续使用的能力。
这里也要避免另一个技术上的过度承诺。
删除原始训练文件,不必然意味着已经消除模型参数中可能保留的相关信息。
反过来,也不能简单认为某条数据参与过训练,就必然能够从模型参数中完整还原。
是否需要以及能否实施数据删除、模型调整、重新训练或者其他措施,应当结合具体法定义务、技术可行性和实际风险依法判断。
第六条本身并未规定所有模型在收到拒绝后都必须立即整体重新训练。
06|“对个人权益有重大影响”,不能被“合理范围”所替代
第六条第二句规定:
对个人权益有重大影响的,应当依照法律规定取得个人同意。
这一要求与《个人信息保护法》第二十七条直接衔接。
它说明,即使信息已经合法公开,也不能忽视处理活动对个人权益造成的重大影响。
例如,企业利用公开个人资料训练高度针对性的身份识别、个人画像或者敏感属性推断模型。
如果相关处理活动可能对个人权益产生重大影响,就不能仅凭信息来源公开、个人尚未明确拒绝,直接认定处理合法。
需要注意,“重大影响”不等于所有AI训练都存在重大影响,也不应仅以模型规模大小作为判断标准。
应当结合处理目的、个人信息类型、模型功能、可能造成的权益影响等因素综合评价。
同时,还要区分两个不同问题。
一是第六条所述公开个人信息处理对个人权益具有重大影响时,应依法取得个人同意。
二是处理敏感个人信息时,《个人信息保护法》可能另行要求特定目的、充分必要性、严格保护措施及单独同意。
这两类要求不能互相替代。
企业不能认为取得普通同意,就当然满足敏感个人信息处理的全部要求。
也不能认为处理对象不是敏感个人信息,就无需审查其是否对个人权益具有重大影响。
07|从模型训练架构看,个人信息风险并不只发生在数据采集阶段
如果把第六条放回实际AI系统,就会发现个人信息处理活动可能贯穿多个技术环节。
以一家企业训练行业大模型为例,其技术链条通常包括数据获取、清洗、标注、数据集构建、模型训练、评估以及后续部署。
每个环节的风险并不相同。
数据获取:合法公开与合法取得是两个需要查明的事实
企业可能通过公开网页、授权数据库或者第三方数据供应商取得数据。
需要核查数据是否包含个人信息、是否已合法公开、获取方式是否合法,以及第三方是否有权提供相应数据。
第三方声称“数据已经脱敏”或者“全部来自公开互联网”,不能替代企业必要的核查。
数据清洗:技术处理不等于匿名化
数据工程师可能通过删除姓名、替换账号或者遮盖部分字段降低识别风险。
但去除直接标识符,并不一定使数据达到《个人信息保护法》意义上的匿名化。
如果仍然可以结合其他信息识别特定自然人,相关数据可能继续属于个人信息。
应当区分匿名化与去标识化,不能仅凭技术文档中标注“脱敏完成”,就认定不再适用个人信息保护规则。
数据集构建:不同来源的数据不宜失去来源记录
当大量数据被合并为统一训练集后,如果原始来源、处理依据和使用限制全部丢失,企业后续可能难以判断某项处理是否超出合理范围。
从工程角度看,数据来源元数据、处理记录、版本信息和必要的限制标记具有重要价值。
模型训练:参数更新不等于个人信息风险消失
模型训练通常通过优化过程更新参数,并非简单把所有训练文件原样存入数据库。
但部分模型可能出现训练内容记忆、敏感信息复现等现象。
因此,训练完成后是否仍存在个人信息泄露风险,需要结合模型结构、训练方式、评估结果和实际输出进行判断。
不能简单认为训练数据已转化为参数,就当然不再涉及个人信息风险。
模型部署:训练合规与输出合规需要分别评价
假设企业在合理范围内使用已合法公开个人信息进行训练。
这并不意味着模型部署后可以任意输出个人联系方式、私人住址或者其他不应披露的信息。
训练阶段的个人信息处理合法性,与模型输出阶段是否侵害人格权益,是两个不同的法律问题。
后者还可能涉及《意见》第四条、第五条、第七条等相关规定。
企业需要管理的不是单一训练集,而是个人信息在模型生命周期中的持续风险。
08|企业实际场景:利用公开专业资料训练法律大模型
假设一家法律科技企业准备开发法律专业大模型。
为了提升模型对法律语言和职业场景的理解能力,企业收集公开裁判文书、法律文章、律师公开执业资料及其他互联网内容,构建行业训练数据集。
从业务角度看,这一需求具有合理性。
但不同数据的法律性质并不相同。
公开法律法规文本与包含自然人信息的裁判文书,不应当被视为同一种数据。
公开裁判文书中的当事人信息,即使已经经过一定程度的技术处理,也需要结合具体内容判断是否仍属于个人信息。
律师公开的姓名、执业机构和职业经历,可能属于合法公开的个人信息,但其后续训练使用仍须符合第六条所述条件。
法律文章还可能涉及著作权保护。
因此,企业至少需要解决三个实际问题。
一是数据分类。
区分法律规范文本、受著作权保护的作品、一般个人信息、敏感个人信息以及其他受法律保护的数据。
二是用途区分。
区分将数据用于预训练、微调、检索增强生成(RAG)以及直接向用户展示。
RAG通常是检索外部资料辅助模型生成回答,并不当然等同于更新模型参数的训练活动。
不同技术活动应分别识别其个人信息处理行为和法律依据。
三是权利限制。
对不宜进入训练集的数据进行排除或者采取其他适当措施,对相关主体的异议建立处理机制。
这一场景说明,行业模型的数据合规不能仅通过一份笼统的“数据使用协议”完成。
它需要法律判断进入数据治理流程。
09|训练数据合规,应当建立六项可以落地的管理能力
结合第六条及个人信息保护法律要求,企业可以建立以下六项治理能力。
一、数据来源登记。
记录数据来源、获取方式、公开状态、供应商信息和必要的处理依据。
二、个人信息分类识别。
识别一般个人信息、敏感个人信息,以及可能受到其他法律保护的数据内容。
三、合理范围评估。
围绕训练目的、模型功能、信息类型、潜在影响和原公开场景,判断相关处理是否具有必要性、适当性。
四、同意与拒绝管理。
区分依法可以基于其他合法依据处理的情形,以及必须取得同意、单独同意的情形;建立个人明确拒绝后的处理机制。
五、训练数据版本与使用限制管理。
在合理可行的范围内保留数据来源、版本、处理记录和使用限制,使后续核查、纠错和风险处置有据可依。
六、模型输出与持续风险评估。
针对个人信息复现、敏感信息泄露等风险开展适当测试,并结合产品用途实施输出控制和投诉处置。
上述措施属于企业治理建议,并非第六条直接规定的统一技术清单。
其中,涉及敏感个人信息处理、自动化决策等法定情形的,还应依法判断是否需要开展个人信息保护影响评估,并履行相应记录保存义务。
10|侵害个人信息权益的民事责任,仍须回到具体请求权和归责规则
第六条的标题是“依法认定人工智能训练过程中侵害个人信息权益的民事责任”。
但其正文重点规定的,是使用已合法公开个人信息进行训练时,何种情形下一般不认定为侵权,以及合理范围的判断因素。
这并不意味着第六条已经独立规定了所有个人信息侵权案件的责任构成和赔偿标准。
如果训练行为不符合第六条规定的条件,还需要结合具体事实和相关法律判断。
例如:
个人信息处理者是否违反个人信息处理规则?
相关自然人的个人信息权益是否受到侵害?
权利人请求停止侵害、删除信息或者赔偿损失,分别具备何种法律依据?
涉及损害赔偿时,如何认定损害、因果关系和责任主体?
《个人信息保护法》第六十九条规定,处理个人信息侵害个人信息权益造成损害,个人信息处理者不能证明自己没有过错的,应当承担损害赔偿等侵权责任。
该条同时对损害赔偿数额的确定作出规定。
因此,在符合其适用条件的个人信息权益损害赔偿案件中,应当注意该条规定的过错推定规则,而不能不加区分地套用一般过错责任。
同时,违法处理个人信息并不意味着权利人提出的所有赔偿金额都当然得到支持。
仍然需要根据相应法律规定,审查损害赔偿请求及其事实基础。
第六条明确的是公开个人信息用于训练的行为边界,具体民事责任仍须结合《民法典》《个人信息保护法》等规定依法认定。
11|进一步判断:AI训练数据治理将从“来源合法”转向“用途可解释”
过去,一些AI企业评估训练数据时,最关注的是能否获取、是否公开、数据量是否足够。
第六条提示了另一种更精细的判断方式。
即使数据已经合法公开,企业仍需要回答:
为什么这个模型需要这些个人信息?
为什么需要以这种方式处理?
相关信息的敏感程度如何?
个人在公开信息时,能够合理预期什么样的后续使用?
处理活动是否可能对个人权益产生重大影响?
这些问题不可能完全依赖一个通用的自动化规则作出最终法律判断。
但企业可以把其中相当一部分审查要求转化为数据分类、来源记录、用途标签、权限控制和风险评估流程。
对于大模型开发企业而言,未来更重要的能力,可能不只是获取更大规模的数据集,而是能够说明训练数据为什么可以被合法使用。
训练数据治理正在从“证明数据从哪里来”,进一步走向“说明数据为什么可以这样使用”。
这并不意味着所有模型都必须公开全部训练数据或者披露商业秘密。
而是意味着,在必要的内部合规审查、权利人异议处理和司法争议中,企业应当具备与其法定义务相适应的事实说明和证据管理能力。
结语
《意见》第六条并没有否定已公开个人信息在人工智能训练中的合理利用。
它明确承认,在符合法定条件的情况下,模型训练可以合理处理个人自行公开或者其他已经合法公开的个人信息。
但公开不是无限制使用的许可。
合理范围、明确拒绝以及对个人权益有重大影响时依法取得同意,共同构成训练使用的法律边界。
对模型开发者而言,真正需要解决的,不只是训练数据能否被技术系统读取。
而是数据进入训练流程后,能否说明其合法依据、使用目的、处理范围以及对个人权益的影响。