夜雨聆风学习资料网

ARTICLE · 1136362

AI 合成配音演员的声音做推广,法院判赔 5 万

AI 合成配音演员的声音做推广,法院判赔 5 万

“花几元钱就能‘偷声’,效果足以乱真。”

这不是网友的吐槽,是最高人民法院研究室副主任司艳丽在今年 9 月发布会上的原话。

9 月 29 日,上海市第一中级人民法院审结了一起 AI 合成语音引发的纠纷。一位实名认证的配音演员发现自己的声音被 AI 合成后用在一家公司的推广活动里,起诉索赔 30 万,一审、二审都判赔 5 万。

金额不高。但二审在认定环节作了一个安排,我觉得比赔偿数字重要:原告不需要证明“你用了我的声音训练模型”;这件事由被告自己讲清楚,讲不清楚,承担不利后果。

该公司虽予以否认,但其作为掌握原始训练数据的控制方,未能就投喂素材来源合法性、未利用自然人声音特征、未造成公众混淆误认等待证事实充分举证,应承担举证不能的不利后果。

一案件大览

原告王女士是某 APP 上实名认证的配音演员,在这个平台配音、发布作品并以此获得报酬。

2025 年 1 月,朋友告诉她,A 公司在一次互联网推广拉新活动里用的音频,听着像她的声音。她核对后认为系 AI 合成,对相关音频作了公证固定证据,随后起诉。诉请 30 万元,理由是她与 A 公司从未合作,也没有给过任何授权。

A 公司的答辩有四层意思:音频确系其开发的 AI 生成;具体投喂了什么素材,因前员工离职无法确认;公司此前并不知晓原告是配音演员,不存在采集、使用其声音的情形;现有证据也不能直接证明推广活动中使用了原告的声音。

审理中作了司法鉴定。案涉音频与王女士本人声音在 28 个共振峰声学指标中,24 个偏离度小于 10%,其中 16 个小于 5.36%;两者较为相似及高度相似的部分达到 90%。

技术上说一句:共振峰是声道共鸣特性在频谱上的表现,通俗讲就是决定“音色像不像”的那组数。28 项里 24 项偏离小于 10%、16 项小于 5.36%,在声学上更像同一音色的不同发音,而不是两个人的相似。

案由
自然人声音权益保护纠纷(人工智能合成语音)
一审
上海市长宁区人民法院,判赔经济损失 5 万元并由被告承担原告为诉讼支出的必要费用
二审
上海市第一中级人民法院,驳回上诉、维持原判
审结日期
2026 年 9 月 29 日
诉请金额
30 万元
关键鉴定
28 个共振峰指标中 24 个偏离度小于 10%,16 个小于 5.36%,相似及高度相似部分达 90%
案号
公开报道中未披露,当事人为化名

案件程序上不复杂,值得分析的是争点。归纳起来其实就一条:训练数据由被告单方控制,权利人的举证到哪一步为止,剩下的由谁承担。

二AI 生成内容涉及人格权的法律依据

这类案子没有专门的单行法,规则分散在《民法典》和最高法今年 9 月的司法文件里。

首先是权利基础。《民法典》第 1023 条第 2 款:对自然人声音的保护,参照适用肖像权保护的有关规定。这一句决定两件事。一是声音权益的内容按肖像权的逻辑走,未经同意不得制作、使用、公开;二是“参照适用”意味着具体规则要靠个案一点一点填——声音毕竟不是肖像,不能直接把肖像权的条文搬过来用。本案要填的,就是其中一块。

赔偿部分的依据在第 1182 条和第 998 条。侵害人身权益造成财产损失的,按权利人受到的损失或者侵权人获得的利益赔偿;两者都难以确定的,由法院根据实际情况确定,需要考虑的因素包括行为人和受害人的职业、影响范围、过错程度,以及行为的目的、方式和后果。判决里“参照权利人同类许可使用费”的口径,就落在这里。

直接回应 AI 的,是 2026 年 9 月 7 日发布的《最高人民法院关于依法审理涉人工智能纠纷案件的意见》,共 5 个部分、24 条,是首部由国家最高审判机构发布的涉人工智能司法裁判规则文件。其中第四条把 AI 声音写了进来:未经同意使用自然人的声音作为训练语料,模仿其音色、语调和发音风格生成能够识别该自然人的合成人声的,构成对声音权益的侵害;用 AI 换脸生成可识别的虚拟数字形象,同理。同一条还规定,操控虚拟形象、合成声音实施不当行为或发表不实言论降低他人社会评价的,构成名誉权侵害。

产业提示

这份《意见》在训练数据上留了一个口子,做 AI 产业的人应当留意:为模型训练在合理范围内处理已合法公开的个人信息、个人未明确拒绝的,一般不认定为侵权;但对个人权益有重大影响的,仍应依法取得同意。边界就在“合理范围”和“重大影响”这两个词怎么解释。

关于举证责任,一般规则是“谁主张谁举证”,原告要证明被告实施了侵权行为。处理证据偏在,民事诉讼里本来有工具:一是《最高人民法院关于民事诉讼证据的若干规定》里的书证提出命令,被要求一方无正当理由不提交的,法院可以认定对方主张的书证内容为真实;二是《专利法》第六十一条,对新产品制造方法专利明文规定了举证责任倒置。但这些都限于特定领域。人格权、AI 生成内容这一块,此前没有可以直接援引的规则。

时间线上有个巧合。9 月 7 日《意见》发布,9 月 29 日本案二审审结。《意见》回答的是“这算不算侵权”,本案回答的是“谁来证明”,中间隔了 22 天。

三本案的裁判思路

法院的思路可以拆成三层。第一层解决“算不算侵害”,第二层解决“原告要证到什么程度”,第三层解决“剩下的由谁来证”。

第一层 · 算不算侵害:可识别性

法院给的标准是“可识别性”。表述是:未经自然人同意,使用自然人的声音作为训练语料,模仿该自然人的音色、语调和发音风格等生成能够识别该自然人的合成人声,应当认定侵害自然人声音权益。注意这里的落点不是技术来源,是结果能不能识别到人。不管声音特征是从哪段录音里提取的、用什么算法重构的,只要合成出来的声音能让普通社会公众关联到某个具体的人,就进入声音权益的保护范围。

第二层 · 原告的初步举证

法院认可了王女士的举证:她作为配音演员,配音作品发布在公开网络平台上,A 公司存在获取其声音来源的信息渠道及可能性。这一步其实很轻,原告只要证明“我的声音在网上是公开可见的”就够了。

第三层 · 举证责任的转移(本案核心)

担子在这一步转过去。法院没有要求原告证明“A 公司用了我的声音训练模型”——按技术条件,这件事原告客观上做不到。法院要求的是被告说明自己的素材从哪来。

我的理解是这样:训练数据、算法日志、素材采购记录全在被告手里,外人看不到,也不知道该怎么看,这在证据法上叫证据偏在。前面提到的书证提出命令、专利法第六十一条的倒置,处理的都是同一类问题,只不过一个在民诉程序里、一个在专利领域。

本案给出的处理是两层——权利人证明“声音有被获取的合理渠道 + 合成语音与本人高度相似”,完成初步举证即止;从这一步起,由掌握数据的一方证明训练数据来源合法,或者证明合成声音与权利人无关,证明不了就承担不利后果。

⚠️ 边界提醒

这套安排目前还不是法律明文规定的举证责任倒置,而是法院在个案中结合被告的证明妨碍行为作出的分配。它的可复制性,要看后续同类案件怎么积累。

主审法官吴丹在法官说法里把话讲得更明白:这一规则实质上把 AI 语音侵权的认定,从“素材来源证明”转向“结果可识别性判断”,防止平台以“技术黑箱”或“员工离职无法确认”为由逃避责任。

回到被告那段答辩。“素材来源因前员工离职无法确认”,这句话在法庭上不是解释,而是自认没有留痕。而留痕本来就该是负有合规义务的一方做的事。拿员工离职来解释数据来源不明,等于告诉法官:我们从来没有建立过素材来源的记录。这个答辩不但帮不上忙,反而把举证不能坐实了。

关于赔偿:5 万元不是“声音不值钱”

判决给的口径是应优先参照权利人同类许可使用费标准确定;许可使用费难以查实的,再结合侵权持续时间、传播范围、使用方式、过错程度、损害结果、人格要素在商业化利用中的贡献比例等因素综合确定。

本案之所以压到 5 万,理由是涉案语音上架持续时间较短,属于流程播报提示音效,不是活动的核心卖点、引流载体;加上原告的网络关注度、公众活跃度不高,声音单独商业化的市场价值有限。也就是说,5 万对应的是“这段声音在这次活动里值多少钱”,不是“你的声音值多少钱”。

同样是 AI 合成声音,殷女士那件判 25 万,是因为声音产品本身被当作商品在卖;仿冒名人带货那件判 12 万,是因为搭的是名人的信任去做转化。场景不同,数字差得很远。反过来说,如果一家公司把 AI 合成的声音当成核心卖点、引流载体来用,赔偿基数会完全不一样。

三个判决,拼出一条追责路径

把时间拉长看,AI 声音这条线上已经攒下三个判决,正好各解决一层。

2024 年 4 月 23 日 · 北京互联网法院

全国首例 AI 生成声音人格权侵权案

配音师殷女士的声音被 AI 化后,在一款配音 APP 上以“魔小璇”的名义对外出售,多个短视频平台用户买去做了影视解说,法院判赔 25 万元并书面赔礼道歉。

解决的是权利对象:自然人声音权益的保护范围可以及于 AI 生成的声音;同时划了一条很实用的线——对录音制品的授权,不等于对声音的授权。

2025 年 7 月 18 日 · 北京互联网法院

仿冒名人带货案

带货主播截取他人演讲、授课视频片段,配上音色语调高度近似的 AI 合成音频做视频卖书,判委托方电商经营者赔礼道歉并赔偿 12 万元。

解决的是责任主体:委托方对素材来源、有没有取得授权没做审核,存在过失,与带货主播构成共同侵权;该案后来被最高法收录进 9 月 16 日发布的网络法治典型案例。

本案 · 上海一中院

配音演员 AI 合成语音案

解决的是证明责任。从“受不受保护”,到“谁来担责”,再到“谁来举证”,三件拼起来,一条追责路径就成型了。

法院对“技术中立”的态度

法官说法里讲得很直接:技术中立不等于使用中立。经营主体在把 AI 合成语音投入商业场景前,负有对声音素材来源合法性进行审查的义务,不能以“不知晓权利人身份”“系 AI 自动生成”免除取得授权的责任。

四对于从事AI相关人员的启示

对权利人

第一反应应该是固定证据,而不是先吵架。王女士做对了两件事:公证音频、申请司法鉴定。28 项共振峰指标那样的鉴定意见,是本案能赢下来的物理基础。

另外要保留自己作品在公开平台发布的记录,那是“渠道可能性”的证明。这个案子的思路同样可以平移到 AI 生成图片、视频、数字人这类纠纷——只要合成结果能识别到特定自然人,权利人证明的担子就到“公开可获取 + 高度相似”为止。

对企业经营主体

有三件事现在就该做。训练语料的授权链条要留痕:谁提供的、来源在哪、有没有取得声音本人的授权,落到书面。采购合同里只有录音制品著作权层面的约定是不够的——“对录音制品的授权不等于对声音的授权”这句话,从 2024 年讲到现在,仍然有公司在踩。

还有一条,别拿“技术黑箱”“员工离职”当抗辩,这两句话在法庭上等于自认没有合规记录。

对做 AI 语音、数字人、口播带货的技术方

训练日志、数据来源清单、素材授权文件这些东西的性质变了。以前它们是内部管理资料,现在是你唯一能拿出来对抗举证责任转移的东西。谁掌握数据谁举证,那就应当在掌握数据的时候,把能证明合法性的材料一并存下来。

相关学习资料