ARTICLE · 1020596
温凤鸣 | AI数字人主播的情感表达与新闻叙事创新研究

一、问题的提出
2025年春节期间,《杭州新闻联播》的6位AI数字人主播以零失误完成了为期7天的新闻播报任务。2024年Hume AI发布的共情语音接口EVI可识别53种情绪,GPT-4.5通过情感智能重塑了人机交互模式。可见,当前人工智能技术正经历从功能模拟向情感计算的范式转型。在新闻传播领域,AI数字人主播的演进和应用尤为引人注目。自2004年央视推出首个数字虚拟人主播以来,中央级媒体的AI数字人主播项目已走过二十多年的发展历程,经历了从数字形象的初步尝试,到技术路径的类型化探索,再到IP化、条线化、常态化应用的三个递进阶段。然而,AI数字人主播的技术成熟并不意味着传播效果的实现。在新闻这一以真实性为根基的专业领域,AI数字人主播面临共情力、亲和力不足的情感表达局限,而AI数字人主播的情感表达对新闻真实性的构建又尤为重要,进一步说,AI数字人主播的情感表达是实现新闻传播效果的核心竞争力。一方面,后真相时代的情感转向使新闻业面临客观性与情感共鸣的张力,受众不仅需要事实信息,更渴望在信息接收中获得情感共振。另一方面,AI数字人主播的强技术属性使其在情感表达层面面临拟真困境,即算法可以模拟人类的表情和语气,却难以传递真实的情感。这一问题促使研究者重新审视AI数字人主播的情感表达机制及其对新闻叙事的影响。为此,本文旨在回答以下三个问题:AI数字人主播的情感表达建立在怎样的技术基础之上?其情感表达呈现出哪些特征?这种情感表达模式如何驱动新闻叙事创新?
二、AI数字人主播研究现状
学界围绕AI数字人主播的研究主要聚焦于AI数字人主播的演进历程研究、AI数字人主播的情感化表征研究、AI数字人主播的传播效果与用户接受研究这三个方面。
(一)AI数字人主播的演进历程研究
国内AI主播的实践探索可追溯至2004年央视推出的三维虚拟主持人“小龙”,但其因制作成本高昂未能持续发展。真正的突破出现在2018年,新华社联合搜狗推出以邱浩为原型的全球首个AI合成主播,通过人脸关键点检测、特征提取、唇语识别与情感迁移等多项技术,生成与真人高度相似的数字分身,AI数字人主播能够用真人主播的声音、动作和面部表情进行24小时新闻播报,显著提升了新闻播报效率。2019年2月,新华社再次联合搜狗对AI合成主播进行了升级,推出的AI合成男主播“新小浩”实现了从坐着播报新闻升级为站立式播报,且丰富了AI合成主播的表情和肢体动作,同时还推出了全球首个AI合成女主播“新小萌”。同年,央视推出“康晓辉”“小小撒”等系列AI主持人。2020年新华社发布全球首位3D版AI主播“新小微”,实现多机位、多景深的播报能力。在2021年全国两会上,新华社AI合成主播“新小萌”走出演播室,出现在了全国两会现场,实现了从室内演播厅向新闻采访现场的“跨越”,使AI合成主播能够在虚拟空间和现实空间来回“穿越”,呈现出全新的新闻报道样态。在这一应用场景中,AI合成主播的表现力也再次得到提升,借助人工智能的动作生成技术,AI合成主播的微笑、点头、挥手、点赞等动作越来越丰富,同时在算法技术驱动下,实现了AI合成主播动作与新闻文本、情景的实时适配,使AI合成主播更具生动性和亲和力,也更加人性化和情感化。2022年以后,央视、人民法院新闻传媒总社分别推出的“AI王冠”“AI夏静”等条线化AI主播投入常态化使用。
(二)AI数字人主播的情感化表征研究
AI数字人主播通过技术赋能,能够进行情感化表达,同时也创造了新的视听体验。其一,通过运用人脸关键点检测、人脸特征提取、唇语识别、情感迁移等技术,在联合建模训练之后,AI数字人主播能够在新闻播报的声音、动作、表情层面实现与真人主播高度相似的效果,给观众带来全新视听体验。例如新华社的AI合成主播“雅妮”,在全国两会报道中,其在新闻断句、音色韵律方面表现自如,呈现出较强的拟真性和情感化特征。其二,5G、AR、VR、物联网、传感器及人工智能技术的融合应用,使新闻播报主体越来越智能化,具备越来越高的拟真性。例如新华社联合搜狗开发的AI数字人主播“新小微”,不仅能够依据不同场景变换发型和服饰,还能够根据新闻播报内容做出自然的表情和动作,其3D立体形象还能够实现新闻报道场景的多元化延伸,进而增强新闻报道的现场感和真实感。其三,AI数字人主播的个性化能够增强受众的真实感。AI数字人主播作为具有数字化外形的虚拟人物,具备形象能力、感知能力、表达能力和娱乐互动能力,其传播功能已经从单一信息呈现转向个性化表演维度。例如,央视与微软合作推出的《你的生活 AI为你唱作》的融媒体作品中,人工智能应用能够根据用户上传照片中的主题、环境、人物、色彩、表情等元素,为用户生成个性化写意歌词,并由康辉和微软AI数字人主播“晓晓”联袂演唱。这种AI数字人主播人格的定制化,使AI数字人主播成为更加智能的“智慧人”。此外,还可以通过开发AI数字人主播的“陪伴者”身份属性,使AI数字人主播模拟真人完成社会交往,并进行更加智能的信息输出,实现与用户的深度交互和情感交流。
(三)AI数字人主播的传播效果与用户接受研究
AI数字人主播对不同受众群体的传播效果呈现出较大差异。年轻网民关注AI数字人主播的形象和互动形式,资深新闻受众则追求富有感染力的新闻表达,传统新闻工作者关注新闻播报的专业性和人文性,情感需求者则追求温暖、正向的情感体验。姚琦、胡崴进一步探究了AI数字人主播对用户接受度的影响因素,认为AI数字人主播的感官可供性、功能可供性、情感可供性是影响受众接受度的前因变量,其中,感官可供性包含外观形象、声音特质、拟人特征三个要素,功能可供性包含口语发音、业务能力、知识储备三个维度,情感可供性则包括人物设定、情绪披露和陪伴互动三大要素。此外,以温暖感知和能力感知为主要内容的社会判断是影响AI数字人主播社会接受度的中介变量。庞华、赵静媛则认为感知技术新颖性、感知相对优势性和感知形象吸引力均正向影响用户对AI数字人主播的技术崇拜和社会临场感。张馨月通过实证研究法,发现受众对AI数字人主播的好感度在不同新闻主题类别中差异较大,受众对财经新闻AI数字人播报的好感度最高,对时政新闻、体育新闻、社会新闻的好感度依次减弱。此外研究者还发现,女性群体、中青年群体、本科学历群体对AI数字人主播的好感度更高。
三、AI数字人主播的情感表达技术机制与特征
情感表达,是指AI数字人主播在新闻播报中通过语音韵律、面部表情、肢体动作、服装形象等模态传递给受众的情感信号与情感氛围,使受众对其产生亲切感、认同感和情感依赖。AI数字人主播有别于真人主播通过身体的自然语言进行表情达意,其情感表达需要以计算机图形学、图形渲染、语音合成、动作捕捉、深度学习、CG建模等多模态情感感知技术和音频、视觉生成等情感响应技术作为中介,利用这些中介技术对人类的声音、表情和动作进行模拟,通过情感感知机制和情感响应机制,实现AI数字人主播与用户之间的情感交互。
(一)AI数字人主播情感表达的技术机制
1.基于情绪建模与数据训练的多模态情感感知机制
AI数字人主播的情感表达能力首先建立在多模态情感感知技术基础之上。所谓“多模态”,是指系统整合语音识别、图像视觉分析、自然语言理解等多种感知通道,从语音韵律、面部表情、肢体动作、文本语义等多维度捕捉情感信息。多模态情感感知技术是基于具身认知(Embodied cognition)理论运行的,该理论认为,人类的情绪不仅体现为心理活动,还可以通过身体的物理反应如皱眉、颤抖、语调变化等得以表达。在AI数字人主播的设计中,人工智能通过对“身心一体”的情绪信号进行建模,实现对人类情感状态的识别与模拟。AI数字人主播在情感感知层面,主要通过深度学习算法对大规模标注的情感数据进行训练,由此建立起音高、语速、语调等语音信息,面部动作单元、人物视线方向等视觉特征,以及喜、怒、哀、乐等情感类别之间的映射关系。可见,人工智能基于情绪信号的建模与深度学习算法对情感数据的训练,是AI数字人主播实现情感表达的底层逻辑和基础技术机制。
2.基于音频与视觉生成技术的情感响应机制
通过情感感知机制能够实现AI数字人主播对用户的情感识别,而AI数字人主播的情感反馈则需要通过情感响应机制才能实现。一是通过音频响应技术进行情绪反馈。AI数字人主播在感知与识别用户情感之后可以通过语音合成技术生成富有情感色彩的音频传递情感反馈,从而实现与用户的情感联结。音频的情感色彩可以通过语音合成技术对AI数字人主播的音量、语调、语速进行精确的情感调控。二是通过视觉响应生成技术进行情感反馈。通过深度学习算法和生成式大语言模型,如动作捕捉、3D建模、面部动画参数化、实时渲染等技术,创建AI数字人主播富有情感的面部表情、肢体动作等视觉输出信息,从而增强与用户的情感交互与情感共鸣。
(二)AI数字人主播情感表达的三重特征
共情,在心理学中指的是个体直觉和理解他人情绪并作出相应反应的能力。共情通常包含情绪与认知两个维度。情绪共情,即感受他人情绪的能力;认知共情,即理解他人意图的能力。“拟真共情”是近年来兴起的情感交互概念,旨在通过技术手段模拟人类的共情能力,实现智能机器与用户之间的深度情感联结。AI数字人主播的“拟真共情”本质上是对情绪共情和认知共情能力的算法复现。而“拟真”通常体现为多模态感知、动态适配与具身化表达三个方面。AI数字人主播的情感表达也呈现出多模态情感输出、动态场景适配、技术具身的情感在场三重特征。
1.多模态情感输出
AI主播的情感表达不是单一维度的信息传递,而是融合语音、视觉、语言的多模态协同输出。在语音层面,高保真语音合成技术支持情感韵律建模,具体可以根据新闻内容自动调整AI数字人主播播报的语调、节奏与重音。例如通过情感韵律建模,AI数字人主播可以实现在财经新闻的沉稳语调与体育新闻的激昂情感之间的自如切换。在视觉层面,肌肉模型与肌肉绑定技术使AI数字人主播的面部表情能够随语义内容实时变化,唇音同步误差可控制在0.1秒以内。在语言层面,人工智能技术通过情感词汇库与语境适配模型,能够使播报新闻文本的措辞风格与情感基调保持一致。例如,科大讯飞以真人主播茜茜为原型打造的AI数字人主播“西西”,依托语音识别、人脸建模、口唇预测、音频驱动等技术,用户只需要输入语音或文本,就能够让AI数字人主播进行网络直播。AI数字人主播“西西”不仅能够根据用户喜好变换五官、还原真人主播的声音,还支持多语种播报。基于大规模音频库,“西西”能够为新闻媒体、文旅等多个场景提供多模感知、情感贯穿、多维表达的深度融合应用。
多模态情感输出的关键价值在于不同元素的“协同效应”。当语音、表情、文本传递的情感信息高度一致时,受众对AI数字人主播的情感感知会更为强烈和真实。因此,在AI数字人主播设计过程中,不仅要进行声音、表情、动作的仿真模拟,更为关键的是还要能够实现语音、表情和新闻文本情感的适配与协同。当前AI数字人主播仍处于以传递单一情绪为主的阶段,要想传递“悲喜交加”等复杂情感,使AI数字人主播情感表达接近人类的丰富性,还需要进一步完善多模态情感输出协同机制。
2.动态场景适配
AI数字人主播的情感表达不是固定模式的重复,而是能够依据新闻场景动态调节的弹性系统。教育科学家布朗、科林斯、杜吉穗提出的情境认知理论认为,知识并不是个体内部心理的静态表征,而是个人与社会或物理情境互动的产物,学习需要嵌入知识产生的特定物理或社会情境,通过参与社会实践才能获取知识、建构意义和解决问题。换言之,人类的认知与行为依赖于具体的物理与社会环境。同理,作为模拟人类认知与行为的AI数字人主播,要想与受众产生认知共情和情绪共情,也需要根据物理环境、语言情境等实时场景动态调整情感表达的共情策略。
在新闻播报实践中,动态场景适配主要体现为个性化适配和场景适配。个性化适配基于用户画像,即通过分析受众的情感倾向与偏好,AI数字人主播可选择不同的情感表达强度与风格。场景适配是建立在新闻主题的基础之上,即AI数字人主播可以根据预设的新闻主题类型,如灾难、时政、财经、文化、体育等不同主题,调取对应的情感表达参数,进而表达不同的情感或态度。例如,杭州文广集团依托神经网络技术开发的AI数字人主播“小雨”,能够依据报道内容调整播报时的语音韵律与面部表情,向观众传递与新闻情境相适配的情感温度。
3.技术具身的情感在场
AI数字人主播的情感表达还呈现出技术具身的情感在场特征。具身认知理论为理解AI数字人主播的情感表达提供了理论视角。具身认知理论认为,人类的身体而非意识成为认知的基础,理性根植于我们大脑和身体的本性以及身体的经验。与身体相关的、微观的、个体的神经感知及其背后的“社会—文化”结构的耦合,成为决定新闻价值与意义的核心要素。在传统媒体的新闻报道中,情感传递往往受限于物理“在场”的缺席,文字、广播,甚至视频媒介都无法完全复现“身体在场”的情感交流体验。与传统媒介相比较,AI数字人主播因具备技术具身性,可通过“数字身体”的“在场”,为观众提供情感表达的在场感。具体而言,AI数字人主播可以通过面部表情、手势动作、眼神变化等数字化的身体映像,在虚拟空间中建构一种“准在场”的情感交流情境,从而使观众产生“情感在场”的体验感。
AI数字人主播技术具身的情感在场体现在两个方面。一方面,AI数字人主播“类人化”的身体表达能够激活受众的社会性回应,即人们倾向于以对待真人主播的方式回应具有类人特征的智能体,并产生礼貌、共情等社会性反应。另一方面,技术具身也赋予了AI数字人主播超越真人主播身体的表达能力,可同时呈现多角度、多景深的情感信号,甚至能够根据算法优化出超越真人主播的表情和姿态。AI数字人主播“超真实”的情感表达能够大幅提升受众的沉浸感。例如,由香港智元创界科技有限公司打造的全球首款3D实时互动人工智能虚拟伴侣“AI侣”(Ai lover),作为具身智能AI数字人,其3D立体数字具身的在场,能够为用户提供情感交流、实时互动和跨语言协作。“AI侣”通过生动的表情、同步口型、肢体动作和语音互动,实现与用户的具身互动。
四、AI数字人主播情感表达驱动的新闻叙事创新
AI数字人主播的情感表达不仅改变了新闻播报的呈现方式,更在深层结构上推动了新闻叙事的范式转型,具体体现为新闻叙事主体、叙事视角、叙事场景和叙事形态四个层面的变化。
(一)叙事主体重构:从人到人机共生
AI数字人主播重构了新闻叙事主体。传统新闻叙事以真人记者、真人主播为主体,AI数字人主播的出现打破了这一格局,使新闻叙事主体从单一的人扩展为人机协同的复合主体。这一重构具体体现在以下两个层面。
其一,AI数字人主播作为独立叙事主体的常态化运行。新华社“AI王冠”与财经评论员王冠的协同报道是典型案例。在《“冠”察财经》栏目中,评论员王冠负责宏观政策评论与民生视角解读,“AI王冠”则聚焦可视化数据传播与专业财经分析,真人主播与AI数字人主播在同一叙事空间中进行分工协作。其二,AI数字人主播作为真人主播“数字分身”的协同关系。例如,《新华社消息》栏目真人主播面对自己的AI分身时,经历了从不安到主动调适的心理转变,他们意识到,真正难以被技术复制的是生动鲜活的表达、对新闻现场的敏锐洞察以及与采访对象建立的真挚连接,因此,真人主播更聚焦于深度报道、现场访谈等领域,从而形成真人深耕专业、AI承担标准化播报的人机协同新格局。
新闻叙事主体的重构本质上是对新闻生产中“人”的价值的重新定义。当AI数字人主播承担起标准化的信息播报功能后,真人主播就能从“播报工具”的角色中解放出来,转向更具创造性、人文性和专业性的叙事实践,比如深度调查、现场访谈、新闻评论等。新闻叙事主体重构并不是AI数字人主播对真人主播的完全替代,而是对真人主播专业价值的淬炼。随着AI数字人智能体的不断成熟,在不久的将来,AI数字人主播与真人主播协作主持同一个新闻节目将会成为传媒业的常态。
(二)叙事视角延伸:从第三人称视角到全知与共情视角
AI数字人主播以“超人类”叙事能力延伸了新闻的叙事视角。叙事视角决定受众“看到什么”以及“如何感受”。在传统新闻叙事中,真人主播主要采用第三人称的客观叙事视角,且其叙事视角常常会受限于物理在场性、感官能力与认知能力,而AI数字人主播凭借技术优势能够实现叙事视角的“超人类”延伸。
其一,AI数字人主播能够实现“全知视角”的新闻叙事。传统新闻叙事中,全知视角通常被视为小说叙事手法,新闻则强调有限视角的真实性。然而,AI数字人主播能够通过同时调取多源数据、多角度画面、多语种信息,实现全知视角的新闻叙事,在同一新闻叙事中能够呈现出点面俱全的信息密度。例如,新华社AI主播平台能够提供16种AI数字人主播形象选择,同时还能实现中、英、西、法等23个语种的同步播报,同一新闻事件可通过不同语言版本,适应不同文化语境的叙事视角。其二,AI数字人主播还能够实现“共情视角”的新闻叙事。当前,以Sora为代表的生成式视觉大模型具有情感仿真和情感唤醒能力,能够模拟出与文本描述相匹配的情感状态,不仅能够模拟人类的面部表情与肢体动作,还可依据传播情境动态生成符合事实情感倾向的视觉符号系统,这种情感建构的叙事模式能够引起受众的情感共鸣。例如,AI数字人主播在新闻播报的同时,能够利用生成式视觉大模型生成重庆火山、土耳其地震救助场景的图片或视频,从而再现火山爆发、地震救助的新闻现场,唤起受众对自然灾害中人类的脆弱性以及人们之间互助的强烈共情。
(三)叙事场景拓展:从演播室到全场景渗透
AI数字人主播的介入和应用,延伸和拓展了新闻叙事场景。在传统新闻报道中,新闻叙事场景以演播室和新闻现场为主。AI数字人主播的介入打破了这种空间限制,将新闻叙事场景拓展至全媒介生态。
其一,从固定场景到多元场景的延伸。早期央视的AI数字人主播“康晓辉”的新闻播报主要在演播室内完成,而最新的AI主播已能够嵌入多种媒介场景。例如,新华社AI主播“新小微”实现了多机位、多景深拍摄;央视AI记者“通通”走出演播室,以记者身份探访不同的新闻现场。AI数字人主播已不再是被框定在屏幕中的新闻播报员,而是可以“进入”不同场景空间的叙事主体。其二,从新闻场景到文化场景的渗透。例如,杭州文广集团推出的《主播寻年味》系列短视频,通过智能剪辑与AI数字人主播解说,将地域文化符号嵌入新闻叙事框架,形成“AI数字人播报+真人纪实”的融合叙事模式;又如,杭州临平、建德融媒体中心启用方言AI数字人主播,以非遗为背景用方言讲述文化故事,让AI数字人主播的应用从新闻领域拓展至文化传播领域。可见,AI数字人主播的叙事场景已从相对单一的新闻演播室延伸至文旅导览、非遗传承、教育科普等多元化场景,与此同时,其“叙事主体”身份也从新闻主播拓展为文化讲述者与知识传播者。
(四)叙事形态变革:从信息传递到情感共创
AI数字人主播驱动新闻叙事创新最显著的体现,是叙事形态的变化。传统新闻叙事的主要功能是信息传递,即告知受众“发生了什么”,而AI数字人主播的情感表达能力驱动新闻叙事形态从信息传递转向情感共创,即AI数字人主播在传递新闻信息的同时,还会给受众营造情感氛围,并通过受众的情绪反馈动态调整共情策略,实现与受众之间的情感双向建构。例如,央视AI数字人记者“小C”在《两会C+真探》直播节目中担任连线记者,大量使用年轻人流行的热点用语,如“蹦迪”“好rua”“ Q萌”等,达到了很好的传播效果。AI数字人记者语言风格调整的依据,正是其对受众情感偏好的识别与回应。
情感共创叙事形态模糊了信息传播者与接收者的边界。在传统叙事形态中,真人主播是信息的传播者,受众是信息的接收者,二者角色分明,边界清晰。然而在AI数字人主播介入的情感共创新闻叙事模式中,AI数字人主播与受众是双向互动的,没有明显的传者与受者的角色边界,受众既接收AI数字人主播所传递的信息,同时也会反馈或再传播信息,如受众的情感反应成为新闻叙事内容的一部分;AI数字人主播也不仅仅作为传播者传递信息,同时还会根据受众的情绪反馈调节自身表达方式,这种调节本身又构成了新闻叙事的新内容。
五、结语
AI数字人主播的拟真共情标志着人工智能已从功能工具向情感伙伴的范式转变。本文研究发现,AI数字人主播的情感表达并非对人类情感的简单模拟,而是建立在多模态感知与情感计算技术基础之上的系统性建构,呈现出多模态情感输出、动态场景适配、技术具身的情感在场三重特征。AI数字人主播的情感表达驱动了新闻叙事层面的创新,体现为叙事主体从人向人机共生的重构;叙事视角向“超人类”能力的延伸,打开了全知视角与共情视角的叙事新可能;叙事场景从演播室向全媒介生态拓展,使新闻叙事渗透至文化、教育等多元化场景;叙事形态从信息传递向情感共创的变革。与此同时,情感共创叙事形态也带来新的伦理挑战,比如当AI数字人主播被设计为迎合受众情感偏好时,是否会牺牲新闻的客观性?是否会导致新闻叙事的娱乐化倾向?这些问题需要在未来的新闻实践中进一步审视。
未来,AI数字人主播的情感表达能力将面临拟真性与真实性之间的持续张力。技术进步会不断提升AI数字人主播的拟真度,但情感交流的真实性不仅源于表达的逼真,更源自用户体验的本真,如何使用户感觉到AI数字人主播情感表达的真实性,是AI数字人设计者与媒体应用者需要共同面对的难题。从技术发展与AI数字人主播的应用趋势来看,AI数字人主播与真人主播协同进化,最终走向智能共生的新形态将成为传媒业的常态。
温凤鸣:广东技术师范大学文学与传媒学院副教授、硕士生导师
(本文图片来自视觉中国)
本文刊发于《视听界》2026年6月刊
视听界
长按识别二维码关注我们
微信:jsbc-shitingjie
国家新闻出版署认定的学术期刊
全国广播影视十佳学术期刊
邮发代号28-320
全年定价108元
电话:025-83287968
投稿:shitingjie@sina.cn