ARTICLE · 1086850
AI客服终于有脸了:谷歌给语音助手装了个会对口型的实时数字人
打电话给客服,对面只有声音,你已经习惯了。
但有些时刻还是会尴尬:AI说完了,你不知道它是不是还在听;你打断它,它不知道你生气了。
声音背后没有表情,对话就少了半层信息。
9月24日,谷歌把这一层补上了。
Gemini 3.8 Live加了一个新功能,叫Live Avatar。
翻译成人话:AI客服不仅会说话,还有一张脸,一张会对口型、有表情、实时生成的数字人脸。
这个功能已经在Gemini Enterprise里全面可用,美国、欧盟双区域端点都上线了。

数字人是怎么“活”起来的
以前的语音助手,声音是声音,画面是画面,两回事。
Live Avatar不一样,它把实时视频生成和语音对话焊在了一起。
你说话,它回应,嘴型跟着动,表情跟着变,你打断它,它马上接得住,不会丢上下文。
这套架构是语音到语音的原生处理,不需要先把你说的话转成文字再走一遍。
更狠的是语言覆盖:97种语言,语音到语音同步切换。
你跟它说英语,它用英语回你;你切中文,它跟着切,视频画质不掉、口型不漂。
谷歌官方给的一个例子特别能说明问题:
你一边跟数字人聊着天,一边让它去帮你办酒店入住。
它不打断你,在后台把API调用、工具执行全部跑完,对话结束,房间也订好了。
以前的客服是“你问一句它答一句”,现在的数字人是“边聊边把事办了”。

一张脸背后,是两道安全锁
给AI装脸,最怕的就是被拿去造假。
谷歌这次上了两层保险。
第一层,形象来源有管控。
企业可以用谷歌预建的虚拟形象库,也可以自定义形象,但自定义功能有严格的企业白名单和身份核验,不是谁都能开。
第二层,内容可溯源。
所有生成的音频和视频流,都内嵌谷歌SynthID水印,不可感知,但可验证。
AI生成的内容一旦流出去,还能查出来源。
对金融、医疗这些强监管行业来说,这一层比脸本身更重要。
客户已经先跑起来了。
Cox Automotive把Live Avatar用在了Autotrader购车平台上:数字人实时高亮屏幕内容,引导消费者完成车辆搜索和融资流程。
印度AI公司Equal AI更猛,靠着Gemini 3.8 Live,平台现在每天处理超过一百万次实时通话,覆盖九种印度语言。

泼冷水:它还不是无所不能的客服
第一,Live Avatar的持续交互时间是分钟级,不是小时级。
模型卡里写得很明白:不适合几小时的连续对话,会有幻觉,也可能超时。
第二,它现在还只对企业开放。
个人用户想在手机里跟数字人聊天,还要等谷歌把消费者版本放出来。
第三,价格没藏着掖着。
视频输出按token计费,1美元/百万视频输出token,叠加原有的音频费用。
换算下来,一张会说话的脸,是额外收费的。
第四,知识截止时间停在2025年1月,最新的事它不一定知道。
谷歌这周其实发了两个AI大动作,周三刚出了两款文本转语音模型,周四又上了Live Avatar。
Google DeepMind的算盘很清楚:先把企业客服这个最愿意掏钱的场景跑通,再谈消费者普及。
语音Agent的“脸”,成了新的战场
Meta的Muse这个月也在推Realtime Avatar,OpenAI的语音模式至今还只有声音。
谁先给语音Agent一张不违和的脸,谁就多占一个入口。
说到底,客服这个场景,拼的不只是“答得准不准”,还有“聊得舒不舒服”。
数字人把“看不见的AI”变成了“看得见的AI”,这一层体验,可能是下一轮竞争的起点。