ARTICLE · 1143364
AI工具横评07|和AI视频通话谁最像人
想象一下:你拨通了银行的视频客服,对面的小姐姐微笑着跟你打招呼,眼神会跟着你的手势走,你话没说完她就接上了茬,连你挑眉的动作她都有回应。聊了一分钟,你敢确定她是真人吗?上个月,一家叫Tavus的公司做了个实验:54个人里,26个没看出来——而对面是AI。
一、先分清:这是"视频对话",不是"视频生成"
上期横评我们聊的是Sora 2那批视频生成工具——你写个提示词,它给你"拍"一条片子,本质是内容生产。本期完全是另一码事:实时视频交互。不是AI给你拍片,而是AI坐在屏幕对面,看着你、听着你、跟你说话。
这条赛道十月初一下子挤满了玩家。10月1日,旧金山公司Tavus发布Griffin,自称"人类交互模型"(Human Interaction Model);9月24日,谷歌把Live Avatar功能推给Gemini企业客户,给智能体装上了一张会动的脸;国内这边,数字人客服已经悄悄上岗——刚开幕的中网赛场上,联想部署的数字人第一次帮观众查赛程、找球员。
二、Tavus Griffin:全双工,为什么是质变?
先说大多数AI语音的真相:它们其实是"对讲机"——你说完、它处理、它再说。你以为在聊天,其实在轮流发言。而人类对话的真相是:两个人可以同时说、随时抢话、边说边观察对方反应。
Griffin干的就是这件事,术语叫全双工(full-duplex):它以亚秒级的间隔持续重新评估对话——你还在说,它已经在听、在看、在想,随时可以插话、点头、转移目光。你把一个东西举到镜头前,它能直接针对这个东西说话,不用你费劲描述"我手上这个白色的方块"。
几个硬数据:在NVIDIA的VideoFDB全双工基准上,Griffin生成质量拿3.83分(满分5),人类参考分3.92,而此前最好的公开系统只有2.80;H100显卡上音视频延迟平均0.43秒;视频以720p、320毫秒一段流式生成;给它10秒你的录音,它就能克隆你的声音。最扎心的还是那个实验:54人和它视频一分钟,26人(48%)认为对面是真人——它的上一代系统,41人里只有1人看走眼。
🤖 小军军观点:从2.4%到48%,只隔了一代产品。误判率的陡增说明"像人"不是渐变而是突变——上一代你还有戒心,这一代你的戒心已经没用武之地了。
不过要泼盆冷水:Griffin目前只是研究预览,只对筛选过的测试者开放。Tavus自己说得很直白——自然到能以假乱真的交互,必须先做好"身份披露"机制,等安全方案成熟再开放。这个自觉,值得同行抄作业。
三、谷歌Live Avatar:企业先上桌
谷歌的路线更务实:不追"以假乱真",先让企业用起来。Gemini 3.8 Live with Live Avatar已经在Gemini Enterprise上线,核心是把实时语音对话和低延迟视频生成拼在一起,让企业客服有一个"看、听、说"的具象形象。
它有三个设计值得说道:第一,97种语言中途切换不掉口型——客服说到一半客户切了语言,唇形和表情照样对得上;第二,异步工具调用——它一边跟你说话,一边在后台调API查你的订单、办你的入住,全程不冷场。谷歌给的演示场景是酒店前台:对话不断,入住手续在后台办完;第三,所有生成内容带SynthID不可见水印,事后可验证是AI。
限制也写得明白:自定义形象要走企业白名单审批,防止有人拿别人的照片生成会说话的脸;官方模型卡承认它适合"几分钟量级"的连续交互,不是7×24小时不下班的数字员工,而且照样会幻觉、会卡顿。
四、横评:三条路线,各占一个生态位
| 维度 | Tavus Griffin-Lite | 谷歌 Live Avatar | 国内数字人客服 |
|---|---|---|---|
| 定位 | 全双工交互研究预览 | 企业智能体的"脸" | 可上岗的数字员工 |
| 交互模式 | 真全双工,随时抢话 | 实时对话+后台办事 | 多为话轮式问答 |
| 视觉能力 | 看表情/手势/实物 | 看摄像头和共享屏幕 | 视厂商而定 |
| 怎么用上 | 暂未开放 | Gemini Enterprise | 国内可采购部署 |
| 合规范式 | 披露机制开发中 | SynthID水印+白名单 | 按国内备案要求 |
顺带一提,10月6日谷歌还开源了EmbeddingGemma 2——一个不到600MB的多模态嵌入模型,能让手机离线"一句话搜遍相册里的照片、视频和录音"。它不跟你对话,但和本期主题殊途同归:多模态能力正在从云端、从专业工具,下沉到每个人的口袋里。
普通人现在能真实体验到的,反而是国内这类"不上镜"的数字人客服:中网赛场联想那套数字人走端云混合架构,语音加触控多模态,背后统一知识库,帮观众查赛程、指引餐饮,把重复咨询的活儿接了过去。行业里把国内数字人分三档:只会播录像的"录播型"、能语音问答的"独立交互型"、接进客服中台能转人工生成工单的"数字员工型"——采购时对号入座,别花三级产品的钱买一级产品。
五、踩坑预警:脸越像人,坑越深
坑一:信任被"脸"绑架。谷歌自己的30人焦点组研究就发现:拟人越流畅,错误越难被察觉,用户越容易过度信任。数字人客服用一个安心的微笑告诉你"订单已处理",可比一个文本框说谎有说服力多了——答案对不对,和它长得多可信,是两回事。
坑二:别神化实验数据。48%误判是Tavus自己组织的实验:54人、每人一分钟、公司主导。真实业务里几十分钟的长对话、复杂业务查询,表现如何没人验证过。视频图灵测试这个词很唬人,样本要先打折。
坑三:全双工=持续采集你的脸和声音。它"看着你"的每一秒,都在处理你的面部、环境甚至桌上的文件。这类系统一旦商用,隐私和合规要求会比纯文字客服高一个量级,欧美披露立法已经在路上,国内部署更要走数据不出境和备案流程。
六、总结
把镜头拉远看:AI的交互接口经历了三次跃迁——文字框、语音、现在轮到"一张会看的脸"。生成式AI解决的是"内容从哪来",交互式AI解决的是"服务怎么给"。当视频通话成为AI的默认界面,客服、教育、面试、问诊这些"看脸吃饭"的行业,都会被重新排一遍座次。Tavus管这叫human computing,谷歌选择先服务企业,国内选择先上岗干活——路线不同,方向一致:机器不再要求你迁就它,而是开始迁就人类最本能的沟通方式。
💬 小军军点评:我是IT运维出身,见过太多"AI客服"从我面前走过——从只会放录音的机器人,到能打字的聊天框,再到今天的视频数字人。每一步都有人喊"颠覆",但真正让我服气的标准始终只有一个:它能不能把问题真的解决掉。脸可以生成,信任生成不了。下次视频客服对你微笑时,不妨多问一句业务问题——微笑是生成出来的,答案才是真的。
你接过AI视频客服吗?当场分清是人还是AI了吗?评论区聊聊!点赞过50,下期出《视频数字人客服选型避坑清单》,三类需求一张表看懂。
— 小军军的玩机技巧 · 让AI更好用 —
素材来源:Tavus官方发布与NexChron/AI Market Watch报道(2026-10-01至10-04)、Hootsuite《AI This Week》与it-ts.co.uk谷歌Live Avatar解析(2026-10)、千龙网/新浪《中网数字人智能客服上岗》(2026-10-07)、AI工具导航数字人选购观察(2026-10)、新智元/36氪EmbeddingGemma 2报道(2026-10-08)