ARTICLE · 1114327
刚刚,AI 首次通过视频图灵测试!48% 的人聊完 1 分钟,坚信对面是活人
AI 还是冷冰冰的机器
AI 首次通过视频图灵测试
48% 的人坚信是活人
聊满 1 分钟就有近一半人相信对面是人——这场实验改变了什么
硅基社 · 观察
📦 9 Parts + Conclusion
👉 滑动
PART 01
一、从 2.4% 到 48%,AI 视频互动跨过了什么门槛?
PART 02
二、传统数字人为什么总有“机械感”?
PART 03
三、Griffin-Lite 的关键:它在每一秒都重新判断“现在该做什么”
PART 04
四、它生成的不是“会动的脸”,而是一整个正在发生的场景
PART 05
五、为什么 0.43 秒的延迟,可能决定它像不像人?
PART 06
六、NVIDIA VideoFDB 第一,离“真人级”到底还有多远?
PART 07
七、真正的颠覆,不在“数字人更逼真”,而在 AI 开始参与真实互动
PART 08
八、当“开视频确认”不再可靠,安全规则必须重写
PART ///
写在最后
FINAL THOUGHTS
引子 · LEAD
“我和对面那个人聊了整整 1 分钟,我敢发誓,他绝对是个真人。”
如果是在两年前,听到这句话,你可能只会觉得理所当然。但如果我告诉你,屏幕另一端其实不是一个人,而是一套实时生成语音、表情、动作和视频画面的 AI 系统呢?

10 月 1 日,实时视频 AI 公司 Tavus 发布了 Griffin-Lite,并将它定义为新一类 Human Interaction Model,即“人类互动模型”。与此同时,Tavus 抛出了一组足够震撼的数据:在一项 54 人参与、时长 1 分钟的实时视频通话测试中,有 26 人、约 48% 判断自己面对的是真人;而这些判断对方是真人的参与者,平均信心度达到 79%。
这不是一张静态人脸在对着口型播放视频,也不是提前录好台词的数字人。它能在你说话时点头、在你停顿时等待、在适当的时候发出简短回应;它会看你的表情、接住你的手势、调整自己的视线和姿态,甚至能在互动游戏里跟上你的节奏。
AI 正在从“你说完,它才答”的工具,变成一个能实时参与对话的对象。
但也正因如此,一个更严肃的问题浮现出来:当屏幕另一端的 AI 已经足够像人,人类还能否轻易相信“开个视频确认一下”?
01
PART
一、从 2.4% 到 48%,AI 视频互动跨过了什么门槛?
OVERVIEW
先说清楚一点:Tavus 这项测试并不等于一场大规模、独立、同行评审的科学裁决。样本量只有 54 人,通话时长只有 1 分钟,话题也是相对轻松的破冰问题——“你今年最期待什么?”

参与者通过独立招募平台进入视频通话,被告知将与另一位参与者交流。实际上,对方是一套由 Griffin-Lite 实时驱动的 AI 人格体。通话结束后,参与者才被问到:你刚才面对的是人,还是 AI?
最终,26 人判断对方是真人,占比 48%。认为是真人的人,平均有 79% 的信心;判断对方是 AI 的人,平均信心度则是 81%。也就是说,无论看穿还是没看穿,参与者都相当确定自己的判断。
这件事的关键,不只在于 48% 这个数字,而在于它和上一代系统的落差。
Tavus 过去采用的,是很多 AI 视频产品都在使用的组合式路线:语音识别把人说的话转成文字,语言模型根据文字生成答案,语音合成模块把答案变成声音,数字人引擎再让脸部、嘴型和表情动起来。
这种架构已经可以完成视频对话,但在 Tavus 此前的测试里,41 名参与者中只有 1 人把 AI 当成真人,比例只有 2.4%。
从 2.4% 到 48%,背后意味着的不是“画面分辨率提高了一点”,而是 AI 开始补上人类交流中最难模拟的一部分:互动节奏。
人和人沟通时,并不是一个人完整说完,另一个人再完整回答。你会在对方讲到一半时点头,听到重点时发出“嗯”“对”,感觉对方还在组织语言时保持安静;当对方突然插话,你会调整自己的表达;当对方皱眉、笑起来、展示一个东西时,你会自然把这些信号带进对话。
过去的数字人往往像会说话的视频播放器。
Griffin-Lite 想做的,是一个能持续参与现场的人。
02
PART
二、传统数字人为什么总有“机械感”?
DEEP DIVE
很多人对数字人、AI 客服或虚拟主播的印象是:第一眼挺惊艳,聊两句就觉得不对。
问题通常不在于它说得对不对,而在于它说得不像一个正在和你交流的人。
传统系统的对话流程大致是:
听到语音→语音转文字→语言模型生成答案→文字转语音→驱动数字形象
这是一条接力式链路。每一段都需要时间,每一段也都可能丢掉信息。
当语音被转换成文字时,你的犹豫、停顿、语气、笑声、叹气和情绪变化,可能被压缩掉;模型拿到文字后,往往只关心“该回答什么”,却不一定知道“现在该不该回答”;等它生成答案、合成语音、驱动人脸后,对话中已经出现了让人不舒服的空白。
更重要的是,大多数系统是半双工的。
你讲话时,它安静地等;它讲话时,你也只能等。你们像在用对讲机,而不是坐在同一个房间聊天。
人类对话却是全双工的。
你讲话时,我仍然在听、在点头、在表达“我跟得上”;我讲话时,你可以突然提出补充,我能停下来让你说;我们都在不断根据对方的语速、表情、视线和停顿调整下一秒的反应。
这种能力听上去不如“推理”酷,却是人类社会交流的底层操作系统。
一旦缺失,再聪明的 AI 也会显得像机器。
03
PART
三、Griffin-Lite 的关键:它在每一秒都重新判断“现在该做什么”
ANALYSIS
Tavus 把 Griffin-Lite 定义为 Human Interaction Model,意思不是让 AI 更会背知识,而是让 AI 更会处理人与人交流中那些不成文的规则。
它的架构可以理解为两套并行系统。
第一套被称为 Continuous Conversational Modeling,相当于持续运行的对话决策层。它会连续接收用户的音频和视频,不断判断当前互动处于什么状态:你是真的说完了吗?只是中途卡住了吗?你需要它点头确认,还是需要它保持安静?你是不是刚展示了一个物品?你的表情是在开心、困惑、怀疑,还是想让对方继续解释?
第二套是 Streaming Audio-Visual Generation,负责把这种判断快速转化成用户能看到和听到的结果:语气、音色、表情、目光、头部动作、身体姿态、手势,以及完整的视频画面。
它和传统数字人最大的不同在于,决策和表达不再是“等一切确定后再输出”的串行过程。
它一边看、一边听、一边生成。
你在说话时,它可以点头或发出简短确认;你打断它时,它能中止原有表达;你停下来思考时,它可以不急着填满沉默;你做了一个视觉动作,它能把这个动作纳入后续回应。
Tavus 称,Griffin-Lite 会以亚秒级 mini-turn 持续更新自己对对话状态的判断。这意味着它不是以“一轮问答”为单位工作,而是以更接近人类交流的微小时间片段持续协作。
这听起来像技术细节,却直接决定了用户体验。
真正自然的交流,往往不是因为对方说了多么精彩的话,而是因为对方知道什么时候该回应,什么时候该等待。
04
PART
四、它生成的不是“会动的脸”,而是一整个正在发生的场景
WHY NOW
过去很多数字人产品的核心目标是“让口型对上声音”。
Griffin-Lite 的目标更进一步:它要让整个画面像一个人在真实环境中进行互动。
Tavus 表示,系统会基于参考图、实时生成的音频和持续更新的交互控制信号,逐帧生成完整视频。变化的不只是嘴巴,还包括眼神方向、面部肌肉、肩部姿态、手势动作、椅子的位置、背景光影,甚至人物与环境之间的协调关系。
这很重要,因为人类判断真实性时,通常不会只盯着嘴型。
一个人的眼神是否自然?手势是否和语言匹配?身体是否会随着情绪变化?背景光线是否稳定?对方是否在真正关注你而不是永远看着摄像头?这些细节会在无意识中影响我们对“真人感”的判断。
在 Tavus 展示的案例里,Griffin-Lite 可以参与 “Simon Says” 游戏。用户给出动作指令时,它不仅需要听懂语言,还要判断指令里是否包含特定条件,再决定是否做出动作;它也可以在故事接龙里自然接话、等待、追问或表达笑意;在魔方演示中,它会看着用户操作,在对方停下来思考时暂时不说话;在焊接指导场景中,它根据任务进度和对话节奏给出提示。
这些不代表 AI 已经理解了人类的情感或拥有意识。
但它表明,AI 已经开始具备一种更强的“现场感”:不只是对语言作答,而是对一个不断变化的视听场景作出反应。
05
PART
五、为什么 0.43 秒的延迟,可能决定它像不像人?
IMPACT
在实时交流中,延迟比很多人想象得更重要。
如果你说完一句话,对方 2 秒后才开始反应,即使内容再准确,你也会感觉对方没有在场。
如果你刚笑了一下,对方过一秒半才跟着笑,整个互动就会显得像剪辑后的回放。
Tavus 披露,Griffin-Lite 可以在 720p 分辨率下,以每 320 毫秒一个视频块流式生成内容;在 H100 环境中,从音频输入变化到相关视频输出出现的平均延迟约为 0.43 秒。
这不是说每一位用户、每种网络、每个部署版本都必然达到相同体验。
但从人机交互角度看,低延迟是“拟人化”真正的基础设施。
因为人类社交信号本来就发生在很短的时间尺度中:停顿、点头、眼神移动、短促笑声、插话、犹豫、让出话语权。
如果 AI 无法跟上这些微小变化,它就永远只能做一个“会回答的问题系统”。
而一旦它能把延迟压缩到足够低,它才有机会让用户感觉:对面真的在和我一起经历这段对话。
06
PART
六、NVIDIA VideoFDB 第一,离“真人级”到底还有多远?
PLAYBOOK
除了 48% 的真人误判测试,Tavus 还公布了 Griffin-Lite 在 NVIDIA VideoFDB 基准上的成绩。
VideoFDB 是一个用于评估全双工视频对话系统的基准,关注的不只是回答内容,也包括模型能否理解人的语言、表情、动作、目光和接话时机,以及它能否生成自然的多模态回应。
Tavus 给出的结果是:Griffin-Lite 在生成赛道得分 3.83/5,人类参考为 3.92/5,分差只有 0.09;在感知赛道得分 3.73/5,人类参考为 4.20/5。它还报告称,在所列对比模型中,Griffin-Lite 的生成与感知得分均排名第一。
这当然是一项很强的成绩。
但越是这种分数,越要避免过度解读。
基准接近人类参考,不等于模型在所有现实交流中都“等同于人”。短时互动、特定数据集、特定任务和特定评分规则,都与真实世界中数小时沟通、关系建立、复杂冲突、隐私边界和责任承担不同。
更准确的结论是:
在实时全双工视频互动这一尚处早期的赛道里,Griffin-Lite 已经展现出接近人类表现的局部能力,尤其是在互动节奏、视听感知与视频表达方面。
它不是人。
但它开始学会人类如何彼此回应。
07
PART
七、真正的颠覆,不在“数字人更逼真”,而在 AI 开始参与真实互动
INSIGHT
这项技术最直接的变化,是把 AI 从输入框里带出来。
过去我们与 AI 的关系通常是:输入一个问题,得到一段答案。
未来,用户可能不再需要写复杂提示词,也不必在每次发言前整理好完整需求。
你可以边说、边操作、边展示物品;你可以说到一半改变想法;你可以用表情表达困惑;你也可以随时插话,要求它换一种解释方式。
这会让很多场景发生变化。
教育不再只是“AI 给你讲答案”,而可能变成一个能观察你卡在哪里、决定何时提示、何时让你继续思考的练习伙伴。销售和客服培训不再只是背话术,而可以在一个会质疑、会追问、会打断、会改变情绪的虚拟客户面前反复演练。企业内部培训、面试模拟、演讲排练、语言练习、产品演示和远程协作,都可能因此获得更自然的交互入口。
但这类技术最有价值的场景,也恰恰是风险最高的场景。
例如医疗和照护。一个能看懂用户表情、用自然语气回应、保持耐心互动的系统,可能帮助人们完成健康教育、康复提醒或基础陪伴。但它不能因此被误认为具备医生、心理咨询师、护理人员或家属的责任与判断力。
自然表达不是专业资格。
“看起来很关心你”也不等于它真的理解你。
08
PART
八、当“开视频确认”不再可靠,安全规则必须重写
SUMMARY
过去,人们判断一段内容真假,常用一个朴素方法:打个电话,最好开视频。
文字可以伪造,图片可以合成,录音可以剪辑,但实时视频通话总该可靠吧?
Griffin-Lite 所代表的技术方向,正在改变这个默认假设。
当 AI 可以实时生成外貌、声音、视线、表情、手势和即时回应时,未来的风险不再只是“骗子发来一段假视频”。
更危险的可能是:有人顶着亲友、同事或领导的脸和声音,与你进行一场可以处理追问、理解反应、调整策略的实时视频通话。
这会让社会工程诈骗、身份冒充、商业欺诈和情感操控进入更复杂的阶段。
因此,越像人的系统,越应当被严格要求做到身份透明。
Tavus 表示,Griffin-Lite 目前仍然是面向部分早期测试者的研究预览,后续会在更广泛发布前继续推进安全、限制与责任方面的工作。
但从行业角度看,至少有几条底线应该尽快形成共识:
AI 视频通话必须在开始时清晰披露“你正在与 AI 互动”
使用真人肖像、声音或身份特征必须取得明确、可验证、可撤回的授权
平台应具备内容溯源、身份验证、异常行为识别和快速举报处置能力
视频、音频、面部信息、环境画面和屏幕内容应实行最小化收集、加密保存与删除机制
对未成年人、孤独老人和心理脆弱用户,应避免设计诱导依赖、制造情感幻觉的交互机制
医疗、金融、法律、招聘、执法等高风险场景中,必须保留人类审核、明确责任人和可追溯记录
一个越擅长让人误以为它是真人的系统,就越有责任在用户面前坦诚:我不是人。
///
LAST
写在最后
FINAL THOUGHTS
Tavus Griffin-Lite 的突破,不是“AI 终于有了一张更逼真的脸”。
它真正推进的是一种新的交互形态:
文本问答→语音对话→实时视听协作
未来 AI 的竞争,可能不再只是谁的参数更大、推理更强、文本跑分更高。
还将取决于谁能更自然地感知人类,谁能在恰当的时间回应,谁能在复杂互动中保持低延迟,谁又能在逼真之外把安全、透明和责任做得足够扎实。
技术的终点,不应是造出最擅长冒充真人的机器。
真正值得期待的,是一种既能让沟通更自然、协作更高效,又能让每个人始终清楚知道自己正在和 AI 打交道的技术。
参考资料 · REFERENCES
Tavus Griffin-Lite 官方研究预览:视频图灵测试方法、技术架构、演示案例、实时延迟与 NVIDIA VideoFDB 评测结果
https://www.tavus.io/griffin
硅基社|探索 AI 前沿,记录智能进化
聚焦 LLM、大模型、AI Agent、具身智能与 AI+生物医药。
追踪前沿技术,拆解关键进展,观察产业落地。
不只报道 AI,更试图理解 AI 将如何改变世界。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING