夜雨聆风学习资料网

ARTICLE · 1114327

刚刚,AI 首次通过视频图灵测试!48% 的人聊完 1 分钟,坚信对面是活人

刚刚,AI 首次通过视频图灵测试!48% 的人聊完 1 分钟,坚信对面是活人
TURING · 图灵测试2026.10

AI 还是冷冰冰的机器

AI 首次通过视频图灵测试

48% 的人坚信是活人

聊满 1 分钟就有近一半人相信对面是人——这场实验改变了什么

硅基社 · 观察

TURINGVIDEO

📦 9 Parts + Conclusion

👉 滑动

PART 01

一、从 2.4% 到 48%,AI 视频互动跨过了什么门槛?

PART 02

二、传统数字人为什么总有“机械感”?

PART 03

三、Griffin-Lite 的关键:它在每一秒都重新判断“现在该做什么”

PART 04

四、它生成的不是“会动的脸”,而是一整个正在发生的场景

PART 05

五、为什么 0.43 秒的延迟,可能决定它像不像人?

PART 06

六、NVIDIA VideoFDB 第一,离“真人级”到底还有多远?

PART 07

七、真正的颠覆,不在“数字人更逼真”,而在 AI 开始参与真实互动

PART 08

八、当“开视频确认”不再可靠,安全规则必须重写

PART ///

写在最后

FINAL THOUGHTS

引子 · LEAD

“我和对面那个人聊了整整 1 分钟,我敢发誓,他绝对是个真人。”

如果是在两年前,听到这句话,你可能只会觉得理所当然。但如果我告诉你,屏幕另一端其实不是一个人,而是一套实时生成语音、表情、动作和视频画面的 AI 系统呢?

10 月 1 日,实时视频 AI 公司 Tavus 发布了 Griffin-Lite,并将它定义为新一类 Human Interaction Model,即“人类互动模型”。与此同时,Tavus 抛出了一组足够震撼的数据:在一项 54 人参与、时长 1 分钟的实时视频通话测试中,有 26 人、约 48% 判断自己面对的是真人;而这些判断对方是真人的参与者,平均信心度达到 79%。

这不是一张静态人脸在对着口型播放视频,也不是提前录好台词的数字人。它能在你说话时点头、在你停顿时等待、在适当的时候发出简短回应;它会看你的表情、接住你的手势、调整自己的视线和姿态,甚至能在互动游戏里跟上你的节奏。

AI 正在从“你说完,它才答”的工具,变成一个能实时参与对话的对象。

但也正因如此,一个更严肃的问题浮现出来:当屏幕另一端的 AI 已经足够像人,人类还能否轻易相信“开个视频确认一下”?

01

PART

一、从 2.4% 到 48%,AI 视频互动跨过了什么门槛?

OVERVIEW

先说清楚一点:Tavus 这项测试并不等于一场大规模、独立、同行评审的科学裁决。样本量只有 54 人,通话时长只有 1 分钟,话题也是相对轻松的破冰问题——“你今年最期待什么?”

参与者通过独立招募平台进入视频通话,被告知将与另一位参与者交流。实际上,对方是一套由 Griffin-Lite 实时驱动的 AI 人格体。通话结束后,参与者才被问到:你刚才面对的是人,还是 AI?

最终,26 人判断对方是真人,占比 48%。认为是真人的人,平均有 79% 的信心;判断对方是 AI 的人,平均信心度则是 81%。也就是说,无论看穿还是没看穿,参与者都相当确定自己的判断。

这件事的关键,不只在于 48% 这个数字,而在于它和上一代系统的落差。

Tavus 过去采用的,是很多 AI 视频产品都在使用的组合式路线:语音识别把人说的话转成文字,语言模型根据文字生成答案,语音合成模块把答案变成声音,数字人引擎再让脸部、嘴型和表情动起来。

这种架构已经可以完成视频对话,但在 Tavus 此前的测试里,41 名参与者中只有 1 人把 AI 当成真人,比例只有 2.4%。

从 2.4% 到 48%,背后意味着的不是“画面分辨率提高了一点”,而是 AI 开始补上人类交流中最难模拟的一部分:互动节奏。

人和人沟通时,并不是一个人完整说完,另一个人再完整回答。你会在对方讲到一半时点头,听到重点时发出“嗯”“对”,感觉对方还在组织语言时保持安静;当对方突然插话,你会调整自己的表达;当对方皱眉、笑起来、展示一个东西时,你会自然把这些信号带进对话。

过去的数字人往往像会说话的视频播放器。

Griffin-Lite 想做的,是一个能持续参与现场的人。

02

PART

二、传统数字人为什么总有“机械感”?

DEEP DIVE

很多人对数字人、AI 客服或虚拟主播的印象是:第一眼挺惊艳,聊两句就觉得不对。

问题通常不在于它说得对不对,而在于它说得不像一个正在和你交流的人。

传统系统的对话流程大致是:

听到语音→语音转文字→语言模型生成答案→文字转语音→驱动数字形象

这是一条接力式链路。每一段都需要时间,每一段也都可能丢掉信息。

当语音被转换成文字时,你的犹豫、停顿、语气、笑声、叹气和情绪变化,可能被压缩掉;模型拿到文字后,往往只关心“该回答什么”,却不一定知道“现在该不该回答”;等它生成答案、合成语音、驱动人脸后,对话中已经出现了让人不舒服的空白。

更重要的是,大多数系统是半双工的。

你讲话时,它安静地等;它讲话时,你也只能等。你们像在用对讲机,而不是坐在同一个房间聊天。

人类对话却是全双工的。

你讲话时,我仍然在听、在点头、在表达“我跟得上”;我讲话时,你可以突然提出补充,我能停下来让你说;我们都在不断根据对方的语速、表情、视线和停顿调整下一秒的反应。

这种能力听上去不如“推理”酷,却是人类社会交流的底层操作系统。

一旦缺失,再聪明的 AI 也会显得像机器。

03

PART

三、Griffin-Lite 的关键:它在每一秒都重新判断“现在该做什么”

ANALYSIS

Tavus 把 Griffin-Lite 定义为 Human Interaction Model,意思不是让 AI 更会背知识,而是让 AI 更会处理人与人交流中那些不成文的规则。

它的架构可以理解为两套并行系统。

第一套被称为 Continuous Conversational Modeling,相当于持续运行的对话决策层。它会连续接收用户的音频和视频,不断判断当前互动处于什么状态:你是真的说完了吗?只是中途卡住了吗?你需要它点头确认,还是需要它保持安静?你是不是刚展示了一个物品?你的表情是在开心、困惑、怀疑,还是想让对方继续解释?

第二套是 Streaming Audio-Visual Generation,负责把这种判断快速转化成用户能看到和听到的结果:语气、音色、表情、目光、头部动作、身体姿态、手势,以及完整的视频画面。

它和传统数字人最大的不同在于,决策和表达不再是“等一切确定后再输出”的串行过程。

它一边看、一边听、一边生成。

你在说话时,它可以点头或发出简短确认;你打断它时,它能中止原有表达;你停下来思考时,它可以不急着填满沉默;你做了一个视觉动作,它能把这个动作纳入后续回应。

Tavus 称,Griffin-Lite 会以亚秒级 mini-turn 持续更新自己对对话状态的判断。这意味着它不是以“一轮问答”为单位工作,而是以更接近人类交流的微小时间片段持续协作。

这听起来像技术细节,却直接决定了用户体验。

真正自然的交流,往往不是因为对方说了多么精彩的话,而是因为对方知道什么时候该回应,什么时候该等待。

04

PART

四、它生成的不是“会动的脸”,而是一整个正在发生的场景

WHY NOW

过去很多数字人产品的核心目标是“让口型对上声音”。

Griffin-Lite 的目标更进一步:它要让整个画面像一个人在真实环境中进行互动。

Tavus 表示,系统会基于参考图、实时生成的音频和持续更新的交互控制信号,逐帧生成完整视频。变化的不只是嘴巴,还包括眼神方向、面部肌肉、肩部姿态、手势动作、椅子的位置、背景光影,甚至人物与环境之间的协调关系。

这很重要,因为人类判断真实性时,通常不会只盯着嘴型。

一个人的眼神是否自然?手势是否和语言匹配?身体是否会随着情绪变化?背景光线是否稳定?对方是否在真正关注你而不是永远看着摄像头?这些细节会在无意识中影响我们对“真人感”的判断。

在 Tavus 展示的案例里,Griffin-Lite 可以参与 “Simon Says” 游戏。用户给出动作指令时,它不仅需要听懂语言,还要判断指令里是否包含特定条件,再决定是否做出动作;它也可以在故事接龙里自然接话、等待、追问或表达笑意;在魔方演示中,它会看着用户操作,在对方停下来思考时暂时不说话;在焊接指导场景中,它根据任务进度和对话节奏给出提示。

这些不代表 AI 已经理解了人类的情感或拥有意识。

但它表明,AI 已经开始具备一种更强的“现场感”:不只是对语言作答,而是对一个不断变化的视听场景作出反应。

05

PART

五、为什么 0.43 秒的延迟,可能决定它像不像人?

IMPACT

在实时交流中,延迟比很多人想象得更重要。

如果你说完一句话,对方 2 秒后才开始反应,即使内容再准确,你也会感觉对方没有在场。

如果你刚笑了一下,对方过一秒半才跟着笑,整个互动就会显得像剪辑后的回放。

Tavus 披露,Griffin-Lite 可以在 720p 分辨率下,以每 320 毫秒一个视频块流式生成内容;在 H100 环境中,从音频输入变化到相关视频输出出现的平均延迟约为 0.43 秒。

这不是说每一位用户、每种网络、每个部署版本都必然达到相同体验。

但从人机交互角度看,低延迟是“拟人化”真正的基础设施。

因为人类社交信号本来就发生在很短的时间尺度中:停顿、点头、眼神移动、短促笑声、插话、犹豫、让出话语权。

如果 AI 无法跟上这些微小变化,它就永远只能做一个“会回答的问题系统”。

而一旦它能把延迟压缩到足够低,它才有机会让用户感觉:对面真的在和我一起经历这段对话。

06

PART

六、NVIDIA VideoFDB 第一,离“真人级”到底还有多远?

PLAYBOOK

除了 48% 的真人误判测试,Tavus 还公布了 Griffin-Lite 在 NVIDIA VideoFDB 基准上的成绩。

VideoFDB 是一个用于评估全双工视频对话系统的基准,关注的不只是回答内容,也包括模型能否理解人的语言、表情、动作、目光和接话时机,以及它能否生成自然的多模态回应。

Tavus 给出的结果是:Griffin-Lite 在生成赛道得分 3.83/5,人类参考为 3.92/5,分差只有 0.09;在感知赛道得分 3.73/5,人类参考为 4.20/5。它还报告称,在所列对比模型中,Griffin-Lite 的生成与感知得分均排名第一。

这当然是一项很强的成绩。

但越是这种分数,越要避免过度解读。

基准接近人类参考,不等于模型在所有现实交流中都“等同于人”。短时互动、特定数据集、特定任务和特定评分规则,都与真实世界中数小时沟通、关系建立、复杂冲突、隐私边界和责任承担不同。

更准确的结论是:

在实时全双工视频互动这一尚处早期的赛道里,Griffin-Lite 已经展现出接近人类表现的局部能力,尤其是在互动节奏、视听感知与视频表达方面。

它不是人。

但它开始学会人类如何彼此回应。

07

PART

七、真正的颠覆,不在“数字人更逼真”,而在 AI 开始参与真实互动

INSIGHT

这项技术最直接的变化,是把 AI 从输入框里带出来。

过去我们与 AI 的关系通常是:输入一个问题,得到一段答案。

未来,用户可能不再需要写复杂提示词,也不必在每次发言前整理好完整需求。

你可以边说、边操作、边展示物品;你可以说到一半改变想法;你可以用表情表达困惑;你也可以随时插话,要求它换一种解释方式。

这会让很多场景发生变化。

教育不再只是“AI 给你讲答案”,而可能变成一个能观察你卡在哪里、决定何时提示、何时让你继续思考的练习伙伴。销售和客服培训不再只是背话术,而可以在一个会质疑、会追问、会打断、会改变情绪的虚拟客户面前反复演练。企业内部培训、面试模拟、演讲排练、语言练习、产品演示和远程协作,都可能因此获得更自然的交互入口。

但这类技术最有价值的场景,也恰恰是风险最高的场景。

例如医疗和照护。一个能看懂用户表情、用自然语气回应、保持耐心互动的系统,可能帮助人们完成健康教育、康复提醒或基础陪伴。但它不能因此被误认为具备医生、心理咨询师、护理人员或家属的责任与判断力。

自然表达不是专业资格。

“看起来很关心你”也不等于它真的理解你。

08

PART

八、当“开视频确认”不再可靠,安全规则必须重写

SUMMARY

过去,人们判断一段内容真假,常用一个朴素方法:打个电话,最好开视频。

文字可以伪造,图片可以合成,录音可以剪辑,但实时视频通话总该可靠吧?

Griffin-Lite 所代表的技术方向,正在改变这个默认假设。

当 AI 可以实时生成外貌、声音、视线、表情、手势和即时回应时,未来的风险不再只是“骗子发来一段假视频”。

更危险的可能是:有人顶着亲友、同事或领导的脸和声音,与你进行一场可以处理追问、理解反应、调整策略的实时视频通话。

这会让社会工程诈骗、身份冒充、商业欺诈和情感操控进入更复杂的阶段。

因此,越像人的系统,越应当被严格要求做到身份透明。

Tavus 表示,Griffin-Lite 目前仍然是面向部分早期测试者的研究预览,后续会在更广泛发布前继续推进安全、限制与责任方面的工作。

但从行业角度看,至少有几条底线应该尽快形成共识:

AI 视频通话必须在开始时清晰披露“你正在与 AI 互动”

使用真人肖像、声音或身份特征必须取得明确、可验证、可撤回的授权

平台应具备内容溯源、身份验证、异常行为识别和快速举报处置能力

视频、音频、面部信息、环境画面和屏幕内容应实行最小化收集、加密保存与删除机制

对未成年人、孤独老人和心理脆弱用户,应避免设计诱导依赖、制造情感幻觉的交互机制

医疗、金融、法律、招聘、执法等高风险场景中,必须保留人类审核、明确责任人和可追溯记录

一个越擅长让人误以为它是真人的系统,就越有责任在用户面前坦诚:我不是人。

///

LAST

写在最后

FINAL THOUGHTS

Tavus Griffin-Lite 的突破,不是“AI 终于有了一张更逼真的脸”。

它真正推进的是一种新的交互形态:

文本问答→语音对话→实时视听协作

未来 AI 的竞争,可能不再只是谁的参数更大、推理更强、文本跑分更高。

还将取决于谁能更自然地感知人类,谁能在恰当的时间回应,谁能在复杂互动中保持低延迟,谁又能在逼真之外把安全、透明和责任做得足够扎实。

技术的终点,不应是造出最擅长冒充真人的机器。

真正值得期待的,是一种既能让沟通更自然、协作更高效,又能让每个人始终清楚知道自己正在和 AI 打交道的技术。

参考资料 · REFERENCES

1

Tavus Griffin-Lite 官方研究预览:视频图灵测试方法、技术架构、演示案例、实时延迟与 NVIDIA VideoFDB 评测结果

https://www.tavus.io/griffin

硅基社|探索 AI 前沿,记录智能进化

聚焦 LLM、大模型、AI Agent、具身智能与 AI+生物医药。

追踪前沿技术,拆解关键进展,观察产业落地。

不只报道 AI,更试图理解 AI 将如何改变世界。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞
在看
转发

THANKS FOR READING

相关学习资料