夜雨聆风学习资料网

ARTICLE · 1121911

AI击穿视频图灵测试,一半人没认出对面是AI

AI击穿视频图灵测试,一半人没认出对面是AI

视频通话,一直是人类验证“对面是不是真人”的最后一道保险。

文字可以代打,声音可以合成,但“开个视频、聊两句、看看表情”,总让人觉得多了一层确定。10月1日,这道保险被一个叫 Griffin 的模型拆了。

一场让一半人认错人的实验

旧金山 AI 团队 Tavus 发布 Griffin 当天,公布了一组数字:

54 名来自美国和欧洲的参与者,被安排与“另一位参与者”视频通话 1 分钟,话题是聊聊新的一年有什么期待。没有人被告知,屏幕那头可能是 AI。

通话结束,26 人认为对方是真人,占比 48%。对照组更说明问题:上一代系统在同一实验流程下,41 人里只有 1 人上当,即 2.4%。

从 2.4% 到 48%,同一套测试方法,20 倍的跃迁。

Tavus 据此宣布:这是首个通过实时“视频图灵测试”的模型,并把它归入一个全新类别 HIM(Human Interaction Model,人类交互模型)。

细节同样耐人寻味。判断对方是真人的受试者,平均确信度 79%;识破的,平均确信度 81%。而 Tavus 自己披露:那些起疑的人,大多在前 20 秒内就察觉了。

它凭什么骗过你:全双工与“接话”

和 AI 聊天最容易出戏的瞬间,往往不是答案离谱,而是它太不会“接话”。

你停下来组织语言,它抢着回答;你讲一件难过的事,屏幕上的脸还挂着笑;你打断它,它仍在按原节奏说。答案也许没错,交流却始终别扭。

Griffin 要解决的,正是这些语言之外的细节。它采用全双工架构:一边输出语音和画面,一边持续接收并处理你的声音与图像,以小于一秒的间隔重新评估交流状态。

它能在你说话时点头、说“嗯哼”,被插话时立刻停住,而不是固执地讲完台词。更硬核的是画面:从一张参考照片出发,实时生成整个场景,包括表情、手势、椅子的移动和背景光影。

视频按每段 320 毫秒的节奏实时生成 720p、25 帧;声音到达画面平均延迟 0.43 秒,约为同类系统的一半。

NVIDIA 的 VideoFDB 基准也侧面印证:Griffin-Lite 生成维度 3.83(人类参考 3.92),感知维度 3.73(人类参考 4.20),均明显领先 Gemini 2.5、OpenAI gpt-realtime 等主流系统[待核实:基准数字为腾讯新闻转述 Tavus 口径,未见 NVIDIA 独立发布]。

从 2.4% 到 48%,是 20 倍的跃迁;从 48% 到 100%,可能是诈骗的狂欢。

先别急着欢呼:48% 里有水分

把这 48% 直接等同于“图灵测试被攻破”,有点乐观。

受试者被告知将与“另一位参与者”通话。先入为主的“对面是人”,本身就是最强的心理暗示。换句话说,在有人设防的情况下,52% 的人还是识破了。

样本只有 54 人,按 48% 估算,统计误差约 ±13 个百分点;通话只有 1 分钟、话题是寒暄级,没有深度追问,也没有真人对照盲测。X 上的社区笔记同样标注:结果未经独立验证,未遵循标准测试协议。

更微妙的差距藏在数据里:生成 3.83 对 3.92,感知 3.73 对 4.20。“演得像”已经快追平人类,“看得懂你”还差 0.47 分。

演,永远比懂容易。

越像真人,越不敢给你用

最讽刺的悖论在这里:Griffin 之所以不公开,就是因为它太像真人。

Tavus 自己的商业化平台有 15 万开发者与企业客户,包括亚马逊、梅奥诊所、Salesforce,主要用于招聘面试、销售外呼、培训与客服。但 Griffin-Lite 目前只开放给少数受信任的测试者,完整版没有时间表。

公司的说法很直白:正是那些让模型像真人的交互特质,会让人误以为自己在和真人交谈。

“眼见为实”是大多数人最后一道心理防线,而这道防线即将失去意义。AI 换脸与拟声已被大量用于诈骗,视频级的“真脸”一旦放开,视频认证、转账核验、婚恋交友都可能成为重灾区。

欧盟《人工智能法案》第 50 条自今年 8 月 2 日起适用:与人类直接交互的 AI 系统,必须让用户知晓对方是 AI。Tavus 表示正在开发“强制身份披露”功能,并与 AI 安全组织合作,合规解决前不会开放。

“AI 已经聪明到极致,但我们仍要按机器的规则来交流。Griffin 是改变这一点的第一步。”——Tavus CEO Hassaan Raza

这句表白,反过来就是警告:当 AI 学会按人的规则来交流,人凭什么认得出它是 AI?

数字人信任三问:一个能套用到任何场景的框架

与其背“如何识破 AI”的教程,不如记住一个三问框架。任何数字人、AI 客服、直播带货、视频通话场景,都能套用:

第一问,它会不会主动亮明 AI 身份?主动披露的,至少还在规则内。

第二问,你能随时打断它,并观察到它即刻调整吗?真人的反应是连续变化的,预设脚本会在细处露馅。

第三问,通话之外,你能否在系统外核验这段交互?留痕,是信任的地基。

三问全占,才值得托付。缺一问,就要回到“对面到底是谁”的原始问题。

从语音合成到视频数字人:同一段历史的第二集

历史正在重演。GPT-4o 之后,单纯做语音合成的公司不得不重新思考位置。如今视频级的“真人”登场,靠“像人”吃饭的数字人厂商也要重新找坐标:技术门槛已经不是护城河,信任成本才是。

还有一个常被忽略的对照:上一代系统只有 2.4% 的骗过率,照样支撑起 15 万开发者的商用平台,说明行业过去对“像人”的标准低得惊人。Griffin 把这条线抬高了 20 倍,也把“骗过人”的风险抬高了 20 倍。能力与风险同源,这是数字人这门生意最别扭的地方。

对行业是机会。面试、外呼、一对一辅导、陪练,Griffin 规划的场景全是“人形界面”的刚需,数字人从客服替代走向亲密关系场景。

对个人是提醒。技术用最温和的方式宣布,“眼见为实”的时代结束了。

别急着收藏“识破 AI 教程”,先想清楚一个问题:下一个视频电话打进来,你凭什么相信对面是人?

相关学习资料