ARTICLE · 1124092
AI视频聊天越来越像真人,测试究竟测到了什么?
现·PRISM
视频通话里的停顿很微妙。对方还没说完就接话,会显得冒失;每次都等一句话完全结束,又像在轮流播放录音。面部表情、视线和语气,常常比一句明确的“轮到你了”更早给出信号。
10月1日,Tavus介绍了Griffin,希望把这些信号放进连续的音视频互动。目前它仍是受邀研究预览,尚未向客户开放。
一分钟里,有26个人把它当成了人
厂商公布的一分钟实验中,54名参与者里有26人判断对面是真人。但实验还带着一个重要背景:参与者事先被告知,将与另一位参与者匹配。这个设定、样本规模和通话长度,都影响结果的含义。
它展示了短时间互动的拟人潜力,还不足以说明长对话里能否保持一致,更不能直接回答能否做好客服、教学或复杂协作。读到“通过图灵测试”时,把测试条件放回去,比争论这个标签更有帮助。
看起来流畅,也要看怎么接话
Griffin的技术说明将持续会话控制与音视频生成衔接起来,让系统在交谈中继续观察、听取并调整响应,而非只等到输入彻底结束。
截至10月4日读取的NVIDIA VideoFDB官方榜,Griffin Lite的生成得分为3.83分,人类对照3.92分;榜单所列中位延迟约1892毫秒,人类对照900毫秒。评分接近,并不表示时延也接近;量表得分也不能折算成人类能力的百分比。
真正落地时,还缺一张成绩单
如果把这种界面放进预约、培训或服务场景,我们还会问:信息有没有听错,任务是否完成,遇到不确定问题会不会停下,用户是否清楚正在与AI交谈。这些是本文提出的应用评价问题,并非上述实验已经证明的能力。
让AI更像人,可以降低交流门槛;也可能让用户更快相信它。这两种影响都需要评估。接下来值得追踪的,不只是多像一个真人,而是自然的互动究竟帮助用户办成了什么事。
资料来源
[1] Tavus · Griffin 技术说明
[2] NVIDIA · VideoFDB 官方榜