夜雨聆风学习资料网

ARTICLE · 1124092

AI视频聊天越来越像真人,测试究竟测到了什么?

AI视频聊天越来越像真人,测试究竟测到了什么?

现·PRISM

视频通话里的停顿很微妙。对方还没说完就接话,会显得冒失;每次都等一句话完全结束,又像在轮流播放录音。面部表情、视线和语气,常常比一句明确的“轮到你了”更早给出信号。

10月1日,Tavus介绍了Griffin,希望把这些信号放进连续的音视频互动。目前它仍是受邀研究预览,尚未向客户开放。

一分钟里,有26个人把它当成了人

厂商公布的一分钟实验中,54名参与者里有26人判断对面是真人。但实验还带着一个重要背景:参与者事先被告知,将与另一位参与者匹配。这个设定、样本规模和通话长度,都影响结果的含义。

它展示了短时间互动的拟人潜力,还不足以说明长对话里能否保持一致,更不能直接回答能否做好客服、教学或复杂协作。读到“通过图灵测试”时,把测试条件放回去,比争论这个标签更有帮助。

看起来流畅,也要看怎么接话

Griffin的技术说明将持续会话控制与音视频生成衔接起来,让系统在交谈中继续观察、听取并调整响应,而非只等到输入彻底结束。

截至10月4日读取的NVIDIA VideoFDB官方榜,Griffin Lite的生成得分为3.83分,人类对照3.92分;榜单所列中位延迟约1892毫秒,人类对照900毫秒。评分接近,并不表示时延也接近;量表得分也不能折算成人类能力的百分比。

概念示意 · AI生成图像。机制与评价维度示意。辨识实验和互动基准不能代替具体任务测试。

真正落地时,还缺一张成绩单

如果把这种界面放进预约、培训或服务场景,我们还会问:信息有没有听错,任务是否完成,遇到不确定问题会不会停下,用户是否清楚正在与AI交谈。这些是本文提出的应用评价问题,并非上述实验已经证明的能力。

让AI更像人,可以降低交流门槛;也可能让用户更快相信它。这两种影响都需要评估。接下来值得追踪的,不只是多像一个真人,而是自然的互动究竟帮助用户办成了什么事。

资料来源

[1] Tavus · Griffin 技术说明

[2] NVIDIA · VideoFDB 官方榜

相关学习资料