乐于分享
好东西不私藏

AI当厨神助手?醒醒吧,它连“盐放多了”都发现不了!高通最新研究Streaming Interventions打脸视频大模型

AI当厨神助手?醒醒吧,它连“盐放多了”都发现不了!高通最新研究Streaming Interventions打脸视频大模型

⭐ 重点推荐:分享下我整理的 awesome-egocentric-vision 仓库,整合 egocentric vision 领域论文、数据集与落地方案,分中英文档长期更新,做具身智能、交互、数采、穿戴式设备相关研究的小伙伴可以食用,欢迎关注和内容共建~https://github.com/sun254667/awesome-egocentric-vision

关键词:#视频大模型 #AI实时交互 #egocentric

你有没有过这样的经历?

跟着视频教程学做菜,手忙脚乱地把盐放多了、火开大了,回头一看视频里的人早就进行到下一步了。这时候你多希望有个AI助手能实时提醒你:“等等!盐放多了!”或者“火小一点,要糊了!”

现在的大模型,能看懂视频、能回答问题,但就是做不到这一点。

来自高通AI研究院的研究团队最近发布了一项研究,专门针对这个问题。他们构建了一个名为 EGO-MC-BENCH 的基准测试,用来评估视频大模型在实时任务指导中的表现。结果让人清醒:即使是当前最顶尖的视频大模型,在“主动发现并纠正错误”这件事上,表现也惨不忍睹。

更扎心的是,在 EGO-MC-BENCH 上,很多模型的错误干预F1分数(Mistake F1)只有0.18(满分1.0),指令完成准确率(IC-Acc)最高也只有45.5%,连一半都不到。

为了让模型学会这项能力,团队还构建了一个名为 EGO-COMIST 的反事实合成数据集,规模达到25087个指令-反馈对。用这个数据集微调后,一个仅有20亿参数的小模型,在错误干预的F1分数上直接追平了闭源的 Gemini-3-Flash。

  • 论文链接:https://arxiv.org/abs/2606.09547v2
  • 代码仓库:暂无

关键概念

1. 什么是“流式干预”(Streaming Intervention)?

就是在视频流持续输入的过程中,模型能够主动发现错误并及时给出纠正反馈。注意两个关键词:

  • 主动——不是等用户问“我做得对吗”,而是模型自己判断该不该说话
  • 实时——不是事后复盘,而是在错误发生的当下(或即将发生时)立刻干预

2. 什么是“回合制”(Turn-based)vs“流式”(Streaming)?

绝大多数视频大模型是回合制的,你给它一段视频,它给你一个回答。就像你给老师看一篇作文,老师看完给你批个分数。但流式交互是一边看一边说,就像老师站在你身后看你写作文,写错一个字马上指出来。后者对模型的要求高得多:它要持续跟踪、实时判断、主动开口。

3. 什么是“反事实数据”(Counterfactual Data)?

这是EGO-COMIST的核心技术。简单说就是:在真实的烹饪视频上“做手脚”,比如视频里有人正确加了4勺面粉,我们把它改成“只加了3勺”,然后生成一条对应的纠正指令:“你需要加4勺面粉,而不是3勺”。这种数据在真实世界中是不存在的(因为没人会故意拍自己犯错),但通过这种方式可以大规模合成。

4. 为什么“主动干预”这么难?

因为它要求模型同时具备三种能力:

  • 跟踪任务进度,知道用户现在做到哪一步了
  • 检测错误,判断当前操作是否符合指令
  • 把握干预时机,太早说可能打断用户,太晚说错误已经无法挽回

EGO-MC-BENCH:一个专门“抓AI毛病”的基准测试

团队设计这个基准测试,模拟的是真实世界中AI助手通过头戴摄像头指导用户做菜的场景

1. 数据怎么来的?

不是从网上扒视频,而是真人实拍。研究团队搭建了一个专门的厨房录制环境:指导者站在参与者身后(不在头戴摄像头的视野内),通过语音实时给出指令和反馈。参与者事先不知道食谱,完全依赖指导者的指令完成任务。

整个过程共录制了约10小时的视频,涉及7位参与者、40个录制会话、559个食谱步骤,以及395条与错误相关的反馈消息(总反馈954条)。

2. 两种干预时机

EGO-MC-BENCH特别设计了两种反馈类型:

  • 预判性反馈(Anticipatory Feedback,49.2%):在错误即将发生时警告用户。比如用户正准备往锅里倒第四勺油,但食谱只需要三勺,AI在用户动手之前就该叫停。
  • 事后反馈(Post-Error Feedback,50.8%):在错误已经发生后纠正。比如用户已经把洋葱炒糊了,AI提醒“火太大了,下次调低一点”。

这种设计非常贴近真实场景,有些错误可以提前阻止,有些只能事后补救。

3. 错误类型分布

团队还分析了EGO-MC-BENCH中的错误类型,主要来自五个类别:

  • 测量错误:用量不对(比如4勺变3勺)
  • 准备错误:准备工作出错(比如没削皮就直接切)
  • 技术错误:操作手法不对(比如该用折叠法却用了搅拌)
  • 温度错误:火候不对(比如该用中火却用了大火)
  • 时间错误:时长不对(比如煮了5分钟但应该煮10分钟)

EGO-COMIST:用“反事实”技术批量制造训练数据

EGO-MC-BENCH虽然质量高,但10小时的数据对于训练模型来说远远不够。而且真实世界中很少有人会在摄像头前故意犯错,所以你上哪找那么多“错误示范”视频?

团队想出了一个巧妙的办法:在现有烹饪视频上“做手脚”

第一步:生成反事实指令和反馈

以一个真实食谱步骤为例:“取一个大平底锅,加入4汤匙橄榄油。”

团队用大语言模型(Gemini-2.5-Pro)做三件事:

  • 提取关键属性:从原指令中提取“4汤匙”和“橄榄油”
  • 生成反事实属性:生成一个“合理但错误”的替代值——“3汤匙”
  • 生成反事实指令和反馈
    • 反事实指令:“取一个大平底锅,加入3汤匙橄榄油。”
    • 反馈:“不要加4汤匙橄榄油,你只需要加3汤匙。”

团队为五种错误类型(测量、准备、技术、温度、时间)都设计了类似的生成流程。

第二步:推断反馈时间戳

光有“说什么”还不够,还得知道 “什么时候说”

团队先用视频大模型(Qwen3-VL-32B-Instruct)生成逐帧的动作描述(10秒窗口,5秒步长),然后让Gemini-2.5-Pro根据这些描述推断 “在哪个时刻用户的行为已经明显偏离了正确路径”

比如在上面的例子中,当用户已经加了3勺油、正准备加第4勺时——这个时刻就是“干预窗口”。

数据规模与质量

EGO-COMIST从三个数据集(CaptainCook4D、Ego4D、Ego-Exo4D)中生成了25087个指令-反馈对。团队还做了人工评估:87.1% 的样本被判定为有效。在时间戳推断方面,约65% 的预测误差在±2.5秒以内,虽然不够完美,但作为训练信号已经足够有用。

实验结果

团队在EGO-MC-BENCH上测试了一系列最先进的视频大模型,包括开源模型(Qwen系列、VideoLLaMA3、InternVL3.5等)和闭源模型(Gemini系列)。

评测指标

  • IC-Acc(指令完成准确率):模型能否正确判断用户是否完成了当前步骤
  • Mistake Precision/Recall/F1:错误干预的精确率、召回率和F1分数
  • BERTScore / ROUGE-L:模型给出的反馈与人工反馈的语义相似度

回合制模型的表现

几个关键发现:

第一,Mistake F1普遍极低。 即使是表现最好的Gemini-3-Flash,F1也只有0.18(满分1.0)。很多模型的F1直接是0.00,完全检测不到错误。

第二,IC-Acc也不高。 最高的Qwen3.5-27B也只有45.5%,连一半都不到。这意味着模型连“用户做完这步了没有”都判断不准,更别提发现错误了。

第三,流式模型也不行。 论文还测试了专门为流式场景设计的Videollm-online和LiveCC,但它们生成的叙述不够及时、不够具体,无法用于有效的错误干预。

流式模型的改进

团队用EGO-COMIST对Qwen3.5-2B等小模型做了微调,结果提升非常明显:

一个20亿参数的开源小模型,在错误干预能力上追平了闭源的Gemini-3-Flash。

“完整食谱”设置更惨

在“完整食谱”设置下(模型需要从头到尾跟踪整个烹饪过程),即使是Gemini-3-Flash的IC-Acc也只有10.6%,Mistake F1只有0.08。错误会随着步骤的推进不断累积,模型越往后越懵。

为什么这么难?

论文对Gemini-3-Flash的失败案例做了分析,发现三个典型问题:

问题一:抓不住重点。

在一个例子中,用户正在用量勺量橄榄油,Gemini-3-Flash的反馈却是:“请卷起袖子再开始做饭”,完全跑题了。在另一个例子中,用户明明已经在用量勺,模型却提醒“请使用量勺”,根本没看懂画面。

问题二:时机完全不对。

在一个例子中,用户只加了1勺橄榄油就把瓶子放回去了(正确应该加4勺),但Gemini-3-Flash的判断是:“用户已完成该步骤”,它根本没发现用户少加了3勺。

问题三:重复同样的反馈。

由于缺乏记忆机制,模型可能会在几分钟内反复给出同一条反馈,让用户体验极差。

核心瓶颈:训练数据缺失。

论文认为,根本原因在于现有的烹饪视频数据集缺乏“错误+适时干预”的配对数据。大多数数据集只记录了“正确完成步骤”的过程,没有“犯错-纠正”的闭环。而EGO-COMIST正是为了解决这个问题而生的。

写在最后

这篇论文最打动我的,不是它提出了多先进的模型,而是它精准地指出了一个被忽视的关键能力缺口

现在的视频大模型,评测都在比“能不能看懂视频内容”,但这和“能不能在实时场景中主动提供帮助”是两码事。一个能答对100道视频理解题的模型,可能连“盐放多了”这种基本的实时错误都发现不了。

问题不是模型不够大,而是任务定义错了。

论文用EGO-MC-BENCH证明了这一点:即使是Gemini-3-Flash这样的顶级闭源模型,在主动干预任务上的F1也只有0.18,几乎等于瞎蒙。

而解决方案也很有意思:不是造更大的模型,而是造更好的数据。EGO-COMIST用“反事实”技术,把大量普通烹饪视频变成了带有“错误-纠正”配对的训练数据。用这些数据微调一个20亿参数的小模型,就能在主动干预能力上追平千亿参数的闭源模型。智能不一定要靠“大”,有时候靠的是“对”的数据和“对”的任务定义。

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下您的想法!

—  —

相关阅读

AI的下一场硬仗是“Egocentric Vision”:第一人称视角正在重写具身智能的底层逻辑