
⭐ 重点推荐:分享下我整理的 awesome-egocentric-vision 仓库,整合 egocentric vision 领域论文、数据集与落地方案,分中英文档长期更新,做具身智能、交互、数采、穿戴式设备相关研究的小伙伴可以食用,欢迎关注和内容共建~https://github.com/sun254667/awesome-egocentric-vision
关键词:#视频大模型 #AI实时交互 #egocentric
你有没有过这样的经历?
跟着视频教程学做菜,手忙脚乱地把盐放多了、火开大了,回头一看视频里的人早就进行到下一步了。这时候你多希望有个AI助手能实时提醒你:“等等!盐放多了!”或者“火小一点,要糊了!”
现在的大模型,能看懂视频、能回答问题,但就是做不到这一点。
来自高通AI研究院的研究团队最近发布了一项研究,专门针对这个问题。他们构建了一个名为 EGO-MC-BENCH 的基准测试,用来评估视频大模型在实时任务指导中的表现。结果让人清醒:即使是当前最顶尖的视频大模型,在“主动发现并纠正错误”这件事上,表现也惨不忍睹。
更扎心的是,在 EGO-MC-BENCH 上,很多模型的错误干预F1分数(Mistake F1)只有0.18(满分1.0),指令完成准确率(IC-Acc)最高也只有45.5%,连一半都不到。
为了让模型学会这项能力,团队还构建了一个名为 EGO-COMIST 的反事实合成数据集,规模达到25087个指令-反馈对。用这个数据集微调后,一个仅有20亿参数的小模型,在错误干预的F1分数上直接追平了闭源的 Gemini-3-Flash。

论文链接:https://arxiv.org/abs/2606.09547v2 代码仓库:暂无
关键概念
1. 什么是“流式干预”(Streaming Intervention)?
就是在视频流持续输入的过程中,模型能够主动发现错误并及时给出纠正反馈。注意两个关键词:
主动——不是等用户问“我做得对吗”,而是模型自己判断该不该说话 实时——不是事后复盘,而是在错误发生的当下(或即将发生时)立刻干预
2. 什么是“回合制”(Turn-based)vs“流式”(Streaming)?
绝大多数视频大模型是回合制的,你给它一段视频,它给你一个回答。就像你给老师看一篇作文,老师看完给你批个分数。但流式交互是一边看一边说,就像老师站在你身后看你写作文,写错一个字马上指出来。后者对模型的要求高得多:它要持续跟踪、实时判断、主动开口。
3. 什么是“反事实数据”(Counterfactual Data)?
这是EGO-COMIST的核心技术。简单说就是:在真实的烹饪视频上“做手脚”,比如视频里有人正确加了4勺面粉,我们把它改成“只加了3勺”,然后生成一条对应的纠正指令:“你需要加4勺面粉,而不是3勺”。这种数据在真实世界中是不存在的(因为没人会故意拍自己犯错),但通过这种方式可以大规模合成。
4. 为什么“主动干预”这么难?
因为它要求模型同时具备三种能力:
跟踪任务进度,知道用户现在做到哪一步了 检测错误,判断当前操作是否符合指令 把握干预时机,太早说可能打断用户,太晚说错误已经无法挽回
EGO-MC-BENCH:一个专门“抓AI毛病”的基准测试
团队设计这个基准测试,模拟的是真实世界中AI助手通过头戴摄像头指导用户做菜的场景。

1. 数据怎么来的?
不是从网上扒视频,而是真人实拍。研究团队搭建了一个专门的厨房录制环境:指导者站在参与者身后(不在头戴摄像头的视野内),通过语音实时给出指令和反馈。参与者事先不知道食谱,完全依赖指导者的指令完成任务。
整个过程共录制了约10小时的视频,涉及7位参与者、40个录制会话、559个食谱步骤,以及395条与错误相关的反馈消息(总反馈954条)。
2. 两种干预时机
EGO-MC-BENCH特别设计了两种反馈类型:
预判性反馈(Anticipatory Feedback,49.2%):在错误即将发生时警告用户。比如用户正准备往锅里倒第四勺油,但食谱只需要三勺,AI在用户动手之前就该叫停。 事后反馈(Post-Error Feedback,50.8%):在错误已经发生后纠正。比如用户已经把洋葱炒糊了,AI提醒“火太大了,下次调低一点”。
这种设计非常贴近真实场景,有些错误可以提前阻止,有些只能事后补救。
3. 错误类型分布
团队还分析了EGO-MC-BENCH中的错误类型,主要来自五个类别:
测量错误:用量不对(比如4勺变3勺) 准备错误:准备工作出错(比如没削皮就直接切) 技术错误:操作手法不对(比如该用折叠法却用了搅拌) 温度错误:火候不对(比如该用中火却用了大火) 时间错误:时长不对(比如煮了5分钟但应该煮10分钟)
EGO-COMIST:用“反事实”技术批量制造训练数据
EGO-MC-BENCH虽然质量高,但10小时的数据对于训练模型来说远远不够。而且真实世界中很少有人会在摄像头前故意犯错,所以你上哪找那么多“错误示范”视频?

团队想出了一个巧妙的办法:在现有烹饪视频上“做手脚”。
第一步:生成反事实指令和反馈
以一个真实食谱步骤为例:“取一个大平底锅,加入4汤匙橄榄油。”
团队用大语言模型(Gemini-2.5-Pro)做三件事:
提取关键属性:从原指令中提取“4汤匙”和“橄榄油” 生成反事实属性:生成一个“合理但错误”的替代值——“3汤匙” 生成反事实指令和反馈: 反事实指令:“取一个大平底锅,加入3汤匙橄榄油。” 反馈:“不要加4汤匙橄榄油,你只需要加3汤匙。”
团队为五种错误类型(测量、准备、技术、温度、时间)都设计了类似的生成流程。
第二步:推断反馈时间戳
光有“说什么”还不够,还得知道 “什么时候说”。
团队先用视频大模型(Qwen3-VL-32B-Instruct)生成逐帧的动作描述(10秒窗口,5秒步长),然后让Gemini-2.5-Pro根据这些描述推断 “在哪个时刻用户的行为已经明显偏离了正确路径”。
比如在上面的例子中,当用户已经加了3勺油、正准备加第4勺时——这个时刻就是“干预窗口”。
数据规模与质量
EGO-COMIST从三个数据集(CaptainCook4D、Ego4D、Ego-Exo4D)中生成了25087个指令-反馈对。团队还做了人工评估:87.1% 的样本被判定为有效。在时间戳推断方面,约65% 的预测误差在±2.5秒以内,虽然不够完美,但作为训练信号已经足够有用。
实验结果
团队在EGO-MC-BENCH上测试了一系列最先进的视频大模型,包括开源模型(Qwen系列、VideoLLaMA3、InternVL3.5等)和闭源模型(Gemini系列)。
评测指标:
IC-Acc(指令完成准确率):模型能否正确判断用户是否完成了当前步骤 Mistake Precision/Recall/F1:错误干预的精确率、召回率和F1分数 BERTScore / ROUGE-L:模型给出的反馈与人工反馈的语义相似度
回合制模型的表现:

几个关键发现:
第一,Mistake F1普遍极低。 即使是表现最好的Gemini-3-Flash,F1也只有0.18(满分1.0)。很多模型的F1直接是0.00,完全检测不到错误。
第二,IC-Acc也不高。 最高的Qwen3.5-27B也只有45.5%,连一半都不到。这意味着模型连“用户做完这步了没有”都判断不准,更别提发现错误了。
第三,流式模型也不行。 论文还测试了专门为流式场景设计的Videollm-online和LiveCC,但它们生成的叙述不够及时、不够具体,无法用于有效的错误干预。
流式模型的改进:
团队用EGO-COMIST对Qwen3.5-2B等小模型做了微调,结果提升非常明显:

一个20亿参数的开源小模型,在错误干预能力上追平了闭源的Gemini-3-Flash。
“完整食谱”设置更惨:
在“完整食谱”设置下(模型需要从头到尾跟踪整个烹饪过程),即使是Gemini-3-Flash的IC-Acc也只有10.6%,Mistake F1只有0.08。错误会随着步骤的推进不断累积,模型越往后越懵。
为什么这么难?
论文对Gemini-3-Flash的失败案例做了分析,发现三个典型问题:
问题一:抓不住重点。
在一个例子中,用户正在用量勺量橄榄油,Gemini-3-Flash的反馈却是:“请卷起袖子再开始做饭”,完全跑题了。在另一个例子中,用户明明已经在用量勺,模型却提醒“请使用量勺”,根本没看懂画面。
问题二:时机完全不对。
在一个例子中,用户只加了1勺橄榄油就把瓶子放回去了(正确应该加4勺),但Gemini-3-Flash的判断是:“用户已完成该步骤”,它根本没发现用户少加了3勺。
问题三:重复同样的反馈。
由于缺乏记忆机制,模型可能会在几分钟内反复给出同一条反馈,让用户体验极差。
核心瓶颈:训练数据缺失。
论文认为,根本原因在于现有的烹饪视频数据集缺乏“错误+适时干预”的配对数据。大多数数据集只记录了“正确完成步骤”的过程,没有“犯错-纠正”的闭环。而EGO-COMIST正是为了解决这个问题而生的。
写在最后
这篇论文最打动我的,不是它提出了多先进的模型,而是它精准地指出了一个被忽视的关键能力缺口。
现在的视频大模型,评测都在比“能不能看懂视频内容”,但这和“能不能在实时场景中主动提供帮助”是两码事。一个能答对100道视频理解题的模型,可能连“盐放多了”这种基本的实时错误都发现不了。
问题不是模型不够大,而是任务定义错了。
论文用EGO-MC-BENCH证明了这一点:即使是Gemini-3-Flash这样的顶级闭源模型,在主动干预任务上的F1也只有0.18,几乎等于瞎蒙。
而解决方案也很有意思:不是造更大的模型,而是造更好的数据。EGO-COMIST用“反事实”技术,把大量普通烹饪视频变成了带有“错误-纠正”配对的训练数据。用这些数据微调一个20亿参数的小模型,就能在主动干预能力上追平千亿参数的闭源模型。智能不一定要靠“大”,有时候靠的是“对”的数据和“对”的任务定义。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下您的想法!
— 完 —
相关阅读
夜雨聆风