
现在的 AI 助手全是「你问它答」——你不开口,它就沉默。Vinci2 想让它学会另一件事:该开口时才开口。这不止是感知问题,更是判断问题:要不要为此刻打扰你,得翻出你几小时前、甚至几天前的第一视角记录来定。为此东京大学 + 大连理工 + Alaya Lab 立了个 3,000+ 条的主动服务评测 EgoServe,结果 GPT-5-mini、Qwen3-VL-Plus 这些闭源大模型在需要跨天记忆的服务(习惯提醒、把今天和昨天连起来)上几乎全灭;他们做的免训练记忆 Agent EgoMemo,用「多尺度摘要 + 知识图谱 + 视觉记忆」三件套,把整体 F1 推到 8.0,几乎是最好闭源基线(4.7)的两倍。
链接速览
EgoServe 评测数据 + EgoMemo 代码都开源了,可以直接上手。
- 🌐 项目页:https://sitonggong.github.io/EgoServe-page/ — EgoServe 基准介绍 + 数据下载入口
- 💻 代码:https://github.com/SitongGong/EgoMemo — EgoMemo 实现(记忆构建 + 检索增强推理)
先看结论
- 这篇论文做了什么:把「主动帮助」定义成一个决策任务——给定一段连续第一视角视频,Agent 要自己判断每个时刻「该不该插嘴」,该的话就生成一条服务响应。同时立了评测基准 EgoServe,并提出免训练的 Agent EgoMemo。
- 为什么重要:现有助手要么被动等提问,要么只会对预设事件触发回应,都不会「根据你的历史、习惯、当前状态」判断要不要打扰你。EgoServe 是第一个专门考这种「主动服务」的基准。
- 一句话结论:三范式(被动 → 半主动 → 主动)+ 3,000+ 条评测 + 免训练记忆 Agent;EgoMemo 在 EgoServe 上整体 F1 8.0(最好闭源基线 4.7),并在 EgoSchema / QAEgo4D 等 5 个既有基准上做到最好或持平。
背景与动机
想象一个真正的 AI 助手:它戴着你的眼镜看你做饭、组装家具、开会,并且不用你开口就适时提醒——「锅要糊了」「你上次把钥匙落在这了」「这几天你录视频录到太晚了」。这就是论文说的主动帮助(proactive assistance)。
但现阶段的助手只有两种模式,都有硬伤(图 1):
- 被动模式(Reactive):大多数 Video-LLM 都是这样,你问它才答。你不会问的隐患、你早就忘了的事,它永远不说。
- 半主动模式(Semi-proactive):你预先给个任务指令(比如「盯着我别把门忘关」),它监控视频流、检测到预设事件才回应。但它被初始指令框死,也看不到跨天历史,更没法判断「此刻到底值不值得打断你」。
论文的核心论点很直接:真正的主动帮助是一个上下文相关的决策问题——Agent 不仅要「看见」正在发生什么,还要把时间跨度拉长,综合你的历史、习惯、当前活动,决定要不要干预、什么时候干预。这跟「检测到事件就触发」是两码事:大部分时刻,正确答案是「保持沉默」。
难在哪?一是没有评测集——离线视频 QA 考的是「看懂」,流式基准考的是「跟上」,都不考「该不该主动说」;二是现有 Video-LLM 压根没有长期记忆机制,给一长段视频,上下文窗口直接塞爆。

图注:三种助手范式——(a) 被动:只回应显式提问;(b) 半主动:盯着视频流找预设任务相关的事件;(c) 主动(本文):不需要任何用户提示,自主决定何时、如何介入。(图:原论文 Figure 1)

图注:EgoServe 基准概览——半自动标注管线(基础模型生成 + 人工核验)、服务响应词频、视频时长分布、各数据源服务数量、10 个子类 × 4 个时间跨度的分布。(图:原论文 Figure 2)
核心方法
论文一次给两样东西:考卷 EgoServe 和 考生 EgoMemo。
1. EgoServe:第一份「主动服务」考卷
先定义要考什么。EgoServe 把主动服务沿两个正交维度切分:需要的时间记忆跨度(决定难度)和应用场景(决定内容)。
4 个时间跨度 × 10 个子类:
- 即时(Instant):只看当前帧就够——安全提醒(锅烧干、刀没拿稳)、工具建议(换个更顺手的工具);
- 短期(Short-Term):要最近几分钟的上下文——错误纠正(步骤做错了)、资源提醒(别把水龙头开着就走)、下一步指导;
- 情景(Episodic):要整个当前任务,几十分钟到几小时——任务提醒(花没插完)、记忆召回(之前看过的东西现在用得上);
- 长期(Long-Term):要跨 session、甚至跨天——习惯指导(你连续几天都在饭桌上刷手机)、日常优化、记忆连接(把今天跟上周连起来)。
数据从三个现成数据集里抠出来:EgoLife(3 个人 × 前 5 天,考跨天)、HoloAssist(191 条验证集,考即时/短期)、CaptainCook4D(87 条带步骤错误标注的做饭视频),总共约 128 小时、3,437 条服务实例(人工核验后)。
标注是半自动的:让 Gemini-2.5-Pro 按「每个类别一套 prompt」从已有的人工标注里生成候选(长线服务用「流式线索累积」策略跨段携带证据),再由两个人一起看视频、达成共识才算过。4,038 条候选最终留下 3,437 条,通过率 85.1%。
怎么打分?两条腿:
- 时间精度:预测的触发点落在真值时间窗 ±δ 内才算命中(δ 按数据源定:EgoLife 60s、CaptainCook4D 25s、HoloAssist 10s),按类别算 P/R/F1;
- 响应质量:命中后再用 LLM 当裁判(GPT-4o 和 DeepSeek-R1 双人,两者排序高度一致 Pearson r≈0.95),对「合理性 + 有效性」打 1–5 分。
2. EgoMemo:免训练的记忆三件套
考卷有了,用什么考?EgoMemo 是完全免训练的——不微调任何模型,纯靠「记忆 + 检索 + 推理」。(图 3)
它维护三种互补的记忆表示:
- 多尺度时间摘要:把视频切成 clip,VLM 给每条 clip 生成带时间戳的 caption,然后一层层往上滚——clip 级细节 → activity 级活动摘要 → session 级日常摘要(在超长记录上用 30s / 5min / 1h 三档)。全部增量构建,只处理新来的片段。
- 演化知识图谱:从每条 caption 里让 LLM 抽实体和关系,用名字对齐合并进一张全局图。图能当「结构化索引」——检索时沿实体跳到语义相关但说法完全不同的历史事件。
- 视觉嵌入档案:关键帧用 ImageBind 编码成向量存起来,解决「文字说不清、但一眼能认出」的视觉细节(物体长啥样、空间怎么摆)。
推理时,每一步把「当前 clip caption + 最近活动摘要」喂给 LLM reasoner,reasoner 先判断要不要检索;要的话生成检索 query,走三条并行通路(时间相似度 / 图谱邻居 / 视觉相似度)捞证据,再用一个 VLM caption 重建步骤把捞回来的碎片拼成连贯上下文,最后输出决策
(0/1)和响应
。被动问答模式共用同一套管线,只是把用户 query 当触发、强制
。

图注:EgoMemo 架构——(a) 流式记忆构建:clip 级 caption 增量组织成三级时间摘要、演化知识图谱、视觉嵌入档案;(b) 流式检索增强推理:时间/语义/视觉三条检索通路汇合,经 VLM caption 重建后由 reasoner 输出干预决策与响应。(图:原论文 Figure 3)

图注:多尺度时间记忆构建示意——细粒度、带时间戳的 clip 级描述,逐步向上聚合成 activity 级和 session 级摘要,越往上时间跨度越大、信息越浓缩。(图:原论文 Figure 5)
核心公式
EgoMemo 的骨架就两个操作:往上滚(摘要)和往外拼(重建)。
三级摘要的滚动式聚合:

大白话:把一小段时间窗里的 clip 级 caption 浓缩成一条 activity 摘要,再把一堆 activity 摘要浓缩成一条 session 摘要——信息从「秒级细节」压到「小时级惯例」,全程只滚新来的部分,不用回头重看。
检索完把碎片拼回上下文,靠 VLM 重建:

大白话:图谱和视觉检索返回的只是一堆 caption 编号,不能直接当上下文用;VLM 把对应的 caption 和关键帧、结合检索问题,重写成一整段连贯叙述——顺便消掉指代不清、补回原 caption 丢掉的视觉细节。
最后一步决策:

大白话:每来一个时刻,reasoner 拿到当前观测和拼好的检索上下文,输出一个「插不插嘴」的 0/1 决策,和真要开口时说的那句话。
关键实验结果
EgoServe(主动服务,主战场):EgoMemo 整体 F1 8.0,比最好的闭源基线 GPT-5-mini(4.7)几乎翻倍,Qwen3-VL-Plus 只有 3.5。最醒目的是长期服务从「零」变成「有」:记忆连接 4.9(两个基线都是 0.0)、日常优化 11.8(基线 0.0)——这正是「只有积累跨天上下文才做得到」的活。所有模型分数都不高,论文自己也说这反映主动服务本身极难,EgoServe 的定位是诊断工具而不是盖棺定论。
消融(哪个部件最值钱):整体 8.0,去掉任意一件都掉——三级摘要 7.0、视觉检索 6.9、多尺度时间检索 6.8、图谱检索 6.5、caption 重建 6.6(去掉后记忆召回和记忆连接直接归零)。三条检索通路互补、谁也替代不了谁,重建和图谱是影响最大的两块。
泛化到既有基准(证明不是只会考试):
- ESTP-Bench 显式主动任务 27.6(超 EyeWO 23.6),隐式主动还差(34.7 vs 52.5,不过 EyeWO 是全场唯一训练过的模型,其余全是免训练);
- OVO-Bench 实时感知 75.15,超过 GPT-4o(64.46);
- 离线第一视角 QA:EgoSchema 74.8(+7.2 超 EgoThinker)、QAEgo4D 68.0(超 66.2)、EgoTaskQA 60.9(紧咬 EgoThinker 64.4)。
速度(产品化最关心的):检索 13.11 秒/分钟视频,比 VideoAgent(67.25s)快 5.1×、比 Video-RAG(20.81s)快 1.6×;记忆构建虽然要 77.33s/分钟,但跟推理异步跑,不占查询延迟。

图注:EgoMemo 主动帮助的两个例子——左:观察到用户徒手刷刀,立刻触发安全提醒(只用当前 clip 就能判断);右:第二天检测到用户又拿着手机长时间录制,检索跨天记忆发现反复出现的模式,触发「日常优化」建议。(图:原论文 Figure 4)
思考与启发
这篇最戳笔者的不是某个涨点,而是它把问题摆正了:AI 助手的难题不是「回答得对不对」,而是「该不该开口」。现在所有助手产品都在卷「答得更聪明」,但真正让人愿意戴一天智能眼镜的,是它别在错的时候烦你。Vinci2 把「插嘴时机」显式变成一个决策变量
,光这个设定就比「感知到事件就触发」高了一档——它默认大多数时刻该闭嘴。
两个更通用的判断,笔者想记下来:
- 「长期记忆」是结构问题,不是模型能力问题。 GPT-5-mini、Qwen3-VL 这种顶级闭源模型在跨天服务上照样扑街,说明光靠更大的上下文窗口、更强的推理解决不了——记忆需要显式的结构(摘要、图谱、向量库)来索引和沉淀。这跟 RAG 的逻辑一脉相承,但在「流式 + 主动」设定下更刚需。免训练路线(现成 VLM 造记忆 + LLM 做推理)当前性价比最高,也最容易被产品直接抄走。
- VLM caption 重建是个容易被低估的细节。 消融里它一去掉,跨时间服务的分数直接归零。道理很朴素:检索到的碎片(尤其图谱和视觉通路返回的 caption 编号)不是人话,喂给 reasoner 之前必须「翻译」成连贯上下文。很多 RAG 系统检索质量看着不错、下游却拉胯,毛病常出在这一步——只拼不译。
边界也要划清:整体 F1 8.0 还是很低的绝对值,说明主动服务难度极大;文本记忆会丢视觉细节、名字对齐对「长得像但不同」的物体容易翻车;标注管线可能偏好好生成的服务类型;而且 EgoServe 目前规模还不大(~128h)。方向都对,路还长。
参考资料
- 论文:Sitong Gong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang. Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos. arXiv:2607.11523
- 前作:Yifei Huang et al. Vinci: A real-time embodied smart assistant based on egocentric vision-language model. arXiv:2412.21080
- 相关基准/基线:EgoSchema (NeurIPS 2023)、OVO-Bench (CVPR 2025)、EgoLife (CVPR 2025)、HoloAssist (ICCV 2023)、CaptainCook4D (NeurIPS 2024)、VideoAgent (ECCV 2024)、VideoRAG (ACL 2025 Findings)
夜雨聆风