摘要:
过去一年,大模型 Agent 在浏览器、游戏等场景里频频刷榜,但当任务真正落到办公套件——Word、Excel、PPT、PDF 的跨软件协同上,它们的表现却鲜有人系统性检验。与此同时,如何把"完成度"还原为真实的"经济价值",仍是生产力工具评测里悬而未决的难题。百度 Agent Frontier 团队推出的 OmegaUse-OfficeVal,给出了一套新的答案:覆盖 4 大办公软件、拆解为 9 大任务类型,将每个子任务映射成可定价的人力工时(Person-Hours),并通过"成本回算"得出一个具有经济意义的综合得分。实验显示,当前最强模型在该基准上的经济得分也仅达到人类专家水平的 30% 左右,且不同软件间的完成度差距显著。这项工作提示我们,办公 Agent 的下一站,不是"能不能点对按钮",而是"值不值得被雇佣"。
关键词:大模型Agent, 办公自动化, 基准评测, 经济价值, 长链路任务
论文标题(英文原文):OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
论文链接:http://arxiv.org/abs/2607.27155v1
作者:Jingbo Zhou、Yusai Zhao、Qi Bao et al.
发表日期:(未提供)
发表期刊:arXiv
论文解读:
想象一个真实场景:你雇了一位助理帮你整理一份三季度的运营报告——从原始表格里提取数据、做交叉对比、生成带图表的 PPT、改写 Word 摘要。这套活儿你估计要花两小时,付费市场上大概值几十块钱。如果让 LLM 智能体去做呢?它确实能跑完流程、确实便宜得多,但交给你的那份文件,你敢直接拿去开会吗?这正是百度 Agent Frontier 团队在 OmegaUse-OfficeVal 这篇工作中试图回答的问题。
一、长任务的价值,不只是"做没做完"
过去一年,LLM 智能体的评测重心正在从"短交互"向"长交付"迁移。所谓"vibe working"——让 AI 接手整个办公工作流——如果真的要兑现,就必须先回答两个朴素的问题:任务平均要花人类多久?这些任务值多少钱?
OmegaUse-OfficeVal 给出的答案是:100 个真实办公任务,平均人类劳动时间 2.32 小时、中位数 2.03 小时、最长 8.35 小时;任务价格代理的中位数 5.11 美元、均值 6.86 美元。换句话说,每一道题都对应着一位初级助理半天到一天的工作量、或一笔可以在外包平台上挂出去的小单。
这种"经济锚定"的设计选择并非多余。团队反复强调,要把评测从"动作步数"或"对话轮数"这类代理指标,拉回到"人类劳动时间"和"市场单价"上来。这有点像经济学里把 GDP 从"产量"换算成"实际购买力"——只有用真金白银来称重,才能避免被表面热闹的指标误导。
二、用代码当裁判,比让 LLM 当裁判更靠谱
这类长任务最难的不是造题,而是打分。团队尝试了三种主流方案,最终选择了一条少有人走的路。
第一种是人工打分。RLI、GDPVal 都用这个,但成本高、速度慢、主观性强,且无法跨年复现。第二种是 LLM 当裁判。但请哪个模型当裁判,本身就是个不稳定变量——模型升级了,旧榜单就作废了。第三种就是 OmegaUse-OfficeVal 采用的"代码验证器":把评分细则写成可执行脚本,让代码去检查最终交付物是否满足要求。
这套机制的核心,是把"评分标准"和"评分动作"绑定成同一份代码。团队用 219 个可用性检查项和 2009 个任务完成度检查项,把每一项要求都拆成"能 / 不能"的二元判断,最终汇总成 0-100 的归一化分数。可用性先要全过线,否则直接判零——这意味着如果你交出来的 PPT 打不开、Word 文档乱码、表格格式崩溃,连"部分完成"的同情分都没有。
更精妙的是评分函数的设计。正向条目按难度分 +1/+3/+5 三档权重,负向条目——比如把不该改的段落误删、把可编辑文本栅格化成图片——按对偶权重扣分;最后用 min(原始得分, 0) 把总分夹在零以上,避免负分累积造成"越努力越糟"的反直觉激励。这套权重的逻辑,几乎就是数据库系统里"完整性约束"的镜像——正向是满足的需求,负向是触发的违规,最终用一个聚合函数保证一致性。
团队的"人机对齐"流程也值得一提:让 AI 生成验证代码,让专家根据原始需求逐条对照,标注每一条 rubric 的得分差异;如果差异源于代码漏洞就修代码,源于细则模糊就回炉重写细则,源于专家理解不一就校准评分口径。这种"让评分本身可被验证"的元设计,是这份工作最被低估的贡献。
三、便宜又快,但还不够好
五款主流 LLM——GLM-5.2、Kimi K2.6、DeepSeek-V4-Pro、MiniMax M3、Qwen3.7-Plus——和人类基线在 OmegaUse-OfficeVal 上的对比如图6所示,气泡大小代表单任务的平均成本,理想的智能体应当出现在左上角的小气泡位置。

图6:人机多维对比散点气泡图,横轴为单任务平均时间,纵轴为任务得分,气泡大小代表单任务平均成本。理想区域是左上角小气泡。人类标注者以 27.79 分位居最高,但耗时与成本显著高于所有 LLM;所有 LLM 智能体虽然更便宜、更快,但得分集中在 17 上下,明显低于人类。这意味着当前 LLM 智能体已具备成本与速度优势,但尚未将这些效率优势转化为人类级别的交付物质量。
具体到分数:表现最好的 GLM-5.2 拿到 17.91,Qwen3.7-Plus 和 Kimi K2.6 紧随其后;DeepSeek-V4-Pro 是最快的,Qwen3.7-Plus 是最便宜的,但快和便宜都不等于好。
更值得玩味的是图7 揭示的分数分布:人类在"50 分以上"区间占 21%,在"零分"区间占 29%;而 GLM-5.2 的高分占比仅 14%,DeepSeek-V4-Pro 和 MiniMax M3 的零分率高达 50% 和 51%。换句话说,每两个任务就有一个被这两个模型彻底搞砸——可能文件打不开、可能格式全乱、可能关键需求一个都没满足。
图8 把任务按人类劳动时间分桶后,揭示了一个对智能体相当残酷的事实:任务越长,分数越低,而且 LLM 的下降幅度比人类还陡。这意味着当前的"长任务"瓶颈不是某一步出错,而是整个流程的状态保持与质量控制——就像跑马拉松,越往后越容易掉速,而 LLM 还没学会分配体力。

值得专门点出的是图9 的领域差异:不同模型的"擅长领域"并不重合——GLM-5.2 在工程技术类任务领先,Qwen3.7-Plus 在商业运营类最强,DeepSeek-V4-Pro 在学术论文类表现最佳。没有任何一个模型是"全能办公助理",这与人类初级员工的"什么都能做、做得一般"形成了有趣的对比。

四、平均分冠军 ≠ 价值捕获冠军
如果说论文里有一张最值得讨论的图,那应该是表3 所承载的洞见:当我们把每个任务按"人类劳动时间"或"任务单价"加权后,模型的排名会发生洗牌。GLM-5.2 在平均分上称王,但在时间加权与价格加权两个指标上,Qwen3.7-Plus 反超。
这个结论颠覆了"分数高就好"的朴素直觉。它提醒我们:如果一个模型擅长的是大量廉价的、几分钟就能搞定的小任务,那它即便平均分领先,也可能没"接住"真正值钱的工作。反过来,一个在长任务、高单价任务上更稳的模型,哪怕平均分略低,从经济角度看反而更有用。
这与经济学中"基尼系数 vs 人均 GDP"的讨论异曲同工——只看平均,会掩盖价值分布的异质性;只有引入权重,才能识别出谁在真正承担高价值的劳动。
五、把"评测"本身当作一种产品
OmegaUse-OfficeVal 的野心不止于"再发一个基准"。它实际上在示范一件事:在 LLM 能力快速迭代的今天,谁来当裁判比谁去当选手更重要。
他们通过经济信号、代码验证器、完整开源这三件套,试图把评测从"一次性快照"变成"可被多年追踪的基线"。价格代理以人民币标价、按 180 天汇率换算为美元,这种细节透露出团队对"复现性"的执念;而把评测代码、rubric、经济标注全部公开,则是在向 GDPVal、RLI、ALE 等"半开源"基准叫板。
当我们继续把 LLM 推向越来越复杂的办公场景时,OmegaUse-OfficeVal 给出的最重要启示或许是:与其追问"模型能不能做",不如追问"模型做得值不值"——而后者要求我们把每一次评测,都当作一次有市场、有交付、有验收的微型商业实验来设计。
延伸讨论上,未来研究可以从三个方向继续推进:一是引入更细粒度的"修复成本"指标,区分"接近完成只需小修"和"半成品需返工",让分数更贴近用户实际体验;二是探索多模态输入下的经济标注协议,扩展到视频、设计稿等更复杂的输入类型;三是把"经济锚定"思路推广到其他领域——编程、法律、咨询——构建跨行业的"AI 任务价值图谱",让"vibe working"从一个营销口号,变成可被持续监测、可持续优化的工程目标。
夜雨聆风