乐于分享
好东西不私藏

AI做Office实操,代码跑通99%却只拿68.8分

AI做Office实操,代码跑通99%却只拿68.8分

一个AI Agent做完200道Office实操题,99%的任务代码无错误运行。

但逐项批改以后,它的平均得分只有68.8%。

这两个数字挨在一起,我盯了很久。文件能打开,代码没报错,Agent也确实交了作业。可如果把Word里的字体、Excel里的图表、PowerPoint里的动画一项项对照,差不多每三分里仍有一分丢在成品细节上。

我想确认的正是这道缝。今天大家说AI能做文档,究竟是在说它能产出一个文件,还是能交出一份经得起逐项验收的Office成品?

这套名为OfficeEval的测试,没有临时编几道演示题。研究团队从全国计算机等级考试的一级和二级MS Office实操部分抽取了200道任务,覆盖Word、Excel和PowerPoint,再把评分拆成7118个可以由机器核对的细项。

一份Word题可能要求把原始材料做成双页宣传册,标题样式、分栏、水印、页眉图片和邮件合并标签都得落到正确位置。评分器不看成品像不像,而会查某一段是不是指定字体,某个图表是不是指定布局,某个动画是不是那一种效果。常见的一道题有二十到七十个这样的检查点。

这让我先松了一口气。它至少没把看起来还行交给另一个模型打印象分。

研究者还收集了200份网上备考社群流传的参考答案,用来检查题目能否完成、评分器是否正常。这些答案平均拿到95.5%,其中89份满分。这个数不是正式的人类平均成绩,论文也反复提醒,它只能算一把校验尺。

先上场的是七款前沿模型。它们一次生成操纵文档的代码,没有执行反馈,也不能失败后再改。最好成绩是36.6%,第二名36.2%。表现最好的模型也只有61.5%的代码能无错误运行,剩下38.5%还没产出可评分文件就先崩了。

看到这里,我的第一反应其实不算意外。让模型一次写完几十个相互依赖的Office动作,像让人闭着眼把一套复杂表格做到底,中间还不许看结果。

真正让我改口的是下一轮。

研究者把同样的工作交给能反复写代码、执行、看报错再修的编程Agent,并放开更广的Office自动化工具。Claude Code把平均分推到53.0%,Codex达到68.8%。前者平均跑23.1轮,后者平均50轮,最长任务能走到133轮,每道题最多给一小时。

更显眼的是,代码运行成功率到了98%和99%。Agent循环确实接住了大量崩溃,它不是摆设。

可那张68.8分的答卷又把兴奋压了回来。报错基本消失以后,错误没有跟着消失,只是从没做出来换成了做出来但属性不对。

论文把失败细项重新分类。在这套诊断口径下,最好Agent的非崩溃加权损失里,97.4%被归为实现知识错误。这个比例不能当成所有Office错误的普遍占比,作者也承认分类可能高估它,但错误长什么样很具体。

它知道应该改颜色,却写错了主题编码。知道应该加动画,却猜错了枚举常量。知道要调尺寸,却在厘米、磅和Office内部单位之间错位。它甚至找到了正确的高层动作,结果栽在一个Open XML属性路径、一个内置样式名或一个图表布局编号上。

这里藏着全文最重要的机制。

人做Office时,会从样式库里点一个肉眼可见的模板,改完立刻看页面有没有变形。研究中的代码Agent没有同样连续的视觉闭环。它得把使用空白三栏页脚这句要求翻译成内部对象、属性和常量,再相信代码执行成功就意味着目标状态已经出现。

执行成功只证明这条指令合法,不证明它指向了正确的文档状态。

论文里有个很扎眼的小案例。一个Excel答案的公式全部正确,图表属性却配错了,单这一处就丢了13分。另一个Word答案没有调用指定的内置页脚模板,而是自己重新拼了一个看着相近的版本。文件照样打开,内容也在,评分器却能看出它没有做成题目要求的那个对象。

这时再看PowerPoint最弱就不奇怪了。单轮模型在动画和图形媒体两类细项上的最好通过率只有26.7%和29.1%,而表格、图表、数据公式这些参数更明确的类别能到59.1%、51.4%和48.5%。越依赖视觉选择和隐含常量,模型越容易在收尾一厘米失手。

Agent多跑几轮能不能把剩下这段磨平?只解决了一部分。

最好Agent在23道题上反而比自己的单轮版本得分更低,占全部任务的11.5%。论文观察到,连续修补有时会把原本正确的文档改坏。循环既是纠错器,也可能成为新的破坏源。

我喜欢这项研究的地方,是它没有把结论偷懒写成AI不会Office。Agent把得分从36.2%推到68.8%,PowerPoint还提高了43.8个百分点,这些进步都是真的。独立的OfficeBench曾用另一套跨应用办公任务测试早期Agent,最高通过率为47%,也指向同一个事实,真实办公自动化比生成一段答案难得多。不过两套任务、模型和评分方式不同,数字不能横着排名。

问题落回普通人的工作,会变得很实际。

如果AI替你做一份周报、投标表或客户演示,文件存在只能算第一道门。第二道门要验收任务里真正决定交付的状态,公式引用、图表范围、母版、字体、页眉页脚、动画和导出结果。重要文件还要留版本检查点,让每轮修复都能对比,坏了就退回去,而不是让Agent在同一份成品上一直覆盖。

这不是要求每个人都去读Open XML。恰恰相反,稳定的办公Skills应该把那些容易猜错的常量和单位封起来,让Agent调用可验证动作。随后再用确定性检查和视觉复核确认页面真的变成了想要的样子。

论文的边界也不能省。它测的是用代码操纵Office的Agent,不是能持续看屏幕、点击界面的GUI Agent,后者可能在版式任务上更占便宜。Agent组同时增加了执行反馈、修复预算、工具范围和脚手架,所以68.8分不能只归功于多思考几轮。题目可能出现在训练数据中,中文任务的英文翻译也会带来干扰。原始考试材料受版权保护,研究没有公开重发,外部复现并不轻松。

这些限制没有抹掉那张答卷,反而把它放到了更准确的位置。

99%的任务代码已经能跑通,这是值得高兴的进步。可右边那张评分表仍有一排小格没有勾上。以后看到AI交出一个漂亮文档,我会先承认它真的做了很多,再多问一句。

它只是把文件做出来了,还是把那7118种做对也接住了?