
OSWorld 70%+ 的成绩,搬到专业软件里只剩 30% 出头。<u>短任务高分</u>,到了专业软件里就露底。FreeCAD、QGIS、剪映、KiCad、Blender 一上场,GUI Agent 的底牌就露了。
Workflow Gym 是字节 Seed 评测团队做的,6 月上旬公开。它把 Chrome、Office 里的短任务,换成了专业软件里的长流程。

它不是随手加难度。- 候选任务:1000 多个,最后筛到 338 个。- 领域覆盖:6 个顶级领域、23 个二级领域。- 环境:每个软件都打成独立虚拟机镜像,Windows 和 Ubuntu 都有。同样是 GUI Agent,换到专业软件里,成绩就断在 30% 出头。
---**考场变硬了**
难度按人类专家标注的步数分层:30-44 步是 Easy,45-60 步是 Medium,61 步以上是 Hard,最长题目到 110 步。模型跑起来更夸张,探索、犯错、重试之后,交互轮次常常冲到 80-400 步。
判分也收紧了。要么比对输出文件的二进制内容,要么把最终截图交给裁判 VLM(看图判分模型)按关键点核对。抽样 60 道题做人评对照,自动评测和人评一致 59 道,一致率 98.3%。
---**成绩单很冷**

最扎眼的三个数是:- 30.67%:Gemini 3.1 Pro 的单次平均通过率。- 2.67%:Gemini-3-Flash 在 Hard 题上的 pass@3。- 25.33%:Kimi-K2.6 在 Hard 题上的 pass@3,比 Gemini-3.1-Pro 的 21.33% 还高一点。
这组数字的意思很直接:模型没有通吃型。Kimi 在数据分析、多媒体创作上更顺手,Gemini 在地理信息、工程设计、科学仿真上更稳。

换到专业软件以后,舒适区和黑洞都更明显。
---**卡在哪里**
论文把失败分成两类:没跑完,和跑完但错了。前一种更像中途掉队,后一种是流程走完了,验收点却漏了。最难受的是,很多任务不是当场崩,而是做到最后才发现前面某一步已经带偏了。
坑主要有四个:- 长程一致性断裂:第 20 步忘了第 5 步的参数。- 错误扩散:点错一个按钮,还继续往下走。- 目标漂移:做完 80%,却漏掉最关键的验收点。- 专业软件理解不足:看见面板和按钮,却不知道先懂哪一层。
专业软件的界面不是通用网页。QGIS 的图层堆栈、KiCad 的网表层级、Blender 的模式切换、FreeCAD 的 sketcher 约束,都要先懂工作方式。再谈操作。截图→推理→坐标点击这套循环,在这里分辨率不够。
---**这张榜怎么用**
看这张榜,别先盯平均分。先看两个问题:50 步以后它还记不记得目标,点错后会不会回退。能过这两关,再谈榜单分数。<u>专业软件里的完整工作流</u>,比演示视频更难糊弄。
对模型团队来说,长程一致性、错误恢复、专业领域知识,已经绕不开。对产品团队来说,演示视频能讲故事,不能代替专业软件里的完整工作流。
Workflow Gym 只是一期,338 题、56 款软件,后面还会继续扩软件范围,打通评测和训练,甚至把 GUI 轨迹转成工具接口。
30% 不好看,但它更像 <u>边界线</u>。


夜雨聆风