夜雨聆风学习资料网

ARTICLE · 1104615

AI会操作电脑了?一进专业工程软件,多软件任务只成功3.6%

AI会操作电脑了?一进专业工程软件,多软件任务只成功3.6%
论文导读

清华大学、智曼公司、北京大学、浙江大学等机构联合建立EngiWorld,用1,301项任务检验Agent能否跨26款专业工程软件完成设计闭环。七个前沿模型中最强者EngiScore仅44.3,多软件任务的尝试成功率只有3.6%,由此暴露真实工程自动化的距离。

会点网页不等于会做工程

通用电脑Agent已经能填表、搜索和操作办公软件,但CAD、仿真、制造、建筑、电路和三维可视化要求对象尺寸、物理约束和文件依赖一路保持正确。一个按钮点对了,不代表导出的零件可装配;一张截图像完成,也不代表模型内部参数符合规范。

图:多个专业软件界面串成完整的成功设计工作流。

EngiWorld覆盖CAD、CAE、CAM、BIM、EDA和3D可视化六个领域,共26个平台、1,301项专家任务,同时包含图形界面和命令行。任务从选择正确软件一直延伸到开放式设计,重点是完整交付物而非单个点击。

直接检查工程产物

基准建立统一的领域验证器,程序化检查最终文件和中间产物的几何有效性、物理可行性与规则符合度。对于有明确数值要求的设计,它按规格达到程度连续计分,而不是仅凭屏幕截图判成成功或失败。

图:基准总览覆盖六个工程领域、任务类型与图形命令行接口。

这种以产物为中心的评估能识别“界面操作看起来顺利、文件其实不可用”的情况。成功工作流图展示Agent跨多个专业界面完成步骤;失败图则保留模型在哪个软件、哪个依赖环节断掉的证据。

跨软件链条最容易断

团队测试七个前沿模型,最强者的EngiScore为44.3;需要多款软件协作的尝试中,只有3.6%成功。数字来自EngiWorld定义的工程任务,不代表所有办公软件能力,也不能直接外推到经过企业定制的专用Agent。

图:左右对照显示跨软件流程中的失败位置和少量成功案例。

主要困难不只是识别菜单,还包括维护坐标、单位、材料、网格和文件版本等隐含状态。单软件中一次小误差,到了下游仿真或制造步骤可能变成无法打开或违反规则的交付物。

未来工程Agent要先学会验收

落地前,企业可以把现有设计规范、检查脚本和样例文件接入类似验证器,让Agent每完成一个阶段就验收,而不是到流程末尾才发现前置错误。跨软件传递还应记录文件哈希、单位和参数变更,方便人工追责与回滚。

下一步应增加真实团队协作、许可证限制和长时间任务,并测量人工接管次数、修复成本与最终产物可复用性。EngiWorld提供的价值不是宣布Agent已经能做工程,而是把“做完”定义成机器可检查的交付标准。对于企业采购,这类可复现验收也比一段顺利演示更能衡量节省了多少工程时间。

参考资料

https://arxiv.org/abs/2609.37686

https://engiworld.github.io

相关学习资料