AI科普馆部分垂类内容转移至👆
【长三角人工智能联盟】公众号,快点进去瞧瞧!
2026年7月,国家工业信息安全发展研究中心人工智能所下设的“人工智能融合发展与安全应用实验室”发布《Office Agent工作流测评报告》。这是该机构连续第三年对办公类大模型工具做标准化实测——前两年只测PPT单点生成,今年把镜头拉到Word+Excel+PPT三件套联动的完整工作流,测的是“从原始数据到演示汇报”的全链路代差。
测了什么:4维20项,5款主流产品
报告选取百度文库、豆包、Kimi、MiniMax、千问五款代表性产品,按协作衔接、文本内容、视觉呈现、功能体验4个一级指标、20个二级指标打分,场景覆盖工作汇报、学术研究、教育教学、党建学习四类常规办公,外加一类敏感信息处理的特殊场景。
整体结论可以一句话收住:办公智能体已经跨过“能不能串起三件套”的门槛,但卡在“敢不敢直接信它产出的内容”这一步。
具体分数很说明问题——
协作衔接 87.92 分(最高):多格式导入导出、长链任务自主执行、跨文件联动修改,大部分产品能一次性走完“数据整理→报告撰写→PPT制作”不出中断,仅个别产品跨文件数据一致性仍需加强。
文本内容 74.38 分,但Word内容真实性仅 65 分,PPT内容真实性仅 61.25 分——幻觉、杜撰数据、结论与原始语料对不上,是全线最大短板;Excel数据准确性相对好些,约 88.75 分。
视觉呈现 74.38 分:排版美化基本合格,Word排版美观度与Excel版式美观度均达76.25分,但PPT图表缺图例、缺数据标签的情况仍常见。
功能体验 67.22 分:系统稳定性反而最好(无崩溃卡顿),弱在AI标识覆盖率、多轮精细编辑、敏感信息兜底与辅助功能丰富度。
头部产品分化明显:百度文库以 85 分领跑独占第一梯队,MiniMax 80 分次之,其余多在 68–75 区间。
这份报告在回答什么问题
把视角抽出来看,它其实在回答一个2026年才变得紧迫的问题:当Agent能自己开Word、自己填Excel、自己排PPT时,我们该怎么衡量它“干得好不好”?
过去测办公AI,测的是“一句话出PPT漂不漂亮”;现在测的是“给它一堆原始数据和一个模糊指令,它能不能自己规划步骤、中途不崩、三份文件对得上、数字不瞎编”。标准从“生成质量”升级成了“工作流可靠性”。
报告里那个87.92分与61.25分的剪刀差,是整个44页最该被记住的数字:
高的是“手和脚”——多工具调度、格式互通、长链执行,工程层已经基本跑通;
低的是“脑子和责任心”——内容是否忠于源材料、专业判断是否站得住、敏感信息是否兜得住,这些恰恰最难用工程指标固化。
换句话说,2026年的Office Agent已经是个能跑全流程的实习生,但还不是能独立签字的交付者。
三个判断
第一,办公Agent的竞争焦点已从“生成漂亮”转向“跨文件保真”。 用户愿意容忍排版一般,但不愿在给领导的汇报PPT里出现虚构的“同比增长38%”。真实性二级指标被单列进评分体系,本身就是行业拐点的信号。
第二,测评口径在倒逼产品架构变化。 从PPT单点→三件套工作流→真实性/安全合规单列,标准逐年变厚,等于把“Agent办公≠高级改写”写进国家级测评语境。后续政企采购Office Agent,大概率会直接引用这套4维20项做POC打分,而不是只看Demo效果。
第三,短板不在模型底座 alone,而在“工作流里有没有校验节点”。 协作衔接能拿87分,说明多工具调用(类似MCP思路)已成熟;文本真实度掉到61分,说明“检索→引用→交叉验证→人工确认”这类环节还没被做成默认SOP。哪一步没固化进流程,哪一步就掉链子——排版美化容易固化所以74分,数据溯源难固化所以61分。
44页报告,核心一句话:2026年的Office Agent已经会跑全流程,但还做不到“跑完不用复核”。从“工具”到“同事”,差的那十几分,就是领域知识校验、引用溯源和人机确认节点要填的坑。
本文基于国家工业信息安全发展研究中心人工智能所《Office Agent工作流测评报告》撰写,详细内容请查阅原文。
以下是内容节选↓↓↓ 文末点击链接免费下载pdf,扫二维码加入交流群



















AI科普馆:打开AI世界之窗


夜雨聆风