你让 AI 帮你做个季度汇报 PPT。它的回复很快,结构清晰,要点齐全——一份漂亮的 markdown。
然后你做了什么?你打开了 PowerPoint,新建幻灯片,把 AI 给的文字一段一段贴进去。调字号、对齐、换颜色。40 分钟后,PPT 做好了。
这是 2026 年一个很荒诞的场景:AI 能写代码、能分析数据、能生成图片,但让它帮你做个 PPT,最后一步还是得你手动贴。
问题不在 AI 不够聪明。它只是没有手——它只能输出文字,不能操作文件。
最近有个开源项目,专门解决这件事。它叫 OfficeCLI,12.9k stars。功能很简单:让任何 AI Agent 都能像人一样,直接读、写、创建 Word、Excel、PowerPoint 文件。
要理解这件事为什么重要,得先看清现在的 AI Agent 能做什么、不能做什么。
Claude Code 能帮你写代码、跑测试、修 bug。各种 Agent 工具能帮你做研究、写报告、整理信息。它们非常擅长处理纯文本——代码是文本,markdown 是文本,JSON 是文本。
但现实世界的大部分信息,不是纯文本。
你公司的财务数据在 Excel 里。合同模板在 Word 里。季度汇报在 PPT 里。这些是二进制文件,不是纯文本。AI Agent 如果不借助专门工具,根本「看不懂」一个表格文件里哪一行是汇总、哪一列是公式,更不用说修改它。
之前有解决方案吗?有。各种 Python 库可以操作 Office 文件。但问题是:每操作一种文件格式就要学一个新库,每种操作都要写几十行代码。一个简单的「在 PPT 里加一页标题」:
from pptx import Presentation
from pptx.util import Inches, Pt
prs = Presentation()
slide = prs.slides.add_slide(prs.slide_layouts[0])
title = slide.shapes.title
title.text = "Q4 汇报"
# ... 还要几十行 ...
prs.save('report.pptx')这还不算完。你写完了代码,还得打开 PPT 看效果——字体有没有溢出?布局有没有跑偏?没有预览,你只能生成、打开、检查、回去改代码、再生成、再打开。
这个循环,比手动做 PPT 还慢。
一种新范式:AI 直接操作文件
OfficeCLI 做的事情,不只是「又一个更方便的工具」。它改变的是 AI 和 Office 文件之间的关系。
旧的关系:AI 输出文字,人把文字放进文件。AI 是参谋,人是操作员。
新的关系:AI 直接操作文件,人确认结果。
这个变化的关键,不在于「方便」,而在于「闭环」。
以前让 AI 做 PPT 的流程:
AI 给文字 → 你贴进 PPT → 你检查 → 不好 → 你改
每一步都要人经手。AI 不知道你贴完之后效果好不好——它没看到最终文件。
OfficeCLI 把一整条链路都还给 Agent:
Agent 直接创建文件 → Agent 预览效果 → 不好 → Agent 自己改
一条命令就够了:
officecli add deck.pptx / --type slide --prop title="Q4 汇报"不需要写 Python,不需要手动贴。Agent 直接操作文件,就像它操作代码文件一样自然。
它支持三种操作——读、改、创——覆盖了日常办公的核心需求:提取文档结构和数据、修改单元格和文字、从零创建文档、用 JSON 批量填充模板。
给 AI 一双眼睛
更关键的一点是「预览」。
你可能会想:AI 看不懂图片,预览有什么用?
OfficeCLI 的做法很聪明。它内置了一个 HTML 渲染引擎,能把文档渲染成 HTML 页面或 PNG 截图。Agent 不需要「看懂图片」——它可以读取渲染后的 HTML 结构,检查文字有没有溢出、两个形状有没有重叠、表格有没有对齐。
这相当于给了 AI 一双眼睛。这个 render → look → fix 的闭环,才是 Agent 能真正「做文件」而不是「写文件描述」的核心。
场景是这样的:你用 Agent 生成了一份带表格的 PPT。Agent 生成完后,拿到每一页的截图,丢给多模态模型检查:「看看第三页的表格,金额那一列有没有超出单元格?」模型说超了,Agent 就调一下列宽,再生成,再检查。
没有预览能力的 Agent 做办公文件,就像一个盲人在布置房间——摆完了也不知道效果。有了预览,它能看到自己做了什么,才能往对的方向改。
什么该让 Agent 做
一个简单的判断:
| 适合交给 Agent | 适合自己手动 |
|---|---|
| 批量生成重复文件(100 份合同、50 张报表) | 创意型排版(海报、品牌设计) |
| 模板填充(JSON 数据 → PPT/Word) | 需要频繁讨论、边改边看的一次性文件 |
| 格式转换(Excel 转图表、Word 转数据表) | 格式极度复杂、嵌套很深的文档 |
| 需要反复微调的任务(Agent 自己预览→改→再预览) | — |
核心原则:如果花在「操作软件」上的时间远大于「思考内容」的时间,让 Agent 做。反之,手动更合适。
能力的边界,正在从「读」走向「写」
OfficeCLI 最值得关注的,不是功能有多全——它确实很全:350+ Excel 公式自动求值、数据透视表、SmartArt、动画都支持。
重点是它代表的一类新工具:让 AI Agent 从「只能理解文本」扩展到「能操作结构化文件」。代码文件、配置文件、JSON 数据——这些 Agent 已经能操作了。Office 文件是下一个。
再往后呢?PDF 合同?CAD 图纸?视频工程文件?
Agent 的价值不在于它能说什么,而在于它能操作什么。每多一类 Agent 能直接操作的文件格式,就少一类需要人工经手的重复劳动。

夜雨聆风