
一、我们为什么需要 OfficeCLI
先说说现在让 AI 做 Office 文档,到底有多拧巴。
你让 AI 写个 PPT,它的标准流程是:现场写一段 Python,调用 python-docx、openpyxl 这类库,把内容"填"进文件,然后撒手不管。
问题出在哪?AI 根本看不见自己做出来的东西。
它往文件里写了一堆 XML,写完就收工。
标题有没有溢出文本框?不知道。
字体是不是全回退成了默认等线?不知道。
图表有没有真的生成?也不知道。
最后你打开文件,发现排版一塌糊涂,再截图回去让它猜着改——来回拉扯,比你手动做还累。
这就是过去 AI 办公的死结:会写,不会看;能生成,不能交付。
而办公室里大量工作——会议纪要、数据汇总、周报月报、批量改格式——恰恰是"规则清楚、重复发生、但必须检查"的类型。
AI 不是做不了,是缺一个能稳妥操作 Office 文件、还能自查的"手"。
OfficeCLI 补的就是这只手。
二、它能帮你解决哪些实际问题
它把 Word、Excel、PPT 的创建、读取、修改、分析、重组封装成命令行,AI 用敲命令的方式操作文档。落到具体工作上,直接能接的活至少有这几类:
1. 会议纪要流水线。 把录音转写、聊天记录丢给 AI:"提取决策、待办、负责人和截止时间,整理成正式纪要,统一标题层级,补充表格。"读资料、提信息、排版式,一气呵成。
2. 数据从清洗到汇报。 "读取这份销售明细,检查列名和数据类型,删掉空行,按区域汇总销售额,标记异常值,生成汇总页,再把核心结论做成一页 PPT。"它内置 350+ 个 Excel 函数,公式写完当场算给你看——返回结果里直接带着计算值,不会出现交给你才发现满屏 #REF! 的尴尬。
3. 可以"对话式修改"的 PPT。 不是一锤子生成,而是持续打磨:"第 3 页标题太长,缩短但别丢结论;图表下移半厘米,和正文留白对齐。"每个元素都有坐标,指哪改哪。
4. 批量脏活。 几十份合同统一查找替换、全公司旧文档统一字体和页眉页脚、读一份模板按新数据批量生成一百份文件——它的模板合并功能专为这个设计:版式设计一次,数据填充 N 次,份份一致。

最适合交出去的,从来不是最复杂的活,而是那些重复、规则明确、人工很烦、还得检查的活。
三、兼容 Office 365 和 WPS 吗
这是本文最想讲清楚的部分。OfficeCLI 的工程取舍非常一致:所有设计都优先考虑"AI 怎么用得稳",而不是"人怎么用得爽"。
三层架构:能用语义,就别碰 XML
它把操作分成三层,由浅入深:
L1 语义视图: view outline / text / issues,AI 先快速读懂"这文档讲了什么、有没有问题";L2 DOM 操作: add / set / get / remove,每个元素有稳定路径坐标,比如/slide[1]/shape[2],AI 定位元素就像在文件系统里cd目录,不用懂 XML;L3 裸 XML 兜底: raw / raw-set,直接用 XPath 操作,高层够不着时也不会被卡死。
简单任务永远停在高层,只有搞不定才下沉——AI 不用一上来就啃 OOXML 那套命名空间地狱。
给 AI 一双眼睛:render → look → fix
整个工具最值钱的设计,是内置了一个从零自研的渲染引擎,能把 .docx、.xlsx、.pptx 直接渲染成 HTML 或逐页 PNG。
于是一个完整的工作流闭环出现了:渲染 → 看一眼 → 修复 → 再渲染确认。
AI 做完 PPT,会自己"看"一遍成品——标题溢出了、两个图形叠在一起了、页面太空了——然后定位元素直接修,修完再看。做、查、改,全程不用人插手。
这就是它和普通代码库的分水岭。
还有两个工程细节值得一提:常驻模式把文档留在内存里,命令间延迟接近零;
批处理默认原子性——任何一步失败整批回滚,不会留下改了一半的损坏文件。
AI 改文档最怕的"改到一半翻车",被从机制上解决了。
接入方式:一条命令的事
它内置 MCP 服务器,对接主流 AI 编程助手只要一条命令:officecli mcp claude(或 cursor、vscode)。安装后还会自动把技能文件装进检测到的各个 Agent,做到"AI 一装就会"。

Office 365 和 WPS 能用吗
文件层面,都能用;软件层面,它压根不依赖任何办公软件。
OfficeCLI 是单文件二进制,Windows、macOS、Linux 全平台,运行不需要 .NET、不需要 Python,更不需要安装 Microsoft Office。它操作的是 .docx / .xlsx / .pptx 这套 OOXML 开放文件格式本身。
由此得出两个结论:
Office 365:完全兼容。Office 365 保存的就是 OOXML 格式,OfficeCLI 改完的文件用 Word、Excel、PowerPoint 打开一切正常; WPS:同样兼容。WPS 的文字、表格、演示保存为 .docx/.xlsx/.pptx时走的就是同一套格式标准,WPS 能打开它生成的文件,它也能改 WPS 保存的文件。
两个注意点:老格式 .doc / .xls(Office 97-2003)和 WPS 私有格式不在支持范围内,先"另存为"新格式即可;另外渲染引擎是自研实现,极个别冷门排版效果和 Office 原生渲染可能存在细微差异,正式场合交付前建议用本机 Office 或 WPS 再过一眼。
也正因为不依赖 Office,它能在没有图形界面的服务器、Docker 容器、CI 流水线里跑——这才是"AI 后端"该有的形态。
四、命令行,会是 AI 接管所有软件的入口吗
最后这部分,是我觉得比工具本身更值得琢磨的。
OfficeCLI 为什么能成?回头看,命令行有几个 GUI 天然不具备的特质:
可组合。 一条命令的输出是下一条命令的输入,几十步操作串成流水线,不需要人盯着点鼠标。
可验证。 每一步都有明确的返回结果,成功还是失败、改成了什么样,白纸黑字。AI 最怕的不是做错,是做错了不知道——命令行天然自带反馈回路。
可复现。 同一串命令跑一百次,结果一致。而"让 AI 模拟鼠标点第 237 个像素"这种事,错一次就全盘皆输。
任何软件,只要暴露出稳定的命令行或 API,理论上都可以被 AI 接管。 Office 三件套只是第一个被攻下的山头——因为它最标准化、最重复、最痛。
这个趋势其实已经开始了。OfficeCLI 自己会主动向 AI Agent 递出技能文件(SKILL.md),等于工具在自我介绍"我这么用";
MCP 协议在给工具和模型之间铺标准管道; GitHub 上 Skills 生态正在爆发。
工具的假想用户,正在从"人"变成"AI"。
但是 "唯一入口"大概率不会成立。
GUI 不会消失——人做决策、做审美判断、做需要手感的事,图形界面依然是最低成本的方式。
更可能的格局是分层:人通过 GUI 和对话做决策与验收,AI 通过 CLI 和 API 做执行与自检。 就像 OfficeCLI 的三层架构一样,各层干各层擅长的事。
真正会变的,是软件的设计哲学。未来评价一个软件好不好用,可能要多问一句:它对 AI 友好吗?有没有命令行?有没有稳定的程序化接口?——因为能不能被 AI 接管,直接决定了你的工作流能不能自动化。
当工具都开始为 AI 而不是为人设计,"AI 能自己动手干活"才算真正落了地。
推荐阅读
夜雨聆风