与其把 Word 丢给 Agent,不如把 Agent 塞进 Word
前天改一份协议,某一页某一段措辞要调,还得加条批注说明数字来源和依据。
试了试把文档丢给Agent——它给我重写了一份。从头到尾。顺便还把排版也改了。
可以,我需要的不是一份被重新生成的文档,而是只在第三页第二段改点东西。
于是我想了个有点反潮流的事:
与其把 Word 丢给 Agent,不如把 Agent 塞进 Word。
然后我打开Codex(现在叫chatGPT)做了个 Word 插件。

后来有了自主 Agent,慢慢开始当甩手掌柜。描述需求,Agent 自己读项目、改文件、跑测试。代码正在越来越“放手”。
这条路走得通,因为代码有一个硬标准:能跑就是能跑。
文字工作不一样。
文字没有“编译通过”这回事。润色后的版本语法全对、逻辑通顺,但味道不对就是不对。“代码能跑”和“代码优雅”之间能差出一个雷军,文字更是如此。
所以处理文字时,我越来越觉得:这事也许得反过来。
不要把 AI 当成许愿机,把它用成手术刀。
Agent 就在 Word 右侧,知道我正在处理哪份文档、选中了哪段文字。
选中一段文字,旁边冒出来一个很轻的入口,叫“问 Agent”。

不主动打断用户,需要时再把 Agent 叫出来。
更多时候,你选中文字只是要复制、删除,或者做 Word 自己的事。只有主动点它,才输入要求,比如:
改成给管理层汇报的口吻,保留事实,压缩到两句话。:
它改的就是你选中的那一小段,改完还在原位,还是 Word 的修订模式留痕。 你不需要从聊天框里再把结果搬回来。
AI 不是接管整份文档。
它是那把手术刀。
真实办公很少只靠一份文档。
填采购申请表,依据可能在需求说明和供应商报价里。写项目汇报,信息散落在会议纪要和上一版方案中。审协议,要对着模板看业务材料。
你要的不是让 AI 给你新写一份。
是把手头这份继续做完。
所以插件里加了“引用文件”。DOCX、XLSX、PPTX 或者文本,都能作为只读上下文交给 Agent。当前打开的 Word 始终是编辑目标。

参考文件提供依据,当前打开的 Word 才是编辑目标。
你可以说:
根据引用资料,填写当前文档里的采购申请表。没有依据的字段留空,标明来源。
Agent 会先在引用材料里搜依据,需要时再分页读取,然后把结果落到当前 Word。
参考文件只读,当前文档可编辑。
边界清楚。
长文档的检查,也不该只输出一篇悬在聊天框里的分析报告。
插件里有一层快速体检:占位词、重复标点、异常空格、过长段落。
也可以让 Agent 分页深入读,检查逻辑、事实一致性、数字和单位、术语用法、结构风险。

发现问题后,可以定位回原文,也可以继续做深度诊断。
发现问题,定位回对应原文。或者把建议一键转成 Word 原生批注。
诊断不是终点。
处理仍然在 Word 里发生。
目前,这还只是一个原型,还有好多BUG要处理。
超长文档的速度和上下文管理还能优化。跨文档填表需要更清晰的来源标注和执行预览。复杂表格和旧版 Office 也都有细节要补。
但做完之后,我越来越确定:
Agent 的下一步,不是拥有更多工具,而是进入人们已经工作的界面。
对写代码的人来说,那是 IDE。
对处理文字的人来说,是 Word。
你不用先把工作搬到 AI 那里,再把结果搬回来。Agent 应该理解眼前的文档、眼前的选区、眼前要动的这一刀,然后在合适的位置搭把手。
这也是我这个插件想验证的东西。
最后说个结尾。
熬夜搞完,我兴冲冲把插件打开,给我老婆演示:你看,选中这一段就能直接改,还能加批注、查问题、引用别的文件填当前表格……
她看了十秒,说:
“WPS 会员就有啊,借你用用?”
你以为自己解决了一个很难的技术问题,用户只会问:
所以,我为什么不用已经有的?
也好。
这句话替我定了下一阶段的产品课题。
我先去认真研究一下,WPS 会员到底有什么。
夜雨聆风