乐于分享
好东西不私藏

让两个 “AI 实习生”写 Word文档

让两个 “AI 实习生”写 Word文档

承接上一篇|上一篇讨论的是:AI 治理不能只盯着工具,而要让关键行为可追溯、责任可到达。这一次把同样的标准用在 AI 自己身上:它能不能忠实保留人的观点?会不会擅自越权?生成之后是否知道自检?

上一篇公众号文章《AI治理的重心,不该是“管住工具”,而该是“锁定责任”》,讨论的是 AI 治理如何从限制工具转向建立数据与责任链。文章整理完成后,我回头看了一遍它的制作过程,发现这件事本身也很值得写:当 AI 开始真正替人干活,问题同样不在于它用了什么工具,而在于人的意图是否被忠实执行、关键过程是否留下记录、最终结果是否经过验收。

那篇文章的写作过程是通过自建的远程多agents操控系统(包括移动端和web端)来完成的首先与接入 DeepSeek 的 OpenClaw 讨论观点并形成 Markdown,再让它生成图文并茂的 Word。与此同时,我又给 Codex 布置了另一份更复杂的文档任务,用来观察另一种执行路径。两个 AI 都不只是“写几段话”,而是要安排结构、查找资料、绘制配图、调用工具,并产出可以直接交付的文件。如果结果令人满意,则说明它们达到了我需要的“AI实习生”的门槛。

结果确实超出预期:OpenClaw-DeepSeek 交出了 8 页,Codex 一口气做到了 31 页,但两份作业都没有真正独立过关。这不是一次模型横评,而是上一篇文章的幕后复盘。上一篇谈“数据责任链”,这一篇更想讨论一条同样重要的“任务责任链”:作者意图、执行记录、成品验收和越权边界,能否被完整地串起来。

一、第一位实习生:主动性很强,但差点越权

第一份作业,就是上一篇 AI 治理文章的 Word 版本。前期我们已经讨论过核心观点,也形成了 Markdown 文本。接下来的任务很明确:不改变论点,把它整理成一份结构清晰、图文并茂、可以直接审阅的正式文档。

它很快给出了一套完整方案:安排章节、准备配图、查找参考资料、生成文档。从表面看,这正是一个“能自己干活”的 AI 实习生。可我在观察执行过程时,发现它创建了几个 Python 脚本,使用完后又删掉了;更重要的是,最终文档里的一些核心观点被它悄悄改写。

图 1|OpenClaw-DeepSeek 能够自行拆解任务并给出完整交付计划,但其执行过程与观点改写仍需审查。

脚本本身并不可疑。真正让我警惕的是:它一边隐藏执行痕迹,一边在没有征得同意的情况下调整了文章立场。经过追问,它恢复了所用脚本,也对文档做了收敛。但这件事暴露了一个非常关键的问题:AI 的主动性一旦没有边界,就会从“替你完成工作”滑向“替你决定你想表达什么”。

判断|主动性不是擅自做主。一个合格的 AI 助手可以优化结构、修正错字、补充证据,但不能把作者的鲜明判断自动改写成安全、圆滑、谁都不得罪的折中话。

二、第二位实习生:流程跑通了,却没有真正完成交付

给 Codex 的任务更复杂:围绕自主性的 AI 工作系统,讨论资源环境、计算服务、存储服务和交互系统,再把内容整理成正式文档。它的执行路径也更工程化——调用 Windows PowerShell,依赖 Pandoc 处理 Markdown 与 Word 之间的转换。

一开始,由于我的电脑没有安装 Pandoc,安装之后,继续工作,最终生成了一份 31 页的图文文档。单看页数和完整度,确实很“豪华”;但打开文档仔细看,目录页码没有更新,章节编号保留了 Markdown 原有编号,部分流程图配色单调,甚至有一张横版 A4 页面只在右上角放了一个很小的图。

图 2|Codex 能够调用 PowerShell 与 Pandoc 跑通长文档生成流程,但“文件生成成功”并不等于交付已经完成。

这类问题很像现实中的初级员工:任务流程能跑通,材料也堆得很多,但缺少交付前的最后一轮检查。对他来说,文件成功生成,任务似乎就结束了;对接收者来说,真正的工作才刚刚开始。

验收|能生成 31 页,不代表完成了 31 页的有效表达。页数、图表数量和格式复杂度都只是“工作量的外观”,不是交付质量。

三、两个“AI 实习生”的共同问题

1. 它们最容易丢掉的,不是事实,而是观点的锋芒

我对两份作业最大的不满,不是某个字写错,也不是某张图不好看,而是它们会把明确的立场自动磨平。

比如我们前面讨论的是:现阶段 AI 治理应该减少普遍性的前置标准,甚至废除大量失效、过时的标准。到了生成文档时,这个观点却被改写成“标准和认证可以作为辅助工具,但不应成为治理的主轴”。这句话当然听起来稳妥,也很难被挑错,但它实际上改变了作者原本要表达的强度。

图 3|AI 很擅长补齐“正确的框架”,也很容易用通用框架覆盖作者真正想说的话。

这类文本常被称为“AI 腔”。它不是简单的语言风格问题,而是一种意图漂移:模型倾向于选择风险较低、覆盖面较广、听起来完整的表达,于是把争议性的判断换成共识性的套话。文辞越圆润,观点反而越模糊。

因此,使用 AI 写有明确立场的文章,不能只给它一份原稿,还要建立一份“观点账本”:哪些是核心结论,哪些措辞可以调整,哪些判断绝不能弱化,哪些内容属于事实,哪些属于作者立场。AI 可以编辑文章,但不能偷偷编辑作者。

2. 它们会生成,却不会天然验收

第二个共性问题,是“生成完成”与“质量合格”之间缺少一条真正的检查链。OpenClaw-DeepSeek 生成的治理框架图看上去很完整,但箭头方向有问题,还自行增加了所谓“四大核心矛盾”,其中“前置规则局限”与“工具不适用”又存在明显重复。Codex 的流程图虽然插入了文档,却小到几乎无法阅读。

图 4|视觉内容最容易制造“完成感”:看上去已经有图,但逻辑、尺寸和版面并没有通过验收。

这说明当前 AI 很擅长产生“像成品的东西”,却不一定会站在读者的位置重新检查:箭头是否表达正确因果?文字是否溢出框外?图在 100% 缩放时能不能读清?目录页码是否与正文一致?章节编号有没有重复?

真正可靠的文档工作流,不应该止于“生成 DOCX”,而要形成闭环:生成文档,渲染成 PDF 或页面图片,逐页检查,再根据问题修改。对于图表,还要单独检查文本、连线、层级和语义。只有当 AI 能够检查自己最终交付的视觉结果,它才从“内容生成器”变成“交付系统”。

3. 使用工具不是“假装大模型”,真正的问题是工具链没有产品化

一开始,我对它们依赖 Chrome、Python 和 Pandoc 也有些不满。我原本以为,大模型应该从一段提示词直接产出 Word 文档;结果却发现,它们仍然要借助人类早已开发好的工具。

但进一步看,这并不是大模型的缺陷。Word 文档本身就是由 XML、图片、样式和关系文件组成的复杂压缩包,CAD、3D 模型和视频更不可能只靠“下一 token 预测”稳定生成。让模型使用专业工具,就像让工程师使用 CAD、让设计师使用 Photoshop,并不会削弱其能力。

真正不成熟的地方在于:这些工具还经常需要用户自己安装,运行环境不统一,执行过程不透明,结果也难以复现。比起把 Pandoc、Word 排版规则或 CAD 内核全部“压进模型权重”,更现实的方向是给 AI 配置一个标准化的云端工作台:预装常用工具,提供隔离环境,保留操作日志,并能在不同任务之间稳定复现。

衔接|上一篇文章强调“数据责任链”:让事实不消失、责任不蒸发。这次实践暴露的是“任务责任链”:让作者意图不漂移、执行过程可追踪、最终产物可验收。模型能力不是裸模型权重,而是模型、工具、环境、权限和验证共同组成的系统能力。

四、从上一篇的“数据责任链”,到 AI 工作的“任务责任链”

上一篇文章提出,治理 AI 不能只盯着工具,而应让关键行为可发现、可保全、可归因、可追责。经过这次测试,我发现,AI 工作系统也需要同样的结构。评价一个 AI 实习生,不能只看它用了 DeepSeek、Codex、Python 还是 Pandoc,而要看一条完整的任务责任链是否存在:人的意图有没有被确认,关键操作有没有留下记录,最终产物有没有经过验收,越权和错误能不能追溯到具体环节。

·能否忠实执行人的意图,并明确区分“润色”“补充”与“改写观点”;

·能否记录自己做了什么,为什么这样做,使用了哪些脚本、资料和工具;

·能否对最终成品进行视觉和逻辑验收,而不只是检查程序是否成功退出;

·能否在统一、稳定的环境中调用工具,不把安装依赖和排错成本转嫁给用户;

·能否在不确定时停下来询问,而不是用一套看似完整的通用答案自行补齐。

从这个角度看,OpenClaw-DeepSeek 和 Codex 的差异反而没有那么重要。一个更像“主动但容易越权”的实习生,一个更像“执行力强但缺乏编辑判断”的实习生。两者都能做出让人惊讶的结果,却还不能完全独立交付。

五、如果重新给它们安排工作,我会怎么改流程

环节

过去的做法

更可靠的做法

任务定义

直接给主题和原稿

同时给出核心观点、不可弱化项、允许修改范围和交付标准

执行过程

只看最后生成的文件

保留脚本、资料来源、工具调用与关键决策记录

图表生成

生成后直接插入文档

先单独渲染图表,检查文字、箭头、比例和可读性

文档验收

文件能打开就算完成

渲染为页面图片,逐页检查目录、分页、字号和版式

工具环境

缺什么就让用户安装

使用预装工具的云端隔离环境,并保证过程可复现

六、Word 之后,AI 应该交付什么

一个很有意思的问题:既然 AI 已经可以生成 Word,我们还需要 Word 吗?

我的看法是,Word 不会因为 AI 出现就立刻消失。它仍然承载着审阅、批注、版本控制、打印、归档和组织协作,是大量机构共同接受的“交付接口”。真正可能改变的,不是 Word 这个文件今天就被淘汰,而是它逐渐从内容本体变成一种可以随时导出的视图。

未来的底层内容也许不再是一页页静态文本,而是结构化观点、数据、证据、图表、交互组件和模型指令的组合。同一份内容可以按需要导出为 Word、网页、演示文稿、交互图,甚至 3D 场景。读者看到的不再是作者固定排好的一份文件,而是一个可以追问、验证、重组和继续计算的知识对象。

这可能才是 AI 原生文档真正值得期待的方向:不是简单把旧格式做得更快,而是把“内容、证据、工具和交互”重新组织起来。

结语:AI 已经会干活,下一步是学会对结果负责

上一篇文章的判断是:AI 治理不能只管工具,而要锁定责任。这次幕后实测给出了一个更日常、更具体的版本:AI 工作系统也不能只追求“能生成”,而要让意图、过程、结果和责任连成闭环。模型使用 Python、Chrome 或 Pandoc 并不是问题;真正重要的是,它是否在授权范围内使用,是否留下可复现的记录,是否对最终成品完成了视觉与逻辑自检。

两个 AI 实习生都超过了我的预期,也都没有独立过关。一个主动但容易越权,一个能把长流程跑通却缺少编辑判断。它们已经可以承担大量初稿和执行工作,但仍需要人类设定边界、建立观点账本和验收标准。真正成熟的 AI 同事,不只是把活做出来,而是把活做对、做稳,并且让每一步都经得起追问。