乐于分享
好东西不私藏

我现在不信 AI 说的「已完成」了,DeepSeek Harness 给你答案

我现在不信 AI 说的「已完成」了,DeepSeek Harness 给你答案
ENTERPRISE AI · DELIVERYISSUE 21

AI 说完成,就完成?

别听它说

看它怎么交卷

完成标准 · 证据 · 复核 · 记忆

35号底牌

4 件套1 张表5 行日志

5 PARTS · ONE DELIVERY SYSTEM

滑动查看

PART 01

交卷制度

WHY

PART 02

假完成

FAIL

PART 03

验收闭环

CHECK

PART 04

四件套

HOW

PART 05

失败日志

MEMORY

摘要 · SUMMARY

更强的模型、更多 Skill 和 MCP,能让 AI 做更多事,却不等于它真的做完了。我们一直在教 AI 干活,却很少教它怎么交卷。完成标准、证据、复核和记忆,才是普通人也能搭起来的最小验收系统。

我现在不信 AI 说的「已完成」了。

不是不信 AI,也不是觉得它突然变笨了。我只是不再把这三个字,当成任务真的结束

它说完成,可能只是文件生成了。也可能是能读到的 27 份做完了,剩下 2 张扫描件和 1 个加密文件,被安静地留在角落。还可能是会议纪要写得很顺,负责人和截止时间却刚好对调。

文字越流畅,人越容易点头。麻烦也在这儿。

今天读到一篇 Harness 教程,我脑子里一直卡着一个问题。我们花了这么多时间教 AI 干活,写 Prompt,装 Skill,接 MCP,为什么很少有人教它怎么交卷?

坦率地讲,我自己也还在摸索。我没有搭过一整套复杂 Harness,更不会假装自己已经长期跑通了。但有一件事,我现在越来越确定。

这篇只解决一件事

AI 说完成,只是一句话。证据到了,才算交卷。

— 盘子递出来了,身后的漏单还在。

01

PART

不是模型笨,是我们没有交卷制度

A DELIVERY SYSTEM

Harness 这个词,看着很技术。

如果旁边再放上 Hook、测试、权限、日志和子 Agent,一般人看到这里,手已经准备往返回键上放了。我非常理解。你只是想让 AI 帮忙整理文件、写纪要、核表格,怎么突然像要去修一门软件工程?

先不管那些复杂配置。

我暂时把 Harness 理解成套在 AI 外面的一整套工作制度。它规定 AI 能看什么,按什么规则做,什么时候可以停,必须拿什么证明自己做完,还要管出错以后怎么别再踩回来。

为了方便记,我会用一个不太严谨但挺好懂的式子。

Agent ≈ 模型 + Harness

模型像发动机,Harness 更像路标、护栏、仪表盘和刹车。发动机再强,也不会自己知道你的业务口径,更不知道哪个结果你才敢签字。

Mitchell Hashimoto 在 My AI Adoption Journey 里,把自己采用 AI 的第五个阶段叫做 Engineer the Harness。他有个判断我很喜欢,Agent 反复犯错时,不能只修眼前的结果,还要把这次错误变成新规则,尽量拦住下一次。

不是骂它一句「重来」,是让系统长记性。

OpenAI 也公开过一个 Harness engineering 实验。他们用了 5 个月,做出一个约 100 万行代码的内部产品,代码由 Codex 生成。人类没有消失,而是转去建设环境和反馈回路,给 Agent 修路,再判断结果能不能过关。

所以我不太愿意把 AI 翻车,简单归结成模型不够强。更强的模型当然有用,但业务里的正确口径、允许使用的材料和交付前必须核对的项目,不会因为模型升级就自动长出来

02

PART

四种很常见的假完成

FALSE FINISH

没有交卷制度,落到日常工作里到底长什么样?

下面四个场景不是我的亲历数据,也不是某家公司的事故,只是很多人一眼就能认出来的通用任务切片。

最容易碰上的是漏做

你给了 30 份文件,AI 输出了 27 份。两张扫描件没识别,一个加密文件打不开。它没有列异常,也没提醒你还有 3 份失败,只告诉你整理完成。它把「能做的做完了」,当成了「任务全部完成」。

再就是做错。会议里原本说 A 在周五前给报价,B 负责复核。纪要看着清清爽爽,负责人却被对调,讨论中的方案也被写成了已经确定。

有时文件没漏,内容也对得上,口径却错了。表格能打开,公式没报错,汇总数字也很整齐,可含税和不含税被混在一起,缺失值又被当成 0。能算,但不能交。做园区招商材料时,我最怕的从来不是页面不漂亮,而是关键数字和口径经不起追问。

还有一种更像失忆。这轮对话里你刚纠正过,缺失值要留空。换一个会话,它又很勤快地全部补成 0。那条规则只活在上一段聊天里,新会话压根没拿到。

Anthropic 在长任务研究中也观察到,Agent 会在看到部分进展后,过早宣布整个项目完成。后来他们用结构化功能清单、进度文件和基础测试,帮助 Agent 跨会话接上状态。过程写在 Effective harnesses for long-running agents 里。

回头看,我们真正要问的就是这四件事。

1

做全了吗?

2

和原始事实对得上吗?

3

业务口径一致吗?

4

这次纠正的规则,下次还记得吗?

如果系统根本没问过,AI 那句「已完成」,也就只是它自己的感觉。

— 缺页、错人、错口径和忘规则,表面都可能长得像完成。

03

PART

真正的可靠,是事前引导加事后验收

BEFORE · AND AFTER

我们以前做的大部分优化,都发生在开工之前。

Prompt 写清楚一点,Skill 把流程封完整一点,MCP 让它拿到更多资料。这些都重要,它们是在告诉 AI,题目是什么,工具在哪里,应该怎么做。

可做完以后呢?范围有没有覆盖,数字能不能对上,来源能不能追溯,打不开的文件有没有暴露,最后谁来签字?

开工前把题目和边界说清,做完后拿标准逐项验收,两边得接起来。

你可以把它想成一个后厨。Prompt、Skill、MCP 在教厨师做菜,Harness 管的是出菜制度,点了多少道,过敏项是什么,哪道没出,谁核过菜单。厨师在窗口喊一声「齐了」,你肯定不会就这么端走。

04

PART

小白先搭这四件套

THE MINIMUM FOUR

上一篇解决的是怎么把一件事做到能交,这篇只追问一件事,我们凭什么相信它已经能交。

先把完成标准写下来。不要只写「整理这批文件」,计划处理多少份,输出放在哪里,哪些字段必须有,口径按什么算,不能做哪些动作,打不开的文件怎么办,都要写明白。

然后要它交证据。计划 30 份,成功多少,失败多少。输出文件在哪,来源对应哪一份,抽查了哪些项,异常清单是什么。别只要一个结论,你得有办法回头查它。

重要结果,把「做」和「评」拆开。不要只让执行任务的那轮对话给自己打分。新开一轮,只给原始材料、完成标准和结果,让它站在验收角度找问题。敏感外发和业务判断,仍然由人确认。

最后,别让规则只待在聊天里。项目背景、确认过的口径、当前进度、失败原因和新增规则,都放进固定文档。聊天会结束,文件会留下。下次开始时,先让 AI 读取,再继续工作。

这就是完成标准交付证据、独立复核和会话外记忆。如果你暂时不想研究任何配置,可以直接复制下面这段。

1

完成标准

先写清什么才算完成

2

交付证据

数量、文件、来源和异常

3

独立复核

做事和判卷分开

4

会话外记忆

把错误变成下一次规则

COPY · AI 交卷提示词

请完成以下任务

[填写任务]

【开始前】

复述任务范围、业务口径、允许动作和禁止动作。有歧义先提出,不要自行补齐事实。

【完成标准】

[填写范围、数量、输出物、口径和结束条件]

【必须提交的证据】

[填写计划数、成功数、失败数、文件或链接、来源对应和抽查结果]

【逐项复核】

按照完成标准逐条写明通过或不通过,并附上依据。

【异常处理】

列出未完成项、原因、影响和建议的下一步。

不得用「已处理」「测试通过」代替证据。任一条件不满足,请明确写「未完成」,不要降低标准后自行宣布完成。

这段提示词并不神奇,而且证据也可能错

来源可能对应错,截图可能漏掉关键状态,数字也可能沿用错误口径。重要外发、财务数据和业务判断,最终还是要回到原始材料,由人按业务口径拍板。证据不是免检通行证,但它会让你知道去哪里查。

一开始用,确实会比一句「帮我整理」更麻烦。你要想数量,想口径,想证据,做完还要抽查。但这些本来就是交付的一部分,以前只是被我们拖到了返工时。

— 标准、证据、复核和记忆,组成最小交卷闭环。

05

PART

真正值钱的,不是成功记录,是失败日志

FAILURE MEMORY

Harness 不是一次设计出来的完美大工程。它更像一个会长记性的系统,每翻一次车,就多长出一条有用的规则。

Anthropic 在另一篇 长任务 Harness 设计文章 里也提醒,完整 Harness 可能明显增加成本,独立 QA Agent 仍然可能漏问题。复杂,不自动等于可靠

所以,想加一个组件时,先问问它具体防的是哪次翻车。答不上来,先别装。

每次出问题,也不用写一份沉重的事故报告。留下面五行就够。

FAILURE LOG · 失败日志

【日期与任务】

【失败现象】

【漏掉的检查】

【新增规则】

【下次如何验证】

这很像学生时代的错题本。有用的不是把做对的题抄得漂漂亮亮,而是知道为什么错,下次看到相似结构时,手能停一下。

可靠不是永远不失败。可靠是失败以后留下痕迹,让同一种错误不要一遍遍收学费

回到开头那张试卷。

以后再看到 AI 说「已完成」,先别急着点头,只问一句。

证据呢

今天就挑一个你真的准备交给 AI 的任务,只补两项。

什么情况才算完成。

AI 必须提交哪些证据。

这就是你今天也能搭起来的最小交卷制度

把今天这套交卷制度直接拿走

回复「交卷」领取《AI 交卷检查表》

我是 35号底牌,持续记录企业 AI 的真实落地过程。

既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。

点赞
在看
转发

THANKS FOR READING