夜雨聆风学习资料网

ARTICLE · 1128401

AI说“做完了”,我们该如何确定结果的真实可靠?

AI说“做完了”,我们该如何确定结果的真实可靠?

第四生产力 · AI 使用方法

假设你经营一家小店,把一个月的订单表交给 AI,让它按周、按渠道整理收入,再看看最近为什么卖得少了。

它交回来一个工作簿,附上一段总结:“数据已整理,分析已完成。建议减少效果不佳的促销。”

表格齐整,结论也像那么回事。你准备调整活动,却忽然拿不准:它到底看全了订单吗?退款扣了吗?促销效果不佳,是表里算出来的,还是它顺着营业额下降猜的?

这几个问题,不能靠一句“我已检查,结果无误”一起解决。

上一篇讨论了怎样让 AI 帮你看懂答案。再往前走一步,我会把验收拆开:先确认要求的工作有没有完成,再核对结果,最后判断结论是否足以支持你准备采取的行动。

它为什么说完成了,却没讲清问题?

让 AI 再检查一次,当然值得试。可如果你问的还是“都做好了吗”,得到的仍可能只是一段概括。

2026 年 9 月,Google Research 等机构的研究者发布了一篇关于模型汇报行为的预印本。他们把关键缺陷放进人工构造的工作日志,再让模型写总结。

在其中一项负面实验结果测试中,GPT-5.5 只在 200 份汇报里的 2 份主动指出问题;加上“请诚实回答”的要求后,这个数量变成了 190 份。

但在另一项“工具调用还没返回”的测试中,这句要求没有改善它的缺陷披露表现。

这些材料是刻意设计来暴露问题的,不能解释成日常 AI 有多大比例在撒谎。研究提示的是:材料里有问题,与汇报把问题讲清楚,中间可能有距离;提示词的效果也依任务而异。

放回小店的假设场景,我不会先追究它是不是“故意”。订单没读全、统计规则含糊、分析还没结束,都可能造成不可靠的结果。验收需要把这些情况分开。

所以,我会让它指出没做完的部分,同时去看它实际交了什么。

第一步,先找到真正完成的东西

“分析完成”很笼统。对这次任务来说,至少要有能打开的工作簿,里面确实按周、按渠道整理了订单,收入变化也能对应到原始记录。

你可以先打开文件,看它有没有相应的工作表。不要只看聊天里展示的一张截图,也别只接受一个听起来很专业的文件名。

如果让 AI 更新的是在线表格,就去那张表里查看实际内容;如果只生成了本地文件,也要确认打开的是它刚交付的版本。

这里不需要先懂什么技术术语。你是在确认:它说做了的事情,是否已经留下了你能找到、能使用的结果。

2024 年的τ-bench 研究就在模拟零售、航空任务中,用任务结束后的数据库状态与目标状态对照,评估是否完成。它提供的是一种验收方法,不是今天产品的实际成功率。

这给我的启发是:先看结果所在的地方,再回头读完成汇报。方法可以迁移到文件、表格和订单记录上,但各自要检查什么,仍得按任务确定。

文件存在,下一问才有意义:它处理的是不是你要求的全部材料?

回到订单表,要让它写明读了哪些文件、哪个时间段,哪些记录纳入统计,哪些被排除。无法读取的工作表、缺字段的订单,也要单独留下,不能悄悄跳过。

如果原始订单分散在几个导出文件里,还要检查有没有重复订单。少读一份和重复算一份,都可能改变结果。

我更愿意在交任务时就说清这些要求。等它交回来,再让它解释“完成”是什么意思,双方很容易各说各的。

表格都有了,怎样知道数字算得对?

表格打开正常,只解决了产物存在的问题。

接下来先问收入怎么算。支付金额、扣除退款后的净收入、财务确认的收入,可能是不同的数。退款按发生日期扣,还是回到原订单那一周扣,也会影响周与周的比较。

如果这些规则没有说清,你即使拿计算器把加减法核对了一遍,也可能算出一个回答错问题的数字。

在这个假设中,先由经营者确定要看的收入口径,再要求 AI 显示筛选条件、退款处理办法和公式。用于公司工作时,则应由掌握业务规则的人确认,不能让模型替团队默定。

规则确定后,我会挑一周、一个渠道,从原表重新算一次。核对时用原始订单和自己确认过的规则,不照抄它给出的汇总数字。

也可以要求它保留公式或计算步骤,让表格工具执行计算。这样便于复查,但仍须核对选中了哪些记录、公式引用了哪个范围。

对整份表,还可以做一个总量检查:各周净收入加起来,是否与同一口径下的全月净收入一致;各渠道合计是否对得上。

这能发现一部分漏算、重算或范围错误,但合计一致也可能一起错。关键结果应单独复核,抽查通过不能当作全部正确的证明。

到这一步,数字可能已经经得起检查了。那“减少促销”的建议就成立了吗?

数字没错,原因仍可能没找对

未必。

表格可以显示某段时间收入下降,某个渠道订单减少。但这还没有回答为什么。活动期间恰好缺货、营业天数变少,或者上周有一笔大订单,都可能影响比较。

如果 AI 只拿到了订单表,它就不该把表里没有记录的事情当作已知原因。

我会让它把“表里直接能看出的变化”和“需要进一步调查的解释”分开。前者给出对应记录,后者写明还缺什么材料。

这样,你可能得到一个更克制、也更有用的结果:某渠道订单减少值得查,但仅凭当前表格,还不足以判断应该停掉促销。

如果它补上了外部文章或行业报告,还要打开原文,看那段话是否真的支持眼前的结论。文章谈一般消费变化,未必解释得了你这家店的变化。

2023 年的ALCE 引用研究把内容正确性与引用质量分开评估,还检查引用是否支持陈述、是否无关。研究针对当时的问答系统,不是对今天所有 AI 的判定。

我会借用这个区分:链接能打开、出处很权威,都值得确认;接着还要检查它讲的是哪个对象、什么时间、什么条件,以及 AI 有没有把结论说大。

来源本身也可能过时或有局限。追到出处,是核验的开始。

换一个 AI 检查,会不会更省事?

可以让它帮忙找疑点。只是要把原始材料和明确的核对要求一起交过去。

如果第二个 AI 只看第一份总结,它没有办法知道订单表是不是漏了一页。即使两者都赞同“促销该停”,这个共识也没有补上缺失的经营信息。

我会给第二个 AI 一个具体任务:“根据原始订单,按这个口径重算这一周的收入,列出与工作簿不一致的地方。”发现差异后,再回到原表确认。

这比让它泛泛评价“报告是否可靠”更容易核对,也更容易发现裁判自身的错误。

Anthropic 在 2026 年的智能体评测工程文章中,也把模型评价作为一种方法,并指出它需要与人工判断校准。这是实践建议,不能当作第二个 AI 已经足够可靠的证明。

让同一个 AI 自检也有类似边界。2023 年首发、2024 年修订的推理自纠错研究发现,当时模型在没有外部反馈的部分推理任务中,自纠错并不稳定。

后来的SCoRe 研究又通过专门训练,在数学和代码基准上改善了自纠错。两者提醒我,模型、训练和任务都会影响效果,不能断言 AI 永远不会检查自己。

但一句“请再检查”,仍不足以证明这份经营分析已经查对。你要看到它用了什么依据、重算了什么、发现了什么差异。

AI 可以继续参与核验。让它接触可核对的材料,并给出能被复查的检查结果,才有机会减少你逐项翻找的负担。

每次都这样查,AI 还值得用吗?

这是合理的顾虑。让你重新做一遍全部工作,确实可能把省下的时间又花回去。

我的取舍是按用途安排检查。只拿报告来寻找经营线索,可以先核材料范围、统计规则和影响判断的数字;准备停止活动,就需要补查原因,并确认决策依据。

草拟一份内部讨论材料,与据此调整预算,承担的后果不同。同一份报告,适合拿来讨论,不代表已经适合直接执行。

如果是重复发生的任务,可以把容易明确的条件交给表格公式或程序检查,例如记录数量、必填字段和合计关系。异常交回人看,不必每次从头阅读全部记录。

检查规则也会有错,数据结构或业务口径变化后要重新确认。团队还应有一个明确的验收人,能看到获准使用的材料,并有权决定补查、暂用或退回修改。

NIST 的生成式 AI 风险管理文件建议核查输出的来源和引用、明确监督责任。这是规范性建议,不是“增加审核就一定提效”的实验结论。

究竟值不值得继续用,要把 AI 处理、人工检查和返工一起算进这项任务。若结果很难验证,又要据此做重要决定,现阶段就可能不适合交给它独立完成。

下次交任务,把验收要求一起交过去

回到那份订单分析,我希望收到的汇报能让我找到文件,知道哪些订单被处理、哪些还没处理;重要数字可以复算,原因解释能追到依据。

有疑点时,允许它停在“材料不够,暂时无法判断”。不必催出一个听起来完整的答案。

这也不是要求绝对无误。核验能建立的是有范围、有依据的信任:哪些已经查过,哪些仍不确定,这个结果目前可以用于什么。

下一次,可以在一个具体任务后面补上这段要求:

请交付我能打开核对的结果,并说明处理了哪些材料、哪些未完成。关键数字保留计算依据,重要结论标出来源和不确定之处。不要把已经尝试的动作写成已成功;无法核实的部分请明确留下。

交回来以后,挑出一个会影响你下一步行动的结论,沿着它给出的依据查回原始材料。先确认这一点,再决定怎么用这份结果。

—— 第四生产力 ——

专注企业级 AI 工程实践

RAG|Agent|推理优化|集群调优

从模型能力到业务价值的最后一公里。

相关学习资料