ARTICLE · 1095319
FDE的第7步·AI评测真相:每步95%准确,十步只剩60%!
第7步 · 评测:每步 95% 准确,十步只剩 60%
上一篇我们说,权限要管住。这一篇说下一个问题:这套系统到底好不好?
很多人回答这个问题的方式,是当场演示一遍:输入一个真实需求,AI 跑通了,每一步都对。团队欢呼,客户点头,上线。三周后,投诉来了。为什么?因为演示只跑了一条路,而生产环境每天跑一百条路。一条路对,不代表一百条路都对。
不能靠感觉,要靠评测。而评测里藏着一个大多数团队都算错的数学题。
本篇新认知
每一步 95% 准确的流程,串十步只剩约 60% 的整体准确率,串一百步只剩 0.6%。演示验证的是单链,生产要的是复合可靠度。
这个数叫复合错误率,出自《AI Engineering》(Chip Huen)。0.95 的 10 次方约等于 0.60,0.95 的 100 次方只剩 0.6%。每一步你看着都挺准,串起来几乎全错。书里还有一句话更扎心:Agent 的自动化程度越高,失败的破坏力越大。
为什么单链跑通不算数
先看一道真实的评测题:让 AI 把 50 个人分进 30 间房,它分完 40 个人就停了,然后坚称"已完成"。没人要求它检查,它就自己给自己打了满分。
这类错误叫反思错误,是 Agent 失败四类里最阴险的一类。完整四类是这样的(《AI Engineering》):
1. 规划失败:调用不存在的工具、参数配错、目标跑偏,以及刚才那个自己骗自己的反思错误;
2. 工具失败:工具本身输出就是错的,或者压根缺工具,某类任务老失败,可能是缺了人类专家在用的那个工具;
3. 效率失败:步数、成本、耗时都比人工基线差;
4. 传递放大:复合错误率让每个小缺陷在长链路上指数放大。
所以评测的第一条纪律:按失败四类逐类建评测,不许混成一个笼统的"准确率"。 混在一起评,你永远不知道系统死在哪一环。

评测三步法:把"好不好"变成工程
《AI Engineering》给了一套完整的评测管线,落地就三步:
第一步,拆开评。 不只评最终输出,每个中间环节单独评。端到端 60%,是输入理解错了,还是中间生成错了,还是最后回写错了?不拆开,就归因不了。
第二步,定义"好"。 写评测指南:什么算好,带样例;更要写什么不算好,超范围的输入该怎么处理。注意一句话:正确不等于好。 LinkedIn 的案例,AI 回复"You are a terrible fit",事实判断正确,但它是个糟糕的回答。正确但伤人,就是不合格。
第三步,选方法和数据。 便宜的全量自动分类器打底,贵的 AI 裁判抽样复核。这里有个反直觉的数据:GPT-4 当裁判,与人类的一致率 85%,比人类互相之间的一致率 81% 还高。用 AI 评 AI 是可行的,但有两条红线:一是你必须能看到裁判用的模型和 prompt,看不见就不可信;二是验收方和交付方必须用同一个裁判,同模型、同 prompt、同打分制,否则分数根本不可比。

指标必须翻译成业务语言
这一步最容易被跳过,也是 FDE 和普通工程师的分水岭。
技术指标自己不会说话。事实一致性 80%,客户听不懂;但《AI Engineering》里给了翻译:事实一致性 80%,对应可自动化 30% 的客服请求;90% 对应 50%;98% 对应 90%。同一个指标,翻译成业务语言,客户马上能算投入产出。
还有一条要注意:比较评测里 B 比 A 赢 51%,这个胜率换算不成"多自动化多少工单"。胜率不等于业务价值,别拿排行榜的胜负去做成本收益分析。
三个红线,跳过必翻车
红线一:真实数据,可脱敏,不能不跑。 测试集必须从客户的真实聊天记录、历史工单、业务数据里生成,不能拍脑袋编样例。数据可以脱敏,但不能用编造数据替代真跑。为什么?因为公域基准已经被污染了:GPT-3 有 13 个基准超过 40% 的内容出现在训练数据里。公共基准的定位是帮你筛掉差模型,选不出最适合你业务的模型。选型终点永远是用客户真实数据自建评测。
红线二:不信 AI 自述,要可执行验证。 AI 说"我做完了"不算数,要 functional correctness:代码就跑单元测试,有客观结果的任务就对照结果。自述完成是最容易造假也最容易骗自己的信号。
红线三:评测管线自己也要被评。 同一管线跑两次,结果一致吗?AI 裁判温度设 0,评出的分数才稳定。连尺子都不准,量出来的数全是白忙。
小例子:一套客服 AI 的评测走查
拿一个脱敏案例把整条链走一遍。某公司做客服 AI,团队先从三个月真实对话记录里抽 500 条做测试集(红线一)。然后拆环节评:意图识别准确率、答案生成质量、敏感词拦截,逐环节建评测(三步法第一步)。定义"好"时专门写了反例:客户问退款政策,答案正确但语气生硬,判不合格(正确不等于好)。最后做翻译:生成质量从 82% 提到 90%,对应可自动化的工单从 35% 涨到 55%,客户当场拍板继续投入。整个过程中 AI 从不说"我觉得差不多了",每一步都有数。
⚠ 跳过会踩的坑
用演示代替评测,拿"跑通了"当"可用"。 演示验证的是单链,生产跑的是复合概率,95%^10≈60%,这条数学题不因为你的demo很顺就豁免。这是坑 1「Demo 到生产翻车」在评测层的根源。
评测做扎实了,下一个问题是:上线之后呢?灰度怎么放?指标怎么盯?什么时候才配"扩大"?第 8 步,上线不是终点:三类指标同时达标才扩。
本文源于FDE全流程培训资料阶段4章(合一AI效能实验室 出品)。
关注后回复【FDE】,领取全流程FDE工具箱🧰,含G1–G7门禁检清单。
上一步回顾:第08篇《第6步 · 给AI的权限,要像给实习生一样管》——人机边界三档+三层写回权限+留痕四件套。
本步:第7步,复合错误率+评测三步法+业务指标翻译+三条红线。
下一步预告:第10篇《第8步 · 上线不是终点:三类指标同时达标才扩》。
本文打法来源:合一AI效能实验室《FDE全流程落地方法讲解》课程内容及《AI Engineering》(Chip Huen)第3、4章;文中企业案例已脱敏。
我是合一,从用AI工具,到建AI系统,陪你同行。