没有评测集,AI调优全凭感觉。讲怎么建一套能量化、能回归的评测,把「我觉得」换成数据。
上周一个做客服机器人的朋友跟我吐槽:团队花两天重写了提示词,在演示群里发了几条对话,所有人都说「明显变聪明了」,当天就推上线。结果三天后客诉量不降反升——新提示词把高频的退款问题答得更漂亮,却把原本答得好好的物流问题带崩了。
他问我哪儿出了问题。我说:你们没出问题,你们只是从头到尾都没量过体温。
做过风控模型的人都有个本能:没回测、没在样本外验证过的评分卡,谁敢推上线?可一到AI应用,大家却心安理得地用「我觉得变好了」当上线依据。模型越强,这个坏习惯越危险——因为它每次都能给你几个惊艳的例子,让你误以为整体也跟着变好了。
AI应用真正缺的,往往不是更强的模型,而是一支能客观读数的体温计:一套评测集(eval)。

评测集就是AI应用的体温计:先能客观读数,才谈得上调优。
01为什么「我觉得变好了」会骗你
凭感觉验收AI,至少踩三个统计学上的老坑。
样本太小且有偏。 你在演示时盯着看的,通常是你最关心、最容易想到的那几个case。它们既不随机,也代表不了线上真实流量的分布。在5条精心挑选的样本上「全对」,推不出在5000条长尾请求上也对。
确认偏误。 改完提示词,你是「带着期待」去看输出的。同一段回答,你想证明它变好,就总能找到变好的理由。人脑不是中立的裁判。
改A坏B(回归)。 这是最隐蔽的一个。提示词、模型、检索参数任何一处改动,都可能在你没盯着的地方制造新的失败。没有全量回归,你永远只看得见自己想看见的那部分。
这三个坑,靠「多看几眼」是堵不住的,只能靠把验收过程数据化。

评测闭环:它不是一锤子买卖,而是一条越跑越密的回归网。
02第一版评测集:先有,再好
很多团队迟迟不建评测集,是被「要做就做全、做标准」吓住了。这恰恰搞反了。评测集是会持续生长的资产,第一版的唯一目标是「有」,不是「全」。
从哪来: 别凭空造。最好的来源是线上真实的失败对话和客诉——它们天然就是模型现在答不好的地方。捞个二三十条,就能开张。
怎么分层: 我习惯把评测集分成三层。冒烟层(几条最基础的,挂了说明彻底崩了)、核心层(覆盖主营业务的高频场景,占比最大)、对抗层(刁钻输入、越权诱导、明知会错的边界)。三层的通过率要分开看,不能混成一个平均分——平均分会把核心场景的退步,藏在对抗层的波动里。
每条长什么样: 一条合格的样例,至少要有「输入 + 判定标准」。判定标准不一定是标准答案,可以是「必须包含退款时效」「不得承诺人工无法兑现的事」这种可检查的条件。
记住:100条粗糙但能跑的样例,价值远大于一份永远停留在规划里的「完美评测方案」。
| 判分方式 | 适合什么 | 成本 | 可靠性 | 主要坑 |
|---|---|---|---|---|
| 精确匹配/正则 | 答案唯一、格式固定(分类、抽字段) | 极低 | 高 | 稍有措辞变化就误判为错 |
| 结构化断言 | 要求JSON字段、数值范围、必含关键词 | 低 | 较高 | 写断言要花心思,覆盖不全会漏判 |
| LLM裁判 | 开放生成、要判「好不好」而非「对不对」 | 中高 | 中(需校准) | 会偏袒、会漂移,裁判本身也得被评测 |
三种判分方式各有适用面:能用规则就别上LLM,但开放生成绕不开裁判。
03让大模型当裁判,但谁来裁判裁判?
开放式生成没法用正则判分,于是越来越多团队用一个大模型去给另一个大模型的输出打分(LLM-as-judge)。这条路能走,但裁判本身会犯错,而且错得很有规律:
- ●位置偏好: 做两两对比时,它倾向于选靠前(或靠后)的那个,跟内容无关。
- ●自我偏袒: 让某个模型当评委,它常给「同门」风格的回答打高分。
- ●打分漂移: 让它打1到10分,你会发现尺度随时间、随批次飘,今天的8分不等于上周的8分。
几个能立竿见影的治法:给裁判一份明确的评分细则(rubric),把「好不好」拆成可勾选的条目;能用二元判定(达标/不达标)就别用连续打分,前者稳得多;两两对比时把顺序随机化、并正反各跑一次抵消位置偏好;最关键的一条——定期抽一批裁判的判定结果让人工复核,先确认「裁判准不准」,再信它给业务模型打的分。裁判没人裁判,整套评测就是建在流沙上。

同一组改动,盯着挑出来的样本一路上扬,全量评测却在v3悄悄回落——回归就藏在这条没人看的线里。
04写在最后:把体温计接进流水线
评测集最大的误解,是把它当成上线前的一道额外负担。恰恰相反,它是你这个AI应用里复利最高的资产之一:每修一个线上bug,就把对应的失败case沉淀进去,评测集越用越聪明,你的回归网越织越密。
三条可以今天就动手的takeaway:
- 1先量再调。 任何提示词/模型/参数的改动,都要在固定评测集上跑前后对比,看的是整体通过率,不是几个挑出来的例子。
- 2分层看分,别看平均。 核心场景退步、对抗场景上升,平均分可能纹丝不动,但你的主营业务已经在流血。
- 3接进CI做回归。 让评测像单元测试一样,每次提交自动跑;通过率掉了就拦住,别等客诉来告诉你。
更强的模型每隔几个月就会来一茬,但能告诉你「到底有没有变好」的,永远是你自己那支体温计。先把它造出来。
• • •
💬 你给AI应用调优,靠的是评测集还是「我觉得」?
觉得有用,点个【在看】,或转发给用得上的人;你的做法和经历,欢迎留言区聊聊 👇
夜雨聆风