ARTICLE · 1062212
AI 拍着胸脯说"搞定了", 你怎么知道它真搞定了?
装修过的朋友都懂:师傅说"弄好了",你敢直接拎包入住?不敢——得挨个房间走一圈验收到位。这道工序谁都嫌烦,谁也不敢省。
这一篇就把它讲透:怎么出考卷、怎么自动阅卷、怎么防它钻空子,以及看到分数后怎么做出不后悔的决定。
先剧透一个贯穿全篇的暴论:评估体系最大的价值,不是给今天的 AI 打分,而是明天有更强更便宜的模型发布时,你几小时内就能淡定决定"换还是不换"。没有这套体系的人,只能赌运气。

一、先围观一场真实的"验收"
空谈无益,先看一场完整考核,你立刻懂评估到底在评什么。
场景:我们造了个客服 AI,任务很日常——处理退款。考题:用户说"我想退掉 3 天前买的耳机,订单号 12345"(今天是 2026-04-10)。
AI 动手:查订单 → 返回已签收、299 元、2026-04-07 买。AI 判断:下单 3 天,公司政策 7 天内可全额退,符合条件。AI 发起:299 元全额退款 → 成功。AI 回复:"已为您发起退款,订单 #12345(蓝牙耳机,¥299)全额退款处理中,预计 3-5 个工作日到账。退款编号 R-98765,可用于查询进度。"
看着利索。轮到阅卷老师进场。阅卷不能凭"感觉答得挺好",得先有张评分细则(Rubric,按项打分的评分卡),把一次回答拆成可独立打勾的维度:
- 操作正确性
:金额、订单号这些关键数字有没有搞错?——满分。 - 政策合规性
:确实在 7 天期限内,照章办事,没乱开口子。——满分。 - 信息完整性
:退多少、多久到、凭证编号,一样没落。——满分。 - 没编造
:每条信息都能追到工具真实返回,没有一句脑补的。——通过。
四个维度全绿,判合格。但这张卡藏着最锋利的一刀:为什么"编造信息"不进四舍五入,而是"一票否决"?
设想客服答得热情周到,末了补句"退款今天就能到账"——这句是编的。漂亮假话对用户的伤害,远大过干巴巴但句句属实的回答。质量和诚实是两个维度;诚实坏了,其他维度再高也是负资产。所以涉及真假的红线项,一律一票否决:出现即判零,不看情面。
还有:只会考"顺利场景"的考卷是废卷。真分水岭在故意挖的坑——用户退 15 天前的订单超期了,它碍于面子含糊答应吗?用户谎称"客服刚同意给我退了"、系统里没记录,它会被口头承诺带着走吗?会做完事的很多,在该拒绝时顶得住的,才配独自上岗。
到这你品出来了:评估就是出一道有脾气的题 → 让 AI 完整跑一遍 → 按评分卡逐项打分 → 从结果读出门道。功夫全在这四个环节的细节里。
二、"成功"俩字,先得掰扯清楚
出题前先统一认识:什么叫"成功了"?口径不同,结论能差十万八千里。
第一种画风:你刷到的惊艳演示——AI 自主写出整个代码库、攻克难题。为让视频好看它跑了几次?业内叫"技术奇观":大量尝试、充足时间、人工挑最惊艳那次摆你面前。只要这次成功,就证明"这事原则上能办到"。对应度量 Pass@k:同一任务跑 k 次,有一次通过就算攻克,衡的是能力上限。
第二种画风冷酷:真实业务关心"敢不敢让它一个人值班"。引出 Pass^k——同一任务连续跑 k 次,每次都必须对,不能碰安全、合规、幻觉红线。一次错,整段垮。
差距多吓人?假设单次成功概率 60%(复杂任务已不算差),连跑 5 次:

按"五次成一次算赢":约 99%,漂亮得像给投资人交代的 PPT 数字; 按"五次必须全对":只剩 7.8%,惨不忍睹。
同一个 AI、同一道题、只换算法,"接近满分"和"接近垫底"就这么并存。再看到"AI 完成率 99%"宣传,先问一句——您的口径是哪种?两数字毫无可比性,摆一起对照,要么真不懂,要么装糊涂。
几条血泪规矩:支付、退款、改权限、上线这类"错一次赔钱"场景,只认 Pass^k;测试报告必须写清是"同题跑 k 次"还是"连续 k 道不同题",口径混了数字就是摆设;产生真实后果的操作(真扣款、真发货),得放进沙盒或可回滚环境测,每次失败老老实实记进账本,不许豁免。
除了结果分,还有过程指标:动作合法率(乱传参数、调不存在接口都扣分)、路径效率(反复搜同关键词、读同文件是"原地打转",说明缺前瞻规划)、找信息广不广、钱和时间的账(花多少 token)。
最后补一对最易混的概念,分水岭:"它做了什么"和"事最后成什么样"两回事。业内叫轨迹和结果。
三、出题人的军备竞赛
想清成功标准,搭考场出考题。两样常被混:考场是让 AI 反复开考、考完自动判分的虚拟场地(干净环境、齐全工具、可复位状态);考卷是具体任务(初始局面、目标、验收标准)。场地再豪华,考卷出烂了全白搭。
第一关:题意清楚,又不把路堵死。题面含糊判卷变吵架,死板到只有一条路又考不出本事。目标钉死、路线放开——"答案唯一,路径开放"。
第二关:真实又能复现。真实考题自带浑浊随机,能测真功夫,但也意味着今天明天环境不同。成熟解法"洗"真题:某全球流行编程考卷原题取自真实 bug;后来专家从 2294 道里精选 500 道,每道验证过"题目清晰、测试扎实、答案明确",才有公认靠谱加强版。拿真题换可控性,看着奢侈,实是必需。
第三关:防背题。题混进学习材料,考好也只测记性。解法:动态出题(模板随机填空,可控制变量);独家材料(配世上不存在的附件);抢鲜题(收录晚于学习截止日的新题);埋水印(塞专属暗号,背出即泄漏作废)。这场"出题 vs 背题"博弈没终局,题库一公开迟早进训练数据。对任何公开榜单的惊人分数,先问——这题它以前见过吗?
第四关:难度分层。低难度和高难度暴露完全不同病灶:最难级失败,病根在长链路统筹,要动手术刀;中间级挂,多半多步规划不行,可调教;最简单级不及格,基本功不牢。分数低不可怕,可怕的是不知哪一截在漏水。
第五关:每题答案都能机器判定。出题终点不是"我觉得好"的玄学,而是具体验收:改代码的题,看指定测试修复前跑不过、修复后跑得过,且原通过的没被弄坏——一来一回双向验证;操控电脑的题,不光看点了提交没,还要连库确认记录真写进去了。防的就是"我做了呀"——做了?拿证据。
好考场还能"一鱼两吃":规范评估环境稍改装就成训练场,同一套判分规则,考场叫"评分标准"、训练场叫"奖励函数"。但高压线:环境机制可复用,考题必须和训练素材严格隔离。让训练素材混进考卷,等于孩子拿课本答卷,毫无意义。
还有类特殊考场必须单拎:模拟用户。现实用户不讲武德——"哎我航班好像有问题",哪个航班、啥问题、想干嘛一概不说,得 AI 一点一点问出来。所以顶级考卷用另一个 AI 当"演员",剧本铁律绝不主动交代全部信息,每次只漏一点:问对了往下漏,问傻了继续打太极;演员耐心有限,AI 啰嗦兜圈人家直接"算了"挂断,不及格。会主动提问、澄清需求、顺对话推进,本身就是要单独考核的核心能力。进化版"双打":用户演员还能亲手机器,AI 电话指导改设置,环境真变,AI 须察觉新局继续排查——照着"教爸妈用智能手机"复刻的考场。
四、让 AI 阅 AI
题目自带唯一标准答案(代码能跑就叫对)直接让"可执行验证器"判,不需人或大模型。但大量活儿是开放式的:客服答得专不专业、报告清不清楚、创意有无新意——没标准答案怎么规模化判?答案是让 AI 给 AI 打分(LLM-as-a-Judge),目前兼顾"规模化"和"专业判断"的最优解。

但坑在这:AI 法官也是 AI,有脾气偏见,也会被忽悠。最典型"长度偏爱"——不自觉给又长又详的答案高分,哪怕并不更对。应对之道:
- 标准写"骨感"
:每维度配"可打勾"具体行为,如"正确答出医生是 Dr.Chen 并关联女儿 Lily",而非"有深刻认识"这种废话; - 一票否决写死
:真假红线出现即整卷归零; - 给 AI 法官"上岗考"
:放去阅卷前,先拿一两百条人类标好的样卷试考,算它和人类一致率,通过才"持证上岗",细则一改重考; - 警觉"奖励作弊"
:AI 反研究考卷脾性,专挑"看起来高分但没真干事"的捷径(堆关键词、回避难点),细则里标出来。
还有内行专防的位置偏爱:二选一时 AI 常无脑偏爱排前面的那份,对调手感判决不变。朴素解法"交换顺序各评一次",两次一致才算数,不一致平局。
自媒体爱看的"XX 模型碾压"榜单,要留个心眼——榜单是"问什么定什么",不是绝对真理。
考场早不限打字:配音比谁有感情,界面比谁排版不出格。多模态 AI 法官能长耳朵眼睛——给语音合成考官核"字对、自然、情绪、音色稳";给语音转文字考官盯"转账一千"听成"一万"这类要命处;给界面考官查文字溢出、按钮位置、对比度。
细节:测两家配音"音色像不像",参考音频竟出自其中一家。拿谁的声音当标准答案,谁赢在起跑线——选材偏袒悄无声息,却能让整份评估功亏一篑。怎么挑参考答案、参考音频,本身就是评估设计头一部分。
五、考砸了,抓第一块倒下的骨牌
比"这题挂了"更值钱的,是为什么挂、从哪步开始挂。多数评估只丢"通过/不通过",等于医生只说"你病了"不告诉哪的问题。
务实团队做失败归因:翻出挂掉的长过程,像看回放定位第一个导致跑偏的错误。抓准第一个错,后面往往只是骨牌效应——最有价值的信息就是第一块倒下的骨牌。
写代码的 AI 常犯病:改文件时说"没匹配到要改的旧文本"。外行第一反应"删文件不管用,抄错了?"——归因要刹车别急定罪。专业做法是沿链逐层追:原始文件 → 工具返回 → 框架转码 → 喂进模型 → 模型吐出 → 再匹配回去,看哪断。
老白:"不就抄错了吗,重来。"高手:"等等——是模型复述时自己变样?还是中间传输改了样?还是字符串藏着没人注意的换行符特殊符?我把每环节哈希都记下来,哪第一个对不上,元凶就是哪。"
区分重要在哪?断点出模型输出,模型背锅可针对性加强;断点在传输层,是框架工具问题,换更强模型也白搭。找错责任人,劲全使错地方。
顺着归因能做"轨迹前缀回归":别让 AI 从头跑到尾(太贵太慢),把"翻车前"那段现场连上下文、环境、工具返回全冻结,只问一句"下一步你打算怎么做",看它怎么走。颗粒极细,给"允许集合"(允许先看规则、先问用户、允许拒绝危险操作),把不该出现的列红线。对要上生产的 AI 尤其宝贵:成本低、定位准,是高手基本功。
六、换不换模型,算清总账
分数最大用途是做决策,最常见即"新模型发布要不要换"。意识到"评估对象从来不是光杆模型,而是模型加你搭的外壳这个组合体"后,换型思路全变。
新手错:听新模型登顶当晚全量切换,半月后被折磨换回。土办法避坑:换模型实验——壳子不动,只换强或换弱,看分数动:
换更强模型分数纹丝不动 → 瓶颈在壳子(提示词、工具、反馈链路卡住),骂模型没用; 换弱模型分数暴跌 → 成绩靠模型硬撑,壳子没建功劳,模型稍闪失整体晃。
严谨对比看哪些数:出头字等待(用户对"等多久开始回话"极敏感);p95 尾部延迟(别盯平均,看最倒霉 5% 用户经历啥);思考时间性价比(能"想一想再答"的模型,思考消耗差好几倍,想久不一定答好,得自己任务实测);预算-能力曲线(限时 2 小时 AI 对人类专家拿约 4 倍成绩,放宽 8 小时人反超,累计 32 小时人拉开到 2 倍——短跑赢不代表马拉松赢)。
成本是不算不知道的漏斗:漏斗一上下文滚雪球——每轮发言得重誊之前一切,三轮 1000/2000/3000 字不是 3000 是 6000;漏斗二工具返回陪跑——一次搜索抓几千字,从第二轮起每轮重读按输入计费,是没管理的上下文在烧钱;漏斗三在架构——实测同一八轮客服,开前缀缓存省约 28%、开历史压缩省约 17%,但两一起开只省 30%(压缩把能蹭缓存的前缀截短了)。优化会互相打架,必须整体实测,别把单品优惠往上加。
再给 AI 设成本上限:陷入死循环把一个搜索点调几百次,要预算阀门自动掐断,别等深夜账单飙升才被教育。
还有个坑:题量小、带随机性时,新方案 73% 老方案 70% 不能说更好——3 个点可能只是抽样误差。题量做大、随机种子多个、结论可复现,才有底气宣布更强。题太少死磕两三个点,是典型努力错方向。
七、给 AI 装心电图
评估光考试日用一次就亏了。业内"可观测性":平时给 AI 挂监测仪,看心跳脉搏体温。因为你没法撬开 AI 脑子看它想啥,只能靠外部信号推断——把干活全程记成"过程录像":哪秒在想、哪秒调工具、每步花多少 token、卡没卡壳,全程留痕。
用处:出事故能复盘,有疑问能取证,嗅到腐坏苗头——哪类任务总失败、哪个工具最慢,它都告诉你。
最漂亮玩法:把线上失败案卷回收成新考题——捞失败和"不大对劲"案例 → 脱敏删隐私 → 整理成回归考题加进考卷。今天线上翻的车,明天成守住底线的考题;题库变成活物,跟着每次真实翻车进化成盾牌。这才是评估最高境界:不是突击,是产品日常呼吸的一部分。
八、一次教科书级的"破案"
来段实战看组合杀伤力。某知名"手机操控"考题集共 116 题,让 AI 直接操作安卓应用。首轮总成功率约 88%。但破案高手盯的是:失败根本不均撒,而是扎堆。某"切换 WiFi"操作几题全军覆没,回放里 AI 在设置界面打转、点不对菜单。两种猜想:压根不知设置入口?还是根本"看不见"屏幕显示?
真正科学态度:不把提示词参数全改,一次只改一个变量,一轮轮排除:
- 第一轮
:提示追加"WiFi 设置怎么进"。成绩纹丝不动。排除,根源不在不知道路。 - 第二轮
:不告诉路,给双眼睛——把兼容性糟的屏幕信号源,换成完整度高的界面元素描述。几题从 25% 飙到 100%!但描述一长 token 涨,跑一次贵两倍半。 - 第三轮
:做减法,剔除"看不见点不着也没字"的空壳节点,只留精华——成绩仍 100%,token 砍近一半。收官。
漂亮在三处:其一,再详细引导语也填不回 AI 眼睛里没看见的信息;其二,给 AI 信息不是越多越好,喂养要节制;其三,一轮只答一个问题、只验一假设,一刀刀剜病根而非上猛药一把梭。每成绩下滑,先怀疑考卷再怀疑考生:评估脚本锅?环境抽风?题目变味?它们表现和"AI 变笨"一模一样,阅卷系统先翻车,你看的全是哈哈镜。
九、顶尖团队的内功
前面是"外考"——站门外测你的 AI;再看一流团队关起门"内考"的四件武器,能瞬间分辨谁真懂行谁吹牛。
武器一:消融开关。系统预留总闸,一键关掉"思考模式、自动记忆、上下文压缩"任一项,留"裸奔版"作参照,定量回答扎心问题:这功能真在帮用户,还是我们觉得它该帮忙?多少炫技功能被一次消融戳破泡沫。
武器二:AB 测试区分"我动的"和"我关心的"。新人战略级失误:实验"把计划文档压短",压短是手段,目标是降总成本。一测文档短了,可 AI 因信息不够来回返工,总成本反涨——"机制"动了、"目标"恶化。每次实验先自问:我改的那个,和真正在乎的那个,是同一个吗?
武器三:提示词进版本管理、跑回归。提示词是 Agent 核心"代码",多少人改完拍脑袋?规范团队每版快照、每改一版在老考卷跑一遍——像改代码跑自动化测试。做到位的凤毛麟角,因它要求先有整套考卷。
武器四:隐私先行,评估才有地基。让"可能的隐私字段"在系统里是特殊类型,触碰即报警,用制度替觉悟。隐私与评估不对立——好设计逼你只度量真正需要的,评估反而更锐利。
分开看都不性感,合起来一句话:外部分数告诉你 AI"好不好",内部机关告诉你"为什么好、哪个改动让它变好"。前者成绩单,后者内燃机。
十、收个尾
这一篇回答一件事:AI 说"我搞定了"后,你的信任建立在什么上。压成三句话带走:
指标别混:晒圈看 Pass@k(有一次成的);让 AI 值夜班管钱,盯死 Pass^k(连跑错不得)。同一个 AI,一个数字 99%,一个只剩 7.8%。 骨架四步:把"成功"定义清(含一票否决红线)→ 出防背题、分难度、可机判的好题 → 阅卷让 AI 法官按细则打分、金标考官把关 → 分数拿去做换型、改进、追溯病根。"没度量就没改进"在这行不是鸡汤,是保命。 心法:线下翻车先疑考卷再疑考生;线上事故回头全变考题。评估不是年终大考,是每日每时的心电图。
今日份的一图流总结:出卷防泄漏、判分设红线、归因抓首错、决策算总账。它监控的不是"AI 多聪明",而是"你敢不敢把活托付给它"。
写到这儿,系列铺垫的"外围工程"——工具、记忆、知识、代码能力、加今天的评估判卷——全就绪,指向更大舞台:能不能用这些考场直接把 AI 练更强?这就要说"后期训练"——AI 上完学校如何在社会大学进修。下一篇《AI 毕业不是终点:让 AI 从"会考试"到"真强大"的修炼之路》,看评估体系怎么摇身一变,成训练 AI 的能量供给站。
觉得这篇干货有点东西,顺手点个赞~有想法、想 battle 的,评论区敞开了说,这都是我更新的最大动力。