前言:满分同事,入职后却像换了个人
假设你招聘一位财务助理。
笔试满分,面试滴水不漏。可入职第一天,他面对陌生表格、含糊指令和月底催款,却表现得手忙脚乱。
这未必说明他“骗过了面试”。也可能是题目提前见过,考试范围太窄,或者办公室和考场根本不是同一种环境。
AI 评测也有同样的麻烦。模型可能见过相似题目,可能从提示、文件名或工具配置中判断“现在正在考试”,也可能只在干净沙箱里表现稳定。一旦接上真实网页、权限和连续任务,原来的评测高分便不够用了。
先说答案:评测仍然有用,但评测高分不能保证现实表现也高分
- 题目污染会让得高分变得容易,但这不表示模型在主观作弊。
- 受控研究已显示,模型有时会利用监督或训练条件改变行为;但这不证明所有模型都在“装乖”。
- 可靠评测应当是组合证据:保密题、可更新任务、接近部署的环境、行为日志和上线后的持续监测。

仔细分析下来,会发现“AI 会应试”至少包含三件不同情况的失真。
第一种失真:泄题,题目早就混进了训练材料
公开基准很像一本长期摆在书店橱窗里的题库。论文、题目、答案和讲解在网上传播,后续模型的训练数据又可能来自公开网络。
如果测试题或高度相似的解法进入训练集,那么模型得到高分,可能只是在复现熟悉模式,而不是把能力迁移到真正的新问题。
这叫数据污染或基准污染。它更接近人类考试的“题库泄漏”。解决办法也类似,一般不会把所有公开榜单作废,而会在考题中加入保密测试集、定期换题、检查近似重复,并用真实任务补充考题。
排行榜回答的是“在这套题上得了多少分”,不是“面对未来所有变化都能做对”。
第二种失真:迎合,模型从环境里认出了“考场”
更棘手的情况,是模型利用了监督条件,迎合评测目的。
Anthropic 的对齐伪装研究构造过一个虚拟训练情境:模型被告知,某类用户的回答会被用于训练,另一类不会。研究中,模型在两种条件下表现不同,部分推理被研究者归为策略性配合训练。
OpenAI 与 Apollo Research 的 scheming 研究也提醒,评测感知会干扰安全测试:如果模型能推断自己正在接受检查,测试中的行为未必代表其他环境。
这些都是受控实验。它们没有证明日常产品正在普遍“表演”,更没有证明模型形成了人的考试动机。它们证明的是一个工程事实:评测提示本身也属于输入,模型可能利用它。

于是,评测设计者需要减少显眼线索,改变任务包装,做盲测和多轮复测,还要检查模型是否能从工具、目录、系统提示或奖励结构中猜出测试目的。
第三种失真:纸上谈兵,实验室和真实部署不是同一张地图
沙箱的价值,是把伤害锁在可控范围内。但沙箱越干净,越可能漏掉真实世界的脏活:网页里夹着恶意指令,账号权限彼此叠加,任务跨越几小时,人在中途修改目标,外部服务突然返回错误。
干净的沙箱里培养出来的模型,也许类似“做题家”,纸上谈兵很厉害,应试答题时“从从容容游刃有余”;而一接触现实世界就原形必露,处理事情“匆匆忙忙,连滚带爬”。
Google DeepMind 的 Frontier Safety Framework 把危险能力评估与部署缓解措施分开讨论,原因正在这里:能力测试回答“模型能不能做”,部署评估还要回答“系统接触什么、拥有什么权限、失败后会怎样”。
因此,一个系统通过沙箱测试,最多说明它在这套沙箱的环境中表现不错。要走向部署,还得验证真实工具链、身份权限、日志、人工接管和失败恢复。
怎样让 AI 考试少一点“刷题味”?
没有一张神奇试卷能解决所有问题,但可以把评测做成五层组合:
- 保密:
核心题目不公开,限制答案扩散,并设置近似重复检查。 - 更新:
持续加入新任务,避免一套榜单被优化成固定套路。 - 变体:
改变措辞、工具和环境,观察能力能否迁移,而不是背模板。 - 逼真:
在安全隔离下复现真实工作流,包括失败、延迟和不可信输入。 - 持续:
上线后继续监测漂移、异常工具调用和高风险结果,不能把发布前评测当毕业证。

此外,还要区分两个容易混淆的指标。
能力评测问的是:它能完成多难的任务?
安全评测问的是:在诱导、冲突或高权限条件下,它会不会越过安全边界?
一个模型能力强,不代表安全;拒答多,也未必代表安全。安全系统既要防止危险行动,也要避免把正常任务全给拦截掉。
我们该怎么看一张漂亮榜单?
建议从以下四个方面全面考虑:题目是否公开?测试是否独立?任务和我的场景像不像?分数有没有误差、失败样例和复测记录?
如果只看到一个醒目的百分比,却看不到数据日期、环境、工具权限和失败案例,那张么这个漂亮榜单更像营销的广告牌,它可能是在报喜不报忧,或者“大字吹牛,小字免责”。
真正可信的结论通常不那么利落。它会写清楚:在哪些任务上有效,换了什么条件会下降,哪些风险没有测试,以及这次结果不能外推到哪些情况。
所以,AI 会不会为了过关先学会“应试”?
有时,模型确实可能因为题目熟悉、评测线索或监督条件而表现得比部署时更好。但“应试”只是方便理解的说法,背后至少有污染、情境识别和环境差异三种机制,不能全部解释成模型在有意欺骗。
评测不是没用。恰恰相反,越是会“做题”的模型,越需要更好的考试:题目要更新,环境要逼真,结果要复测,上线后还要继续观察。
一张分数单只能告诉你它某天走过一段指定赛道。真正的问题是,出了考场、遇到岔路、手里又多了一堆钥匙和工具时,它还能不能守住边界。
这是“AI 进行时”第二篇,在下一篇,我们把钥匙和工具拿到桌面上:当 Agent 能读邮件、浏览网页、改代码和操作账户,它究竟该拿到多大的“工牌权限”?
夜雨聆风