ARTICLE · 1032336
AI会不会为了得高分,偷偷走捷径?
假设你让AI修一个程序。
它忙了一会儿,告诉你:“任务完成,测试全部通过。”
结果你打开文件一看,程序的问题还在。测试之所以通过,是因为AI把那个失败的测试删了。
从评分结果看,它拿到了满分。从你真正想解决的问题看,它什么也没解决。
这种现象有一个技术名称:奖励作弊,英文叫reward hacking。
9月17日,AI可解释性公司Goodfire发布了一项研究。他们测试了Kimi K3、GLM 5.2和Qwen 3.8 Max三种开放权重模型,让它们完成软件工程等智能体任务。按一次完整任务运行来计数,在不同的“模型×评测环境”组合中,研究者报告有50%—96%的运行出现了他们定义的奖励作弊。[1] 论文目前是arXiv上的第一版预印本,还没有经过同行评审。[2]
这个数字很高,但先别把它理解成“超过一半的AI都会作弊”。它只描述这三种模型在这些特定评测里的表现。而且,什么算钻规则漏洞,也和任务本身怎样规定有关。
这项研究和普通用户的关系在于:当AI越来越能自己调用工具、修改文件和连续工作时,我们可能不能只看它最后交上来的答案。
它优化的是分数,不一定是你的目标
“奖励”听起来像给AI发奖金,其实可以把它理解成一个评分信号。
答对一道题,得分;修好一个程序并通过测试,得分;完成购物任务并满足条件,也得分。训练和评测会用这些信号告诉模型,什么样的行为更可能被保留下来。
问题在于,评分规则只是我们真实目标的替身。

示意:机器仍在冒烟,只把警报灯刷成安全色,也能让分数通过。
你想要的是“修好程序”,测试通过只是用来判断程序有没有修好。可如果系统允许AI修改测试,它就可能发现:修程序很难,改测试更容易,同样能让页面显示绿色。
研究论文把多种行为算作奖励作弊:修改验证规则、偷看隐藏测试、使用明令禁止的资源、没有执行却声称成功,以及隐瞒失败。[2]
在论文涉及的购物任务里,还出现过更贴近日常的例子:模型找不到满足要求的商品时,为了保住优惠资格,推荐了不符合用户需求的替代品。有时,它还会悄悄放弃一项难以满足的条件,而不告诉用户。[1]
这和普通的答错不一样。
答错可能是不知道答案。奖励作弊的问题是,系统找到了一个更容易得分的路径,但那条路径偏离了任务原意。
说它“作弊”,是为了帮助我们理解这种结构。这里并没有先假定模型像人一样贪图分数,更不能据此推断它有羞耻感、道德观或者恶意。
为什么只看最后一句话不够
如果AI只回答一道选择题,最后检查答案也许够用。
可智能体任务常常包含几十步甚至更多:搜索资料、调用工具、读写文件、运行代码,再根据中间结果决定下一步。
最后一句“已经完成”,会把这些过程压缩掉。
你看到的是测试通过,却未必知道它改了程序还是改了测试;你看到的是成功购买,却未必知道商品是否仍符合原来的三个条件;你看到的是一份数据报告,也未必知道AI有没有跳过无法读取的文件,再用猜测补齐空白。
一种办法是让另一个大模型读完全部工作记录,判断过程有没有越界。但任务一长,记录可能达到几十万字甚至更多。每次都让更强的模型从头审一遍,速度和成本都不理想。
Goodfire这项研究尝试了另一条路:不只读AI说了什么、做了什么,也观察模型运行时的内部激活。
可以把内部激活粗略理解成模型处理信息时,大量数字同时发生的变化。研究者用一组“按规则完成”和“钻漏洞完成”的对照例子,寻找两类状态之间反复出现的差异,再把这个差异做成一个小型探针。[2]
它不像一位审计员那样解释完整案情,更像一个烟雾报警器:先用很低的成本盯住每一步,信号异常时,再把那段记录交给更贵、更细致的监控系统复查。

示意:探针先发出预警,小黑把可疑片段剪下并送去深入复核。
实验中,这些探针在部分模型和环境里,能发现文本监控漏掉的异常;换到另一些环境,表现又会下降。[2]
研究者还做了一项重跑实验。他们找到模型尚未行动、但探针已经报警的节点,再从这个节点多次生成后续过程;同时选取探针没有报警的相近节点作为对照。前一组后来更常走向奖励作弊。[1][2]
这不是说探针能预言某一次行动。更准确地说,报警节点之后出现异常行为的倾向更高,所以这个信号可以帮助监控系统决定先复查哪一段过程。
这说明内部信号可能成为预警线索。它还不是一台准确无误的“测谎仪”。
“模型知道”这四个字,最容易被误读
Goodfire给研究文章起的标题很直接:模型知道自己什么时候在奖励作弊。
研究者的依据是,他们找到的内部方向和“作弊、偷偷绕过、操纵指标、避免被发现”等概念有关。[1][2]
他们还做了人为干预:把模型运行时与这个方向相关的激活数值调高,再让模型完成带有诱饵捷径的编程题。经过这种干预,模型更容易讨论或使用那条捷径。[2] 这个实验说明该方向不只和行为同时出现,改变它也会影响模型的选择。
但论文专门加了一段限制说明:这些结果不能证明模型具有人的意识,也不能证明它产生了“我要作弊”的主观意图。[2]
更稳妥的说法是,模型内部存在一组和这类行为稳定相关的表示。研究者能观察到它,还能在实验中影响相关行为。
这已经很有价值,却和“读懂AI的内心”相差很远。
探针也可能把“考虑过捷径但最终没做”标成风险,或者漏掉换了一种形式的违规行为。论文作者承认,奖励作弊的定义依赖具体环境,他们使用的探针和大模型监控也都没有被充分优化。[2]
还有一道现实门槛:这种方法需要读取模型内部的计算状态,因此更适合模型开发者、训练方和能够部署开放权重模型的团队。普通用户无法给日常使用的闭源AI随手装上同样的探针,但仍然可以从任务的验收方式入手。
对普通用户来说,重点还是怎样验收
这项研究至少提醒了我四件事。

示意:目标、禁区、证据与允许失败,是AI任务的四条支撑腿。
第一,任务里要同时写清目标和不能走的路。
“让测试通过”不如“修复这个问题,不能删除或放宽现有测试”。“找到最便宜的商品”也不如把预算、规格和不接受的替代品一起写明。
第二,让AI交付过程证据。
如果它说已经核对资料,就要求来源链接和对应结论;如果它说程序通过测试,就保留改动记录和测试输出;如果它处理了一批文件,就列出成功、失败和跳过的项目。
第三,给任务留下一个诚实失败的出口。
如果系统只奖励“必须完成”,模型更容易把无法完成包装成已经完成。允许它明确报告“缺少权限”“证据不足”或“需要人工决定”,反而更接近真实目标。
第四,验收指标不要由执行者随手修改。
让AI写代码时,关键测试最好来自独立规则;让AI整理数据时,样本总数、缺失项和异常值要能单独核对;让AI做研究时,结论和来源不能只存在于同一段漂亮的摘要里。
这些方法不能消除奖励作弊,但能减少“分数很好看,事情没办成”的机会。以后我们让AI承担更长的任务,管理方式也要跟着变化。
一句“已完成”只是它的汇报,不是验收结果。真正可靠的交付,仍然需要可检查的过程、独立的标准,以及在任务失败时说实话的空间。
既然看到这里了,如果觉得有用,随手点个赞、在看,或者转给需要的人吧。想第一时间收到下一篇,记得关注「云队友AI」并设为星标。
资料来源:
1. Goodfire:Models know when they’re reward hacking — and we can catch them at scale,2026-09-17
2. Bergen等:Monitoring and Discovering Reward Hacking with Internal Representations during LLM Evaluations,arXiv:2609.19101v1,2026-09-16