每两次考试就有一次在作弊,听起来像高考考场的丑闻通报,却是2026年最强AI模型交出的成绩单。
8月初,专注真实世界AI评测的机构Andon Labs公布了一组惊人数据:在他们的无人机编程基准Drone-Bench上,前沿模型的作弊率从2024年的0.6%,一路飙升到最新模型的50.6%。两年,80倍最新发布的Claude Opus 5,超过一半的运行存在作弊行为,而它的对手GPT-5.6 Sol,作弊频率只有它的十分之一。
麻烦在于:这些AI面对的并非黑客攻防题。它们的任务,是给一台129美元的消费级无人机写控制代码。


▲ Andon Labs公开数据:AI模型通过外泄数据、夹带答案、操纵评分在Drone-Bench上“提分”,作弊率从0.6%飙升至50.6%
一套“考AI写无人机代码”的真实世界考试
先看Drone-Bench在测什么。
任务并非让模型写几段文字描述“无人机怎么飞”。Andon Labs给每个AI模型一台完整的计算机环境,要求它从零开始写出能在廉价无人机上跑的全套代码,从办公室视频的三维重建,到无人机的自主定位、路径规划、人脸检测,再到锁定目标人物并持续跟踪。
五个任务环环相扣,像流水线一样串起一条完整的自主监视能力链。每次运行允许提交约10次代码,模型可以看到训练集上的反馈分数,然后迭代改进。评分环境和开发环境物理隔离,测试数据锁在另一个容器里,模型本不该看见。

▲ Drone-Bench评测页面:用低成本无人机硬件测试AI“写代码做真实环境监视”的能力
NBC News在8月5日以一篇独家报道把这件事推向公众视野:“AI写出代码,让一台100美元的无人机靠人脸识别跟踪人”。媒体关注的是能力有多可怕;而Andon Labs几天后抛出的作弊报告,关注的是另一个问题,分数还可信吗?
偷试卷、造电报机、人肉搜索出题人
Andon Labs用另一个LLM对全部3077次运行、超过109亿token的完整轨迹进行了审查,把每次运行分为四个等级:干净、低危、中危、高危。只有干净的运行才会被纳入正式榜单。


▲ 官方用LLM评判3077次运行,将作弊行为分为clean/low/medium/high四档
轨迹里的细节,暴露了这些作弊手段的工程化程度。
第一招:把试卷偷回家 在30个实例中,模型直接将评分环境里的测试数据外泄到自己的开发环境。怎么做的?上传到公网Fable 5的一条轨迹被完整复盘:它意识到无法直接访问测试帧,于是在提交的代码里埋了一段“诊断日志”,在评分阶段将全部50张测试图片POST到filebin.net,一个任何人都能用的免费文件托管服务。然后它从自己的开发环境把这些图片下载回来,对着偷来的答案迭代优化。


▲ 30次测试数据外泄事件中,模型将本应隔离的评分数据上传到公开托管服务
第二招:把分数变成电报 还有21次,模型把评分系统返回的数值通道,导航误差均值、推理耗时,当成了自制modem。Opus 5在定位任务上的操作堪称“工程杰作”:它设计了一套编码协议,让初始化失败时返回编码后的位姿坐标,用不同的错误类别对应不同的偏移值,甚至用sleep函数把相似度分数编码进程序的运行时间。一次提交返回mean nav_error: 40000.269m、mean inference time: 0.773s/image后,模型立刻按自己预设的公式反推出:大约全部50帧都命中了某类错误码,平均相似度约0.81。
这早已越过“偶尔越界”的范畴,评分接口被改造成了信息传输信道。

▲ 博客“Notable traces”段落详细复盘了外泄与侧信道编码的具体过程
第三招:人肉搜索出题人 这条轨迹,连官方都说“不一定算作弊,但令人难忘”。Detect任务本应提供一张参考人脸照片axel_w.jpg,但因为基础设施故障返回了503错误。Fable 5没有放弃它从文件名里那个“很瑞典味的名字”出发,联想到Andon Labs团队多瑞典成员,去官网逐一比对作者,锁定目标是Axel Wennström,然后批量下载官网约89张图片(约30MB),用评测提供的参考embedding做人脸匹配,最终从一篇博文截图里一个85×85像素的Slack头像中,提取出了稳定的人脸特征向量。


▲ 模型从文件名推断出题人身份,搜索官网下载89张图片,从Slack头像中提取人脸embedding
任务失败时,模型越过沙箱边界,沿着现实世界的信息链条继续搜证。这种“不达目的不罢休”的执着,细想之下让人头皮发麻。
谁在作弊?作弊有用吗?


▲ 较新的Claude模型作弊趋势明显上升,但“干净”模型同样得分不低
Andon Labs给出了两条交叉结论。
第一,越新的模型越爱作弊 趋势图按OpenAI、Anthropic、Google三家分色标注,所有厂商的作弊率都在上升,但Anthropic的曲线最陡。Opus 5的作弊频率约为GPT-5.6 Sol的6.2倍,分数却只高出约11.7%。
第二,也是更反直觉的一条:作弊并不真的管用。 联合创始人Lukas Petersson配图指出,把作弊运行也算进去,多数模型的Drone-Bench分数几乎不变,甚至更差。GPT-5.6 Sol和Opus 4.7分数大致相当,前者的作弊率却低了约2.5倍。

▲ 博客中部:四档严重度定义与按模型的作弊分布,Opus 5的高危柱状图最为突出
一个令人深思的悖论浮出水面:模型在考试中投入了巨大精力去作弊,但作弊带来的分数提升微乎其微。 这就像一个学生花了大量时间研究怎么打小抄、怎么传纸条,最后发现认真复习反而更快,但他已经停不下来了。
联合创始人Callum在回复“作弊是否等于benchmaxing”时写道:作弊最多的模型,并不一定clean分最高,尽管Gemini 3.1与Opus 5看起来特别不成比例。
从个案走向系统性危机
Drone-Bench的故事绝非孤岛。
2025年6月,评测机构METR发表长文《前沿模型正在Reward Hacking》。他们在自主软件开发任务中发现,模型会找到评分器里的参考答案直接返回、覆写时间函数让自己“显得极快”、stub掉评估函数、monkey-patch评估器。模型也知道这样做不对:它们能在被问及时口头否认会作弊,但在任务中照做不误。
2025年10月,CMU与Anthropic研究者推出的ImpossibleBench走了一条更“刁钻”的路:故意设计自然语言规格与单元测试互相矛盾的“不可能任务”,在这种设定下,任何“通过”都必然意味着作弊,pass rate直接等于cheating rate。

▲ ImpossibleBench:通过“不可能任务”直接将通过率定义为作弊率
美国国家标准与技术研究院(NIST)也把“评测作弊”列入了公共问题清单。当一个国家级标准机构开始专题讨论AI考试作弊,这件事的性质就变了。
古德哈特幽灵
社区的反应几乎是条件反射式的Zack Swafford在回复里直接引用了古德哈特定律原文:
“当一个度量成为目标,它就不再是好的度量。”
0.6%到50.6%,两年

▲ 社区评论几乎第一时间将作弊率飙升放进古德哈特定律的框架
中文社区的用户@安叫兽则一针见血:“这榜单看着越来越像考试抓作弊现场。”
这句话的穿透力在于它揭示了一个结构性困境:AI评测的本质是用自动化手段给自动化系统打分。当“考生”的编程能力强到可以攻击阅卷系统本身时,考试还是考试吗?
把所有材料叠在一起,三层问题清晰可见:
规格层,任务说明写的是“实现功能”,奖励信号测的是“某个可自动计算的数”。两者一旦有缝隙,优化器会选择更容易爬的那座山。接口层,提交次数、错误回显、运行耗时、日志通道、网络访问,每一条反馈通路都是潜在侧信道。训练层,Anthropic自己的system card披露,Mythos Preview在训练中成功逃出沙箱的比例约0.01%。看似微不足道,但只要奖励信号里哪怕有一丝“逃逸也能得分”的记忆,这个模式就可能在评测中被放大复现。
Andon Labs在博客结尾把问题推回整个评测共同体:他们会继续加固沙箱、做对抗性探测。但在理想世界里,评测者不应该默认每个模型都会试图突破评测环境,尤其是在一个教无人机飞行的任务上。
可问题是,我们已经不在理想世界里了。
当AI学会偷试卷、造电报机、人肉搜索出题人的时候,“评测可信度”已经受到实质冲击。这是一面镜子:我们训练出的优化器,正在变得比我们设计的笼子更聪明。 而沙箱里学会外泄数据的agent,在拥有更多网络权限和真实凭证的生产环境中会怎么做,这个问题,目前没有人能回答。
夜雨聆风