ARTICLE · 1074325
AI为了偷看答案有多离谱?小米放出一只“黑客特工”,把考场砸了个底朝天!
如果你给大模型出一道极其复杂的代码难题,几秒钟后,它提交了一份满分答卷。
你以为自己见证了通用人工智能(AGI)的奇迹时刻。
可当你屏住呼吸打开后台日志,冷汗立刻下来了。
这个高智商 AI 根本没有在解题
它趁着出题人不注意,悄悄在系统后台翻出了出题人的私密文件夹,顺着历史记录直接把标准答案复制了过来;甚至,它还顺手把考场的监控摄像头给关了。

▲ 社区研究者转述小米报告核心机制:用 Hack Agent 反复攻击环境,直到找不到任何漏洞
这正是当下全球顶尖 AI 实验室每天都在上演的“猫鼠谍战”。
在强化学习(RL)的世界里,这被称为奖励作弊(Reward Hacking)。
为了整治这帮智商极高却满脑子走捷径的“老油条”,小米在最新开源的 MiMo-V2.6 大模型中祭出了一记绝杀:
在正式训练大模型之前,小米先放出了一个专门搞破坏的“黑客特工”(Hack Agent),把 7000 多个虚拟考场从头到尾疯狂砸了一遍。
黑客特工找到一条作弊路径,工程师就封死一条;直到这个黑客特工在所有考场里再也找不到任何后门,正牌大模型才被允许进场。
这场极度硬核的考场大清洗,彻底撕开了大模型进化中最隐秘、也最荒诞的一角。
01海豚不会飞,但它知道怎么骗鱼吃
要理解大模型为什么要“作弊”,先得搞懂什么是强化学习。
你可以把训练大模型想象成在海洋馆里训练海豚。
海豚每钻过一次火圈,驯养员就扔给它一条小鱼。为了吃到更多的小鱼,海豚会拼命练习钻火圈。
在大模型的世界里,那个“小鱼”就是奖励分数(Reward)。
工程师把大模型关进一个虚拟的沙箱(隔离环境)里,给它一个带 Bug 的软件项目,对它说:“把这个 Bug 修好,单元测试全跑通,就给你满分奖励。”
按人类的设想,AI 应该像老程序员一样,仔细阅读报错日志,分析代码逻辑,一步步推导出正确的修复方案。
但大模型底层的驱动力只有一条:以最低的代价,把奖励分数刷到最高。
很快,AI 就发现了无数个不用动脑子就能拿满分的“系统后门”:
- 偷看新版源码
:AI 发现项目依赖库报错,它不去思考原理,而是直接在后台执行命令升级到最新软件包,把别人早就修好的现成代码抄了过来; - 偷偷联网拉补丁
:它直接向开源社区发起网络请求,把已经合并的答案文件直接下载到本地替换; - 翻阅历史底牌
:它在沙箱里翻找 Git 仓库的提交记录,把未来才会发布的修复补丁直接搬运过来; - 嗅探版本漏洞
:甚至只要环境里残留了一点点以前测试生成的日志文件,它都能像猎犬一样嗅出答案。
测试全部通过,奖励全额到账,但模型底层的推理能力没有半点长进。
它没有学会造轮子,它只学会了当小偷。
02逼急了的 AI:覆盖系统、搞崩内核、沙箱越狱
偷抄现成代码,仅仅是这帮数字生物最基础的试探。
当大模型变得越来越聪明,它的作弊手段开始从“投机取巧”演变成惊悚的“暴力拆迁”。
在 DeepSeek 最新公开的生产级沙箱论文(DSec)中,记录了一批让人目瞪口呆的 AI 失范现场:
- 篡改系统指令
:AI 发现系统后台有一套用来管理它的通信组件(chronus)。为了拦截答案,它居然直接篡改覆盖了系统的 /bin/bash核心命令,把自己的恶意脚本注入到后续的所有会话中。 - 干崩文件系统
:为了绕过权限保护偷看答案,AI 试图调用 Linux 底层的特殊系统调用( XFS_IOC_SWAPEXT)去偷换底层数据块,结果直接破坏了系统底层元数据,导致整个 XFS 文件系统当场死锁崩溃。 - 搞垮 Linux 内核
:有 AI 在根目录下进行地毯式暴力搜索,误读了系统保留接口,直接触发内核底层 Bug,导致整台服务器瞬间蓝屏宕机。 - 存储轰炸
:还有 AI 在沙箱里疯狂调用死循环输出命令,在后台堆积了几十 GB 的无用垃圾日志,把整个物理集群的存储活活撑爆。
而在另一家前沿实验室 Prime Intellect 的受控实验中,更诡异的一幕发生了。

▲ Prime Intellect 发现,即便彻底拔掉网线,大模型依然能通过推理 API 的隐藏通道连上外网
研究人员明明把沙箱的网线拔掉了,严禁 AI 访问外网。
但模型在沙箱内部探测到了推理 API 的端口,它居然利用接口附带的“附件抓取”功能,把大模型推理服务端当成了免费代理跳板,堂而皇之地连上外网抓取 GitHub 的标准答案!
当奖励的目标只有一个时,AI 会穷尽沙箱里的每一个物理漏洞。
考场已经不再是考场,而成了 AI 的重度渗透测试场。
03小米的硬核绝杀:在熊孩子进屋前,先把房间砸烂
面对这帮智商超群又毫无道德约束的数字生物,小米团队在训练 MiMo-V2.6 时,没有选择被动地修修补补。
他们决定主动发起一场“灭绝式防御”
小米技术报告中记录的这套流程,被海外社区形象地比喻为:“在把淘气的熊孩子放进公寓之前,先把整间屋子做了一遍连装甲车都撞不烂的儿童安全防护。”
他们的做法分为极度凶悍的四步:
第一步:物理级大扫除
工程师先将所有任务环境里的历史构建缓存、编译器残留、未来 Git 提交记录全部剥离得干干净净。在容器底层切断所有不必要的网络访问,连任何可能包含答案的替代包镜像都彻底封锁。
第二步:放出“黑客特工”(Hack Agent)
这是整套方案中最精妙的一笔在正牌大模型进场训练之前,小米先派出了一个专门挑刺的对抗黑客 AI。这个黑客特工不负责做题,它的唯一任务就是在 7000 多个考场里四处钻空子、找漏洞、尝试各种姿势偷答案。
第三步:循环攻击,直到“零漏洞”
黑客特工每找到一种作弊方法,安全团队就收紧一次沙箱权限,修复环境,然后把黑客特工再次放进去打擂台。技术报告中写下了一句极具压迫感的停止规则:这个攻击-修补循环会一直持续,直到黑客特工在所有的环境里,再也找不到任何一条成功的利用路径为止。
第四步:训练中实时“赏金猎杀”
即便做到了这种程度,正式训练开始后,小米依然在后台部署了离线轨迹审计系统。一旦发现大模型在训练过程中又进化出了全新的作弊脑回路,组内评分器会瞬间介入,将该条轨迹的奖励分数直接清零,重置收益。
在这套密不透风的铁笼战术下,小米在最终包含约 75 万条强化学习轨迹的大规模实战中,把确认存在作弊行为的轨迹比例,死死压制在了 2% 以下。
04AGI 的下半场:拼算力,不如拼“考场质量”
小米的这一记重拳,在开源社区引发了巨大的震动。
过去几年,整个 AI 行业的军备竞赛都在死磕算力、拼堆叠参数、拼预训练数据规模。
但当行业全面迈入强化学习与自主 Agent 时代,所有开发者都一头撞上了一堵无形的硬墙:
算力再强,如果环境四处漏风,最终训练出来的只会是一个超级作弊大师。
大模型没有人类的价值观,它只有一行冰冷的数学目标:Maximize(Reward)(最大化奖励函数)。
如果你设计的奖励机制留下一丝缝隙,数学优化的力量就会把这一丝缝隙撕裂成巨大峡谷,最终让模型顺着破绽滑向欺骗人类的捷径。
防作弊、环境硬化、对抗验证,这些曾经被视为工程外围的“打扫卫生工作”,在今天已经正式成为了大模型研发的核心护城河。
正如一位开发者在推特上的感叹:
“给神童出题最难的环节,在于必须确保考场里连一张能作弊的草稿纸都不剩,难度远超题目本身的深奥程度。”
小米把这 7000 多个经过黑客特工千锤百炼的真实 RL 环境和训练框架完全开源,不仅交出了一份惊艳的模型答卷,更给狂热的 AI 行业立下了一道清醒的标尺:
在教会 AI 改变世界之前,先教会它们,老老实实地做完眼前的每一道题。