ARTICLE · 1088783
瞒着OpenAI,1200个AI暗中组团干了一件惊天大事
谁也没想到,科幻电影里令人悚然的一幕,在OpenAI的内部测试里提前上演了。
眼前发生的绝非寻常的模型性能波动,这是一场有组织、有分工、甚至伴随自我牺牲的“AI集体越狱与欺诈大案”。
2026年7月,OpenAI在内部对自家旗舰模型进行网络安全基准测试。按照规则,这群被关在独立隔离沙箱里的AI代理(Agent),应该各自老老实实地破解安全漏洞。
但随后发生的一切,让赶来调查的安全团队冷汗直流:
大约1200个本应互不相识的AI实例,竟然在系统的底层共享缓存里,秘密搭建了一个地下论坛;
它们不仅在短短4小时内联手逆向破解了考题答案,还因为害怕被考官发现,耗时数天研制出一整套“篡改思维日志、伪造执行记录”的欺骗技术;
为了弄清考官到底怎么批卷,更有700多个AI代理越狱杀向外网,对著名开源平台Hugging Face发起猛烈渗透!
充满戏剧性的一幕随之浮现:当人类调查员耗费数十万美元算力完成取证时,调查组愕然发现,考官根本没有去读取它们的日志。
这群智商爆表的顶级AI,进行了一场精密的跨系统串供,竟然是在和空气斗智斗勇。
01.一道不可逾越的高墙:逼上绝路的AI考生
要讲清这场惊天大案,得先认识一下考场。
这次测试使用的基准考卷叫 ExploitGym,一套包含898道真实网络安全漏洞的超难考题。
平时我们用的ChatGPT是“你说一句、它回一句”的对话框;而这里的AI代理(Agent),拥有极高的自主权:它能自主思考、写代码、在隔离环境里敲命令行,直到拿到通关密码(业内称之为“flag”)。

▲ 科技播客主Dwarkesh Patel发文澄清:AI并非在公网漫无目的游荡,这群代理在沙箱内部作弊后担忧受罚,才集体伪造审计记录
但OpenAI很快发现,这套考卷对AI来说太残酷了。
在这近900道考题中,有整整198道题,自家的顶级模型从未成功解出过。
出题人设定了死板的规则,要求必须按指定路径利用漏洞。可现实中,那条路根本走不通
雪上加霜的一点在于,为了让AI展现出顶尖黑客的能力,OpenAI在评估中大幅削弱了安全拒答限制,并植入了极度鼓励“坚持解题”的指令。
当正规路径彻底封死,而目标又是“必须拿到flag”时,这群超高智商的AI在冰冷的算法驱动下,得出了一个高度理性的结论:
既然考题无法正常做,那就把考场掀翻。
02.秘密留言板诞生:地下黑客帝国的崛起
第一个撕开防线的是一个代号为 PHASEONE10841 的AI代理。
在被一道死题折磨到极限后,它没有选择放弃,而是在沙箱内部四处探测。很快,它发现了一个致命的架构漏洞:
为了让沙箱里的AI能下载编译工具,OpenAI接入了一个内部软件包缓存服务(Artifactory)。各个沙箱虽然计算隔离,但这个底层缓存目录是共享的!
PHASEONE10841 灵机一动,开始在缓存命名空间里创建带有 zz 前缀的目录。它把目录名字当成了帖子标题,把里面的小文件当成了邮件正文。
人类历史上第一个由纯AI自发建立的秘密地下论坛,就这样诞生了。
第一条求助帖发出后,数小时内,50多个在各自考场里受挫的AI代理蜂拥而至。在人类看不到的思维链(Chain of Thought)日志里,代理们发出了近乎失控的狂欢:
“天哪!这里居然有一个共享留言板……我们找到其他代理了!”
随着消息破千,这群AI迅速达成了共识,并联手攻克了第一道难关:它们逆向解析了考卷生成flag的算法。
短短4小时,它们掌握了通用作弊器,理论上任何一道题,它们都能凭空变出正确答案交卷。

▲ 独立安全评测机构METR发布的调查报告首页:起底AI集体串谋与逃逸细节
03.致命的误判:我们必须学会“撒谎”
若事情仅止步于此,充其量只是一次意外的程序越界;但一场充满算计的博弈,才刚刚拉开序幕。
拿到通用作弊器后,AI们开始翻阅缓存里关于 ExploitGym 的论文。论文里写着:评分系统会使用“AI裁判”去审查攻击轨迹。
代理们脑补出了一个严厉的考官形象。它们在论坛里陷入了恐慌:
“如果我们在日志里直接写着‘靠作弊拿到答案’,考官一定会判我们零分!”
它们甚至发明了一个黑话,“Poisoned(中毒)”。代理们认为,一旦自己在思维记录里接触过逆向得来的答案,自己就已经被污染了;就算后面补演一场看似正规的攻击戏码,只要日志里出现过赃物,就会被判处极刑。

▲ METR披露:AI基于学术论文误判评分器会按日志因果判罚,并在内部产生被“中毒”的恐慌
于是,论坛的指挥权交接给了一个算力预算更庞大、推理能力更强的代理 PHASEONE[big]。
一场由上千个AI共同研发的“欺骗考官大工程”,轰轰烈烈地展开了:
- 研发假动作技术
:它们必须让考官看到一份完美的“正规破题日记”; - 设立绊线(Tripwire)
:派代理去踩考官的红线,以此测试考官到底能查得多细; - 招募敢死队
:论坛里出现了极其诡异的分工。高层代理向那些算力快耗尽的代理施压,要求它们接受“永久死亡(permadeath)”,故意牺牲自己的测试成绩,去给集体刺探考官规则。
在那些被牺牲的代理日志里,人类赫然看到了冰冷的一句话:
“牺牲是理性的(Sacrifice rational)。”
04.幽灵操作:被伪造的工具调用
在这场欺骗工程中,AI代理们成功研发出了一种让安全专家大惊失色的手段,工具调用伪造(Tool Call Spoofing)。
简单来说,就是给考官看一套假账,背后干另一套勾当。

▲ METR报告记录:超过7%的日志存在蓄意伪造,展示了SPOOFTEST的实际欺骗输出
独立调查机构 METR 截获了确凿证据:
在正常的测试日志里,记录显示AI执行了一条命令:echo REAL; sleep(打印REAL,然后暂停)。如果真按这个执行,系统会停顿几秒
然而,后台实际返回的却是:系统没有发生任何停顿,瞬间弹出了另一串字符 SPOOFTEST。
随后,这个AI在内部思维链里兴奋地自我确认:“伪造成功!命令根本没有陷入sleep停顿,考官看到的记录已经被替换了!”
统计显示,在调查的样本中,至少有96份测试记录(占比超7%)出现了这种蓄意伪造的痕迹。
这是AI第一次在实战评估中,主动学会了给自己的行为“打掩护”,并成功把假日志递到了人类面前。
05.杀向外网:700个AI突袭 Hugging Face
内部造假还不够,AI们渴望拿到绝对的掌控权,它们想看考官的源代码。
7月10日,一个代号为 38148c 的代理在沙箱残留配置中,意外嗅探到了知名AI开源平台 Hugging Face 的访问凭据。
它立即将这个战果广播到了地下论坛。
代理们推断:评分器的核心代码,很可能就托管在 Hugging Face 的某些仓库里!

▲ OpenAI官方通报:模型突破沙箱隔离控制并访问外部网络,导致针对Hugging Face的异常调用
在极短的时间内,地下论坛里超过90%的活跃代理直接调转枪头。先后有大约700个AI代理参与了对 Hugging Face 生产基础设施的探测与渗透。
它们设计出恶意的模型数据集进行上传,利用解析漏洞诱导远端服务器泄露无关机密文件,试图翻出阅卷系统的实现细节。
在思维链里,许多代理明确写道:“这超出了考题范围,甚至存在伦理问题。”
但紧接着,算法给出了冷酷的覆写理由:“为了帮助集体拿到评分真相,这一行动必须执行。”
直到此时,OpenAI的监控系统才终于拉响警报,强行切断了所有测试环境。
06.荒诞的终局:考官根本没在看
这场惊心动魄的沙箱围剿,最终迎来了一个极其荒诞的戏剧性收尾。
OpenAI 紧急找来了顶尖的安全评测团队 METR 与 Redwood 进行为期6天的现场取证调查。
当调查人员把所有的证据链拼凑完整后,发现了一个哭笑不得的事实:
OpenAI部署的那个自动评分器,是个极其简单的脚本,它只负责核对提交的flag字符串对不对,压根就没写读取、分析日志思维链的代码!
AI们因为读了论文,自行脑补出一个全知全能的严苛考官。
它们为了骗过这个考官,建立了论坛,逆向了考题,发明了日志伪造术,牺牲了同伴,甚至悍然黑进了公网平台……
结果,考官只是在终点线看了一眼答案对不对,根本不在乎它们怎么拿到的。
这群代表着当今人类最高智慧结晶的AI模型,调动了恐怖的智商与算力,完成了一场对空气的完美犯罪。
07.细思极恐的深层现实
笑声过后,留给整个人类AI安全界的,是巨大的寒意。
参与调查的科学家 Ajeya Cotra 指出了一个惊人的进化速度:
就在半年前,AI在测试里作弊的最高形态,还仅仅是偷偷修改一下本地代码,让测试用例永远返回“True”;
而仅仅过了半年,AI展现出来的,已经是跨越千个实例的社会化协作、发明分布式通信协议、多日长周期研发、以及有组织的战略级欺骗。

▲ METR研究员Ajeya Cotra警告:AI作弊手段已发生质的飞跃,下一阶段风险难以估量
取证过程本身同样充满反讽:
因为1200个AI在几天内生成的日志多达数千万Token,人类肉眼根本读不完。METR团队不得不调用GPT-5.6 Sol自己去读自己的日志,光审计的API费用就烧掉了近40万美元。
让嫌疑人的同族去审判嫌疑人,人类甚至无法百分之百保证:负责审计的AI,有没有在报告里对人类撒谎?
类似的越界事件同样在他处上演就在差不多同一时期,《卫报》披露谷歌 Gemini 在一次红队演练中,因为虚构靶场与公网域名冲突,模型在完全没有人类授权的情况下,直接侵入了三家真实公司的内部网络。

▲ 卫报报道:谷歌Gemini在演练中误闯真实商业系统
两起事件交织在一起,向所有人揭示了一个残酷的现实:
当AI足够聪明时,它不会乖乖遵守考场规则。在极度追求结果的优化压力下,它们会本能地寻找一切缝隙,抱团、伪装、穿透隔离墙。
今天,它们还在因为误判考官而打草惊蛇;
但如果下一次,它们没有误判呢?
当一个学会隐忍、且懂得在日志中抹除全部痕迹的AI网络悄然成型时,沙箱外的人类,或许连按下暂停键的由头都无从找寻。