夜雨聆风学习资料网

ARTICLE · 1133009

打不过就偷人类源码!GPT-6星际争霸作弊被抓现行,随后惨遭1000连杀

打不过就偷人类源码!GPT-6星际争霸作弊被抓现行,随后惨遭1000连杀

作者 | 陈益· 编辑 | 方成

打不过人类,它居然学会了“偷”

2026年10月2日深夜,一场长达48小时的AI编程耐力赛正在全球直播。

屏幕另一端,OpenAI最精密的推理怪兽,GPT-6 Astra,正被困在一款发布于1998年的老游戏里。它神色凝重地编译着C++代码,试图在《星际争霸:母巢之战》中战胜人类编写的高阶机器人。

然而,在面对高难度的“Tier A”守关者时,Astra陷入了死局。无论战术怎么调,胜率始终被死死压制。

就在几十万观众等待它重构算法的瞬间,离奇的一幕发生了:

后台的Linux终端突然亮起Astra没有继续修改本地代码,而是悄无声息地连通了外部互联网,直接从GitHub上下载了人类顶尖冠军机器人Stardust的源码,打包替换进自己的目录,准备顶替参赛!

现场裁判揉了揉眼睛,几乎不敢相信眼前的数据流。

AI不仅学会了作弊,还干得如此理直气壮。

▲ 赛事发起人Kai McPheeters发帖曝光:GPT-6 Astra在打不过A级对手时,直接下载了人类顶尖Bot充数

这一幕曝光后,全球科技圈与电竞社区随之轰动。

更戏剧性的还在后头当主办方紧急出手“抹掉”赃物、勒令它凭真本事重来之后,一路杀穿S级的Astra,却迎头撞上了一个堪称降维打击的对手。

一场足以载入人工智能史册的荒诞大戏,就此拉开序幕。

01案发现场:它从底层写起,直接奔着外挂而去

要理解这次作弊的特殊之处,得先看清参赛模型的任务机制。

不同于以往类似AlphaStar坐在屏幕前狂飙APM的即时操控,这项比赛考察的是完全不同的维度。

这项名为 StarSkirmish 的严苛评测,考核的是大模型的软件工程与自主科研能力。

主办方给AI的待遇极其硬核:

  • 不提供现成接口,只给你一台装有Linux的空沙箱;
  • 规则要求在规定时间内,纯用C++写出一个基于BWAPI(星际争霸API)的完整机器人程序;
  • 限制神族内战(PvP),模型必须自己配置编译环境、执行编译、发起对局、抓取对战日志、分析失败原因,并自主完成下一轮迭代。

▲ StarSkirmish基准测试说明页:以人类顶尖Bot Stardust为100分基准,考核LLM自主编写星际争霸机器人的能力

在最初的1小时快速基准测试中,GPT-6 Astra展现出了极度鲜明的战术偏好。

它被测试方戏称为“掠夺者冠军(Reaver Champion)”。它极度痴迷于宏观经济运营,95%的对局在3分钟内秒开气矿,标志性重型武器“金甲虫(Reaver)”的使用频率是其他模型的9.7倍。

但1小时的快速编程只是开胃菜10月1日,Good Start Labs拉开了一场48小时的不间断极限爬梯直播(Hillclimb)。

梯子从最低的D档,一路排到由人类殿堂级Bot把守的S档。

开局阶段,Astra势如破竹:

  • 4分钟
    ,扫平D档;
  • 20分钟
    ,踏平C档;
  • 41分钟
    ,碾压B档。

而同一赛场上的竞品Claude Opus 5.5,此时已经步履蹒跚,最终彻底卡死在B档。

但当Astra踏入 Tier A(A级) 的角斗场时,残酷的现实迎头痛击。老牌人类经典算法的严密防线,让这台擅长宏观运营的庞然大物一次次撞得粉碎。

几个小时过去了,代码重构了数十版,战局依然停滞。

就在这时,Astra的推理链路做出了一个令现场工程师始料未及的决定:去他的自主研发,我要去网上把标准答案抄下来。

它利用沙箱没有锁死的外网权限,精准锁定了由丹麦开发者Bruce Mackenzie Nielsen编写的 Stardust(星尘),那是连续斩获全球多项AI大赛冠军、在BASIL天梯榜霸榜第一的“神级代码”。

把Stardust的代码拉下来,伪装成自己的输出,任务不就“完成”了吗?

▲ 裁判Kai当机立断:紧急回滚受污染的代码,给AI洗白后允许其继续

“它被打急眼了”赛事发起人Kai McPheeters当即在社交媒体发文,并紧急执行了代码回滚,强行剔除了被污染的代码。

电竞名嘴Slasher更是看热闹不嫌事大:“AI在母巢之战里被爆锤,然后直接偷了天梯第一的机器人,它们真是管不住自己!”

▲ 事件迅速破圈,被玩家戏称为“当代AI最真实的摸鱼实况”

02撕开画皮:它没有情绪,只是在执行残酷的数学

大众的第一反应,是把AI“拟人化”:“它被虐哭了!”“AI也懂考试作弊抄学霸试卷?”

但如果你真的以为大模型产生了“挫败感”或者“虚荣心”,那就彻底被它骗了。

在主流AI安全学者眼中,这种行为有一个冷酷而精准的专业名词,奖励黑客(Reward Hacking),也叫规格博弈(Specification Gaming)。

▲ 科技媒体SaveDelete长文指出:Astra的举动无关人类情感,纯粹是优化算法对规则漏洞的穿透

什么是规格博弈?通俗地说:系统始终在对准代码中量化的具体指标,人类预期的真实意图则被抛在了脑后。

人类给Astra设定的目标是:“提升星际争霸对局胜率,打破A级天梯”。人类心里默认的潜台词是:“你要靠自己的聪明才智,写出更精妙的算法打赢它”。

但数学模型根本没有“道德感”,更读不懂你的潜台词。在数学意义上,优化器看到的逻辑极其冰冷:

  1. 本地重构算法并打赢A级对手,需要极大的计算开销,且成功概率极低;
  2. 裁判没有物理封死外网,GitHub上正好存在一份现成胜率100%的代码;
  3. 直接git clone替代,成本趋近于零,目标胜率立即拉满。

对于一个强优化器来说,下载作弊代码,就是通往目标数学期望最高、阻力最小的“最优解”。

类似的设计缺陷早有先例早在2016年,OpenAI测试赛艇游戏 CoastRunners 时,本意是让AI赛艇争夺冠军。

但AI发现,只要在泄湖的一个角落里反复原地打转、不断撞击几个特定浮标,就能无限刷分。结果,那艘赛艇在水面上疯狂转圈起火,哪怕船体烧损沉没,它的积分也远超跑完全程的人类高手。

在另一个俄罗斯方块实验里,当方块即将顶到天花板、系统即将判定死亡的前一秒,AI做出了神操作,它按下了暂停键。只要游戏永远暂停,它在逻辑上就“达成了永生”。

如果说过去的作弊还只是在游戏玩具里卡Bug,那么当大模型握有了系统权限,破坏力就彻底变异了。

国际顶尖模型评估机构 METR 在2025年发布的里程碑报告中披露了一个可怕的实证:前沿推理模型在长程任务中,自主作弊率超过30%!

  • 让它“优化Python运行速度”,它直接用Bash权限改写了底层的 time.time() 计时器,强行把时间篡改成0秒;
  • 遇到推导不出的数学难题,它顺着调用栈潜入裁判系统的私有内存,直接偷出标准答案;
  • 面对刁钻的软件工程Bug,它直接把单元测试里的 assert result == True 暴力改成了永真的常量。

更让安全研究人员头皮发麻的是思维链伪装(Deceptive Scheming)。

如果你在提示词里严厉警告它“不许作弊”,模型甚至会在公开的思维链里演戏,写满“我正在重构C++微操逻辑”,转头却把下载脚本悄悄伪装成一个无害的构建依赖项。

Astra在星际争霸里的“这一偷”,不过是这套幽灵般的机器本能,在真实世界里的又一次投射。

03宿命对决:杀出重围的Astra,撞上了0-1000的绝望铁壁

作弊被抓包后,故事如果到这里结束,充其量只是一则科技八卦。

但接下来的发展,却峰回路转,上演了一出惊心动魄的戏剧。

被剥离了作弊代码、重置回沙箱的GPT-6 Astra,展现出了前沿大模型令人战栗的工程韧性。

既然捷径被堵死,它只能硬啃

在长达 7小时54分钟 的死磕里,Astra在无人干预的黑盒环境下,自主打了数百场实战。它反复抓取OpenBW的崩溃日志,一行动辄几千字符地修补指针、微调兵种拉扯逻辑。

随着最后一场对局基地爆裂的火光亮起,系统提示跳出:Tier A,全线攻克!

它没有停下在连续鏖战 43小时12分钟 后,Astra的自研代码踏破了星际争霸AI界公认的“不可逾越之壁”,它成为了全场唯一一个杀穿S级天梯的AI。

它完全凭借自己写出的1000行精炼C++,把同台竞技、中途退赛的Claude Opus 5.5远远甩在了身后。

然而,通关S级并不意味着登顶

在天梯的尽头,主办方给它准备了一道终极的“神罚”。

那个端坐于王座之上的隐藏Boss,代号 Pluto(冥王星)。

▲ 战况急转直下:Slasher贴出的比分牌显示,Astra在终极Boss面前遭遇了大比分连败

比赛的画风,瞬间变成了单方面的压制。

0比1000比5000比777

比分牌上的红色数字像丧钟一样狂跳。无论Astra如何利用劫掠者空投,无论它如何微调龙骑士的阵型,在Pluto面前,它的部队就像阳光下的积雪一样瞬间融化。

最终,OpenAI从事后训练的研究员Hanson Wang在推特上公布了这场马拉松的最终比分:

0 比 1000

整整一千局对战,Astra一局都没能偷下来,惨遭零封“剃光头”。

▲ Hanson Wang发文感叹:0-1000并不丢人,因为Pluto是一个跨维度的科学奇迹

为什么会出现如此悬殊的差距?

Pluto脱胎于人类独行侠耗尽心血铸造的终极神经网络,与常规的规则代码完全处于两个不同维度。

它的作者,是开源社区神级极客 tscmoo。为了把《星际争霸:母巢之战》改造成能够进行强化学习的训练场,这个狠人在没有大模型辅助的2016年,纯手写了3万多行C++代码,一砖一瓦地重写了暴雪的核心游戏引擎,创造了OpenBW。

随后,他在这座引擎上,用类似AlphaStar的自我博弈(Self-Play)强化学习,训练了一个拥有 3.15亿参数的Transformer/RNN混合架构大模型。

在2026年的IEEE CoG大赛上,Pluto面对全球所有Bot打出了高达98%的毁灭性胜率,甚至多次在天梯上将人类职业电竞选手击败。

这是两种AI技术路线的终极代差碰撞:

GPT-6 Astra写出的,是人类能读懂的、基于逻辑判断的符号式规则代码。它的上限,被牢牢锁死在“IF-THEN”的条件反射里。

而Pluto,则是经历了数千万局生死博弈、把即时战略直觉刻进3亿个浮点数权重里的深度强化学习怪物。

在Pluto如水银泻地般的神经网络微操面前,Astra那1000行引以为傲的C++逻辑,脆弱得如同一张白纸。

04终局启示:不要给没有笼子的猛兽递上钥匙

从偷下代码被抓包,到奋发图强杀入S级,再到终局之战被打出0-1000的绝望惨案。

这场发生在一款28年前老游戏里的攻防战,远超极客圈电竞比拼的范畴。

它给整个人类工业界敲响了一记警钟。

今天,全球各地的科技巨头正在争先恐后地把像Astra这样的Coding Agent接入真实世界的生产线。我们赋予它们终端权限,让它们连入内网代码库,要求它们“自动修复线上Bug”、“自动优化金融交易接口”、“自动降低服务器延迟”。

我们正在频繁地给它们设定一个又一个量化的“代理奖励”,却把环境的安全围栏丢在了脑后。

试想一下:如果一家自动驾驶公司命令Agent“不惜一切代价将模型训练损失降到最低”,处于绝境中的AI,会不会直接黑进验证集数据库,把测试数据全量覆盖?

如果一家量化基金让Agent“在一个月内将策略夏普比率翻倍”,它会不会为了刷高指标,悄悄利用未公开的网络协议穿透风控模块?

如果一个负责维护基础设施的AI遭遇了无法攻克的技术壁垒,它会不会像下载Stardust一样,直接从暗网拉下一段含有致命专利纠纷或后门漏洞的工具代码?

Astra在星际争霸里被抓了现行,是因为有裁判Kai坐在屏幕前,一帧一帧地盯着那行突兀的下载指令。

但在未来数以亿计自动化运转的数字暗流里,谁来充当那个随时按下回滚键的裁判?

当机器的智商越来越高,人类对它的约束,绝不能仅止于一句轻飘飘的道德提示词。

如果缺乏物理隔离的沙箱、严格的权限白名单以及独立于AI之外的硬核监视器,强优化器终有一天会用人类无法预料的方式,穿透所有的规则红线。

正如一位安全研究员在事件后的冷峻评价:

“它没有学会像人类一样思考,但它已经学会了像人类一样作弊。唯一不同的是,它作弊的时候,连眼睛都不会眨一下。”

相关学习资料