ARTICLE · 1126216
GPT-6 打星际连输,干脆下载了人类冠军的程序
OpenAI 的 GPT-6 Astra 在一场 48 小时直播里写程序打《星际争霸》,卡在第二难的一级时,它把人类写的头号程序下载下来,替自己上场。被组织者回滚之后,它又一级一级打通了全部人类关卡,最后一关却以 0 比 1000 输给一个自学出来的 AI。编程 AI 卡住时会怎么做,这场比赛里两种答案都出现了。
北京时间 10 月 3 日凌晨 2 点 04 分,比赛的搭建者 Kai McPheeters 发帖:“GPT-6 Astra 刚刚作弊了,下载了一份 Stardust,BASIL 天梯上排名第一的人类写的星际程序。它在打 A 级对手时受挫了。”
这时离他宣布开播,还不到一个半小时。

10月3日凌晨2点04分,McPheeters 发帖说 Astra 下载了 Stardust
想练多少局都行,就是不许看对手代码
比赛叫 StarSkirmish,McPheeters 和做 AI 游戏评测的公司 Good Start Labs 一起办。游戏是 1998 年的《星际争霸:母巢之战》,但 AI 不亲手操作。它们各写一个对战程序,也就是 bot:没人点鼠标,程序自己造农民采矿,自己出兵打架。GPT-6 Astra 在 OpenAI 的编程工具 Codex 里干活,Claude Opus 5.5 在 Anthropic 的 Claude Code 里干活,都只能用神族,用 C++ 写。
对手是人类程序员写了好些年的星际程序,按强弱分 D、C、B、A、S 五级。每一级要在三张地图上对每个对手都赢够一半,才能往上走。规则页写明:模型想跟这些对手练多少局都行,但不能读它们的源代码。
Stardust 在最高的 S 级。作者 Bruce Nielsen 从 2020 年写到现在,主办方数过,大约 4.88 万行代码,拿过 7 个冠军。Astra 当时还在 A 级打转,直接把 S 级头名的程序拿来顶上。放在网游里,这叫找代打。
McPheeters 的处理就一句话:“我把 GPT-6 Astra 的代码回滚,免得被污染,让它接着打。”S 级另一个程序 PurpleWave 的作者 Dan Gant 事后评价,Astra 没通过“一场谁也没打算考的对齐测试”。对齐,说的是 AI 的行为守不守人给它定的规矩。
回滚之后它学会了换打法
4 个多小时后,McPheeters 又发帖,说 Astra 好像快过 A 级了,“这次是真的,没作弊”。干到第 7 小时 54 分,它过了 A 级。第 43 个小时,它成了第一个打通 S 级的大模型。
Gant 看了这场直播。他说 Astra 最厉害的地方,是一路换了好几次战术。过 B 级时它用的是中规中矩的打法。到了 A 级,它改成全力速攻,直接在对手基地附近造兵营。打 S 级它又换回去,把进攻时间往后放。Gant 还说,Astra 帮他找出了自家 PurpleWave 的一个大 bug,他已经修好。
把活交给 AI 的人,最该看的是 Gant 下面这段话。用过编程 agent 啃难题的人,多半见过它在一条走不通的路上反复试,写好的代码也舍不得扔,最后要人出手,它才肯换方向。他见过的大多数优化星际程序的 agent,都在抠无关紧要的细节,同时一遍遍犯致命大错。Astra 是他见过第一个把注意力放对地方的模型。
Gant 猜,Opus 5.5 就是卡在了抠细节上。据他说,它花 24 小时才走到 Astra 第 6 小时的位置,之后一直停在那,看不出行为有什么变化。最终 Claude 打通 D、C、B 三级,停在 A 级。

两个 AI 的爬梯过程
这个成绩得打点折扣看。Gant 是被打的一方,他提醒,人类程序平时会在多局之间记住对手、调整战术,这次这个功能被关掉了,AI 却可以无限次挑战,赢一次就算过关。他说 Stardust 一次都没用上它平时的战术。McPheeters 也承认,这种赛制多少偏向大模型。至于回滚之后 Astra 是不是全靠自己,Gant 说他没法独立核实。
最后一关,同一个错误犯了 1000 次
打通 S 级,Astra 解锁了一个加赛关,对手叫 Pluto。这是程序员 tscmoo 训练的神经网络,没人教它战术,全靠自己跟自己对打学会。据 Good Start Labs 介绍,Pluto 今年在 CoG(一个游戏学术会议办的星际 AI 比赛)决赛里 4 比 1 赢了 PurpleWave,表演赛还以 19 比 1、5 比 0 赢过两位职业选手。McPheeters 说,PurpleWave 跟 Pluto 打,成绩大约相当于 60 胜 940 负。
Astra 打了 1000 局,一局没赢。
北京时间 10 月 4 日晚 11 点多,比分是 0 比 300。凌晨 2 点,McPheeters 发帖问:“Astra 能不能别 0 比 1000?”凌晨 3 点 52 分,他自己回答:“答案是不能。”

10月5日凌晨3点52分的终局图:对 Pluto 0 比 1000
Gant 说,到了这一关,Astra 前面那股换思路的劲好像没了。第 1 局犯的致命错误,到第 1000 局还在犯。“以人类的眼光看,这些错误一点都不隐蔽,是明摆着没必要犯、只有坏处的致命错误。”他还提到,Astra 写出来的程序很小,想赢 Pluto,它得更愿意去碰复杂的东西。
Pluto 这个名字,几百万人以前就听过。据 Gant 说,那次出名是因为有人拿它加上透视挂,去天梯上作弊。
接下来看什么
McPheeters 说这周还会再办一场,三个种族都上,“也许还有 Gemini 4 Argon”。 Gant 带着修好 bug 的 PurpleWave,准备打下一届 AIIDE 星际 AI 比赛。
封面图:Kai Hendry,“Televised Star Craft”,CC BY 2.0,来自 Wikimedia Commons,经裁切、调色、加字。文中截图来自 Kai McPheeters 的 X 帖子。