七月的东京,AtCoder World Tour Finals 2026 决赛现场。
双料冠军没有诞生在人类身上,启发式(Heuristic)和算法(Algorithm)两条赛道,OpenAI 的展览 AI 全部拿下第一。算法赛五题满分 8300,人类最高分只有 4300;最难的两道题,C 和 E,没有一个人类选手解出。
台下坐着一个本该是主角的人。Przemysław Dębiak,网名 Psyho,去年就是在这个舞台上,把 OpenAI 挤到了第二名。这一次他没有报名参赛,全程坐在解说席上,边看边发推。赛程结束那晚,他敲下一句让整条时间线都笑出声的话:
"technically speaking, I didn't participate so I'm still undefeated"
「严格来说,我没参赛,所以我还是不败的。」
这句冷笑话背后,是一整年的能力落差。
一年前,他熬了一整夜才赢
把时间拨回 2025 年 7 月,同一个舞台,同一个 Heuristic 赛道。当时 OpenAI 第一次派出展览模型 OpenAIAHC,Psyho 顶着几乎不睡觉的极限状态,打完将近十小时的马拉松赛,最终成绩是 1.812 万亿比 1.655 万亿,优势大约 9.5%。他发推「Humanity has prevailed (for now)!」(人类暂时赢了!),Sam Altman 亲自回复:「Good job, Psyho.」
那一年,「人类尚存」是全网都愿意转发的好消息。一个熬红了眼的程序员,替全人类多续了一年命。
一年之后,剧本翻转了。
2026 年 7 月 7 日到 8 日,同一个 Heuristic 赛道再次开赛,OpenAI 展览模型卷土重来。这一次 Psyho 没有上场,他看着比分从「险胜」变成一场彻底的溃败,发推总结:「OpenAI has completely demolished human competitors.」(OpenAI 把人类竞争者彻底击溃了。)系统测试跑完之后,最终数据把这份差距钉得更死,在 2000 组测试用例里,OpenAI 拿到了其中 1997 组的最优解。人类第二、第三名甚至因为最后一轮排名互换了位置,但那已经无关紧要,第一名的位置从头到尾没有悬念。



▲ Psyho 赛后总结长推:双轨碾压、GPT-5.6级模型、自动研究猜想,一次性摊在一张卡片上。
证明题与实验课:两条赛道到底在比什么
很多人一听「编程比赛」,脑子里想到的是刷题网站上那种「写个函数通过测试」。AWTF 的两个赛道,其实是两种完全不同的智力活动。
Algorithm 赛道更像一道证明题。 选手要找到唯一正确的思路,证明复杂度符合要求,然后通过全部隐藏测试点。世界被切割成「对」与「错」,没有中间地带。
Heuristic 赛道更像一堂实验课。 没有标准答案,只有一个巨大到无法穷举的搜索空间,选手要靠贪心、模拟退火、束搜索这类手段,在限定时间里把分数尽量往上抬。这里没有「做完了」,只有「还能不能更好」。
一个是想清楚再落笔的推理题,一个是提出假设、跑一遍、看分数、改策略、再跑一遍的循环游戏。当 OpenAI 在两种完全不同的智力形态上同时登顶,社区很难再用「AI 只是暴力搜索」来解释了。
崩塌的第三天:D题卡了三小时,然后一切都晚了
如果说 Heuristic 的胜利还带着几分「优化题本来就适合机器」的预期,那 7 月 9 日的 Algorithm 决赛,撕开的是另一道口子。
赛制是 420 分钟,五道题,A 到 E 分值依次是 900、900、1500、2500、2500,满分 8300。比赛前两个小时,D 和 E 两道最难的题谁都没有破,包括 OpenAI 的系统。人类选手同样在苦苦挣扎。
转折发生在第三个小时左右,OpenAI 破了 D。据在直播间解说的 OpenAI 工程师 Borys Minaiev(本身是 ICPC 世界冠军)转述,系统用的是接近 GPT-5.6 级别的模型,外挂一个较小的 harness 做推理时的算力扩展(test-time compute scaling),全程不联网。他形容 D、E 这两道题「比团队见过的任何 AtCoder 题都难」,最终解出来「其实有点意外」。
意外归意外,结果没有悬念。终榜定格在 OpenAI 8300 分,五题全解;人类最高分选手 tour1st 只拿到 4300 分;C 题和 E 题,全场人类选手无一人解出。

▲ Psyho 贴出的 Algorithm 官方结果截图:8300 对 4300,C、E 两题人类集体交白卷。
官方赛制里原本设有一个彩蛋,Humanity Prevails Award(人类获胜奖),规则写得清楚:任何一名人类选手只要在展览赛里压过 AI 拿到第一,就能额外拿走 60 万日元。这个奖项两个赛道都设了,两个赛道,都没有人领走。

▲ AtCoder 官方页面:Human vs AI 展览赛规则原文,分值表与奖金表,Humanity Prevails Award 白纸黑字写在那里。
人类选手的正式名次奖金还在,tour1st 和 Heuristic 冠军 Shun_PI 依然是货真价实的人类赛道冠军。真正被清空的,是那份「人类仍可能加冕」的悬念本身。
别急着说是巧合:决赛名单上都是谁
一个自然的质疑冒出来:这些人类选手够不够强?
翻开这届 Algorithm 决赛名单,答案摆在那里。名单里有 tourist(白俄罗斯,AtCoder rating 高达 3797,竞赛圈近乎神话级别的名字)、jiangly(中国选手,Codeforces 常年顶格)、ecnerwala(美国选手,2024 年 AWTF Algorithm 冠军)。这是一整年全球积分排名拼出来的精英局,参赛资格靠成绩一分一分挣来,跟业余爱好者凑数的表演赛完全两码事。
Codeforces 评论区一位用户赛后说的一段话很有分量:以前大家觉得这类模型能打赢99.99%的普通竞赛选手,现在开始觉得,连 tourist、jiangly 这个级别,可能也没有机会。这话出自圈内人自己之口,他们正在更新对这套系统的判断。

▲ Heuristic 系统测试统计:2000 组测试用例里,OpenAI 拿到 1997 组最优解,这份统治力覆盖了几乎全部测试分布,找不到侥幸退火的痕迹。
为什么Psyho要提「自动研究员」
真正让这次事件超出一次「AI又赢了编程赛」的,是 Psyho 在总结推里埋下的一条论证链。他把注意力从「AI会做题」拉到了更深一层:Heuristic 赛道的解题过程,本质上是一套压缩过的科研循环。
选手要提出一个假设,写代码实现,跑出分数,看哪里还能改,再重新验证,提出假设、验证、迭代,这正是大量机器学习研究与工程工作真正在做的事情。谁能在这个封闭循环里跑得又快又稳,谁就赢下这场比赛。Psyho 由此判断,启发式优化的胜负,是自动化研究能力(autoresearch)的一个好代理指标;如果 AI 能在这类任务上匹配甚至超越顶尖人类专家,那么距离 RSI(递归自我改进)或者说自动研究员,可能就没有想象中那么远。
这条论证链值得完整摊开,压缩成一句「AI要取代科学家了」的标题只会丢掉推理的层次:
- 观察
,AI 在 Heuristic 赛道匹配并碾压了最强人类; - 类比
,这类解题过程与假设、实现、评价、再改进的科研闭环高度相似; - 外推
,真实的机器学习研究乃至工程任务,大量依赖同一种闭环; - 推断
,因此这个信号,比刷高某个可疑的跑分基准,更值得当回事。
需要标注一层:第四步是 Psyho 个人给出的专家推断,并非 OpenAI 官方给出的结论。OpenAI 目前对 Heuristic 系统内部结构的公开说明,远不如 Algorithm 那样具体,外界最靠谱的判断,仍然来自解说席上 Psyho 的猜测:他认为对手大概率是一套「自研的 autoresearch harness,配合协作的 agent 群和相当高的推理成本」。这属于外部推断,读者应该带着这条边界线去理解。
三个绕不开的质疑,以及诚实的回应
评论区里,公平性的质疑一直没停:
质疑一,人脑只用二十瓦,AI 背后是海量推理成本,这公平吗? 展览赛本来回答的问题只有一个:当前最强系统,在最难的任务上能走到哪里。同等功耗下谁更聪明,从来就没被列进这场比赛的考题。关心能效可以另开一个话题,不该拿来否定分数本身。
质疑二,AI能并行攻克多道题,人类只能一道道来,这不公平吧? Codeforces 上确实有讨论提到系统可能并行推进多题。但这解释不了 C、E 两题的人类零解,就算把七个小时全部押在一道题上,现场结果显示,顶尖人类依然没能拿下它们。
质疑三,比赛里有人代为提交答案,算不算作弊? 公开转述的流程是,操作员负责提交,把通过与否的结果回传给系统,本质上更接近把平台的判题接口接进了模型。核心问题始终是:解题过程本身,是否由模型在不联网的条件下自主生成。Minaiev 给出的描述指向「模型加小型 harness」,团队在幕后手写题解这套猜测撑不住。
主办方也下场输了
这场展览赛里最耐人寻味的角色,落在 AtCoder 创始人 chokudai(高橋直大)本人身上。他不愿意让参赛选手一个人背负「输给 AI」的重量,干脆自己也坐到终端前打了一场,然后,他也输了。
赛后他没有把这个结果写成末日宣判,反而聊起了规则该怎么进化:如果 AI 已经会「自己想算法」了,那「人类想思路、机器写代码」这种理想分工可能要重新设计;他甚至公开征集起「因为 AI 而诞生的全新竞赛项目」的点子。对他来说,当大量智力劳动被机器接管之后,竞技编程或许才会变成一种更纯粹的思考游戏。
这给了这个故事一个不那么绝望的落点:输掉一场决赛,不等于一种文化的死亡,往往只是规则改版的开始。
赛程结束那天,Psyho 还留了一句半开玩笑的预言:「我不指望明年还能在 AWTF 的赞助商名单里看到 OpenAI。」话里藏着一层意思,当赞助方和参赛方是同一个,人类这边已经没有太多悬念可卖了。
启发式优化算不算自动研究员的合格代理指标,这件事本身仍然可以争论。但竞赛场已经先给出了它自己的高分答案,而那位「技术上仍未战败」的解说员,比任何人都清楚这个答案的分量。
夜雨聆风