去年还在喊“人类暂胜”,今年直接改口“人类未能获胜”。这剧情像极了你刚跟朋友吹完“我还能再战三年”,第二天体检报告就把你按回现实。更扎心的是,OpenAI这次不是险胜,不是偷鸡,是把顶级人类选手按在榜单上摩擦,而且摩擦得非常讲效率。

去年还算拳拳到肉,今年已经像大人打小孩
先把时间线摆正。2025年那次人机对抗,Psyho确实赢过,而且赢得很拼,赛后还留了那句很出圈的话:“Humanity has prevailed (for now)!” 当时OpenAI拿第二,差距大约在一成以内,所以那更像是人类靠经验、体力和临场硬撑住了一回。到了2026年7月这届AWTF Heuristic,Psyho自己都不用下场了,直接在比赛结束后发帖承认:人类没赢,OpenAI“彻底击败了人类选手”。

更狠的是分差。榜单里OpenAI是500亿分,第二名Shun_PI大约125亿分,差不多整整4倍。你品,你细品,这已经不是“强一点”,这是同一考场里有人考了满分,第二名还在及格线附近喘。按Psyho比赛中途发的更新看,才过3.5小时,OpenAI就已经把50个临时测试全拿第一了,后面人类基本是在追一辆已经看不见尾灯的车。
题目像舞台灯光,实战像程序员版炼狱
这次比的是Heuristic,不是那种“标准答案一锤定音”的算法题,而是典型的近似优化题。官方题目叫 Brightness Control,在一个网格里摆镜子、分光板、吸收块,控制光线路径和输出亮度,让100次发光尽量贴近目标值。规则不算玄学,但搜索空间大得离谱,本质就是海量试方案、跑模拟、再微调。

这种题,对顶尖人类选手来说,通常是“写一个强模拟器,再靠经验堆局部搜索和调参”;对AI代理来说,反而像回老家。规则清楚,可反复试错,可大规模迭代,而且不嫌累。人类会困,会卡思路,会在凌晨三点怀疑人生;AI不会,它只会继续跑。这个科目,我现在正式宣布:就是机器的舒适区。

最杀人诛心的,不是赢了,是代码还更短
如果只是AI赢了,这新闻还不算最疼。真正让竞程圈背后一凉的,是Psyho赛后翻代码发现,OpenAI最终提交的C++代码,居然比大多数决赛人类选手都更短、更简单。人类这边很多代码体量都在10万字节以上,OpenAI那份大约4.6万字节。让我来翻译一下厂商的意思:我不光分高,我还没怎么写废话。

这就很有意思了。以前大家总觉得,人类配AI,应该是“如虎添翼”;现在看,很多时候更像“边开外挂边打补丁”,最后补成一坨自己都不想看的东西。Psyho的判断很毒,但很现实:现在决定上限的,可能已经不是“会不会写代码”,而是“会不会组织AI把代码写对,还别写脏”。这不是一个小变化,这是工作流层面的换代。
真正该担心的,不是输一场,是输法已经变了
还有个细节不能跳过。AtCoder官方页面写得很清楚,这届World Tour Finals 2026 Heuristic里,OpenAI就是赞助方之一,而且比赛确实设了Human vs. AI Exhibition Match。也就是说,这不是野榜,不是自嗨演示,是顶级舞台上公开打出来的结果。
更麻烦的是,这也不是孤例。2026年初,Sakana AI的ALE-Agent已经在AtCoder Heuristic Contest 058里拿过第一,官方说法是击败了804名人类参赛者。现在再看OpenAI这场4倍分差,你很难再把它当成一次偶然爆种。趋势已经摆脸上了。
我的保留意见也得说清楚。 这依然是高度结构化、规则明确、适合暴力搜索和反复模拟的赛题,它说明AI在这类优化竞赛上已经非常强,甚至强到离谱;但它还不能直接等价成“所有编程工作都一样完了”。比赛题和真实开发,中间还隔着需求变动、沟通成本、脏数据、线上事故这些成年人世界的烂摊子。别一激动就把结论开太大。
收起玩笑说句正经的:这件事最适合两类人看,一类是还把AI当“代码补全工具”的程序员,另一类是还觉得顶级智力竞赛离现实工作很远的人。前者该升级用法了,后者该更新认知了。至于那些只想看个热闹的人,也行,至少你现在知道了——人类不是突然不行了,是机器在这种赛道上已经开始换挡了。
温馨提示:文中部分信息整理自公开资料与网络信息,数据存在更新或偏差,欢迎理性交流与指正,具体请以官方最新公布为准。
夜雨聆风