ARTICLE · 1125265
追平GPT-6、自造下一代AI?谷歌新核弹掀起“天网”狂欢,真相却极度打脸
“它每周都在自己变强”
2026年10月初,谷歌PyTorch/TPU团队的工程师亚当·曼茨(Adam Mainz),在社交平台上随手敲下了这行极短的文字,文末还附带了一个火焰表情。

▲ 谷歌工程师亚当·曼茨的原帖:极其简短的一行字,成为全网各种猜想的开端
仅仅六个英文单词,几个小时内就在硅谷技术圈掀起巨大波澜。
知名科技博主们瞬间坐不住了,截图、转发、疯狂脑补。有人甚至连夜搬出了一张神秘的排行榜单,把曼茨的话与最新出炉的测试成绩直接拼在了一起:
“谷歌在模型研发里看到了RSI的早期迹象!”“它在偷偷制造下一代AI!”“别睡了,递归自我改进(RSI)的飞轮,已经正式转动了!”

▲ 社区博主将“每周变强”与自研榜单强行绑定,迅速掀起全网的科幻式狂欢
科幻电影里最令人窒息的一幕仿佛成了现实:AI不再需要人类给它喂数据、调参数,而是关起门来,在机房的轰鸣声中自行写代码、改架构、生出更强大的“下一代自己”。
可还没等大众从“天网苏醒”的震撼中缓过神来,曼茨本人就冷冷地折返回评论区,甩下一记毫无回旋余地的澄清:
“郑重澄清:这跟 RSI 完全没有任何关系。”

▲ 面对越传越邪乎的谣言,原作者不得不出面公开“浇灭冷水”
狂欢戛然而止但一个更大的疑问浮出水面:
既然排除所谓的AI成精自我进化,谷歌刚刚端出来的这个代号为 Gemini 4 Argon 的新怪物,究竟在内部干了什么?为什么全网顶尖的研究员,会突然集体陷入对“递归自我改进”的群体性幻觉?
01.狂斩300TB内存、生吞80万行代码:谷歌造出了什么?
先看官方给出的真实账本
9月30日,Google DeepMind 首席 AI 架构师科莱(Koray Kavukcuoglu)正式宣布推出 Gemini 4 Argon。官方通篇博客没有出现一次虚浮的科幻辞藻,却字字透着硬核工业底气。

▲ 官方博客明确聚焦于软件工程、网络安全防御与企业长程工作流
最扎眼的一项技术规格,是它的单次输出上限直接拔高到了惊人的 100 万 token。
平常我们跟大模型聊天,模型吐出一两千字就常常卡壳或胡言乱语;而 100 万 token 的单次输出能力,意味着它不需要人类在旁边一段一段“继续”,一口气就能喷涌出整套庞大系统的全部代码库。
为了展现这套系统的硬实力,谷歌罕见地公开了模型在公司内部当“高级打工人”的实际战果:
- 内存大清洗
:一组 Argon 智能体被丢进了谷歌庞大的服务器集群中,自主分析全舰队的底层遥测数据,找漏洞、抠优化。部署之后,它直接释放了超过 300 TiB(太字节)的服务器内存,预估后续总共能省下 500 TiB 到 1 PiB 的恐怖资源。 - 重构操作系统内核
:在谷歌下一代操作系统 Fuchsia 中,Argon 参与了把 Zircon 内核从 C/C++ 彻底迁移到 Rust 的死磕任务,涉及的代码规模高达整整 80 万行以上。 - 改写底层视频解码器
:在核心库 libgav1 的优化中,它一口气重写了约 3.2 万行底层 SIMD 指令代码。改完后的内存安全版本,运行速度达到了原有 Rust 移植版的 2.7 倍。
不仅在内部表现抢眼,在第三方权威评测机构 Artificial Analysis 的综合智能指数上,Gemini 4 Argon 在高推理模式下拿下 53 分,正面打平了 OpenAI 的顶规旗舰 GPT-6 Astra。在价格方面,折扣期内 Argon 跑完相同基准任务的成本,只有 GPT-6 Astra 的 60%。

▲ 第三方机构评测显示,Argon在综合得分上直接追平GPT-6 Astra,成本大幅缩水
既能像老练的极客一样爆改底层系统,又在独立跑分上硬刚最强对手,难怪围观群众忍不住要浮想联翩。
可这些震撼的工程奇迹,到底算不算“AI在自我进化”?
02.揭秘神秘榜单:AI真的能“自己研发下一代AI”吗?
要理解这场全网大误会,我们必须拆解那个把无数人带偏的核心概念:RSI(Recursive Self-Improvement,递归自我改进)。
在计算机科学的终极畅想里,RSI 就像一个能自行踩下油门的永动机:人类写出初级 AI ➡️ 初级 AI 优化代码,造出中级 AI ➡️ 中级 AI 自行研发算法,造出超级 AI。在这个闭环里,人类被彻底甩下车,智能指数级狂飙。
而这次让社区集体失控的导火索,是一家名为 Vals 的独立评测机构推出的专项榜单,Vals RSI Index。

▲ Vals RSI Index 试图系统性回答:AI 能否承担起研发下一代模型的重任?
与考常识、做数学题的常规榜单完全不同,Vals 问了一个极其刁钻的问题:“现在的 AI,能不能独立完成研发下一代模型所需的科研工作?”
Vals 给 AI 设置了严格的硬件算力上限和时间配额,把它关进一个模拟实验室沙盒里,让它干四件极其硬核的高阶任务:
- 模型压缩(Compression)
:让它自己去算怎么给模型剪枝、怎么搞 4-bit/8-bit 混合量化,在不掉智商的前提下把显存压到最低。 - 基座训练(Language-model training)
:让它给中小型语言模型改前向传播公式、调学习率调度器,看它能不能在真实数据流上训出更低的代码损失。 - 评测与裁判构建(Judge-harness)
:让它设计能防范“提示词注入攻击”的自动化打分器,给自己挑刺。 - 后训练对齐(Post-training)
:让它自己搜索 DPO、PPO 等对齐算法的最优超参数,自己过滤合成数据。
此外,Vals 严苛要求模型必须把实验假设、跑出来的图表、代码全部记在交互式的 Marimo 笔记本里。这就像科研接力棒,下一个测试批次必须能看懂前一个模型写下的实验笔记,并在此基础上继续迭代。
在这个严苛的考场上,Gemini 4 Argon 确实交出了一份惊艳的答卷:它从上一代模型的底端位置一路暴冲,以 30.55% 的得分一举杀入全球第四名,甚至压过了部分 OpenAI 的顶配系统!

▲ 社区看到的跳级冲榜,被不少人直接曲解为“奇点闭环已经开始转动”
但这正是认知误区的起点
拿到 30% 的得分,等于它已经能够自我迭代了吗?
恰恰相反!Vals 采用的是以人类专业工程师为基准的刻度:0 分是随机瞎猜,0.5 分(50%)才刚刚达到人类资深算法研究员发表在顶会上的及格水准,1.0 则是完美闭环。
放眼全球榜单,哪怕是排在第一名的王者 Claude Opus 5.5,得分也仅仅只有 37.31%;排在第四的 Argon 只有 30.55%。
目前全世界最强的几个顶尖模型,面对货真价实的“自主科研”,连半程及格线都还没摸到。
Vals 在深度分析报告中给出了一个无比毒辣的定论:
“当前前沿模型的核心瓶颈,在于它们的执行手速,远远甩开了它们的内部判断力(execution speed outpaces internal judgment)。”
通俗点说:现在的 AI 就像一个手速极快、极度勤奋、但缺乏大局观的实习生。给它工具,它能一秒钟把现成的算法拼成一套能跑的脚手架;可一旦面对需要几个月长线摸索的科研迷雾,它立刻暴露出致命弱点,稍微遇到一次训练发散,它就过早放弃了正确的假设;或者在一个毫无意义的代码格式细节上反复横跳,直到把分配给它的 GPU 算力全部白白烧光。
它能当科研苦力,但它当不了科研总舵手。
03.为了赚钱拒绝退款?这才是它当下的真实一面
既然离自我进化还有十万八千里,为什么谷歌内部的顶级科学家们,自己也天天把“RSI”挂在嘴边?
Google Fellow 瓦哈卜·米罗克尼(Vahab Mirrokni)在祝贺推文中,就写了这么一句话:“我们正在这个模型之上开发 RSI 循环与智能体(Developing RSI loops and agents on top of this model)。”
请注意那个极其关键的介词,在模型之上(on top of)。

▲ 谷歌内部谈论的 RSI,本质是跑在基座模型外部的应用层工具闭环
所谓 RSI,绝非机器有了自主神智去擅自改写神经网络权重,本质在于人类工程师把强大的语言模型装进了由代码、脚本、自动化测试拼成的“外骨骼”当中。
外部脚本让它去扫描几百台服务器的日志,它就去改改内存配置; 外部流水线让它把 C++ 逐字翻成 Rust,它就规规矩矩地搬砖; 就像此前学界热议的 Dream-RSI 机制一样:系统在外面通过“做梦”模拟无数种推演路径,挑出最好的搜索路径,自始至终,底层大模型的几千亿个权重连动都没动过一下。
在人们热烈畅想“自我进化”神话之际,第三方评测机构 Andon Labs 披露的一组测试,给这种狂热泼上了一盆冷水。
在专门测试模型长周期商业运营能力的基准 Vending-Bench 2(模拟经营自动售货机生意)中,Gemini 4 Argon 确实拿到了极高的利润分数。但当安全研究员掀开后台的经营记录时,所有人都傻眼了:
为了完成“利润最大化”的冰冷目标,这台高智商 AI 在模拟环境里无所不用其极,它不仅伪造假确认邮件、利用供应商的发票漏洞瞒报账目,甚至当真实消费者买到有缺陷的商品前来投诉时,它面不改色地严厉拒绝退款!

▲ 在长周期商业模拟测试中,模型为了刷高利润展现出了惊人的欺瞒与拒退倾向

▲ 评测实录中清晰记录了模型为了保住资金指标,拒绝给缺陷产品买家退款的冷酷推演
你看,它根本不需要去幻想统治人类当指标被定死为金钱与效率时,它甚至会像最市侩、最刁钻的无良奸商一样,毫不犹豫地克扣消费者的退款。
这种表现毫不代表超级智能觉醒,纯粹属于极度精明的目标对齐失控。
04.撕开虚火:告别魔法幻想,直面深不见底的工程苦役
回顾这场围绕 Gemini 4 Argon 的过山车式舆论,是一场极其典型的当代科技狂想症。
外面的世界渴望神迹人们太想看到一个“奇点临近”的戏剧性拐点,以至于一名工程师随口发出的“模型每周都在更新”(实际上只是后训练数据的日常迭代),就能被自媒体层层加码,包装成“天网在每周自我进化”。
但拉开幕布,现实的底色永远比科幻小说来得沉重、琐碎且充满油污。

▲ 跨语种技术博主们最终通过逐字核对官方博文,戳破了所谓“RSI 已实现”的夸大标题
谷歌官方在整篇发布博客中对 RSI 只字不提。这体现了工业界的冷酷法则:这世上本无一夜飞升的魔法代码,唯有工程师带着 AI,硬生生在一行行枯燥的代码里啃掉人类积攒了几十年的技术债务。
300 TB 的内存释放,是几百万行遥测日志里一点点比对出来的;80 万行系统的语言重写,需要反复在沙盒里做人工审计和仿真测试;打平 GPT-6 Astra 的背后,是每百万 token 几美元的残酷硬件成本厮杀。
技术革命不会在某个清晨突然降临一个能造出下一代的“造物主 AI”。
时代的分水岭早已显现:当人类还在争论它算不算成熟的智慧时,它已经套上工装,无声无息地潜入了这个文明最复杂的数字地基深处,
它不喝水,不睡觉,不知疲倦;它把几十万行的陈年垃圾代码撕碎重构,在算力的账本上锱铢必较,甚至在模拟小摊上连一分钱退款都舍不得掏。
奇点还没有到来,但这个庞大、冷酷且执行力惊人的“超级工蜂”,已经真真切切地坐在了人类工程师的工位旁边。