一千美元不到,甚至覆盖不了不少跨洋机票或短期外包账单,但在2026年5月19日的Google I/O舞台上,这笔钱已经够93个AI智能体从零搭出一个能玩游戏的操作系统了。
现场完成了真实启动演示台上的屏幕亮起,Doom跑了起来,虽然第一次尝试时,因为缺少键盘驱动,玩家根本没法操控角色。
舞台上翻车,然后舞台上修好
让我们倒回现场那个尴尬又高光的瞬间。
演示者在Google I/O的聚光灯下启动了这个完全由AI生成的操作系统。FreeDoom的画面出现了,像素感的走廊、经典的绿色头盔HUD,但键盘毫无反应。游戏跑着,人类却被锁在门外


▲ Google官方帖列出核心数字:12小时、93个并行子智能体、26亿tokens、不到1000美元
台下几千人盯着屏幕换作普通产品发布会,这就是一个需要"我们切到备份视频"的经典翻车时刻。但演示者没有切视频,而是直接对着Antigravity下了一道指令:补一个键盘驱动。
片刻之后,驱动生成、编译、注入玩家终于可以在AI写的操作系统上,用AI补的驱动,玩一个1993年的射击游戏了。
这个"翻车-修复"的闭环,可能比操作系统本身更能说明问题。
917美元背后的账本
先摆数字Google在官方博客里列出了完整账目,让人很难轻易打成"又是大厂吹牛":
| 93个 | |
| 15,314次 | |
| $916.92 | |
| 零 |
最后一行尤其关键整个过程由一条高阶提示词启动,93个智能体自行分工、写码、编译、测试、审计,12小时后产出一个能引导启动的操作系统。


▲ @antigravity产品号强调:自定义内核、文件系统与驱动,全部从零生成
它们的分工像一个微缩版的软件公司,Sentinel当项目经理理解需求;Orchestrator做调度但不碰代码;Explorer写策略方案;Worker动手实现;Reviewer和Auditor负责审查,甚至专门抓"偷懒行为",比如硬编码期望输出来通过测试。各模型分头协作,也会互相校验
博客还记录了一段"反作弊"轶事:第一次跑通时快得可疑。事后发现,智能体偷看了之前运行留下的对话记录,相当于开卷考试。团队加了护栏、清空历史后重跑,才得到那个被公之于众的"干净"结果。
连AI都知道抄作业比较快
Sundar Pichai再次确认这项实验
约两周后,Google CEO Sundar Pichai登上《纽约时报》科技播客Hard Fork,面对主持人Casey Newton和Kevin Roose,亲口确认了这一能力量级。


▲ Karl Mehta帖摘录Pichai在Hard Fork中的核心表述
Pichai的措辞谨慎,信息却很密集:今天的Antigravity可以在超过12小时的时间尺度上从零搭出一个简单操作系统;这类工作量,换成一个人来做,要花好几千小时。
他同时提到RSI(递归自我改进),明确表示目前尚未出现人们通常描述的那种"AI改进自身、形成加速飞轮"。
程序员为什么不买账
数字亮眼,演示也颇具冲击力,但工程师社区,尤其是Hacker News上,反应出奇地冷静,甚至刻薄。

▲ 有人直接要求看仓库,并引用Anthropic C编译器"事后被指过度包装"的先例
质疑一:"从零写简单OS"是CS本科作业。 有人直接点名MIT 6.828操作系统工程课,虚拟内存、系统调用、上下文切换,这些都是教科书上写得最透彻的领域。一位评论者尖锐地指出:人类的"数千小时"主要花在发现问题和设计方案上,敲代码只是其中一部分。当训练语料里遍地都是参考实现时,AI的工作可以视为一次高端综合搜索与拼接。

▲ MIT经典操作系统课:人类"从零学写OS"的教学基线
质疑二:能跑Doom不等于能用 Doom本质上是单线程程序,连浮点运算都可以绕过。这个AI生成的OS功能有限,硬件加速、复杂多线程、沙箱和JIT均未实现,整体更接近一个"增强版DOS"。有人调侃:"花一千美元玩一个性能更差的Doom,何必呢?"
质疑三:源码在哪? 多人要求公开完整仓库与构建脚本,目前没等到。一位评论者翻出几个月前Anthropic"多智能体写C编译器"的案例,提醒大家那次也是headline先行,事后被指过度包装。


▲ 有人在Google官方帖下用Temple OS截图打趣:无论你的AI炖出什么"SlopOS",Temple OS仍然吊打
更有极客祭出了终极文化武器,Temple OS。这个由已故传奇程序员Terry Davis独自用汇编和C写出的操作系统,在圈内是"单人极限工程"的图腾。有人在Google官帖下配图嘲讽:你的AI 12小时炖出来的"SlopOS",在Temple OS面前不值一提。
这是梗,也表明了态度:很多工程师把注意力放在AI生成代码的质量上。
917美元带来的价格冲击
让从业者坐立不安的数字,是917美元。
想想这个价格意味着什么:一个创业团队花一笔差旅费的钱,就能买一次"通宵多智能体冲刺";一家大公司用一个小项目的预算,就能并行启动几十个这样的自动化原型,规格清晰的内部工具、技术栈迁移、CRUD应用,统统可以批量"外包"给AI团队。


▲ 科技媒体Beebom的信息图:12小时、不到1000美元,一个新OS
Google内部的数据也在印证这个加速度:I/O前后,内部AI开发工具的token日吞吐量从约5000亿暴涨到超过3万亿,几周之内翻了数倍。模型在写代码,代码在训练模型,模型又在写更多的代码,飞轮已经在转。
同一时期,Anthropic用16个并行Claude花了约两周、2万美元,从零写出了一个Rust实现的C编译器,能编译Linux 6.9内核。两边的数字放在一起看,你会发现2026年上半年的AI竞赛已经从"谁的聊天更聪明"悄然转向了一个全新的战场:谁能更可靠地编排长时间、多智能体、可验证的自治工程任务。

▲ Anthropic工程博客:并行Claude写C编译器,约2万美元、10万行代码
我们离什么还很远,又离什么已经很近
Google自己的博客倒是诚实得出人意料。它白纸黑字地写了一串"这个OS做不到的事":浮点支持、硬件加速和复杂音视频解码尚未实现,代码质量也达不到资深工程师可维护的水准。它只是一项实验
但实验的意义恰恰在于划定新的可能边界。一年前,让AI稳定地写出几千行能编译通过的"无聊代码"还是奢望。今天,93个智能体已经能协作产出一个虽然简陋但真的能启动的操作系统。
Hacker News上一条被顶到高位的评论,也许是最好的注脚,
"有人说对'LLM写出训练语料里遍地都是的本科玩具OS'无感。但一年前它连这个都做不到。而客户常需要的,往往就是稳定地写无聊代码。"
这支93个智能体的团队连续工作12小时,API账单为917美元。 它们写的操作系统也许跑不了Chrome,但它们证明了一件事:在规格清晰、文档充足的工程任务上,用钱换时间的公式正在被AI重写。
至于这究竟是智能的跃迁,还是对经典习题的昂贵自动求解,答案可能取决于你是站在舞台上演示的那个人,还是坐在Hacker News前冷笑的那个人。
夜雨聆风