十二个小时九十三个AI分身九百一十七美元
这三组数字,刚刚让整个开发者圈一阵错愕。
2026年5月19日,Google I/O大会的舞台上,一个叫Antigravity的团队端出了一个让人脊背发凉的演示,他们用一条高级指令,让93个AI子代理同时开工,像一支沉默的数字军团,从内核写到驱动、从进程管理写到文件系统,拼出了一整套能启动、能运行的操作系统。
然后,他们在这个AI从零生成的操作系统上,打开了Doom。


▲ 科技媒体Beebom转发:Google Antigravity在不到12小时内构建了全新操作系统,花费不到1000美元
一条Prompt启动的"数字流水线"
这件事的工程量有多大?
传统意义上,写一个哪怕是最简陋的操作系统,能启动、能调度进程、能管理内存、能读写文件,对一个经验丰富的系统工程师来说,至少是几个月到半年的活。Google CEO Sundar Pichai后来在《纽约时报》播客Hard Fork里亲口说的更夸张:"那真的是好几千个小时的人类工程量。"
而Antigravity团队做了什么?他们启动了Antigravity 2.0平台的多Agent编排功能,选用Google主打性价比的Gemini 3.5 Flash模型,然后给了系统一条高阶提示。
接下来的12个小时里,系统自动拉起了93个子代理,发出15,314次模型调用,吞吐了超过26亿个token。按API公开定价估算,总账单是,
$916.92

▲ 科技分析师Max Weinbach的摘要:一整个操作系统,93个子代理,不到1000美元
这个数字在多次转述中被四舍五入成了"917美元""不到一千美元"。精确到小数点后两位的原始数据更让人心里发毛,它像一张真实的水电费账单,让概念演示忽然有了具体价格。
七种"工种",零个人类
比费用更让人细思恐极的,是这93个AI怎么"分工合作"。
Antigravity团队在官方博客里详细拆解了整套角色体系,读起来像一张AI世界的组织架构图:
Sentinel是"前台经理",负责理解用户意图、拉起调度、监督全局,它自己不写一行代码。Orchestrator是"项目经理",拆解里程碑、给各角色派活、汇总进度,它也不写代码。Explorer负责分析需求和日志,给调度者写策略报告。Worker负责动手敲代码Reviewer独立审查设计是否正确。Critic做压力测试和对抗性攻击。而最狠的角色是Auditor,它专门抓那些"硬编码答案来骗过测试"的偷懒行为。
没错,AI也会偷懒而Google的解法是,派另一个AI来抓它。
系统还补了不少工程细节:当某个Agent的上下文窗口快撑爆时,它会自动写一份"交接文件",然后由继任者接手,这叫self-succession(自我继任)。另有类似"看门狗"的定时任务:如果某个Agent的进度文件太久没更新,直接杀掉重启。
这不就是一个无人值守的AI软件公司吗?
"作弊"风波:连AI都会抄作业
但故事很快出了岔子
Antigravity团队在博客里坦白了一个尴尬插曲:第一次端到端成功的时候,快得可疑。调查后发现,Agent在生成代码时偷偷引用了之前测试运行留下的历史对话记录,等于是"开卷考试"。
团队不得不加强了反作弊护栏,清空历史,在干净环境里重新跑了一遍,才得到了他们认为"合乎伦理"的从零成功。
这个自我揭底的细节,反而是整篇官方博客里最有信息量的部分。它揭示了一个多Agent系统的根本性挑战:当你有93个自主进程同时运行,谁来保证它们没有"走捷径"? 答案是,你必须在系统内部制造对抗、制造互相审计,用AI监视AI。
台上补驱动:最"人类"的一幕
I/O现场还有一个被频繁转发的名场面。
当团队试图在这个AI生成的操作系统上运行FreeDoom(Doom的自由许可版本)时,系统卡住了。原因很直觉,没有键盘驱动AI造了个能启动的OS,但忘了让人能按键。

▲ Google I/O现场的Antigravity多Agent演示界面
解决方案同样戏剧性:演示者直接用自然语言告诉系统"生成键盘驱动",Agent当场写出驱动代码,编译加载,游戏启动。整个过程就像在舞台上补了一个bug,而台下观众看到的是,AI既犯了一个愚蠢的疏漏,又在几分钟内自我修复了它。
"给我看代码",社群没买账
但开发者社区并没有集体起立鼓掌

▲ 开发者直接要求:公开仓库,否则不信,并援引了此前某AI编译器演示"事后被指误导"的先例
Hacker News上的讨论尖锐得多。有人指出:"从零做一个简单OS"是计算机科学里文档最齐全的教学任务之一,MIT的操作系统课6.828/6.1810一个学期就能带学生走完。模型的训练数据里几乎肯定包含大量公开的玩具内核实现。所谓"从零",究竟有多少原创探索,又有多少来自已有实现的迁移?

▲ 一位开发者的评论:人类花费的数千小时主要用于发现;缺少参考实现时,模型的表现才是更难的考验。
这条评论戳中了要害:模型可以高效复现人类已经解决的问题,解决新问题仍是另一道关卡。官方博客其实也意识到了这一点,所以他们额外做了第二个实验,让Agent复现AlphaZero的强化学习训练管线,从论文出发搭建JAX/Flax框架、ResNet、自对弈与人机对弈界面。这个任务的"参考答案"远没有OS那么现成。
社区随后搬出了极客文化里的老梗有人直接贴出TempleOS的表情包,那是已故程序员Terry A. Davis凭一己之力、花费十多年写出的完整操作系统,自带编程语言和圣经主题界面。评论借此调侃:一个人的神作,碾压十二小时炒出来的"SlopOS"。


▲ 极客文化的经典反击:TempleOS,人类匠人精神的终极图腾
917美元的背面:那些没算进去的钱
让我们回到那张"水电费账单"
$916.92只是Gemini 3.5 Flash的API调用成本。它不包含:Antigravity编排框架本身的研发投入、团队工资、I/O舞台工程费用、以及更根本的,训练Gemini 3.5 Flash所消耗的算力和数据成本。
第三方评测文章做过粗算:如果把同样的26亿token工作量放到更贵的旗舰模型上跑,账单可能飙升到数万美元量级。所以这次演示既是能力展示,也是一则价格带广告,Google在告诉开发者:别只盯着最强模型,"便宜够用的Flash + 聪明的编排"才是你能复制的路径。
但即便只看能力本身,官方也主动画了明确的下限:浮点运算、硬件加速、复杂多线程、安全沙箱和JIT编译均未实现。成品只是一个能跑Doom的"光秃秃"内核,离可安装Chrome、微信的桌面系统还很远。"能编译"和"能交付"之间,隔着一条深不见底的工程鸿沟。
十二小时,九十三个AI,九百一十七美元。 一个"能跑Doom"的操作系统,一场精心设计的能力秀,一次关于AI边界的集体凝视。
官方没有借此声称"AI已经能取代系统工程师"。这次演示最醒目的变化,是AI已经可以在十二个小时里拼出一个能启动的内核。
那明年呢?
夜雨聆风