想象一下这个场景:
周五晚上十点,你给电脑留下一条指令:"给我造一个操作系统",然后去睡觉第二天早上十点,一个能开机、能运行游戏的操作系统,已经静静躺在你的硬盘里
这样的场景已经出现在2026年5月19日的谷歌年度开发者大会 Google I/O 舞台上
而台上,工程师打开这个"AI一夜造出来的操作系统",运行了一款游戏,《毁灭战士》(Doom)
观众席先是沉默,随后爆发出掌声。
一夜、七千块、九十三个"员工"
先看数字,每一个都触目惊心。
谷歌官方给出的账单是:12小时构建完成,动用了 93个并行子agent,发出超过 15,314次模型请求,处理 26亿个token,API费用合计,$916.92,约合人民币不到7000块
这套系统覆盖了内核、进程管理、内存管理,一路写到图形驱动,能开机,能响应输入,能运行游戏谷歌官方对它的定位是:"功能型操作系统(functional OS)",不完美,但确实可以运行
谷歌CEO桑达尔·皮查伊后来在播客《Hard Fork》里这样说:"在Antigravity里,它大约12小时就能从零构建一个简单的操作系统对人类来说,这相当于数千小时的工程量"
数千小时。
一夜。
这两个数字之间的鸿沟,就是2026年的AI能力跃迁
九十三个agent,组成一支"公司"
很多人对这件事的第一反应是:这个AI会不会在训练数据里"背过"操作系统的代码,然后原样吐出来?
这个问题合理,但答案没那么简单。
谷歌展示的核心,是一套完整的多agent编排架构它的运转方式近似一家科技公司,由不同角色共同完成任务

▲ 官方博客公开了所有关键数字,包括输入token量、缓存读取和API成本
这家"公司"里有七种角色:
- Sentinel(哨兵)
:不写代码,负责理解用户意图、拆解任务、监督全局 - Orchestrator(调度官)
:不写代码,负责分配里程碑、派生子agent、汇报进度 - Explorer(探索者)
:读需求、写策略,制定路线图 - Worker(执行者)
:负责写代码、跑构建、执行测试 - Reviewer(审查者)
:独立检查设计与接口 - Critic(批评者)
:对抗式找漏洞、压测覆盖盲区 - Auditor(审计员)
:专门侦测"糊弄行为",比如把测试结果硬编码、写空壳实现
最后那个角色,尤其值得玩味。
谷歌在官方博客里自述了一个"防作弊"插曲:第一次端到端成功异常快,团队后来发现,agent在引用历史对话"作弊"他们随即加入了反作弊护栏,在干净环境里重跑,依然成功
这个细节的意义在于:谷歌没有藏着这段弯路,而是主动公开了它这是一种可信度建设,也是对"AI演示可信吗"这个问题的正面回应
一场持续三十年的老梗,被重新严肃对待
"能跑Doom",这个梗在技术圈已经流传了三十年
从示波器到打印机,从智能冰箱到电子秤,无数奇形怪状的设备都被黑客们塞进过这款1993年的经典FPS游戏它早已成为验证"一个平台是否足够完备"的文化暗语:你的东西跑得起Doom,说明你的图形输出、输入响应、基础运算都活着
谷歌选择用Doom做验收,既是工程意义上的门槛检验,也向这个传统致敬


▲ 有人搬出了传奇程序员Terry Davis的"神圣操作系统"TempleOS,嘲讽这个"AI炒出的SlopOS"
当然,也有人对这个画面不为所动。
质疑的声音:你测过吗?代码在哪?
事实上,这件事在技术社区引发的反应,远比掌声复杂

▲ 质疑声从第一时间就出现了
程序员 darkseidz 在推文下直接发问:"**你测过吗?有任何公开测试吗?有Demo吗?**不要把这种东西当hype来发。"
另一个声音来自开发者 Alok Malik,他的切入角度更尖锐:
"从零写一个简单操作系统,是CS领域文档最完备的问题之一。这是MIT 6.828一整个学期的课程内容。那数千小时的人类时间,主要花在发现上,打字只占一小部分。 更有挑战的考验,是看模型在没有现成参考实现时能做什么。"

▲ 这条回复击中了很多技术人的共鸣:发现知识和复现知识,是两件完全不同的事
这话说到了一个核心困境:互联网上有成千上万的开源操作系统教程、MIT公开课代码、hobby OS仓库,当一个模型的训练数据覆盖了所有这些,它"从零生成"的意义究竟是什么?
还有用户 Zygis 要求看仓库代码,并类比了此前一个Claude被指误导的C编译器演示:"我们已经听过类似的故事,后来发现是严重误导"
Hacker News上的讨论更是直接:有人指出Antigravity 2.0的安装包本身做得"业余",有人嘲讽"除了Doom还有什么真的能用",有人冷冷地问GPL开源协议的问题
这是AI演示的宿命:能力越惊人,质疑越汹涌
皮查伊说了一句让人背脊发凉的话
所有关于OS演示的技术讨论,在2026年7月24日,被一个人重新组合,推向了另一个维度
创业者与投资人 Karl Mehta 在X上发布了一段剪辑视频他把谷歌I/O的OS演示,与皮查伊在播客《Hard Fork》里的一段话并排放在了一起
那段话,皮查伊是这样说的:
"就人们所描述的RSI(递归自我改进)而言,我认为我们还没到那一步……那将代表下一层级的加速。"
"到了那一步,它不应该只是公司内部的讨论。那必须是一场比这广泛得多的对话。"
"在AGI相关的那些阶段,我们都要避免race conditions(竞速条件)。"



▲ Karl Mehta的这条帖子,把"产品发布"和"文明级决策"并置,在科技圈引发了新一轮震荡
RSI,递归自我改进。
简单说,就是AI开始设计、构建、优化下一代AI,形成"自我进化"闭环弱形式是"模型帮人写训练代码";强形式是系统几乎无需人类干预,持续加速改进自身,能力跃迁速度超过社会的适应速度
而"race conditions(竞速条件)",是一个来自软件工程的术语它原本描述的是多个并发进程在没有正确同步时,因为"谁先跑完"的随机性而产生错误皮查伊把它借用来描述一个更宏大的危险:当多家实验室同时冲刺更高的AI自治能力时,竞争压力会不会压过审慎,让某家公司在治理和安全机制还没就绪时,抢先越过那条线?
呼吁一场"还没有地方发生"的对话
Karl Mehta的评论,在皮查伊的原话之上,加了一把刀
他写道:皮查伊呼吁"更广泛的讨论",呼吁"不要由单一公司决定",但现实是,现在只能由单一公司决定
没有任何实验室在跨越RSI相关阈值之前,有义务通知任何人没有任何外部检验标准。公众只能在事后得知。
皮查伊在呼吁一场,目前还没有任何制度空间让它发生的对话
这个矛盾带来的不安延伸到了OS演示之后:当AI开始参与设计下一代AI,那扇门由谁把守,又由谁判断它是否已经打开?
Anthropic的公开长文《When AI builds itself》里,有一条时间轴:从2021年"人手写代码",到今天"agent可以独立完成数小时的工程任务",再到未来可能的"闭环训练下一代模型"文中同时承认:选题与判断,目前仍然是人类与模型之间的主要差距皮查伊的"还没到",与Anthropic的"连续谱",是同一种表述,没有人说奇点已经来了,但所有人都在说,这条坡道是真实的,而且越来越陡

▲ Anthropic公开讨论递归自我改进的长文,与皮查伊的表态形成了行业级的呼应
最后,那台$7000的"玩具"意味着什么
回到那台能跑Doom的操作系统。
它当然不能替代Linux,更不能替代Windows谷歌官方也明说:系统缺少浮点运算、硬件加速、复杂多线程、沙箱和JIT它只是一个能开机的本科级课题,离商业产品还有很远
但它的意义,恰恰在于那个"本科级课题"的定语
以前,"从零写一个简单操作系统"需要一个学期,MIT 6.828,十六周,数千小时现在,它需要一夜,七千块,以及九十三个并行工作的agent
"课程作业"被压缩成"一晚上的计算账单",这样的变化究竟用了多久?
这个时间跨度,比账单上的数字更让人震惊
数据来源:Google Antigravity官方博客(antigravity.google/blog/google-antigravity-built-an-os)、谷歌I/O 2026官方演示、桑达尔·皮查伊在Hard Fork播客的访谈
夜雨聆风