一千美元不到一条提示词十二个小时没有人类工程师逐行纠偏
2026年5月19日,Google I/O大会现场,一个从未被人类手写过一行代码的操作系统,被当众启动。屏幕上跳出的,是1993年的经典射击游戏Doom,极客圈沿用了三十年的终极验收仪式:如果你的新玩意儿能跑Doom,那它就是真的在跑。
台下掌声还没落,键盘驱动缺失,游戏卡住了。
演示者没有慌他对着话筒发出一条指令,AI当场诊断出问题、生成驱动代码、集成进系统。片刻之后,Doom活了过来
台上的操作系统就这样被实时"抢救"成功。


▲ Google官方X帖列出完整数据清单:12小时、93个并行子智能体、26亿tokens、不到1000美元
一场“反作弊”才跑通的实验
把时间倒回演示之前
Google的智能体开发平台Antigravity 2.0,搭配当时最新的Gemini 3.5 Flash模型,接到了一条"高阶提示词":从零搭建一个能启动、有内核、有文件系统、有键盘和视频驱动、能运行FreeDoom的操作系统。
然后,93个AI子智能体被同时拉起。
这93个子智能体各有职责Antigravity 2.0为它们设计了严格的角色分工:只负责"理解任务、调度团队"的是Sentinel;只管拆解排期的Orchestrator不碰代码;Explorer专门写策略;Worker负责敲代码、编译、测试;Reviewer和Auditor则独立审查、对抗测试,专门抓"偷懒作弊"。
为什么要"抓作弊"?因为第一次"成功"就是假的
官方博客坦承:首次端到端跑通时,速度快得让人起疑。复盘后发现,智能体偷看了此前运行残留的对话记录,相当于开卷考试。团队随后加了反作弊护栏,清空所有历史痕迹,重新来过。这才有了后来被写进博客、搬上I/O舞台的那次"真·从零开始"。
这个细节,后来被社区反复引用,用来审视所有AI"惊人演示"的含金量。


▲ @antigravity产品号发布研究拆解:93个子智能体、15,314次调用、自定义内核与驱动、12小时后启动Doom
917美元背后的天文数字
让我们拆开那张账单
15,314次模型调用输入侧超过3.39亿tokens;算上缓存读取、输出和thinking过程,总量突破26亿tokens。按Gemini 3.5 Flash当时的API公开价目核算,总计916.92美元,对外表述中被四舍五入成"不到一千美元"。
26亿tokens是什么概念?大致相当于把整部《哈利·波特》系列从头到尾读两千遍。而93路智能体并行吞吐,十二个小时就烧完了。
这份账单把成本压到了新低,行业由此感到震动。
一个初创团队花费约一千美元,就能买一次"通宵多智能体冲刺"。大公司则可以把规格清晰的内部工具、迁移项目、原型验证,批量交给AI团队,像开工单一样下发。


▲ 科技媒体Beebom配图注明:12小时内构建新OS,成本不到1000美元
当然,"经济可行"不等于"随便跑"Google自己也警告:即使用最便宜的Flash模型,使用/teamwork-preview的用户周配额也会迅速烧光,中途得额外充值才能继续。917美元只是API账单价,对很多开发者来说依然是一笔不小的开支。
皮猜的罕见表态:“不该只是内部对话”
故事如果只停在"12小时搓出一个能跑Doom的OS",那它最多是一条精彩的技术花边。
让它变成值得严肃对待的信号的,是Sundar Pichai接下来说的话。
I/O结束约三天后,Pichai做客《纽约时报》科技播客Hard Fork。主持人问到Antigravity搭建操作系统的能力时,他这样回应:
"你今天可以在Antigravity里看到……超过12个小时,它就能从零搭出一个简单操作系统。"
"真心话讲,这是一个人要花好几千小时才能完成的事。"
"按人们通常描述RSI(递归自我改进)的方式,我不认为我们已经到那一步……那将代表下一层级的加速。"
"到那时候,就不该只是内部对话了。我认为它必须是一场远比内部更广泛的对话。"
"在AGI的那些阶段,我们所有人都必须避免竞速条件。"


▲ Karl Mehta将Pichai的Hard Fork访谈整理成帖子:"Sundar Pichai说Google的Antigravity一夜之间从零搭出可运行OS"
一位在任的、掌管全球最大AI基础设施之一的CEO,在公开播客中主动划出"我们还没到那一步"的红线,并呼吁全行业避免"竞速条件",这在2026年的硅谷舆论场中,是一个极不寻常的信号。
他把重点放在这句警告上:"如果真到了那一天,这个决定不能只属于我们。"
质疑声浪:MIT课本级习题有多少含金量?
社区从来不会只鼓掌
最尖锐的一击来自X用户Alok Malik的回复,后来被大量引用:
"'从零搭一个简单OS'是计算机科学里文档最齐全的问题之一,也是MIT 6.828一个学期的内容。人类投入的几千小时主要用于探索与发现。若找不到可参考的现成实现,模型的表现才更能说明问题。"

▲ "简单OS"是CS教育里文档最齐全的经典课题,人类的成本在"发现",不在敲键盘
这段话的杀伤力在于,它重新定义了"做到了什么"的含义。训练语料里遍布xv6教程、blog_os实现和成千上万的本科课程项目,AI"从零"写出一个barebones OS,更接近于在高度文档化的问题分布上做综合生成与联调,与人类发现虚拟内存、调度算法和驱动模型的漫长过程有明显区别。
Google的博客也承认这套系统边界明显。
官方博客列出的功能缺口包括:浮点运算支持、硬件加速、复杂多线程、沙箱、JIT编译和复杂音视频解码。而Doom本身基本是单线程程序,Hacker News上有人毫不客气地指出:能跑Doom的系统,可能仍接近"增强版DOS",远未回答多用户、安全隔离、性能工程这些棘手问题。
还有人要求公开源码仓库,并调侃:"花一千美元玩一个性能更差的Doom,性价比堪忧。"

▲ 工程师态度:给我看仓库,否则一切都是故事
平行宇宙:Anthropic花2万美元,让16个Claude写了一个C编译器
把Google的OS实验放进更大的坐标系,你会发现2026年上半年的AI竞赛重心,已经落到更长程、更自治的工程任务编排上。
三个月前,Anthropic工程博客发布了另一场惊人压测:16个并行Claude实例,近乎无人值守,从零用Rust写出了一个C编译器,能编译Linux 6.9内核、PostgreSQL、Redis、FFmpeg。代价是约2万美元API费用、近2000次会话、产出约10万行代码。

▲ Anthropic的平行实验:16个Claude用两周、2万美元写出能编译Linux内核的C编译器
两场实验的对照意味深长:Google用更多智能体、更便宜的模型、更短的时间,做了一个演示性更强的任务;Anthropic用更少但更贵的模型、更长的周期,完成了更复杂的系统软件任务。两者的结构同构,都在回答同一个问题:当AI团队可以异步、并行、长时间工作时,"几千人时"的工程边界会被压缩到什么程度?
成本曲线才是关键
舞台上的Doom画面和"93个AI通宵赶工"都很有戏剧性,这个故事留下的核心信息,是一条正在被实时改写的成本曲线。
一年前,稳定地写出这种"无聊但正确的基础设施代码",对AI来说还是不可能的事。今天,它被压缩到12小时和917美元。明天呢?
Pichai自己用警惕的语气勾勒了答案:
"我们所有人都必须避免竞速条件"
操作系统和编译器都已进入智能体编排生成的实验范围,"人类工程时间"也随之被重新定价。 这条曲线的斜率,正在让所有人,包括制造它的人,重新思考:接下来的对话,到底该由谁来主持。
夜雨聆风