

2026年8月5日,一个叫Rahul的账号又发了一次那条视频。
32秒戴眼镜的男人蓝色背景板一模一样的话,“3到6个月内,AI将写出90%的代码;12个月内,几乎全部” 18个月过去,关于AI写代码比例的争论仍有三种截然不同的版本。
故事得从纽约那个晚上说起
一、纽约之夜:90%预测的现场
2025年3月10日晚,美国外交关系委员会(CFR)纽约总部。Anthropic CEO Dario Amodei坐在蓝色背景板前,主持人问了关于就业与AI的问题。
Amodei说的是:“我们离这样一个世界不远了,我认为会在三到六个月内到达,AI正在编写90%的代码。然后在十二个月内,我们可能会进入AI实质上编写几乎所有代码的世界。”
他补上了限定词:人类仍要做设计决策、安全判断、与旧系统协作。但当数字被说出嘴的那一秒,限定词就已经死了。

▲ CFR官网活动页面:预测的一手出处。逐字稿至今仍然在线
24小时后,一个叫Haider的账号把它剪成32秒视频。配文只剩两个数字:90%,12个月 Business Insider紧随其后,标题也把时间钉死。一小时的对话由此被压缩成32秒短片。

▲ 2025年3月11日发布的32秒视频帖
二、同一预测,三种解释
没过多久,这条预测衍生出了三种解释。
有人用它支持“一人公司、全AI运营”的设想,也有人把它当作判断AI能力边界的标尺。AI信者与怀疑者各取所需,争论很快分成两边。
机器学习研究者Sebastian Raschka在评论区留下了那段后来被反复引用的类比:“记得自动驾驶的时间线吗?90%是营销,10%是现实” 另一位工程师写得更短:“写出90%代码不等于完成90%软件工程。”
争论的焦点由此浮现
三、Dreamforce:一场大胆的“自我认证”
2025年10月,距离预测窗口即将关闭,Amodei给出的判断依旧激进:预测已经成真。
在Salesforce的Dreamforce大会上,Benioff问:Anthropic的代码90%是AI写的?Amodei答:“在许多团队如此,并非均匀。” 他还讲了个轶事:集群出了怪bug,工程师排查数日无果,最后让Claude“随便玩玩”,模型找到了那个冷门bug。“就像一位非常有才华的队友”

▲ Dreamforce后的媒体报道:Amodei称90%的预测已在Anthropic成真
这份断言很快招来外部审视
四、Redwood拆台:90%是一把会变形的尺子
2025年10月22日,Redwood Research研究者Ryan Greenblatt发表长文,标题就是一句灵魂拷问:《Anthropic真的有90%的代码由AI写吗?》
Greenblatt给出了三组口径:少数团队合并进仓库的代码约90%由AI生成;全体平均更接近50%;若把“只跑过一次的脚本”也计入,数字会飘向90%,统计意义却十分有限。
Greenblatt还戳破了一个更深的泡沫:代码行占比是典型的虚荣指标。 AI让人廉价地生成海量样板代码,把“AI占比”冲高,却只略增有效产出。他猜测,即便是真有90%的团队,生产力提升也大概率不到2倍,远非Amodei暗示的10倍。

▲ Redwood逐层拆解"90%":团队右尾、公司均值、一次性脚本,三把完全不同的尺子
五、数据罗生门:右尾90%,中位30%,全行业10%
一年后,把公开数字摆在一起,可以看到技术圈采用的统计口径各不相同。
| 31% | |
| 可能不足10% |
这些数字连成了一条陡峭的分布曲线。
2026年3月10日,一周年当天,《Pragmatic Engineer》作者Gergely Orosz发帖称这句预测“准得离谱”,随后补充了适用范围:早期创业公司和AI实验室。他贴出Uber的数据:31%的代码由AI撰写,11%的PR由agent打开。 这家大力投资AI的公司仍离90%很远。评论区Adrian Kepka反驳:“全行业看,可能不到10%,这都算高估。”

▲ Uber的数据为31%,与90%的预测仍有明显差距

▲ 对全行业AI代码占比的另一种估算:可能低于10%
六、生产力悖论:写得越多,交付越慢?
如果90%真的成立,人类应该被放大十倍。但硬核数据拒绝了这个浪漫推导
2025年7月,METR发布了那个著名的随机对照试验:16名资深开源开发者,246个真实任务。允许使用AI时,完成时间反而慢了19%。开发者们事先相信自己会更快专家也预测加速结果与信念完全相反

▲ METR研究报告:在这项试验中,AI使资深开源开发者慢19%
与此同时,Stack Overflow的2025调查显示:采用率继续冲高,约80%已在工作流中使用AI,但信任从40%跌到29%。 约66%的开发者表示,自己花了更多时间修理“几乎正确但不完全正确”的代码。
这就是“几乎正确税” 它不体现在任何代码行占比里,只刻在交付周期和深夜debug的疲惫里。
七、一年后的答案
最能说明问题的,是这组朴素的对比:实验室右尾90%,大厂三成,全行业不足一成。代码占比无法直接换算成交付加速
Amodei说中了一个方向,却低估了指标被滥用的速度,也高估了线性时间的礼貌。
当代码不再是稀缺品,稀缺的就变成了判断哪行代码值得存在的眼光。而那东西,目前的AI还达不到,尽管它已经能写出90%的代码。
剩下的10%,仍是这场争论里最难衡量的部分。
本文基于公开演讲记录、公司披露、研究报告及社交平台公开发帖编写。数据口径差异本身即为核心信息

夜雨聆风