

2025年3月10日那个晚上,Anthropic CEO Dario Amodei抛出一段让硅谷一半人热血沸腾、另一半人冷笑翻白眼的预测:
“三到六个月内,AI将写出90%的代码;十二个月内,或许几乎全部代码都将由AI生成。”
它远比模糊愿景更激进,带着明确的时间戳。 一年半之后回头再看,这场预言留下了一场关于“90%”的罗生门,也照出整个AI行业乐观与焦虑交织的一面。无论你信不信这句狂言,它都已经开始重塑人们对“写代码”的理解。
一个晚上,三条轨道同时开跑
2025年3月10日,在纽约,美国对外关系委员会(CFR)的CEO演讲系列上,Dario Amodei坐在主持人、CFR总裁Michael Froman对面。当话题滑入“编程”这个AI进展最快的领域时,他说出了那段后来被反复剪辑、转述、放大的话。
但很少有人注意到,原话的结构远比短视频里的要复杂得多。

▲ CFR活动官方页,预测的一手出处:那句“3到6个月写90%代码”最初就诞生在这个精英对话场景中
Amodei说的是三个层次:第一,3到6个月,AI写90%代码,这是硬数字,最容易被剪出来;第二,12个月内“may be”(或许是)几乎全部,这个“may be”带着犹豫,却在二次转述中消失;第三,人类依然要负责规格、产品意图、安全判断和设计决策,这层限定在短视频里鲜少出现。
活动结束不到24小时,Haider发布的30秒视频开始在X上快速扩散:Amodei演讲特写,逐字字幕,硬数字砸下来。机器学习研究者Sebastian Raschka在下面留言,获得大量点赞,成为整个事件中最响的一记冷笑:
“我还记得自动驾驶汽车的时间表……90%是营销,10%是现实。”

▲ Sebastian Raschka的回复卡,把“AI写代码”类比为自动驾驶汽车的时间表,营销与现实的落差扑面而来
几乎同一天,IBM CEO Arvind Krishna在SXSW上直接反驳:他认为比例只有20%到30%,距90%很远。
于是第一周刚过,舆论场上三条轨道已经同时铺开:
- 前沿实验室CEO的激进时间表
,Amodei,3到6个月,90%; - 大型企业软件CEO的保守百分比
,Krishna,20%到30%; - 从业者与研究者的直觉反应
,有人喊“We are already there”,有人喊“胡扯”。

▲ TechCrunch报道IBM CEO Krishna对Amodei的直接反驳,20%-30%对90%,一场口径之争就此公开化
争议由此升温,而这只是开始
六个月后:媒体写下三个英文词
2025年9月,时间走到了Amodei给出的“3到6个月”窗口的终点。各大媒体开始“对表”
The Information的记者Stephanie Palazzolo在X上这样写:“六个月前,Anthropic的CEO Dario Amodei说现在AI应该已经在写90%的代码了。这里是为什么这件事没完全应验” 评论区瞬间撕裂:有人回复说“我们最好的开发者早就超过95%了”,还有人直接开骂,说“这是为了点击率制造的垃圾”。

▲ Stephanie Palazzolo推文卡,专业科技媒体在六个月节点的公开追问

▲ Josh Peterson的回复卡,“只有老派工程师还在手写代码,几乎人人都在用LLM”的一线观感
紧接着,Futurism刊出回看文章《正好六个月前,Anthropic的CEO说六个月后AI会写90%的代码》。副标题只有三个词,却成为整个事件的经典判词:
“Not even close.”(根本没影儿。)

▲ Futurism文章页,“Not even close.”成了对这场预测的临时裁决
文章抛出了一组让乐观者坐立难安的证据:AI在拖慢工程师的速度,审查成本飙升,编码助手误删生产数据库的事故开始浮现。编码这个“第一块倒下的多米诺”,没有按剧本倒下。
但这里有一个关键细节:Futurism对原预测的时间线复述本身就存在压缩和误读。那篇报道所回应的“预测”,带着一层媒体转述的滤镜。原文的措辞更精密,也更狡猾
“90%”到底是什么?一个听起来像考试分数的词,其实有五层歧义
这就要说到一个让所有讨论都陷入泥沼的核心问题:“AI写90%的代码”这句话,到底该怎么量?
对不熟悉软件工程的人来说,这听起来像一门考试的得分。但真相是,它至少有五层歧义,每一层都能让数字翻盘:
第一,统计单位是什么? 按字符?按行?按提交?还是按合并进主分支的有效变更?
第二,分子分母怎么取? 一次性脚本、测试脚手架、实验可视化,算不算“代码”?训练用的合成数据算不算?
第三,这是谁的90%? Anthropic某个团队?全公司?YC创业公司?还是全球的职业软件工程?Amodei原话根本没限定范围,后来的转述却自动升级成了“整个行业”。
第四,生成等于负责吗? AI起草、人类粘贴、大改、审核、接受建议,哪一步算“AI写的”?
第五,也是最重要的一层:行数不等于价值。 样板代码和测试桩可以被模型以惊人速度生成,需求澄清、架构约束、跨服务一致性、故障排查和安全合规往往更耗时。你可以把“90%的行”灌满廉价代码,而项目工期却纹丝不动。
这也解释了为什么两个看似完全矛盾的陈述可以同时为真:某个高频使用Claude的个人开发者可以拍胸脯说“我95%的代码都是模型出的”,而一家拥有十年遗留系统的大公司可以同样笃定地说“我们离90%还远得很”。

▲ METR的RCT研究,16名资深开源开发者在真实issue上使用AI工具后,完成时间反而增加了约19%
七个月后:Amodei换了一个词
关键转折发生在2025年10月的Dreamforce大会上。Amodei与Salesforce CEO Marc Benioff对谈,被问及六个月的预测是否已经落空。
他的回答,是一次精妙的修辞再平衡:
“有人觉得这预测错了。但在Anthropic内部,以及我们合作的一些公司里,这现在绝对为真。”
他并未宣布整体目标已经实现,而是把范围收窄到“一些地方”。在他的解释中,工程师可以把精力放在最难的10%上,或者监督一组AI模型。他用“rebalancing”概括这种变化。

▲ Business Insider对Dreamforce对话的报道,Amodei用“再平衡”解释AI带来的工作变化
表面看,这是一个巧妙的退让但Redwood Research的Ryan Greenblatt不买账,他在自己的长文里展开了全网对这场预测最细致的裁决。

▲ Redwood Research博客文章,标题直接发问:“Anthropic内部真的有90%代码由AI写吗?”
Greenblatt的判断相当锐利:
即便把原预测尽可能宽厚地解释为“主要关于Anthropic自身”,也很难说已经在全公司层面成立; - 可能有部分团队
,合并进主仓的代码行中约90%由AI写出,但那可能只是少数; 全公司合并代码的AI占比,他估计为接近一半量级,甚至更低; 如果把一次性脚本等“有点用”的代码也算进去,比例会高得多,这已偏离人们讨论“工程师写了多少代码”时的默认口径; 他还指出,行数占比并非理想的生产力指标。廉价生成大量低价值代码,可以推高AI行数占比,却未必带来成比例的效率提升。即便真到了90%行数,有效生产力提升可能远小于10倍,甚至小于2倍。
Amodei给出了一种可以被合理辩护的局部真实,媒体和公众听到的却是一种全球性承诺。

▲ Greenblatt在X上发布的长帖摘要,媒体对Benioff对话的概括合理,但他认为“全公司90%”并不成立
最安稳的事实,和最躁动的现实
所以,这句狂言的真相到底是什么?
把它拆开来看,你会得到一副非常有意思的骨架:
2025年3月,Amodei给出了一个激进的、可裁决的、带时间戳的短期预测,同时埋下了人类角色的保留条款,只是后来的转述几乎无人提及。
六个月节点,外部共识是“没实现”,但一线开发者的自我报告已经形成“我的代码几乎全是AI写的”与“我们公司离90%远得很”的对峙。
七个月后,Amodei在Dreamforce上把“90%”翻译成“10倍工程师杠杆”。这次语义迁移让“预测是否成真”变得更加难以验证。
独立分析派,以Greenblatt为代表,则追问了行数占比能否衡量AI对软件业的影响。
这场争论的价值,正在于它暴露出的口径错位。在同一片土地上空,飘着完全不同的世界:创业公司绿场里,95%的代码行由LLM生成;大型企业遗留系统里,AI的净贡献可能趋近于零;实验室内部,某些团队真的跑到了90%;而一个资深开源开发者用了AI工具,却比不用时更慢。
这些都可以同时为真 因为它们讨论的“写代码”存在不同口径。
当人们下次再引用Amodei那句“3到6个月,90%”时,也许该先问一句:你说的90%,秤的是什么?

夜雨聆风