

2026年8月,X 上又出现一条视频帖。
熟悉的金句、西装和眼镜同时回到时间线上。Anthropic CEO Dario Amodei 对着镜头,再次说出那段已被转载百万遍的话:
“未来3到6个月,AI将编写90%的代码。12个月内,几乎所有代码都可能是AI生成的。”
问题是,这句话,已经说出口整整17个月了。
三到六个月的窗口早已关闭,一年期判断也已到期。公开数据仍未显示90%或“几乎全部”已经成为行业常态。统计口径仍是一团迷雾:Anthropic内部到底多少?微软谷歌只认多少?为什么CEO说“绝对成立”,研究员却说“全公司才一半”?
金句的诞生:3秒剪辑,砍掉一半真话
2025年3月10日晚,美国对外关系委员会(CFR)。Amodei 坐在 Chair 对面,灯光打得很足。主题名义上是“美国AI领导力”,但没人记住那些宏观词汇。所有人只记住三个数字:3个月、6个月、90%。
原话其实有后半句他说程序员仍要指定条件、做总体设计决策、判断如何与已有代码协作、判断安全与否。但那段32秒的短视频被剪出来后,后半句就像从未存在过。
Business Insider 很快将其做成标题,X 上的视频播放量冲到百万级。二级创作者接连改写这段话,转发速度甚至超过模型生成代码的速度。

▲ 2025年3月11日,早期高热度视频帖,浏览量达到百万级
但就在全网狂欢的同一天,有人冷得可怕。机器学习圈顶级研究型网红 Sebastian Raschka 在那条爆款推文下,只留了一行字:
“我记得自动驾驶的时间线……90%营销,10%现实。”
这句评论把时间轴拉回了十年前 2016年特斯拉说“明年全自动驾驶”。2025年AI CEO说“下个季度AI写90%代码”。相似的激进时间表再次出现

▲ Raschka的回复:自动驾驶式“时间表疲劳”。AI编程预测,被指是同一出营销剧本重播
公开数据大对账:大厂约30%,与90%相差60个百分点
死线到期日,人们开始翻出各家公司发布过的数据。一比,尴尬了
微软,2025年4月,CEO 纳德拉在 LlamaCon 亲口说的数字是:仓库内约20%到30%的代码由AI生成,比例在稳步上升。谷歌,皮查伊在财报电话会上的口径更早:新代码约四分之一以上由AI生成,合并前须经人类审阅。
行业汇编网站 Second Talent 在2026年5月给了更细的分层:样板与测试层,AI占比可达50%到70%;业务逻辑层,15%到30%;关键基础设施与算法层,更低也就是说,AI吃掉的是奶油层,承重的地基始终握在人类手里。

▲ 产业分层数字:AI代码占比呈现明显的层次差异
最刺骨的拷问:Anthropic自己到了吗?
那Anthropic 自己呢?这是整场公案最要命的一问
Amodei 后来多次公开说:预测在 Anthropic 内部“绝对成立”。但听完整句话的人发现,他从来会补一句,“在许多团队,并非处处均匀”。
2025年10月,Redwood Research 的研究员 Ryan Greenblatt 发了一篇万字长文,逐字逐句拆解:
少数团队合并代码的AI占比,确实接近90%; 但全公司平均,更接近50%; 如果把“用过一次就扔的一次性脚本”也算进去,数字会明显升高,这种口径与公众理解的“工程师写了多少代码”并不相同。

▲ Redwood Research的“裁决长文”:90%是经过选择的局部最大值。全公司平均仅约50%,口径一变可差几十个点
90%更接近局部团队的上限样本好比说巴西队一场进了7个球,却没告诉你对面是业余队。
最难堪的实验:AI让资深程序员反而慢了19%
一组反直觉数据随后改变了争论的方向。
2025年7月,研究机构 METR 发布随机对照试验:16位在各自大型开源仓库拥有多年经验的资深开发者,246个真实 issue。随机分组,一组能用当时最先进的AI工具(Cursor + Claude 3.5/3.7 Sonnet),一组不能。
结果让人大跌眼镜:使用AI的那一组,平均耗时反而多了19%。 该页面后来提示,2026年初已有后续数据,这组结果应被视为早期工具条件下的历史快照。
开发者事前预测 AI 会让他们快约24%;做完实验后,他们仍然觉得自己快了约20%。但秒表是铁面无私的感知生产力与测量生产力之间,隔着一整个幻觉区。

▲ METR对照试验的early-2025历史结果:资深开源开发者使用AI后平均慢19%
这当然不证明 AI 编程无用它证明的是另一件事:“模型生成的行数”与“人端到端交付的快慢”是两个不同命题。 在成熟、高标准、开发者本就极熟的代码库里,审查、纠偏、上下文检索的成本,足以吃完生成速度的红利,还得倒贴。
而 Stack Overflow 的数据更诡异:2025年 84%的开发者使用或计划使用AI工具,51%每天在用,但信任AI的比例反而降到了29%。用得越多,越知道坑深

▲ Stack Overflow 2025:高采用与低信任同时存在,呈现工程现场的日常张力
到期后的评论现场
时间来到2026年3月,12个月的窗口也到期了。有用户直接翻出一年前的原话,指出公开现实仍未走到预测中的位置。

▲ 一年节点的回顾帖:12个月过去,公开现实仍未达到预测所说的程度
有评论给出了更精确的数字:今天的实际量级约 41%,且近半开发者感觉调试AI代码更慢。方向没错,错在“写代码”三个字的含义被无限窄化了。
与此同时,2026年的转帖仍在为这段旧话添加“职责上移”等新解释。时间表虽然到期,解释框架仍在继续变化。
谁该为这口锅买单?
其实,Amodei 原话中的限定,一直被转发链有意无意地砍掉。
“90%”绑的是三到六个月,用的是“I think we'll be there”;“几乎全部”绑的是十二个月,用的是“may be”。而且他开宗明义就区分了“写代码”和“完成软件工程”,生成行数之后,规格、设计、安全判断,仍坐在人的椅子上。
媒体偏爱数字,短视频偏爱金句,平台则放大焦虑。话是他说的,算法又为它加速 Greenblatt 在 Redwood 长文里明确批评:CEO 后来用“absolutely true”概括时不够严谨,媒体按字面报道,“并不冤枉”。
这件事提醒人们:即兴口头百分比,是高噪声信号。 一旦绑上季度级死线,它就变成一张迟早到期的支票。兑现不了时,数字也会面对更严格的口径核查。
方向对,数字错。但警钟是真的
平心而论,这场公案绝不应该以一句“预测破产”草草收场,那太便宜了。
真实发生的事是:AI 确实在吃掉代码的低垂果实。 样板、测试、CRUD、MVP、一次性脚本,这些战场上,90%甚至已在局部达到。但那些最深、最难、最不可替代的工程决策,架构取舍、遗留系统集成、安全边界、事故责任,仍然、而且将长期,坐在人类的椅子上。
Amodei的问题在于把“写代码”的局部指标,扩展成了对软件开发进程的判断。他把一条长期渐变的曲线,硬生生压缩进了两个季度的死线。
死线过期了,技术仍在推进90%缺乏公开数据支撑;眼下该问的是:你敢让AI写哪一部分? 这个问题,比预言本身刺激得多

夜雨聆风