乐于分享
好东西不私藏

AI写代码暴增17倍,最终上线却只多了三成!MIT万人研究撕开残酷真相:没人用的软件堆成山

AI写代码暴增17倍,最终上线却只多了三成!MIT万人研究撕开残酷真相:没人用的软件堆成山

代码在疯狂生长,产品却纹丝不动。十万开发者的数据描出了这幅反差强烈的图景

2026年夏天,一份来自MIT和沃顿商学院的重磅论文,像一记闷棍敲在了整个AI行业头上,你以为AI编程代理正在掀起生产力革命?数字告诉你:革命只革了上半身。

论文名字起得就很刻薄:Writing Code vs. Shipping Code,写代码 vs. 把代码发出去两者相距很远。

▲ NBER Working Paper 35275,作者为MIT的Demirer、沃顿的Musolff,以及MIT的Yang

一张图,戳穿所有幻觉

研究者追踪了超过10万名GitHub开发者在采用AI编程工具前后的行为变化,涵盖从最早的自动补全(Copilot那一代),到本地交互代理(Claude Code等),再到远程自主代理(OpenAI Codex、GitHub Agent等)三代工具

结果浓缩在一张图里,我建议你盯着看十秒钟:

▲ 论文Figure 1:从代码行到正式发布,AI的增益像瀑布一样逐级跌落

横轴从左到右,是软件生产的六级漏斗,代码行、触及文件、提交(commit)、合并请求(PR)、涉及项目数、正式发布(release)纵轴是采用AI后的变化幅度。

最左边,代码行:17.3倍。 自主代理让人写出的代码暴涨了一个数量级

最右边,正式发布:1.3倍。 也就是说,最终交付到用户手上的东西,只多了大约30%

从1730%到30%,中间蒸发掉的,就是这篇论文要讲的全部故事

瓶颈不在打字速度

为什么会这样?论文给出了一个精炼的解释框架:“薄弱环节”假说(weak-link)

软件开发远非"写完代码就完事"。它是一条串联的生产线:你改了代码 → 提交 → 发起合并请求请同事审查 → 通过测试 → 合入主分支 → 打包发布 → 用户才可能用到AI把最上游的"敲代码"加速到了荒谬的程度,但下游每一个环节,审查、测试、集成、发布决策,仍然由人来完成

上游再快,下游不动,整条线就被最慢的那一环卡死

▲ Table 5细分数据:不同工具在不同层级的增益差异巨大

具体看数字:自动补全让代码行涨了228%,但release只涨了10%同步代理(比如Claude Code)让代码行涨了981%,release涨了29%到了异步自主代理,代码行涨幅更猛,但release的数字?论文甚至因为计量困难没法单独报出来

作者还估算了AI产出与人类劳动之间的替代弹性:大约0.25这个数字意味着什么?意味着它们之间是强互补关系,AI写得再多,没有人类审查和判断,产出就是半成品

▲ 沃顿教授Mollick的补充:论文方法无法评价代码质量,人类评审恰恰是必要的互补环节

沃顿教授Ethan Mollick点评这篇论文时一针见血:"人类之所以成为瓶颈,部分原因正是他们在做某种质量把关" 下游的"慢"承担着质量控制这项feature

应用商店的残酷验证:软件堆成山,没人去下载

如果说开发者漏斗的数据还停留在"生产端",那论文的第二组证据直接打到了消费端的脸上

研究者同时分析了四大应用分发市场,Apple App Store、Google Play、Chrome Web Store和SourceForge的面板数据

结论令人窒息:

供给端,新应用上架量在2025年代理编程兴起后显著加速iOS新应用从此前每月约3-5万款,飙升到2026年春的约10万款/月Chrome扩展也几乎翻倍。

需求端呢?走平。甚至偏弱。

▲ 四大应用市场数据:新应用暴增,总使用量纹丝不动

更扎心的细节是:在新上架的应用中,达不到"起码有一点受众"门槛的占比在上升,iOS上三个月内评分不足10条的、Android下载不足100的、Chrome下载不足10的……这些"零受众应用"正以前所未有的速度涌入商店

▲ 财经博主Hedgie面向非技术读者总结论文发现

一位评论者的话被大量转发:"更多应用却没有更多使用,这才是这项研究中最重要也最不方便的发现"

▲ "对AI生产力判断最不方便的发现"

产业界的平行证据:审AI代码的时间,已经超过写新代码

论文之外,产业调查也提供了佐证。

工程管理者Mark Ajzenstadt引用DX对12.1万开发者的调查数据写道:92.6%的开发者已经在用AI编程助手,AI生成的代码占到生产代码的26.9%但生产率增益?仍然卡在10%左右

更魔幻的数字来自另一份调查:开发者每周花在审查AI生成代码上的时间是11.4小时,而写新代码的时间只有9.8小时

▲ "AI替换了打字,但它没有替换思考。"

AI接管了打字,思考仍需人来完成。 成本没有消失,只是从"写"转移到了"审"。

17倍代码的讽刺

一位开发者的评论堪称全场最佳:

"当大多数工程组织已经淹没在无法维护的代码表面积里时,我们造了一个能多写17倍代码的工具。'更多发布'真的是我们该优化的方向吗?还是说,我们只是在加速冲向另一种形式的技术债?"

▲ "产出乘数很惊人。问题是我们是否在加速走向另一种债务。"

另一位评论者更简洁:

"瓶颈一直在决定什么值得做、以及做完了谁会用。AI修好了那个没人觉得难的步骤。"

三成增益该怎么看?

30%的发布增益放在整个行业规模上,仍然是可观的数字论文测的是十万人级别的平均效应,一些组织通过改造下游流程,完全可能获得更多增益

但它确实刺破了一个泡沫:任务级的演示效果,不能直接等号于经济价值代码行与产品之间有距离;提交之后还要经历发布,发布之后还要经受用户选择

Hedgie在原帖中把这个逻辑接到了一个更大的故事上:"整个AI基建的财务假设,建立在'更快的产出等于更多的经济价值'之上这项研究给出的数据表明,两者目前仍有很大距离"

用论文自己的术语说:替代弹性0.25 AI与人类劳动是强互补品。上游自动化得再彻底,只要下游的审查、协调、产品判断仍然靠人,而且两者不好互换,最终产出就会被最紧的那一环压住

写代码很难。决定做什么、判断做得对不对、让人用起来,这些环节仍然压在人类肩上

而它们,才是软件的全部意义。