十万开发者,四大应用商店,一条从天堂坠入人间的生产率曲线,2026年最扎心的一篇论文,把AI编程从代码量一路追到真实发布
你以为AI写代码越快,软件就越多、世界就越好?MIT和沃顿商学院的研究者盯着GitHub上超过十万名真实开发者的行为数据,给出了一个让整个硅谷都该冷静三秒的回答:代码量陡增,软件发布和用户使用却没有同步增长


▲ 沃顿教授Ethan Mollick直接贴出论文Figure 1:代码行暴涨17.3倍,发布量"只"升了约30%
一场17倍狂欢,一条自由落体的漏斗
这篇编号NBER第35275号的工作论文题为Writing Code vs. Shipping Code,写代码,对比交付代码
作者把近年AI编程工具分成三代,效果一代比一代猛:
- 自动补全
(早期Copilot那种"边敲边猜"):代码行 × 2.2倍 - 交互式代理
(本地Claude Code,人还在方向盘上):代码行 × 7.4倍 - 自主代理
(远程Codex,扔个任务它自己干到出PR):代码行 × 17.3倍
17.3倍。 光看这个数字,开发流程似乎已经被彻底改写
但论文画了一条漏斗,像一盆冰水从头浇到脚 17.3倍的代码行,经过文件整理变成3.9倍,到提交变2.8倍,到拉取请求变2.5倍,到项目数变1.5倍,最终,变成发布数,只剩1.3倍
1.3倍。也就是+30%。
从1730%到30%,中间蒸发掉的那些,去了哪里?

▲ 论文首页与摘要:三位来自MIT和沃顿的作者,十万开发者样本
瓶颈从来不在键盘上
答案藏在一个经济学术语里:弱环节假说
想象一条流水线。AI把最上游的"写代码"环节加速到了荒诞的程度,但评审要人看,合并要人批,发版要人盯,需求要人定 这些环节没有被加速,甚至因为上游洪水般的产出,反而更堵了
论文估算,AI与人类努力之间的替代弹性约为0.25换成日常说法,它们呈现出强互补关系,AI写再多,人类不点头,代码就出不了门
一位系统工程师在推特下面写了句被疯转的话:
"瓶颈在于决定什么值得做、以及上线后谁真的用。AI修好了没人在挣扎的那一步。"

▲ 评论区的灵魂拷问:AI解决的,是没人觉得难的那一步
Mollick教授本人也补了一刀:按这篇论文的方法,他们其实没办法直接评判代码质量好不好人类之所以成为瓶颈,恰恰是因为人类在给AI的产出做质量把关,这也体现了质量把关的作用
应用商店的残酷验证:更多App,零增长的用户
如果说GitHub上的漏斗还只是"生产端的故事",那论文第8节把刀捅到了消费侧
研究者爬了四大分发市场的月度数据:苹果App Store、Google Play、Chrome网上应用店、SourceForge结果触目惊心,
新应用数量确实暴增。 iOS月均新应用从2024年的3-5万,飙升到2026年4月的每月约10万Chrome扩展从每月5000涨到1.3万供给端一片繁荣。
但总使用量呢?纹丝不动。 每批新上架App在三个月内累计的下载与使用,整体走平甚至下降更多新软件停留在几乎无人触达的区间低使用量应用的占比在上升,换句话说,AI正在高效地生产没人要的软件



▲ 金融博主Hedgie配图:App发布量陡升,评论数与实际使用走平,经典的"供给幻觉"
这组数据的冲击力在于,它动摇了一个隐含假设:更多软件 = 更多价值 更多软件也可能只等于更多噪音。
历史的回声:索洛悖论又回来了
如果你觉得这个故事似曾相识,你的直觉是对的
1987年,经济学家罗伯特·索洛说了一句后来被引用了几千次的话:"计算机时代到处可见,就是不在生产率统计里" 电力进入工厂后,花了几十年,企业才把厂房布局、管理流程、工人技能全部改造到能配得上电力的程度在此之前,蒸汽机换成电动机,工厂并没有快多少
AI编程工具正站在同一个历史节点上 生成端已经电气化了,但评审流程还是蒸汽时代的,需求定义还靠手工,用户发现机制还是老一套应用商店搜索
有团队已经意识到了这一点。风险投资人Tomasz Tunguz汇总了NVIDIA、Anthropic、Replit等公司的内部数据,有的团队报告了2.5到3倍的人均产出提升,缺陷率大致持平但他同时承认:大多数公司仍停留在"装个AI编辑器,别的不变"的默认模式,结果就是论文里那个30%

▲ 不同组织对AI工具的利用深度差异巨大,多数还在"默认30%"区间
从业者Montana Labs在评论区总结得精准:
"17倍到30%的比率,才是应用AI团队该盯的东西。缺口在验证、评审工具、集成逻辑和反馈回路,2026年,多数团队在这些地方仍然投入不足。"
更快,也可能更危险
还有一个不那么显眼、但可能更致命的维度:安全与技术债
Opsera对超过25万开发者的遥测显示,AI生成代码的安全漏洞率可高于人类代码约2.74倍到达PR的时间确实缩短了最多58%,但AI相关PR在评审队列中等待时间可达普通PR的4.6倍,因为审的人不放心
MIT Sloan Management Review在2025年底专门做了个短片讨论这事:今天省下的键入时间,可能变成数月后凌晨三点被叫醒修bug的成本仪表盘上的速度指标一路飘绿,理解缺口要到生产事故那天才暴露
JK在Mollick帖下写了一段值得每个技术管理者贴在屏幕上的话:
"在大多数工程组织已经淹没在无法维护的代码表面积里时,再造一个17倍的输出乘数,几乎是讽刺的。由此要追问:'更多发布'究竟该占多高的优先级,我们是否正在加速冲向另一种债?"
所以,AI编程到底"行不行"?
行,但没有PPT里那么行。
这篇论文没有说AI编程工具无用,发布量+30%,放在任何一个传统行业都算得上惊人的生产率跳跃有评论者直接说:"30%的生产率增益已经很出色了"
这份研究集中说明三点:
第一, 基准测试上的数字和真实交付之间,有一条深不见底的沟AI代理在SWE-Bench上的分数从13%跃升到80多分,这个进步仍不能直接换算成生产环境里的交付能力
第二, 软件行业最稀缺的是判断力,做什么、舍弃什么、这段代码该不该合进主干、这个产品有没有人需要AI加速了供应充足的编码环节,把稀缺的判断环节变成了新的堵点
第三, 对投资者而言,如果编码工具的增益穿不透整条生产链,建立在"AI让软件产出翻几番"之上的资本开支假设也会随之下调 Hedgie把矛头直指Alphabet 1800亿美元的资本开支指引论文没有直接下这个结论,它的数据为这场讨论增加了一个可核对的尺度
17倍的代码,30%的交付,0%的用户增长 这组数字给出了一张路标:模型能力继续进步时,组织能否消化产出、团队能否守住判断质量,将决定多少代码值得进入产品
夜雨聆风