十万开发者,三代AI工具,一条从天花板坠落到地板的生产率曲线这篇论文给出了少见的真实世界答案
2026年5月,麻省理工学院与宾夕法尼亚大学沃顿商学院联合发布了一份重磅工作论文,编号NBER第35275号三位经济学家,Mert Demirer、Leon Musolff与Liyuan Yang,做了一件此前没人系统做过的事:追踪超过10万名GitHub开发者的真实行为数据,逐层测量AI编程工具到底把"生产力"推到了哪里,又在哪里卡死了
答案极其戏剧性。
一条令人窒息的"蒸发漏斗"
先说那个让所有人倒吸凉气的数字。
论文把AI编程工具分为三代:第一代是自动补全,像更聪明的输入法,代表产品是早期GitHub Copilot;第二代是交互式代理,能在你的电脑上实时改文件跑命令,比如本地运行的Claude Code;第三代是自主异步代理,你丢个任务过去,它自己去远端干活,干完给你交一份完整的Pull Request
当最强的第三代自主代理上场后,开发者产出的代码行数暴涨至原来的17.3倍
17.3倍!这个数字足以让任何投资人血脉偾张,也让程序员重新估量日常工作但别急,跟着论文的镜头继续往下游走,你会看到一场教科书级别的高空跳水:
| 代码行 | 17.3× |
| 正式发布 | 1.3× |
从17.3倍到1.3倍。翻译成人话:AI帮你多写了十六倍的代码,但经过评审、合并、测试、发布这条流水线的层层"绞杀",最终多交付出去的软件,只有30%


▲ 沃顿教授Ethan Mollick直接贴出论文核心图表:三代工具的代码产出倍数与最终交付之间,形成了一道令人绝望的陡坡。
17倍的代码,喂进了什么黑洞?
答案藏在一个经济学概念里:弱环节假说
想象一条工厂流水线。AI把最前端的零件冲压速度提升了17倍,但中间的质检工位还是那三个老师傅手动看、手动敲后端的包装线还是原来的节拍。最后出厂的成品能多多少,取决于最慢的那个环节
论文用严格的计量方法估算出:AI与人类劳动之间的替代弹性仅约0.25这个数字的含义是,它们之间是强互补关系,而非替代关系AI写出海量代码后,人类必须做的那些事,理解需求、评审变更、跑集成测试、决定发布节奏,一样都少不了而这些环节的产能几乎没有同步扩张
正如Mollick在后续讨论中指出的:人类之所以成为瓶颈,部分原因恰恰是人类在对AI产出做质量把关这种质量把关是必要的互补环节。

▲ 从业者一针见血:"能力扩张了,交付没有。缺口在验证、评审工具、集成逻辑和反馈回路。"
更扎心的后半段:应用更多了,但没人用
如果说生产链内部的衰减还算"意料之中",那论文第8节的发现就是一记冷水兜头
研究团队追踪了四大分发市场,苹果App Store、Google Play、Chrome网上应用店和SourceForge,的月度数据发现:
供给端疯狂起飞。 iOS新应用月产量从2023–2025年初的约3万–5万,到2026年4月前后飙升至每月约10万Chrome扩展从每月约5千涨到约1.3万
使用端纹丝不动。 新上架的应用在三个月内获得的累计下载和使用量,整体走平甚至下降低使用量应用的占比急剧上升,大量新软件停留在几乎无人触达的区间



▲ 金融博主Hedgie的可视化:应用发布量曲线陡升,而"有显著使用的应用"和"应用评论"曲线几乎躺平。更多的应用,换来的是更多的寂静。
一位评论者评价:"更多应用却无更多使用,是这项研究中最重要的发现,也是对AI生产力预期最不方便的发现"

▲ "More apps with no more usage is the most important finding."
30%到底算好还是算差?
这取决于你站在哪里看。
如果你是工程团队负责人,30%的生产率增益在历史上堪称优秀有回复者直言:"30% is fantastic in terms of productivity gain." 企业管理咨询领域里,能把一个成熟流程的效率拉高30%,足以被写进年度最佳实践案例

但如果你是投资人,正在为AI基础设施投入数百亿美元的资本开支,这个数字可能要命当华尔街的模型假设AI编程工具能带来2–3倍甚至更高的效率飞跃时,30%和300%之间差了一个数量级的估值逻辑
风险投资人Tomasz Tunguz试图在另一面拼出更乐观的图景:NVIDIA内部30000名开发者代码提交量增长约3倍、Anthropic人均代码产出增长约2.5倍、Replit人均产出翻三倍,且bug率和事故率大致持平但他同时承认:"多数公司仍停留在'发一个AI编辑器、别的不变、结果接近30%'的默认档"



▲ Tunguz将生态分成三档:重新设计整套流程的头部团队、改造局部的中段,以及"只发工具不改系统"的默认多数。你在哪一档?
历史正在押韵
经济学家们对这种"技术爆炸、统计沉默"的场景并不陌生
1987年,罗伯特·索洛说了一句后来被引用了几千次的话:"You can see the computer age everywhere but in the productivity statistics." ,计算机时代到处可见,就是不在生产率统计里
电力的故事更有嚼头。爱迪生的发电站1882年就亮了灯,但美国工厂的生产率直到1920年代才因电力而显著提升,中间隔了将近40年原因?工厂老板只是把蒸汽机换成电机,厂房布局、管理方式、工序编排一概不动新一代管理者后来把工厂围绕电力重新设计,生产率随之爆发
2026年的AI编程工具,很可能正站在那条时间线的最前端代码行是电机,评审、集成、发布和用户获取是厂房布局 前者已经换了,后者几乎原封不动。
那么,谁该紧张?
论文自身保持了学术审慎,但从材料中可以提炼出几条信号:
对工程组织:只买AI编辑器不改评审和发布流程,大概率停在"提交涨、交付微涨"的状态工具的收益取决于整套系统。
对产品市场:更多上架 ≠ 更多用户。发现、信任与质量分布正在成为比"能不能写出来"更致命的瓶颈
对投资判断:把基准测试跑分或代码行倍数直接外推为收入增长,这篇论文就是一面镜子Forbes在解读中引述投资人Sarah Guo的话:"许多人从基准进步中学到了错误的课"
对开发者个人:一位评论者写道,"编码从来算不上最难的部分,只对不会写代码的人很难" AI修好了很少有人挣扎的那一步。更稀缺的能力包括判断什么值得做、保证上线后稳定、说服真实用户使用上游产出越多,这些能力的成本越高。
17倍的代码正在涌入管道。管道另一头,人类评审员的咖啡还没凉
这张系统账单,记录着每个没有同步扩容的环节
而账单,总是会到的。
夜雨聆风