夜雨聆风学习资料网

ARTICLE · 1054597

AI slop一则:AI生产率增益会流向哪一侧?

AI slop一则:AI生产率增益会流向哪一侧?

乘法之后:AI 生产率增益的社会分布

—— 一份调查报告

日期:2026 年 9 月 21 日


摘要

本报告从一场争论出发。争论双方都接受"AI 是做乘法而不是做加法"这一流行命题,但对乘法的分布后果判断相反。甲方认为:乘法终将拉平生产率分布——聪明人用 AI 省下的时间拿去摸鱼,不熟练者把工作整个外包给 AI,全社会生产率上升的同时差距收窄,如同完全竞争市场终将走向均衡。乙方认为:乘法只在"线性区"有效,超出一定范围后"人一天只有 24 小时"成为限速步,因此可以预期生产率水平普遍上升、但头部存在明确截断。

基于 2026 年 9 月对实验经济学与劳动经济学文献十余轮系统检索,本报告的结论是:命题本身成立,但双方各需修正一处,且二者很可能同时成立——只是作用在不同的边际上。任务执行层(边界内、可编码、短期)的证据一致支持压缩;判断选择层与资产层(边界外、验证与责任、长期)的证据一致支持集中。理论文献已把这一"矛盾"形式化为不平等的"两种体制",体制边界取决于 AI 的技术结构与劳动市场制度(Chen and Meng, 2026; Benzell and Myers, 2026)。

阅读约定:文中所有数字均可溯源至文末来源列表;凡标注"转引自"者为二手引用;凡检索中未能获得一手精确数字者,本文采用定性表述而不给出数值,以避免过度声称(overclaim)。


0 引言:把争论严格化

把双方立场翻译成可检验的命题,争论会清楚很多。

命题 A(均衡化)包含三个经验断言:(A1) AI 对生产率的冲击近似于对所有人乘上同一个大于 1 的系数——在对数空间里,这等价于给每个人的产出加上同一个常数,因此相对差距不变;(A2) 但实际分布要收窄,需要一个额外机制:AI 对低生产率者的提升比例更高(天花板/地板效应),即乘数本身是反向不均匀的;(A3) 均衡化是可持续的稳态,而非过渡现象。

命题 B(截断)也包含三个断言:(B1) 乘法只在"线性区"有效——AI 能力边界之外("jagged technological frontier",Dell'Acqua et al., 2023),乘数失效甚至为负;(B2) 存在一个生物学约束的生产要素(人类注意力/时间/验证带宽),它不随 AI 进步而扩张,构成所有个体产出共同的渐近线;(B3) 因此分布的头部存在一个水平意义上的硬截断

值得注意的是,双方共享一个未言明的前提:乘数是一个单一的、给定的数。下文将证明这正是分歧的来源——乘数在任务之间、人群之间、企业之间、时间维度上都不均匀,而文献对"它在哪些维度上如何不均匀"已经积累了相当好的证据。

方法说明:本报告的证据来自 2026 年 9 月 21 日前后以 Firecrawl 检索引擎与 arXiv 论文索引完成的多轮检索(约 15 次网络检索、8 次论文索引查询、5 次一手页面核对),检索在两组对立关键词("skill compression / narrows gap"与"superstar / winner-take-most / verification bottleneck")上交替进行,直到两个方向的文献互相引用、不再出现新的独立证据源为止。所有关键数字均回溯至一手来源(论文原文、官方摘要、机构报告原文)。


1 "AI 是乘法不是加法":命题检验

1.1 话语考古:一个没有单一出处的流行比喻

"AI 是乘法不是加法"在中文与英文技术话语圈各自独立流行,找不到单一的经典出处。中文侧可直接检索到大量同题文本:知乎专栏《AI 在做乘法,而你还在做加法》称"在加法世界里你拼尽全力也就翻一倍;在乘法世界里你可以做到 10 倍、100 倍"(知乎,n.d.);腾讯云开发者社区《为什么说AI不是加法而是乘法?》主张"用 AI 放大你的核心能力,而非简单替代"(腾讯云,n.d.)。英文侧则有 "AI is a Multiplier, Not an Adder" 一类的文章(xleioo,n.d.),以及 BCG/HBS 圈更常用的 "force multiplier" 话语(adnanmasood,n.d.)。这个比喻在学术谱系上可追溯到"智能增强"(intelligence augmentation, IA)传统——AI 的价值在于放大人的能力而非替代之(Agrawal, Gans and Goldfarb, 2024)。

有趣的是,这个比喻从诞生起就分裂为两个方向。同为中文话语,方格子上的《AI是加法還是乘法?》写道:"如果你有 10 分的能力,AI 能帮你做到 50 分;如果你只有 2 分,AI 頂多幫你做到 10 分"——乘法保持比值,差距在绝对值上拉大(黃同慶,n.d.);雪球上的《AI是杠杆:放大认知,也放大幻觉》则说"它没让结果变平等,而是把人和人的差距拉得更开"(雪球,n.d.)。这两个版本恰好分别预演了乙方的"放大论"与……都不支持甲方的"抹平论"。换言之,甲方立场在话语层面其实比乙方少见:从"乘法"比喻出发,最自然的推论恰恰是差距保持或放大(乘法保比值);要得出"均衡化",必须额外假设乘数对弱者更大。而这个额外假设——如第 2 节所示——恰好是实验文献中证据最强的部分。这是本报告的第一个反转。

1.2 微观证据:乘法是真的,且相当大

2023 年以来针对生成式 AI 的随机与准随机实验已覆盖客服、写作、编程、咨询、法律、出租驾驶、创业与教育等场景。核心数字如下表(均为一手来源数字):

研究
场景与样本
平均效应
分布效应
Brynjolfsson, Li and Raymond (2025)
5,179 名客服专员,某软件企业分批部署 AI 助手
每小时解决问题数 +14%(偏好设定 13.8%)
新手/低技能 +34%;司龄不足 1 月者 +46%;资深者≈0,且其对话质量指标略有下降
Noy and Zhang (2023)
444 名大学学历职业者,中级专业写作任务
耗时 −40%,质量 +18%
工人间不平等下降;首轮低分者获益最大
Peng et al. (2023)
受控实验,JavaScript 实现 HTTP 服务器
完成任务快 55.8%
异质性提示 AI 有助于职业转型者(方向性)
Dell'Acqua et al. (2023; 2025)
758 名 BCG 顾问,GPT-4
子任务完成数 +12.5%,评分质量 +40% 以上
低于中位数者 +43%,高于中位数者 +17%
Cui et al. (2025)
4,867 名开发者,Microsoft/Accenture 等三场 RCT 合并
完成任务数 +26.08%(SE: 10.3%)
初级开发者获益更大(转引自 Cruces et al., 2026)
Kanazawa et al. (2025)
横滨 520 名出租车司机(201 人使用 AI 需求预测导航)
巡航(寻客)时间 −5%
低技能司机 +7%,高技能≈0;技能间生产率差距 收窄 14%
Cruces et al. (2026)
1,174 名 25–45 岁成人,商业问题解决任务
高教育组 +0.834 SD,低教育组 +1.242 SD
教育间差距 0.548 SD → 0.139 SD(收窄约 75%)

三点解读。第一,乘法在任务级是真实的、可重复的:八个独立团队、六种职业场景,平均效应从百分之几到 55.8% 不等,没有一项研究得到零或负的平均效应——除了 METR 的例外(见 §3.1)。第二,效应大小与任务的"可编码性"高度相关:写客服回复、写新闻稿、实现标准服务器这类任务乘数最大;这预示着"线性区"概念(§3.1)不是比喻而是测量结果。第三,本表的最后一列一致指向"低基础者获益更大"——这是甲方命题 A2 的直接证据,其规模(差距收窄 14%–75%)远超"聊胜于无"。

1.3 宏观折扣:乘法在哪一步蒸发了

如果个体乘数如此可观,宏观统计却几乎看不见它。Acemoglu (2024) 从任务暴露度与任务级生产率提升出发,推算生成式 AI 未来十年的累计 TFP 增益不超过 0.71%(年均约 0.07%)。美国首个全国代表性调查显示:28% 的劳动者在工作中使用生成式 AI;使用者在自报口径下节省了 5.4% 的工作时间;据此推算的总生产率增益仅 1.1%——尽管折算下来,使用者在使用 AI 的每一个小时里产出高约 33%,与 RCT 的量级吻合(Bick, Blandin and Deming, 2025)。微观与宏观之间的缺口由三部分构成:其一,正式部署 AI 的企业在 2024 年 2 月仅占 5.4%(Bonney et al., 2024,转引自 Bick, Blandin and Deming, 2025),绝大多数使用是员工自发的、无组织整合的;其二,重新配置与互补任务的存在使得任务级乘数不能简单加总(Acemoglu, 2024);其三,度量问题——节省的时间若变成"在职闲暇",它增加福利但不增加产出的统计值(Bick, Blandin and Deming, 2025)。第三点正是甲方"摸鱼"机制在官方文献中的对应物,值得为甲方记一分。

1.4 小结

"AI 是乘法不是加法":(i) 有广泛的中英文话语讨论,无单一出处;(ii) 在任务级有强实证支撑;(iii) 在宏观层面尚不可见,缺口的解释(采用率、重新配置、闲暇归宿)本身就是一个重要的研究议题;(iv) 最关键的——乘数不是一个均匀的数。命题 A 与命题 B 的分歧,本质上是关于乘数在哪个方向上不均匀的分歧。


2 甲方论证:均衡化的机制与证据

2.1 为什么乘数对弱者更大:三个机制

甲方命题的成立与否,取决于 A2(乘数反向不均匀)是否为真。实验文献给出了三个相互咬合的机制。

机制一:AI 把最佳实践变成公共品。 Brynjolfsson, Li and Raymond (2025) 对其结果的核心解释是:生成式模型从历史对话中学到了高技能专员的做事方式,再把这种隐性知识(tacit knowledge)下发给所有人。证据链相当完整:低技能专员的对话文本在 AI 部署后向高技能专员的沟通模式收敛; AI 建议的遵从度越高增益越大;用原文的话说,模型学到的是"将高绩效工人与其较低效同行区分开的具体行为与特征"(Brynjolfsson, Li and Raymond, 2025)。用甲方的语言说:AI 不是给每个人一个乘数,而是把头部工人的技能外溢给了尾部——这正是 A2 的微观基础。

机制二:经验曲线加速。 同一研究显示,拥有 AI 的两个月薪手,产出追平了没有 AI 的六个月薪手;司龄不足一个月的新人提升 46%(Brynjolfsson, Li and Raymond, 2025)。这意味着 AI 压缩的不只是当期产出差距,还有积累差距的速度——对"笨人外包"场景而言,这其实是好消息:外包不必然阻碍赶超,赶超速度本身被乘大了。

机制三:AI 替代的是"努力"而非"技能"。 Noy and Zhang (2023) 发现 ChatGPT 主要替代工人的努力投入(草拟),把任务结构重构为"创意与编辑";由于努力投入恰恰是低产出者的短板,替代努力的技术的分布效应天然偏向下层。Kanazawa et al. (2025) 的出租车司机研究提供了同构的物证:AI 需求预测替代的是"知道去哪儿等客"这一技能,因此只有低技能司机获益(+7%),高技能司机的相对优势被削去,组间差距收窄 14%——作者称之为"去技能化技术"(deskilling technology)。

2.2 跨场景一致性:均衡化不是单一研究的产物

§1.2 表格末列的分布效应在六个场景中全部指向同一方向:客服(+34% vs ≈0)、写作(不平等下降)、咨询(+43% vs +17%)、编程(初级获益更大,Cui et al., 2025)、出租驾驶(差距 −14%)、教育分组实验(差距 −75%,Cruces et al., 2026)。Cruces et al. (2026) 在综述这批实验时总结道,新兴证据表明"生成式 AI 常常提升绩效,并在相对同质的工人群体内压缩生产率分布";Benzell and Myers (2026) 则为这些混合结果提供了统一的模型化解释。值得强调的是最反面的一条证据也被诚实报告了:对甲方最有利的表述不是"AI 帮了弱者",而是 Cruces et al. (2026) 的后续测试表明这些增益不是纯代工幻觉——撤走 AI 后,受试者并不比对照组更差,低教育组还保留了一部分增益(约 +0.171 SD)。这一点将在 §4.2 与 Bastani et al. (2025) 的反例对质。

2.3 "摸鱼"的度量归宿

甲方叙事中最难证据化的部分——"聪明人省下的时间拿去摸鱼"——意外地有官方对应物。Bick, Blandin and Deming (2025) 明确写道:如果工人在雇主不知情的情况下用更少时间完成同样任务,省下的时间就成了"在职闲暇"(on-the-job leisure)——它增加福利,但不进入生产率统计。这与"聪明人摸鱼"是同一个现象的经济学表述。旁证包括:资深开发者对 AI 输出的信任度最低(84% 的开发者使用 AI 工具,仅 33% 信任其输出——Stack Overflow 2025 开发者调查,转引自 Zaalouk, 2026),而感知与实际的差距可达 39 个百分点(METR 实验中开发者自认为快 20%,实际慢 19%;Becker et al., 2025)。不过必须诚实地记录反向证据:一项追踪 40 名知识工作者八个月的哈佛商业评论/UC Berkeley 研究发现 AI 让多数人感到更忙碌而非更清闲,62% 的初级员工报告倦怠(转引自 Zaalouk, 2026)。"省下的时间去哪了"目前没有定论——摸鱼、验证与更多任务相互竞争,答案可能是岗位依赖的。

2.4 甲方论证的四个隐含假设

把甲方立场推到最强之后,它的脆弱点也随之显形。均衡化要成为稳态,需要:(i) 接触均质——但正式采用 AI 的企业仅 5.4%(Bonney et al., 2024),且 AI 技能的工资溢价三年间从 25% 涨到 56% 再到 62%(PwC, 2024, 2025, 2026),市场正在给 AI 互补性定价而非抹平它;(ii) 静态视角——不考虑技能习得渠道本身被 AI 侵蚀(§4.2);(iii) 任务层分布 ≈ 收入分布——忽略企业、资产与所有权层面的集中(§3.4);(iv) 省下的时间无差异地再分配——而验证与判断恰恰是时间质量差异最大的领域。这四条假设正是乙方论证的入口。


3 乙方论证:截断的机制与证据

3.1 线性区与专家区:乘数有边界,甚至可以为负

乙方命题 B1(乘法只在线性区有效)在文献中有精确的对应物。Dell'Acqua et al. (2023; 2025) 把它命名为"锯齿状技术前沿"(jagged technological frontier):AI 能力覆盖的任务集合不规则且不可见,边界内 AI 使顾问表现大幅提升(质量 +40% 以上),边界外则使其表现显著恶化(发表版摘要原文:"AI assistance improves human performance only for tasks within current AI capabilities—and worsens" it outside;Dell'Acqua et al., 2025)。乘法不是一个全局常数,而是一个任务集合的指示函数。

边界之外还有一种更微妙的现象:对专家,乘数可以为负。METR 的随机对照实验中,资深开源开发者在使用早期 2025 年 AI 工具后完成任务的时间增加 19%(置信区间 +2% 至 +39%)——而这些开发者事前预测 AI 会让他们快 24%,事后仍自认为快了 20%(Becker et al., 2025)。样本量小、结论有过修正(METR 于 2026 年 2 月宣布重新设计该实验),单凭它不能下强结论;但与之独立的大型观测证据指向同一方向:Daniotti et al. (2026) 在 Science 发表的研究用神经网络分类器识别了 160,097 名开发者、六个国家、超过 3,000 万次代码贡献中的 AI 生成代码,发现到 2024 年底 AI 已写下近三分之一的新代码、整体生产率提升 3.6%——但增益完全由资深开发者驱动。最具讽刺意味的细节是:新手恰恰是最高频的使用者(AI 代码占其产出的 37%,资深者仅 27%),却"几乎没有获益"("Beginners hardly benefit at all")。资深者不仅完成任务更快,还更敢借助 AI 探索新的库与工具组合——AI 加速的似乎是学习,而学习的复利归经验者所有。

三份来源各异的研究补齐了这个图景:大学辩论赛中高能力参与者从 GenAI 获益更大(Roldan, 2024,转引自 Cruces et al., 2026);164 名法学生的随机实验中,无训练的 LLM 访问适得其反——答案更短、判例误引更多、分数边际下降,且"高能力者选择不用,低能力者用了但用得没效率"(Chen and Bao, 2026)。乙方"线性区"概念的实证内容,比它的化学比喻严密得多。

3.2 验证瓶颈:"24 小时限速步"的形式化

乙方命题 B2 在 Catalini, Hui and Wu (2026) 处获得了教科书级的表述:AI 把执行的边际成本推向零,而验证(validate, audit, underwrite responsibility)的成本仍被人类认知生物学地锁定——"对增长的约束不再是智能,而是人类验证带宽"。两个成本曲线的相对速度撕开一个"可度量性缺口"(measurability gap),技术进步的性质随之从"技能偏向"转为"可度量性偏向"(measurability-biased technical change):租金流向验证级真值、加密溯源与责任承保——即"为结果投保的能力,而非生成结果的能力"。

企业层数据与之吻合:对 10,000 余名开发者的追踪显示,使用 AI 的团队完成任务多 21%、合并的 PR 多 98%,但 PR 审查时间上升 91%、PR 体积膨胀 154%、人均 bug 率上升 9%——工作没有消失,而是从"写"迁移到了"审"(Faros AI 数据,转引自 Zaalouk, 2026)。这正是"24 小时是限速步"的观测形态:约束不表现为产出水平的整齐截断,而表现为审查队列的积压、资深工程师读生成代码的时间超过自己写代码的时间、以及对"上周二上线的东西"信心下降(Zaalouk, 2026)。

3.3 判断溢价:截断管得住小时数,管不住价值

乙方最强的一手证据来自肯尼亚。Otis et al. (forthcoming) 给数百名肯尼亚小企业主随机分配 GPT-4 商业助手,结果平均处理效应为零(无法拒绝对企业收入与利润无效应的原假设);但按基线绩效分组,低绩效者因 AI 助手恶化了约 10%,高绩效者可能受益 15% 以上,差异约 0.25 个标准差。关键在机制:效应差异不是因为两组问的问题不同或得到的建议不同,而是因为选择了哪些建议去执行。免费的乘法摆在所有人面前,把乘法变成钱的判断力不免费。

这正是 Rosen (1981) 超级明星理论的现代翻版:当技术放大每个人的能力时,质量的微小差异在产出的放大中被同时放大——杠杆时代,天赋的租金上升而非下降。PwC (2026) 的企业版数据与之呼应:最暴露于 AI 的"超级明星企业"生产率增益达 163%,AI 经济收益的四分之三被五分之一的企业攫取;需要 AI 技能的岗位工资溢价升至 62%。但必须指出乙方论证在此处需要一处修正:24 小时是数量约束,不是价值约束。即使所有人每天的小时数相同(且都用于验证),每小时验证所体现的判断力仍有天壤之别——Otis 实验的机制恰恰发生在时间预算相同的两个人之间。因此"头部硬截断"应当改写为"头部软尾部":小时数收敛,价值不收敛。

3.4 乙方论证的隐含假设

把乙方立场推到最强后,同样能看到它的三处脆弱:(i) 边界静止假设——锯齿前沿在移动,且移动方向不定:Cui et al. (2025) 三场 RCT(2024 年中完成)发现初级开发者获益更大,Daniotti et al. (2026) 观测数据(2024 年底)发现增益全归资深者——"谁受益"是技术代际与任务结构的函数,不是常数;(ii) 数量约束 = 价值约束(§3.3 已证伪);(iii) 验证带宽不可扩张——Catalini, Hui and Wu (2026) 自己的结论恰恰相反:验证可以被制度化地扩展(审计技术、溯源、责任保险),"Hollow Economy"与"Augmented Economy"的分岔取决于是否做这笔投资。换言之,乙方的截断不是物理常数,而是一个未做出的制度选择


4 调和:两种体制,而非一个均衡

4.1 理论文献已经给出了框架

本报告检索的最大收获,是发现这场争论在 2025–2026 年的理论文献中已被形式化——双方都不是第一个提出自己立场的人,而文献的裁决是"分边际成立"。

压缩与集中并存。 Chen and Meng (2026) 构造了一个含内生教育、雇主筛选与异质性企业的任务模型,其结论几乎逐字复述了本报告的争论:"生成式 AI 压缩任务内技能差异,同时把经济价值推向集中的互补资产,造成一个表面悖论:在个体绩效上平等化的技术,可能在总体上扩大不平等。"模型产生两种体制(two regimes),边界取决于 AI 的技术结构(专有 vs 商品化)与劳动市场制度(租金分享弹性、资产集中度)。作者刻意强调:"本文的贡献是机制,而非对符号的判决。"

不平等效应非单调。 Benzell and Myers (2026) 把"自动化实验测得的分布效应"翻译成理论命题后证明:实验外推天然不可靠,因为不平等效应取决于任务级技能在工人间的相关结构,且随技术进步非单调变化——可能先降后升,也可能相反。这为 §3.4 的 Cui–Daniotti 矛盾提供了统一解释:两组研究面对的是同一技术的不同时点与不同任务层。

体制分叉取决于组织。 Farach (2026) 引入"协调压缩资本"(agent capital)证明:同一技术可以产生普惠收益或超级明星集中,取决于谁从协调成本的压缩中获益;所有体制中总体不平等都因就业扩张而下降,但管理者—工人工资差普遍扩大。"分配后果取决于谁控制组织弹性"——这是对甲方"完全竞争均衡"比喻最直接的理论反驳:均衡化不是一个市场自动过程,而是一个由组织与制度决定的过程。

进入民主化,顶端照旧。 Kim, Kang and Song (2026) 分析 Product Hunt 上超过 16 万次产品发布,发现 ChatGPT 发布后创业进入激增且由单人创业者驱动——但顶端质量分布没有变化,团队项目在排行榜顶层的支配地位反而增强。这为争论提供了一个干净的隐喻:AI 改变了"谁进场",没有改变"谁赢"。

4.2 动态维度:压缩能持续吗

甲方稳态假设(A3)的真正考验在时间维度。Bastani et al. (2025) 的土耳其高中实验是现有最强的反稳态证据:约 1,000 名学生中,无护栏的 GPT Base 让练习成绩提高 48%,但撤走 AI 后的独立考试成绩比从未用过 AI 的对照组低 17%;加入教师设计的护栏(只给提示、不给答案)后练习增益升至 127% 且独立考试无伤害。更关键的细节是分布性的:使用 AI 时学生成绩的离散度(HHI)确实被压缩了——甲方的压缩在当期、有人工辅助的条件下成立——但"压缩在拿走工具后不再持续"(no significant effect on HHI for the unassisted exam)。学生把工具当"拐杖",且对自己学没学会毫无感知。

把这条证据与 Catalini, Hui and Wu (2026) 的"Missing Junior Loop"(学徒制塌缩:初级岗位自动化后,未来的专家验证者失去训练场)并置,可以看到乙方立场的动态版本:短期的压缩可能是以长期的分化为代价购买的——今天的尾部借 AI 摸到了头部的水平,代价是明天的头部不再有人接替。但乙方也不应过度引申:Cruces et al. (2026) 在成人样本中发现了相反的动态证据(撤走 AI 无伤害、低教育组部分增益保留),而 Bastani 实验自身的对照组设计也表明伤害是工具设计的函数而非技术的宿命。压缩的可持续性取决于使用方式——拐杖式还是家教式——而使用方式是可以被制度设计的变量。

4.3 裁决

现在可以回答最初的争论了。

甲方对的地方:命题 A2(乘数对低基础者更大)在任务执行层有六场景一致的一手证据,强度(差距收窄 14%–75%)超出多数人的直觉;"摸鱼"机制有官方表述与部分旁证。

乙方对的地方:命题 B1/B2(边界与验证瓶颈)有一手理论与观测证据;任务层压缩不外推到收入分布——企业层的 75/20 集中(PwC, 2026)与判断溢价(Otis et al., forthcoming)都发生在任务层证据看不到的尺度上。

双方共享的错误是"均匀乘数"假设。更准确的表述或许是:AI 是一台把任务执行商品化、把判断与验证资产化的机器。它对"做事"的价格是通缩的(乘法,且偏向下层),对"决定做什么、信什么、担什么责"的价格是通胀的(集中,且偏向上层)。甲方的均衡是执行市场的均衡,乙方的截断是判断市场的入口——两个市场同时存在,收入分布由两者的合成决定,而合成系数恰恰是 Chen and Meng (2026) 说"尚未存在能检验它的数据"的那个未知数。


5 可检验预测:让争论走出比喻

这场争论的可贵之处在于它是可判决的。以下预测分别对应甲乙双方的要害主张,且现有数据基础设施(或其温和扩展)足以检验:

  1. 1. 工资离散度分岔。若甲方正确,采用 AI 的企业内部工资离散度应随采用深度收窄;若乙方正确,扩大的是"验证者—执行者"与"管理者—工人"的工资差。Farach (2026) 的模型明确预测后者在任何体制下都扩大。检验数据:企业内部工资面板——Chen and Meng (2026) 恰当地指出,"能在任务内、职业内层面检验预测的面板数据尚不存在"。
  2. 2. 验证工作份额。Catalini, Hui and Wu (2026) 预测验证在时间与租金中的份额上升。已有第一个观测点(审查时间 +91%,Faros AI,转引自 Zaalouk, 2026);后续可跟踪工作流遥测中"审查/生成"时间比的行业均值。
  3. 3. 进入与顶端的分离。Kim, Kang and Song (2026) 的"进入民主化、顶端照旧"若成立,则各类平台(应用商店、GitHub、众创平台)的进入者数量增长应系统性快于顶端份额集中度的下降。公开评论者已把同一现象表述为"赢家通吃市场的类固醇"与"把独立思考者与其余所有人分开"(Mahroum, 2026a; 2026b)——评论与数据在此罕见地指向同一方向。
  4. 4. 学徒管道。"Missing Junior Loop"(Catalini, Hui and Wu, 2026)与 Bastani et al. (2025) 的技能侵蚀共同预测:初级岗位入职率下降的行业,将在 5–10 年后出现专家供给缺口。这可用职业-年龄组入职数据与后续专家产出追踪。
  5. 5. AI 技能溢价的走向。溢价从 25%(PwC, 2024)到 56%(PwC, 2025)再到 62%(PwC, 2026)的轨迹,是市场给"AI 互补能力"定价的直接观测。溢价持续上涨支持乙方的集中叙事;溢价回落至普通技能水平则支持甲方的商品化/均衡叙事。这是最便宜、最不该被忽视的一个预测。
  6. 6. 任务边界的反转。Cruces et al. (2026) 明确警告:"本文记录的均衡化模式,在更依赖人际协调等当前 AI 难以复制技能的任务上可能减弱或反转。"若未来实验在高协调任务上得到放大而非压缩的结果,即为该预测的确认。

6 结论与局限

判词。"AI 是乘法不是加法"是真的,但乘数不是均匀的:在任务执行层,它系统性地偏向低基础者(六场景一致,差距收窄 14%–75%),甲方的均衡化在这一层有迄今最强的证据;在判断选择层与资产层,技术的租金系统性地流向验证带宽、判断力与互补资产的所有者(平均零效应下的 ±0.25 SD 分化、75/20 的企业层集中、62% 的技能溢价),乙方的集中叙事在这一层有迄今最强的证据。乙方的"24 小时硬截断"应改写为"小时数收敛、价值不收敛"的软尾部;甲方的"完全竞争均衡"应改写为"执行市场的均衡、判断市场的分层"。两个修正之后,双方不再矛盾——他们描述的是同一台机器的两个不同市场。

局限。(i) 外推边界:实验测得的分布效应不可直接外推,因为不平等效应随技术进步非单调(Benzell and Myers, 2026);本报告引用的一切"压缩"结论都限定于实验时的任务与模型代际。(ii) 样本与测量:METR 实验样本小且结论仍在修正(METR, 2026);自报时间节省存在 39 个百分点的感知偏差(Becker et al., 2025);"质量"评分部分依赖人工或 AI 评分。(iii) 快速移动的目标:Cui et al. (2025) 与 Daniotti et al. (2026) 在"谁受益"上的分歧提示,任何弹性估计的有效期都以月计。(iv) 语料偏差:本报告以中英文来源为主,未系统覆盖其他语言的文献与劳动市场证据。(v) 利益相关:部分行业数据(PwC、BCG 合作研究、Microsoft 资助实验)来自对 AI 扩散有商业利益的机构,方向上可能偏乐观;本报告在引用时保留了原始口径与置信区间,请读者据此折价。


附录 A:关键数据速查表

正文的每个数字对应如下("一手"指数字直接来自论文原文、官方摘要或机构报告原文;"转引"指经二手来源引用并已标注):

数据点
数值
来源
性质
客服 AI 助手平均生产率提升
+14%(偏好设定 13.8%)
Brynjolfsson et al. (2025)
一手
新手/低技能提升;司龄<1月提升
+34%;+46%
Brynjolfsson et al. (2025)
一手
写作任务耗时下降 / 质量提升
−40% / +18%
Noy and Zhang (2023)
一手
Copilot 编程实验提速
55.8%
Peng et al. (2023)
一手
BCG 顾问子任务 / 质量提升
+12.5% / +40%以上
Dell'Acqua et al. (2023)
一手
BCG 后半段 vs 前半段提升
+43% vs +17%
Dell'Acqua et al. (2023)
一手
三场开发者 RCT 合并任务提升
+26.08%(SE 10.3%)
Cui et al. (2025)
一手
出租车巡航时间下降;低技能提升;差距收窄
−5%;+7%;−14%
Kanazawa et al. (2025)
一手
教育差距(无 AI → 有 AI)
0.548 → 0.139 SD(−75%)
Cruces et al. (2026)
一手
低/高教育组增益
+1.242 / +0.834 SD
Cruces et al. (2026)
一手
撤走 AI 后低教育组保留增益
+0.171 SD
Cruces et al. (2026)
一手
肯尼亚创业者:低绩效 / 高绩效
−10% / +15%(差异≈0.25 SD)
Otis et al. (forthcoming)
一手
METR:资深开发者用 AI 耗时变化
+19%(CI +2% 至 +39%)
Becker et al. (2025)
一手
METR:感知 vs 实际
自认 −20% vs 实际 +19%
Becker et al. (2025)
一手
土耳其高中生:GPT Base 练习 / 撤走后考试
+48% / −17%
Bastani et al. (2025)
一手
GPT Tutor 练习 / 考试
+127% / 无伤害
Bastani et al. (2025)
一手
法学生无训练 LLM 访问
答案更短、误引更多、分数边际更低
Chen and Bao (2026)
一手
AI 生成代码占比:新手 vs 资深
37% vs 27%
Daniotti et al. (2026)
一手(经机构新闻稿)
16 万开发者生产率提升(至 2024 末)
+3.6%,增益全归资深者
Daniotti et al. (2026)
一手(经机构新闻稿)
美国 AI 总生产率增益推算
+1.1%(用户省 5.4% 工时)
Bick et al. (2025)
一手
美国 AI 使用者每小时产出提升
+33%
Bick et al. (2025)
一手
企业正式采用生成式 AI 比例(2024.2)
5.4%
Bonney et al. (2024)
转引
AI 十年累计 TFP 增益上限
≤0.71%(年均≈0.07%)
Acemoglu (2024)
一手
万人开发者:任务 / PR 合并 / 审查时间 / PR 体积 / bug 率
+21% / +98% / +91% / +154% / +9%
Faros AI,经 Zaalouk (2026)
转引
开发者 AI 使用率 / 信任率
84% / 33%
Stack Overflow (2025),经 Zaalouk (2026)
转引
AI 技能工资溢价轨迹(2024→2026)
25% → 56% → 62%
PwC (2024; 2025; 2026)
一手(机构报告)
超级明星企业生产率增益
+163%
PwC (2026)
一手(机构报告)
AI 经济收益的企业层集中
75% 收益归 20% 企业
PwC (2026)
一手(机构报告)
AI 暴露行业工资增速差(2025 报告)
16.7% vs 7.9%
PwC (2025)
一手(机构报告)
知识工作者倦怠(40 人 8 个月追踪)
62% 初级员工报告倦怠
HBR (2026),经 Zaalouk (2026)
转引

参考文献

学术文献

  • • Acemoglu, D. (2024) 'The Simple Macroeconomics of AI', Economic Policy, 40(121), pp. 13–58. 工作论文版:NBER Working Paper 32487. https://www.nber.org/papers/w32487 (PDF: https://economics.mit.edu/sites/default/files/2024-04/The%20Simple%20Macroeconomics%20of%20AI.pdf)
  • • Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö. and Mariman, R. (2025) 'Generative AI Without Guardrails Can Harm Learning: Evidence from High School Mathematics', Proceedings of the National Academy of Sciences, 122(26), e2422633122. https://doi.org/10.1073/pnas.2422633122
  • • Becker, J., Rush, N., Barnes, E. and Rein, D. (2025) Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. arXiv:2507.09089. https://arxiv.org/abs/2507.09089
  • • Benzell, S.G. and Myers, K.R. (2026) 'Automation Experiments and Inequality'. NBER Working Paper 34668;arXiv:2510.24923. https://arxiv.org/abs/2510.24923
  • • Bick, A., Blandin, A. and Deming, D. (2025) 'The Impact of Generative AI on Work Productivity', St. Louis Fed On the Economy, 2 月 27 日. https://www.stlouisfed.org/on-the-economy/2025/feb/impact-generative-ai-work-productivity (对应工作论文:Bick, A., Blandin, A. and Deming, D. 'The Rapid Adoption of Generative AI', Federal Reserve Bank of St. Louis Working Paper 2024-027C)
  • • Bonney, K. et al. (2024) 关于企业生成式 AI 正式采用率的工作论文, NBER Working Paper 32319. https://www.nber.org/papers/w32319 (标题以 NBER 页面为准;本文经 Bick, Blandin and Deming, 2025 转引)
  • • Brynjolfsson, E., Li, D. and Raymond, L. (2025) 'Generative AI at Work', The Quarterly Journal of Economics, 140(2), pp. 889–942. https://academic.oup.com/qje/article/140/2/889/7990658 (工作论文版 NBER w31161: https://www.nber.org/system/files/working_papers/w31161/w31161.pdf)
  • • Catalini, C., Hui, X. and Wu, J. (2026) Some Simple Economics of AGI. arXiv:2602.20946. https://arxiv.org/abs/2602.20946
  • • Chen, B.M. and Bao, H. (2026) Training for Technology: Adoption and Productive Use of Generative AI in Legal Analysis. arXiv:2603.04982. https://arxiv.org/abs/2603.04982
  • • Chen, X. and Meng, S. (2026) When AI Levels the Playing Field: Skill Homogenization, Asset Concentration, and Two Regimes of Inequality. arXiv:2603.05565. https://arxiv.org/abs/2603.05565
  • • Cruces, G., Fernández Meijide, D., Galiani, S., Gálvez, R.H. and Lombardi, M. (2026) Does Generative AI Narrow Education-Based Productivity Gaps? Evidence from a Randomized Experiment. NBER Working Paper 34851. https://www.nber.org/papers/w34851
  • • Cui, Z., Demirer, M., Jaffe, S., Musolff, L., Peng, S. and Salz, T. (2025) The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers. SSRN Working Paper 4945566. https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4945566 (据 Cruces et al., 2026,将刊于 Management Science
  • • Daniotti, S., Wachs, J., Feng, X. and Neffke, F. (2026) 'Who is using AI to code? Global diffusion and impact of generative AI', Science. https://doi.org/10.1126/science.adz9311 (机构新闻稿:https://csh.ac.at/news/ai-is-already-writing-almost-one-third-of-new-software-code/)
  • • Dell'Acqua, F., McFowland III, E., Mollick, E. et al. (2023) Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of AI on Knowledge Worker Productivity and Quality. SSRN Working Paper 4573321. https://mitsloan.mit.edu/sites/default/files/2023-10/SSRN-id4573321.pdf ;发表版(2025):Organization Science. https://pubsonline.informs.org/doi/10.1287/orsc.2025.21838
  • • Farach, A. (2026) AI as Coordination-Compressing Capital: Task Reallocation, Organizational Redesign, and the Regime Fork. arXiv:2602.16078. https://arxiv.org/abs/2602.16078
  • • Kanazawa, K., Kawaguchi, D., Shigeoka, H. and Watanabe, Y. (2025) 'AI, Skill, and Productivity: The Case of Taxi Drivers', Management Science. https://doi.org/10.1287/mnsc.2023.01631 (工作论文版 NBER w30612: https://www.nber.org/system/files/working_papers/w30612/w30612.pdf)
  • • Kim, H., Kang, H. and Song, J. (2026) Generative AI Fuels Solo Entrepreneurship, but Teams Still Lead at the Top. arXiv:2605.10291. https://arxiv.org/abs/2605.10291
  • • METR (2026) 'We are Changing our Developer Productivity Experiment Design', METR Blog, 2 月 24 日. https://metr.org/blog/2026-02-24-uplift-update/
  • • Noy, S. and Zhang, W. (2023) 'Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence', Science, 381(6654), pp. 187–192. https://doi.org/10.1126/science.adh2586
  • • Otis, N., Clarke, R., Delecourt, S., Holtz, D. and Koning, R. (forthcoming) 'The Uneven Impact of Generative AI on Entrepreneurial Performance', Management Science. 预印本:OSF. https://osf.io/hdjpk (DOI: 10.31219/osf.io/hdjpk_v3)
  • • Peng, S., Kalliamvakou, E., Cihon, P. and Demirer, M. (2023) The Impact of AI on Developer Productivity: Evidence from GitHub Copilot. arXiv:2302.06590. https://arxiv.org/abs/2302.06590
  • • Roldan, A. (2024) When GenAI Increases Inequality: Evidence from a University Debating Competition. POID Working Paper 096, Centre for Economic Performance, London School of Economics. (转引自 Cruces et al., 2026)
  • • Rosen, S. (1981) 'The Economics of Superstars', The American Economic Review, 71(5), pp. 845–858. https://www.jstor.org/stable/1803469

评论与行业报告

  • • Harvard Business Review (2026) 'AI Doesn't Reduce Work—It Intensifies It', 2 月. https://hbr.org/2026/02/ai-doesnt-reduce-work-it-intensifies-it (UC Berkeley 合作追踪研究;转引自 Zaalouk, 2026)
  • • Mahroum, S. (2026a) 'AI and the End of Time', Project Syndicate, 2 月. https://www.project-syndicate.org/onpoint/how-ai-is-splintering-labor-by-sami-mahroum-2026-02
  • • Mahroum, S. (2026b) 'Cognition for Sale', Project Syndicate, 6 月. https://www.project-syndicate.org/onpoint/what-ai-cannot-replace-by-sami-mahroum-2026-06
  • • PwC (2024) PwC's 2024 Global AI Jobs Barometer(新闻稿). https://www.pwc.com/gx/en/news-room/press-releases/2024/pwc-2024-global-ai-jobs-barometer.html
  • • PwC (2025) The Fearless Future: PwC's 2025 Global AI Jobs Barometer. https://www.pwc.com/gx/en/issues/artificial-intelligence/job-barometer/2025/report.pdf
  • • PwC (2026) 'AI reshapes global labour market into two distinct paths, rewarding human skills: PwC 2026 Global AI Jobs Barometer'(新闻稿). https://www.pwc.com/gx/en/news-room/press-releases/2026/pwc-2026-ai-jobs-barometer.html ;PwC AI Performance Study(新闻稿,"四分之三收益归 20% 企业"). https://www.pwc.com/gx/en/news-room/press-releases/2026/pwc-2026-ai-performance-study.html
  • • Stack Overflow (2025) 2025 Developer Survey: AI. https://survey.stackoverflow.co/2025/ai/ (转引自 Zaalouk, 2026)
  • • Zaalouk, A. (2026) 'The Verification Bottleneck: Why AI's Real Cost Is Human Attention', The Technomist, 2 月 26 日. https://thetechnomist.com/p/the-verification-bottleneck-why-ais (Faros AI 万名开发者研究转引出处:https://www.faros.ai/blog/ai-software-engineering)

中文话语样本(§1.1 比喻流行度证据)

  • • adnanmasood (n.d.) 'Operating at the Jagged Frontier: Turning Generative AI into a Force Multiplier', Medium. https://medium.com/@adnanmasood/operating-at-the-jagged-frontier-turning-generative-ai-into-a-force-multiplier-ee29542ddde8 (访问日期 2026-09-21)
  • • xleioo (n.d.) 'Stop Trying to "Replace" Experts with AI', Medium. https://medium.com/@xleioo/stop-trying-to-replace-experts-with-ai-why-the-agent-mindset-is-killing-real-productivity-22634326778b (访问日期 2026-09-21)
  • • 知乎 (n.d.) 《AI 在做乘法,而你还在做加法》,知乎专栏. https://zhuanlan.zhihu.com/p/2042352371133592096 (访问日期 2026-09-21)
  • • 腾讯云 (n.d.) 《为什么说AI不是加法而是乘法?》,腾讯云开发者社区. https://cloud.tencent.com/developer/article/2657626 (访问日期 2026-09-21)
  • • 雪球 (n.d.) 《AI是杠杆:放大认知,也放大幻觉》. https://xueqiu.com/9752824777/408368625 (访问日期 2026-09-21)
  • • 黃同慶 (n.d.) 《AI是加法還是乘法?》,方格子 vocus. https://vocus.cc/article/6a280594fd897800019ce9c9 (访问日期 2026-09-21)

报告完。检索与写作:2026 年 9 月 21 日。所有网络来源访问日期均为 2026-09-21;论文索引(arXiv)元数据核对同日完成。

相关学习资料