乐于分享
好东西不私藏

深度剖析|AI 时代经济学研究:证据、悖论与护城河

深度剖析|AI 时代经济学研究:证据、悖论与护城河

AI-最优解

当论文可能被批量生产
经济学家还能做什么?

凌晨三点,某位经济学博士生小最仍杵在电脑前。屏幕上是一份两百万行的面板数据,她正在手动核对第 37 个变量的编码规则。

而下午三点,隔壁的小优打开终端,输入了一段自然语言指令。三分钟后,Agent 在沙箱里跑完了同样的清洗流程,附带输出了一份描述性统计的 LaTeX 表格。早早做完所有任务的她,半夜三点正在梦会周公。

但小优的电脑屏幕仍然亮着,Agent正不知疲倦夜以继日地工作着。

你的三点,我的三点,好像不一样。

2026 了,

你还停留在科研刀耕火种的时代吗?

但故事还有另一面。
2025 年,METR(Model Evaluation and Threat Research)一项随机对照实验给出了让 AI 乐观派如坐针毡的数据:16 位经验丰富的开源开发者,在熟悉的代码库里使用 Cursor + Claude 完成任务时,平均耗时多了 19%,尽管他们自己相信 AI 让他们快了 20%(Becker et al., 2025)。直觉和实证,在同一个 Agent 上分道扬镳。

这就是 2026 年的经济研究者必须同时凝视的两种幻觉:一种是"AI 还只是润色工具"的滞后幻觉,一种是"Agent 无所不能"的光环幻觉。Anton Korinek 在《AI Agents for Economic Research》(2025, NBER)中提到:AI 正在从"快思考的文本生成器"进化为"能自主执行的科研代理"。这是现实的一角,但还远远不是全部。

本篇文章将尝试梳理这一飞速发展的动态变换图景。
1. 三次跃迁:从补丁到大脑,再从大脑到手脚

Korinek (2023, JEL) 最早在《Generative AI for Economic Research》中系统列出了生成式 AI 在经济学研究中的 25 种用例;两年后,他又在《AI Agents for Economic Research》里把 AI 的演进切成了三个阶段。
阶段一:文本辅助。"帮我把这段 Abstract 润色一下。"我们省了半小时,但研究本身没变。Noy & Zhang (2023, Science) 的随机对照实验发现,453 位职业白领在写作类任务上使用 ChatGPT 后,完成时间缩短 37%,质量评分同时上升;且能力较弱者获益更大,文本生产力的"基尼系数"因此被压缩。
阶段二:推理增强。"帮我推导一下这个均衡条件。"思维链(Chain-of-Thought)让 o1、Gemini DeepThink、Claude Sonnet 4.6 这一类模型能逐步处理复杂数学、博弈论推导、乃至长证明。Korinek (2023) 用一整张附录表记录 GPT-4 在经济学 PhD 资格考题上的表现:已能稳定解出宏观、微观核心题目的大半。
阶段三:自主代理。"用 CFPS 数据,跑一个双重差分,控制县级固定效应,把结果输出成三线表。"它不再是在告诉我们怎么做,而是在沙箱里把活干完。Claude Code、Codex、Devin、Cursor Agent Mode 背后的关键技术,是 LLM 加工具调用、加持久状态、加长时程规划的组合。

从"大脑"到"大脑 + 手脚",才是这一轮真正的跨越。

2.Vibe Coding 的证据:

生产力、质量与异质性


"Vibe Coding"一词由 OpenAI 联合创始人 Andrej Karpathy 于 2025 年初普及:你不再写代码,你用自然语言描述研究意图,Agent 替你搞定一切。

它究竟有多真实?四组证据给出了迄今最接近实证的答案。
第一组(Peng et al., 2023)。GitHub 与 MIT 的联合随机实验显示,使用 Copilot 的开发者在标准化任务上完成速度提升 55.8%。
第二组(Cui, Demirer, Jaffe, Musolff, Peng & Salz, 2024)。在三家大型企业的大规模自然实验中,Copilot 让每位开发者每月完成的任务数增加 26.08%,代码提交量显著上升,且对资历较浅的开发者提升更大。
第三组(Brynjolfsson, Li & Raymond, 2025)。5179 位客服坐席接入生成式 AI 辅助后,整体生产率提升 14%,但关键是结构性的:新手和表现差的员工提升 34%,而最资深的员工几乎没有获益。AI 似乎把高手的"默会知识"编码并传给了新手。
第四组(Dell'Acqua et al., 2023)。BCG 全球 758 位顾问的随机实验。当任务落在 AI 能力的"锯齿形前沿"内侧时,GPT-4 让他们多完成 12.2% 的任务、速度快 25.1%、质量高出约 40%。但当任务落在前沿外侧(需要复杂判断、数据权衡的商业问题),使用 AI 的顾问得出正确答案的概率反而下降了 19 个百分点。

换言之,Vibe Coding 抹平了技术层面的编程异质性,却把新的异质性推向了更高的一层:你是否知道 Agent 何时会失败。

3. 锯齿形前沿:AI 在何处突然降智

://bexp.135editor.com/files/users/1679/16799051/202604/v8QRZFpr_dncX.png?auth_key=1776614399-0-0-281b9616e6d4a459954b82770b070163&https://bexp.135editor.com/files/users/1679/16799051/202604/v8QRZFpr_dncX.png?auth_key=1776614399-0-0-281b9616e6d4a459954b82770b070163&

Dell'Acqua 团队把 AI 当下的能力边界称作"锯齿形前沿"(jagged technological frontier):并非一条光滑的能力曲线,而是锯齿状的。两个看起来难度相近的任务,AI 可能一个完美解决,另一个系统性失败。
这件事与 Agrawal, Gans & Goldfarb(《Power and Prediction》, 2022, HBS Press)的观察相呼应:AI 的本质是"预测成本下降",但真正的经济影响要看它与判断力(judgment)、行动(action)之间的互补关系。预测便宜了,判断反而更贵。
对经济研究者的操作含义有三条。
第一,不要把 Agent 当万能 RA。Otis, Clarke, Delecourt, Holtz & Koning (2024) 在肯尼亚对 640 位企业家的田野实验发现,GPT-4 给出的商业建议让原本表现最好的企业家月利润上升 15%,却让表现最差的企业家下降 8%。这与 Noy–Zhang 的"缩小差距"结论完全相反。能力的压缩还是扩大,取决于使用者能否识别 AI 的错误。
第二,METR (2025) 的 19% 减速警告。当代码库复杂、隐性约束多时,让 Agent 动手反而拖慢真正的专家。
第三,经济学直觉(domain intuition)变成了"守门员"技能。我们不是在审代码,我们是在审 Agent 对"因果"、"外生性"、"SUTVA"这些根深蒂固的概念的隐性假设。
4. 文献综述的升维:从关键词到多智能体并行
三年前,文献综述的瓶颈是读论文的速度。今天,瓶颈是审阅 Agent 读论文的结果。
Korinek 在《AI Agents for Economic Research》中描述的 Orchestrator 架构,已经在开源框架中普及:LangGraph、CrewAI、AutoGen、Anthropic Claude Agent SDK 都支持"编排器 + 多个专职 Agent"的工作模式。典型流程是这样的:
一个编排器把你的研究问题拆解,派出三个专职 Agent。一个抽取各篇论文的识别策略(DID/IV/RDD/事件研究),一个汇总主要系数和稳健性设定,一个梳理制度背景与变量定义。它们并行工作,最后由编排器合成一份文献矩阵。
就速度而言,3 个 Agent 并行阅读过去 5 年某一领域约 200 篇论文,大约 2 小时能生成一份按识别策略分类的结构化矩阵。而同样的工作,一位人类 RA 往往需要两到三周。
更深一层的用法来自 Ludwig & Mullainathan (2024, QJE):他们把机器学习视作"假说生成器"而非"假说检验器"。经典思路是研究者想出假说、用数据检验;新思路是让算法在数据中扫出人类看不见的规律,再倒逼理论解释。他们用面部识别模型在法官庭审图像中发现了与保释决定相关的潜在特征,而这些特征此前完全不在经济学关注的特征清单里。Mullainathan & Rambachan (2024) 把这类方法进一步推向"算法自动生成经济学异象":数据与理论之间的主从关系,正在被 Agent 改写。
当然,AI 目前在"识别研究前沿的细微缝隙"上仍然笨拙,Korinek 本人也承认这一点。但在"不遗漏、不偏废、结构化整理"这件事上,它已经比人类可靠得多。
5. LLM 本身正成为经济学的研究对象

一个常被忽略的维度:Agent 不仅是研究工具,它正在成为研究对象。
Horton (2023, NBER) 提出"homo silicus"。LLM 可被视为一类模拟经济主体,研究者可以把经典实验(独裁者博弈、时间偏好、损失厌恶)"重跑"在模型之上,观察它与人类主体的系统性偏差。
Manning, Zhu & Horton (2024, NBER) 的"自动化社会科学"。用 LLM 不仅模拟主体行为,还让其自主设计实验、生成假说、执行数据收集,整个研究循环开始闭合。
Mei, Xie, Yuan & Jackson (2024, PNAS)。对六种主流 LLM 做行为图灵测试,发现它们在独裁者与公共品博弈中比人类更慷慨、更合作。这种系统性偏离本身就是值得研究的新现象。
Anthropic Economic Index(Handa et al., 2025)。对 400 万条真实 Claude 对话做了去标识化分类,发现约 37% 是增强型(augmentation)使用,约 57% 是替代型(automation)使用;占比最高的任务类别是软件工程、写作、教学辅助。这为"AI 暴露度"研究提供了前所未有的被动观测数据,远比 Eloundou et al. (2024, Science)《GPTs are GPTs》基于 O·NET 任务描述的预测性暴露度度量更贴近真实。
Agent 既是望远镜,也是我们要观测的星体。
6. 回到标题的那个问题:杰文斯悖论的三重嵌套

1865 年,William Stanley Jevons 发现蒸汽机效率的提升并没有减少煤炭消耗,反因用途扩大而倍增。Korinek 把这一逻辑移植到学术界。但把前面五节的证据拼起来看,我想主张一个更强的版本:学术界的杰文斯悖论是三重嵌套的。
第一重:稳健性检验的通货膨胀。以前一篇顶刊需要 2 个稳健性检验,现在 Agent 几分钟就能跑完 100 组参数设定。审稿人知道你能做到,于是心理阈值被无限抬升。"你为什么不多跑几组?"会成为 Referee Report 的标准句式。
第二重:论文数量的爆发与注意力的稀缺。Acemoglu (2024, NBER)《The Simple Macroeconomics of AI》测算 AI 在未来 10 年只能贡献约 0.53% 的累积全要素生产率增长,一个相当保守的数字。但在知识生产领域,供给曲线会比需求曲线右移得更快。Bick, Blandin & Deming (2024) 的调查显示,截至 2024 年 8 月,39.4% 的美国成年人已在使用生成式 AI,工作场所中的每周使用率接近 28%。并且,这一比例正在飞速增长,论文供给量上升得比论文被读到的概率快得多。
第三重:技能压缩与技能分化的矛盾共存。把 Noy–Zhang(缩小)、Brynjolfsson–Li–Raymond(缩小)与 Otis 等(扩大)、Dell'Acqua(内侧缩小、外侧扩大)拼在一起看,我们得到一个更精确的判断:AI 缩小了"执行层"的能力差,却放大了"判断层"的能力差。谁来定义问题、谁能识别 Agent 的错误、谁能把多个 Agent 编排进一个可复现的研究流水线,这些能力的回报正在急速上升。
门槛会被拉高,价值会被重估。当"执行"变得廉价,真正稀缺的东西浮出水面:
识别新颖问题的直觉、对复杂制度的深度理解、以及联结无关现象的想象力。
这是经济学家最后、也是最可靠的溢价来源。
7. 结语:做建筑师,不做搬砖工

回到 Korinek 的建议:尽早上手。不是等 AI 变得"够好"再用,而是现在就去理解它的能力边界。亲自用 Claude Agent SDK、LangGraph、CrewAI 搭建自己的科研工作流;亲自跑一遍 Ludwig–Mullainathan 式的假说生成;亲自复现一次 Horton 的 homo silicus 实验。

因为只有建造者才能理解工具的真实边界,而不是旁观者

在算力平权的时代,研究将回归其本质:

它不再是一场关于谁更会调代码的测试,而是一场关于谁更理解世界运行逻辑与本质的探险。

下一期,我们手把手拆解:如何用 Claude Agent SDK + Sandbox 在本地跑通一条完整的实证流水线,从 Zotero 的文献知识库,到原始微观数据清洗,到双重差分回归,再到自动出表出图,全程自然语言驱动。

关注「AI最优解」,前沿精彩不错过。

END
扫码关注
AI 最优解

从研究前沿到经济现实,

寻找理解变化的更优路径。 

AI与技术变迁中的观察笔记。

参考文献
  • Acemoglu, Daron. (2024). "The Simple Macroeconomics of AI." NBER Working Paper 32487.

  • Agrawal, A., Gans, J., & Goldfarb, A. (2022). Power and Prediction. HBS Press.

  • Bick, A., Blandin, A., & Deming, D. J. (2024). "The Rapid Adoption of Generative AI." NBER Working Paper 32966.

  • Becker, B., et al. (2025). "Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity." METR Technical Report.

  • Brynjolfsson, E., Li, D., & Raymond, L. (2025). "Generative AI at Work." Quarterly Journal of Economics.

  • Cui, Z., Demirer, M., Jaffe, S., Musolff, L., Peng, S., & Salz, T. (2024). "The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers." NBER Working Paper 32944.

  • Dell'Acqua, F., et al. (2023). "Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of AI on Knowledge Worker Productivity and Quality." HBS Working Paper 24-013.

  • Eloundou, T., Manning, S., Mishkin, P., & Rock, D. (2024). "GPTs are GPTs: Labor Market Impact Potential of LLMs." Science, 384, 1306–1308.

  • Handa, K., et al. (2025). "Which Economic Tasks are Performed with AI? Evidence from Millions of Claude Conversations." Anthropic Economic Index.

  • Horton, J. J. (2023). "Large Language Models as Simulated Economic Agents." NBER Working Paper 31122.

  • Korinek, A. (2023). "Generative AI for Economic Research: Use Cases and Implications for Economists." Journal of Economic Literature, 61(4), 1281–1317.

  • Korinek, A. (2025). "AI Agents for Economic Research." NBER Working Paper 34202.

  • Ludwig, J., & Mullainathan, S. (2024). "Machine Learning as a Tool for Hypothesis Generation." Quarterly Journal of Economics.

  • Manning, B., Zhu, K., & Horton, J. J. (2024). "Automated Social Science: Language Models as Scientists and Subjects." NBER Working Paper 32381.

  • Mei, Q., Xie, Y., Yuan, W., & Jackson, M. O. (2024). "A Turing Test of Whether AI Chatbots are Behaviorally Similar to Humans." PNAS, 121(9).

  • Mullainathan, S., & Rambachan, A. (2024). "From Predictive Algorithms to Automatic Generation of Anomalies." Working paper.

  • Noy, S., & Zhang, W. (2023). "Experimental Evidence on the Productivity Effects of Generative Artificial Intelligence." Science, 381, 187–192.

  • Otis, N., Clarke, R., Delecourt, S., Holtz, D., & Koning, R. (2024). "The Uneven Impact of Generative AI on Entrepreneurial Performance." Working paper.

  • Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). "The Impact of AI on Developer Productivity: Evidence from GitHub Copilot." arXiv:2302.06590.