夜雨聆风学习资料网

ARTICLE · 1038567

AI能把科研自动化到什么程度?| NBER最新论文3篇

AI能把科研自动化到什么程度?| NBER最新论文3篇

AI能把科研自动化到什么程度?

AI已经不只是在帮研究者检索文献、润色论文。它开始自主寻找资料并构建数据集,运行和修改计量代码,甚至进入同行评审流程。但能力边界不断扩大的同时,新的问题也随之出现:AI生成的数据是否可靠?能够运行的代码是否真的实现了正确的研究设定?更准确的AI审稿,为什么反而可能让编辑获得更少的信息?

这三篇2026年发布的NBER工作论文,分别考察AI介入科研的数据生产、实证分析与同行评审三个环节,共同指向一个问题:当AI从辅助工具逐渐变成科研流程的参与者,我们应当如何设计验证机制与人机分工,才能在提高效率的同时,不牺牲研究的可靠性与信息质量?

NBER:提示词写得更复杂,还是让AI自己运行代码?

让AI生成一段计量代码之后,真正决定结果的,是研究者会不会写提示词,还是模型能不能自己运行并修改代码?

NBER工作论文《AI Agents and Prompt Engineering in Econometric Coding》以21类应用计量与统计任务为对象,比较Stata、R和Python中的不同提示方式与自主程度。结果显示,让模型从一次性生成代码升级为可以执行、检查并反复修改代码的受限智能体,任务成功率从74.4%提高到95.7%。

原因并不神秘:聊天机器人只能根据文字要求写出脚本,却看不到程序是否成功运行;智能体则能读取报错和输出,发现缺少结果文件、代码无法执行等问题后自行修正。与此同时,示例提示对一次性聊天机器人的帮助更大,对能够不断试错的智能体帮助较小,说明详细提示与执行反馈在一定程度上可以相互替代。

研究者之所以设置明确的计量任务,而不是让AI完成开放式研究,是为了获得可客观核验的答案。每项任务都规定数据、估计方法、目标结果和允许误差,再系统改变统计软件、是否提供示例以及模型拥有的执行权限,由统一程序判断代码能否运行并产生正确输出。

在1,890次Claude Sonnet 4.6测试中,一次修复机会将成功率提高到83.2%,受限智能体进一步提高到95.7%,相当于消除了约六分之五的原有失败。平均单次成本则由0.18美元增加到0.26美元。一次性生成时,Stata明显落后于Python;允许智能体执行和修改代码后,不同软件之间的差距大幅缩小。

这项研究把“AI是否会写代码”推进为一个更具体的问题:模型能够获得什么反馈、可以采取哪些行动。其结论仅适用于已经明确数据、方法和目标结果的任务,并不意味着AI能够选择正确的识别策略或研究设计。当智能体可以稳定实现既定计量方案后,如何检验那些能够正常运行、却实现了错误研究设定的代码?

论文原文:Galiani, S., López, F. A., & Sosa, R. A. (2026). AI Agents and Prompt Engineering in Econometric Coding. NBER Working Paper No. 35588.

NBER:AI能否从零开始建造一套经济学数据?

AI已经能够给现成文本打标签,但它能否自己寻找资料、判断证据并逐项建立一套可供经济学研究使用的数据?

NBER工作论文《Deep Research on a Loop: Using AI Agents to Construct Economic Datasets》提出DRIL方法,并将其用于更新8个拉丁美洲和加勒比国家的全球税收支出数据库。一次运行找到129份来源,生成136条证据记录,完整覆盖22个定性字段,并为6类定量指标记录数值或缺失原因,按API价格折算约花费21美元。

DRIL的关键不是让智能体“自由研究”,而是先冻结研究规则。设计阶段明确变量定义、编码规则、来源等级和证据要求;执行阶段再把同一套研究工具循环应用于每个国家。每一个编码值必须附带原文引句、具体位置和来源链接,找不到资料时也必须记录缺口,因而把模型可能隐藏的判断转化为可审查的证据链。

作者选择真实的数据库更新任务,是为了检验智能体能否处理跨国家、跨来源和多种文档格式的资料,而不仅是完成预先整理好的基准题。设计与执行被刻意分开,也防止智能体在看到部分结果后随意改变变量含义,使不同国家的数据保持可比。

运行结果同时暴露了这套方法的限制:48个定量数据格中有32个没有填入数值,主要原因并非智能体没有找到任何材料,而是研究设计要求一个国家的全部定量指标来自同一年、同一权威报告。更重要的是,论文尚未执行独立验证环节,因此这些记录只能被视为具有审计轨迹的智能体产出,不能直接等同于经过确认的正式数据库。

论文的贡献,是把AI构建数据集从零散的信息检索任务,转化为由研究工具、单位空间、证据政策和质量控制共同组成的方法体系。它也重新安排了人的工作:研究者减少重复搜集,把更多精力投入变量设计和证据审核。当数据收集成本不再构成主要约束,研究者应依据什么标准决定哪些数据库值得被建立?

论文原文:Afonso, S., Galiani, S., Gálvez, R. H., & Sosa, R. A. (2026). Deep Research on a Loop: Using AI Agents to Construct Economic Datasets. NBER Working Paper No. 35188.

NBER:AI提高了每份审稿意见,却可能让编辑知道得更少

如果AI能帮助每位审稿人发现更多问题,把同一份AI报告交给所有审稿人,是否一定能提高同行评审质量?

NBER工作论文《Designing AI-Augmented Peer Review》给出了否定答案。理论分析表明,即使AI报告改善了每位审稿人的判断,同时向所有审稿人公开报告,仍可能减少编辑最终获得的信息;在一些条件下,只向一名审稿人提供AI报告,比全部提供或完全不提供更有效。

关键在于,期刊需要的不是几份分别更准确的结论,而是一组能够相互补充的证据。两名审稿人看到同一报告后,可能重复检查同一个问题、共同忽略另一项缺陷,或者受到相同机器错误影响。编辑可以识别报告里已经写出的内容,却无法恢复一项从未有人进行的独立调查。

为识别这一机制,论文建立了一个信息经济学模型:编辑能够看到期刊提供的AI报告,两名审稿人则自行决定投入多少精力、检查哪些问题以及是否调用私人AI工具。模型比较三种制度——报告仅供编辑查看、只交给一名审稿人、交给两名审稿人——因为这些制度改变的不只是信息数量,也改变了审稿人的行动。

模型给出的条件链条是:如果接触报告削弱了人类独立证据,编辑应保留报告;如果报告改善审稿质量,但使两人的剩余错误更加相关,选择性地交给一人更好;只有第二名审稿人获得报告带来的增益超过新增的共同误差时,全面共享才占优。不过,当审稿人私下使用误差高度相关的AI工具时,官方报告也可能替代这些不可见工具,从而提高整体信息质量。

这篇论文把AI审稿讨论从“机器评价准不准确”推进到“整个审稿团队产生了什么信息”。它据此提出,可以随机分配审稿人的报告访问权,在保持编辑所见报告和评价规则不变的情况下,比较审稿分歧、任务覆盖和独立核验结果。如果审稿人提前知道AI最终会检查哪些问题,即使报告直到审稿结束后才公布,他们的调查方向是否也会随之改变?

论文原文:Gans, J. S. (2026). Designing AI-Augmented Peer Review. NBER Working Paper No. 35688.

推荐试用

唧唧堂顶刊论文结构数据库

系统检索论文,并获取结构化研究信息

心理学顶刊论文结构数据库

经济学顶刊论文结构数据库

金融学顶刊论文结构数据库

会计学顶刊论文结构数据库

管理学顶刊论文结构数据库

战略管理顶刊论文结构数据库

组织行为顶刊论文结构数据库

市场营销顶刊论文结构数据库

运营信管顶刊论文结构数据库

管理综合顶刊论文结构数据库

以上数据库,安卓手机用户可通过下方小程序链接订阅,苹果手机用户请通过文末“阅读原文”链接访问唧唧堂学院H5页面订阅。

咨询+开票+团购

相关学习资料