夜雨聆风学习资料网

ARTICLE · 1104531

AI 时代的可信测量:从生成变量到有效推断

AI 时代的可信测量:从生成变量到有效推断

论文解读:Melissa Dell 与 Ashesh Rambachan,The Measurement Revolution? Credible Measurement and Inference in the Age of AI

论文首页:标题、作者与摘要

当 AI 能把海量文本、图片和音频迅速变成变量,研究的瓶颈就从“没有数据”变成了“凭什么相信这个测量”。

过去,实证研究常常卡在一个朴素的问题上:想研究的东西,没有可用的变量。

一份历史报纸有多“悲观”?一张卫星图像反映了多少贫困或污染?一段政策文本表达了多强的不确定性?材料并不少,但它们以文本、图片、音频和视频等非结构化形式存在,很难低成本地转成可分析的数据。

大模型和计算机视觉改变了这件事。研究者只需设计提示词或分类规则,就能为成千上万篇文档打标签,把海量图像压缩成连续指标。

但 Melissa Dell 与 Ashesh Rambachan 在 2026 年的综述论文《The Measurement Revolution?》中提醒:

AI 降低的是规模化测量的成本,却把可信度问题推到了研究流程的更前端。

当同一个概念可以由不同模型、提示词、训练数据和聚合方式生成许多“看起来合理”的变量,真正的问题就变成了:为什么选择这个指标?它究竟测到了什么?换一个模型或提示词,结论会不会改变?

这篇论文试图回答的正是:AI 生成的变量,怎样才能进入可信的实证推断?

01AI 让测量从稀缺走向过剩

测量不是从现实中直接抄下一个客观数字。经济与社会世界复杂而高维,研究者必须选择保留哪些信息,再把现实压缩成一个可解释、可分析的变量。

过去,建立一套能够大规模执行的测量规则很昂贵。研究者常常只能接受现成的代理变量,即使它与真正关心的理论概念并不完全一致。

AI 改变了成本结构。它可以低成本编码问卷、新闻和历史档案,也能从卫星影像中提取贫困、植被或污染等指标。研究者还可以近乎零成本地更换模型、提示词、示例和标签体系。

候选测量因此从稀缺变成过剩。

风险也随之变化。过去,研究者可能通过不断更换控制变量和样本来挑选有利结果;现在,还可以先尝试许多变量生成方法,再选择结果最“漂亮”的一种。

论文把这类风险类比为测量选择式 p-hacking:不必改回归,只需换一种提示词或模型,估计的幅度、显著性甚至符号都可能改变。

所以,AI 时代最重要的问题不只是模型准不准,而是研究者如何约束测量选择,并说明这个变量为什么值得相信。

02一项 AI 测量要过三道关

论文把测量拆成三个阶段:发现、构念定义和观测。

论文 Figure 1:测量流水线

三个阶段面对不同的不确定性,不能只靠一个 accuracy 指标统一验证。

2.1发现与定义

发现要回答的是:究竟值得测什么?

AI 能从文本、图像和其他高维材料中发现研究者没有事先命名的模式,帮助生成新的研究假设。但这些模式必须在留出样本中重新检验。发现出来的结构只是候选概念,不能直接当成成熟变量。

构念定义要回答的是:这个概念到底指什么?

信任、制度质量、政策不确定性等概念无法直接观察。研究者必须先写清楚什么算、什么不算,它应与哪些变量相关,又必须与哪些相邻概念区分。

AI 可以快速生成许多貌似合理的定义,却不能替研究者决定哪一种定义真正回答了研究问题。一个模型也可能非常稳定地执行一套错误定义,因此“输出稳定”不等于“测量正确”。

2.2观测与验证

定义明确后,AI 才真正成为一种可扩展的测量工具:把同一套规则应用到大量文本或图像上,生成进入分析的变量。

这时需要区分两个问题:

  • 构念效度:尺子的刻度代表的是不是我们真正想研究的东西;
  • 观测效度:这把尺子在重复使用时,是否忠实执行既定标准。

验证的目的不是证明某个指标代表“终极真理”,也不是认定人类标签天然正确,而是把模型输出锚定到一套明确、可审计、可重复的标准。

多个模型给出相似答案,也不能替代验证。前沿模型可能共享架构、训练语料和对齐方式,因此可能在同一批样本上犯同一种错误。模型一致既可能因为它们都测对了,也可能因为它们具有相关偏误。

03可信推断的关键是验证样本

论文在统计方法上最有启发的一步,是把 AI 变量重新理解为一个缺失数据问题。

假设研究者拥有全体样本的原始文本或图像,但真正想使用的结构化变量,只在一小部分样本中经过高质量人工或仪器测量。AI 对其余样本的预测,本质上是一种插补。

关键是:插补值不能直接当成真实值。

更稳妥的做法是:先用全体样本的 AI 预测获得规模和效率,再用随机验证样本中“高质量标签与 AI 预测的差异”修正系统偏误。

只要验证设计满足相应条件,AI 预测可以存在偏差,校正后的估计仍然能够有效。但必须同时满足三项要求:

  • 验证标签来自研究者愿意捍卫的测量规则;
  • 验证样本能够代表目标总体,或在控制抽样变量后具有可比性;
  • 各类观察都有机会进入验证样本,不能把某些类型永久排除。

论文因此并不是说“模型准确度不重要”。更准确的表述是:

在验证和纠偏设计正确时,准确度主要决定估计有多精确,而不是估计是否有效。

模型越准,验证误差的波动越小,置信区间通常越窄。模型很差时,AI 带来的效率增益会缩小,研究最终仍主要依赖高质量验证数据。

这也说明,accuracy、F1 和 AUC 只是预测指标,不能直接回答下游回归系数是否可信。

3.1三种验证条件,三种结论强度

AI 时代可信测量路线图

AI 扩大测量规模,结论的可信度则取决于定义、验证制度与推断方法。图由 MindAI 根据论文框架生成。

有代表性验证样本是最理想的情形。研究者可以直接从当前分析总体中学习模型如何出错,再把误差校正到最终估计中。这条路径最少依赖对黑箱模型内部机制的猜测。

只有外部验证样本时,例如标签来自另一个地区、时期或人群,就必须额外说明什么关系能够跨样本保持稳定:是真实标签与预测之间的关系稳定,还是模型错误率稳定?地区差异、传感器变化和模型升级都可能破坏这些假设。

完全没有验证数据时,只能依赖更强的识别假设、部分识别或敏感性分析。多个模型并不天然等于多份独立信息,因为它们的错误可能高度相关。此时,AI 测量更适合探索和生成假设,不应包装成与随机验证设计同等强度的确认性证据。

聚合也不会自动解决问题。若模型对某类文本、地区或时期存在系统偏误,把逐条预测平均成年份或地区指标,仍可能保留偏差。研究者需要说明验证发生在哪一层,变量最终又在哪一层进入估计。

04这篇论文真正留下了什么

这是一篇综述,价值不在于提出一个万能估计量,而在于建立了一套判断 AI 测量是否可信的共同语言。

对正在使用大模型构造变量的研究者,最值得带走的是五条原则:

  • 先定义,再调用模型。 不要让模型输出反过来定义研究对象。
  • 把模型与提示词选择当成研究设计。 保存模型版本、完整提示词、参数和原始输出。
  • 让验证集服务于下游估计。 不只报告准确率,还要说明抽样方式和覆盖范围。
  • 让测量误差进入推断。 AI 变量在模型中扮演什么角色,会影响所需的校正方法。
  • 让结论强度匹配证据。 当前样本有代表性验证数据、只有外部数据、完全无验证数据,是三个不同的可信度等级。

论文也留下了明确边界。现有统计方法主要集中在“观测”阶段;发现与构念定义仍高度依赖理论和领域知识。高质量验证标准本身可能有争议,模型误差如何跨地区和时期迁移,也仍是开放问题。

如果说上一轮信息技术革命让研究者学会约束“回归规格的自由度”,那么这一轮 AI 测量革命要求我们进一步约束“变量生成的自由度”。

AI 可以替我们规模化地读材料、看图像和打标签,却不能替我们决定什么值得测、什么算测对,以及一个结论究竟凭什么可信。

05参考文献

  • 论文:Melissa Dell and Ashesh Rambachan, The Measurement Revolution? Credible Measurement and Inference in the Age of AI, August 2026,arXiv:2608.23524。
「能源经济大赛必看」15个能源经济DID政策最全汇总!
「能源经济大赛必看」能源经济、环境经济会议与期刊权威盘点!
2026年第十二届能源经济学术创意大赛40个选题推荐!
从 “数据透明” 到 “生态公平”:数字监测的环境平权之路
蚂蚁森林背后的“减碳密码”:公益碳普惠政策如何改变家庭碳排放?
能源经济选题推荐:可再生能源转型政策如何提高能源韧性?基于双重机器学习的因果推断
能源经济学术创意大赛·计量类实证论文示例·代码复现
能源经济学术创意大赛·泛能源大数据与人工智能·参考顶刊解析(视频讲解+复现代码)
能源经济大赛选题新参照:第九届中国绿色低碳发展论坛深度解析
「能源经济选题必看」从第十四届中国能源经济与管理学术年会看选题创新(附名单)
面向社科研究者:用深度学习做因果推断(一)
面向社科研究者:用深度学习做因果推断(二)
面向社科研究者:用深度学习做因果推断(三)
没有好工具变量,怎么做因果识别?AutoIV 方法与一篇中国经验证据
当工具变量遇上深度学习:DeepIV如何看透因果?
控制变量到底该怎么选?《管理世界》给你答案
双重机器学习还可以进行分位数回归?怎么做才能让故事更加精彩!
利用双重机器学习进行因果分析的工作流(附Python和R代码)
如何对双重机器学习模型进行敏感性分析?绘制敏感性分析等高线图可视化教程
随机试验中异质性处理效应的通用机器学习因果推断
因果推断想突破传统局限?深度学习 × 结构经济模型,异质性研究的创新契机在这
机制分析还能怎么做?来看看「多中介因果路径分析」(附顶刊案例+源文献代码)
政策评估中的隐形陷阱:从冷战CIA干预研究看“阿森费尔特沉降效应”
如何让你的 Stata 接入大模型 Agent ?Stata MCP+ IDE 配置教程
合成控制双重差分(SDID)可视化实战:用synthdid绘制顶刊因果推断图表
两时期DID的双重稳健估计:DRDID
多时期DID的双重稳健估计:CSDID
Stata19 条件平均处理效应(Conditional average treatment effects,CATE)
非平行趋势下的双重差分敏感性分析:HonestDiD
因果中介分析指南(三):stata中mediate的用法(完结)
因果中介分析指南(二):stata中mediate的用法
因果中介分析指南(一):估计流程与理论介绍
能源经济选题推荐:可再生能源转型策如何提高能源韧性?基于双重机器学习的因果推断
绿色政策变 “灰色结果”?新能源汽车如何牵动煤炭消费,这篇研究敲醒警钟
发现一个能发能源经济顶刊的DID选题
用 CFPS 数据探究 “新一代人工智能” 政策的劳动力影响:咋推动服务业人去制造业?
跟着顶刊学实证|零工经济渗透与企业创新——来自外卖和网约车平台进入的经验证据
谁说智能驾驶只能工科做?智能驾驶DID:“车路云一体化”试点预定经管顶刊选题!
从第二十五届中国经济学年会看选题创新(附论文名单)
经管研必看!2025下半年人工智能主题学术会议大合集
从2025年中国数量经济学会年会看选题创新!(附论文选题)
2026年第十二届能源经济学术创意大赛40个选题推荐!
把握2025年中央经济工作会议信号:新一轮经济学研究该怎么选题?

相关学习资料