单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达

美国西北大学团队在PNAS发表重磅研究,通过分析NSF和NIH的机密提案数据,首次大规模揭示大语言模型(LLM)正在重塑美国联邦科研资助的格局。研究发现:LLM使用率在2023年后急剧上升,但更高的LLM参与度与更低的语义独特性显著相关——AI辅助的提案越来越"像"已获资助的项目。更令人担忧的是,NIH中LLM参与度高的项目虽然更容易获批、产出更多论文,但这些增量几乎全部集中在非高影响力论文上。
一、当AI开始写科研提案
联邦科研资助是美国将公共资源转化为科学知识的核心机制。通过国家科学基金会(NSF)和国立卫生研究院(NIH)等机构的竞争性拨款项目,纳税人资金流向哪些科学思想、哪些领域获得推进、哪些研究者能够启动和维持研究项目,都取决于这些资助决策。
然而,尽管近年来AI在科学领域的应用引发了广泛关注,一个关键问题却鲜有研究:大语言模型(LLM)的崛起,是否正在重塑公共科研资助的格局?
这一空白至关重要,因为资助决策发生在发表、招聘和认可之前,在科学思想被追求之前就已经塑造了科研方向。然而,提案文本——尤其是未获资助的提案——通常是机密的,使得这一阶段难以大规模系统研究。
⚠️ 关键背景:2025年7月,NIH明确声明"主要由AI开发的应用"将不被视为申请者的原创作品;NSF也强调了研究者对准确性和原创性的责任,并鼓励披露生成式AI的使用。
二、LLM使用的快速上升与双峰分布
研究者通过分析提案摘要中的文本痕迹来估计LLM的使用程度。他们采用了一种已建立的检测方法(Liang et al.),利用2021年(LLM广泛使用之前)的公开资助摘要估计人类写作的词分布,同时用GPT-3.5-turbo重写同一批摘要来模拟LLM生成的词分布。

图1:LLM使用的快速上升与双峰分布(a-d) 语料库层面的LLM使用估计,涵盖2021-2025年NSF和NIH的私有提案和公开资助数据;(e-h) 单个资助项目的LLM参与度分布,显示明显的双峰模式。虚线标记2022年11月30日ChatGPT公开发布时间。
研究发现,在所有四个数据集中,LLM参与度(α)在2022年底之前相对稳定,然后从2023年开始急剧上升——这与ChatGPT的广泛可用时间吻合。这一增长在提案提交阶段和已获资助项目中都清晰可见,表明LLM的使用并非局限于资助流程的单一环节。
🔍 关键发现:双峰分布
在单个资助项目层面,研究者观察到了双峰分布 一个峰接近零(几乎不用LLM),另一个峰在10-15%左右(实质性使用LLM) 这一模式揭示了一个清晰的分化:一部分资助摘要基本避免使用LLM,另一部分则实质性地将LLM纳入提案准备
三、LLM使用与语义独特性的下降
LLM的快速且不均衡采用引发了另一个关键问题:更高的LLM参与度是否与科学思想定位的转变相关?
为了量化思想的定位,研究者测量了每个提案或资助摘要相对于该机构近期资助前沿的语义独特性。具体而言,他们使用SPECTER2嵌入方法计算每个摘要与同机构前一年获资助所有摘要之间的平均余弦距离,然后转换为年内百分位数。

图2:LLM使用与语义独特性(a-d) 回归估计显示,在私有NSF、私有NIH、公开NSF和公开NIH数据中,更高的LLM参与度一致与更低的独特性百分位数相关。负系数表示提案和资助项目在语义空间上更接近该机构近期资助的工作。
研究发现,在所有四个数据集中,更高的LLM参与度一致与更低的独特性百分位数相关。例如,对于NSF资助项目,从低LLM参与度(第25百分位)到高LLM参与度(第75百分位)对应独特性百分位数下降5个百分点;对于NIH资助项目,下降4个百分点。
"重要的是,研究者通过固定效应模型比较的是同一研究者内部的变化,而非不同研究者之间的差异。这意味着:对于同一研究者的提案和资助项目,当LLM参与度更高时,其提案和资助项目系统性地变得不那么独特。"
四、LLM使用与提案成功率
接下来,研究者考察了LLM采用是否与资助流程中的首要后果相关:哪些提案实际获得了资助。

图3:LLM使用与提案成功率(a) NSF提案的回归估计;(b) NIH提案的回归估计。所有回归均包含提案请求起始年份、领域和研究者固定效应,以及请求资助金额的控制变量。
研究发现,对于NSF提案,LLM参与度与提案成功率之间没有统计学上显著的关联。然而,对于NIH提案,LLM参与度与提案成功率呈正相关且显著。具体而言,从低LLM参与度(第25百分位)到高LLM参与度(第75百分位)对应NIH资助概率提高约4个百分点。
️ 机构差异:LLM采用对提案选择的后果因机构而异。在NSF,LLM使用并未系统性地使提案获得优势;但在NIH,即使对于同一研究者,LLM参与度更高的提案也更有可能获得资助。
五、LLM使用与科研产出
利用公开的NSF和NIH资助数据,研究者进一步将资助项目层面的LLM参与度与后续发表产出相关联。

图4:LLM使用与科研产出(a-b) 总发表数量的回归估计;(c-d) 高影响力论文(引用前5%)的回归估计。"hit"论文定义为引用数位于同年份同领域全球所有论文前5%的论文。
研究者再次发现,对于NSF资助项目,LLM参与度与发表产出之间没有显著关系。然而,对于NIH资助项目,更高的LLM参与度与更多后续发表显著相关。从低LLM参与度到高LLM参与度预测NIH资助项目增加约5%的发表。
🔍 关键发现:数量vs质量
NIH的生产力溢价几乎全部集中在发表数量而非高影响力产出上 当研究者将分析限制在高被引论文(如前5%论文)时,这种关系减弱且不再具有统计学显著性 这意味着:LLM辅助的提案产生了更多论文,但这些论文并非最具影响力的工作
六、讨论:AI对科研的深层影响
这些发现共同揭示了LLM的快速扩散正在重塑美国联邦科研资助流程的关键阶段。
核心发现总结
1. 思想趋同:更高的LLM参与度一致与更低的语义独特性相关,提案越来越接近该机构近期资助的工作。
2. 机构差异:LLM采用的下游后果因机构而异。在NIH中,LLM参与度与更高的资助成功率和发表产出相关,但在NSF中未观察到类似关联。
3. 数量vs质量:NIH的生产力增益集中在非高影响力论文上,而非最高被引工作。
政策含义
科学政策的核心关切之一是维持多样化和探索性的研究组合,既支持累积性进步,也支持非常规思想的追求。如果LLM采用系统性地将提案拉向更安全、更容易论证的思想,它可能会悄悄地将公共投资组合偏向利用而非探索,即使各机构强调高风险高回报探索性研究的价值。
同时,提案中重度依赖LLM也引发了问责和信任问题。如果用于反映研究者原创思想的文档大量由AI生成,这可能削弱公众对科研资助过程的信任。
"这项研究通过结合机密提案提交和公开资助记录,提供了大规模证据表明LLM的崛起正在重塑科学思想的定位、选择和转化为公共资助研究的方式。"
七、结论与反思
对于科研管理者而言,这些发现对投资组合治理、研究多样性和科学的长期影响具有重要意义。对于研究者而言,这提醒我们:AI可以是强大的工具,但也可能在无意中塑造我们思考和研究的方式。
在AI日益渗透科研各个层面的今天,如何在利用AI提升效率的同时保持科学探索的多样性和原创性,是一个亟待回答的问题。
更多阅读
参考文献:Qian, Y., Wen, Z., Furnas, A.C., Bai, Y., Shao, E., & Wang, D. (2026). The Rise of Large Language Models and the Direction and Impact of US Federal Research Funding. Proceedings of the National Academy of Sciences (PNAS). DOI: 10.1073/pnas.2601439123

文章精选:
夜雨聆风