ARTICLE · 1043469
论文不该只是一份 PDF:Paper2Agent把一篇篇研究变成能直接干活的 AI 智能体
题外话:其实俺试图做一个文章复现的agent,费了九牛二虎之力仅仅是复现了图,与本文更是望尘莫及,知耻而后勇,向大佬学习如何认知界定元问题、解决元问题,到时候也能说一句“俺也一样!”。
Paper2Agent 把论文连同它的代码库自动”打包”成一个可对话、可执行的 AI 智能体——你用自然语言提问,它替你把原作者的方法真正跑起来。
研究背景
每年有海量方法学论文发表,但绝大多数读者与这些成果之间隔着一堵墙:论文是静态文档,真正能用的东西藏在 GitHub 仓库、教程笔记本和一堆依赖版本里。想复用别人的方法,往往要先读懂文档、配环境、改报错,几天过去可能还卡在安装阶段。已有研究反复指出,科研代码的可执行性普遍不佳,数据与代码共享也面临现实障碍。结果是:发表与使用之间存在巨大落差,方法的实际影响力远低于它应有的水平。
近两年的”科学 AI 智能体”(AI agent,即能自主调用工具、分步执行任务的大模型系统)浪潮提供了新思路。已有工作尝试让 AI 自动写代码、自动做实验设计,甚至自动开展研究。但这些系统大多是从零生成代码,而生成的代码是否忠实于原论文的方法、是否真的跑得通,很难保证——这恰恰是科研场景最不能妥协的地方。
本文的切入点因此不同:不让 AI 重新发明方法,而是让 AI 把原作者已经写好、已经验证过的代码,包装成可以被调用的工具。作者把这个框架称为 Paper2Agent,并提出一个更大的主张:论文应当成为”面向智能体的研究对象”(agent-native research object),而不只是一篇静态文档。
研究方法
Paper2Agent 的核心思路,是在”论文/代码仓库”与”用户”之间插入一层标准化的工具接口。

图1 | Overview of Paper2Agent. a, Paper2Agent turns research papers into interactive AI agents by building remote MCP servers with tools, resources and prompts. Connecting an AI agent to the server creates a paper-specific agent for diverse tasks. b, Workflow of Paper2Agent.
整个流程可以拆成三段:
输入——一篇论文及其配套代码仓库(通常包含 README、示例教程、Jupyter notebook 等)。
核心步骤——系统先扫描仓库,从教程和示例中识别出”这篇论文到底提供了哪些可执行的分析能力”,再把每一项能力封装成一个标准化工具,汇总成一个 MCP 服务器。MCP(Model Context Protocol,模型上下文协议)是近年出现的通用接口规范,作用类似”AI 世界的 USB 接口”:只要按这个规范把工具暴露出来,任何支持该协议的大模型客户端都能即插即用地调用它。
这里最关键的设计是“执行—诊断—修复”的迭代闭环。系统不是把代码抄一遍就算完,而是真的去运行它:跑通了,就固化为一个可靠工具;报错了,就读取报错信息定位原因、修改环境配置或调用方式,再跑一次。作者专门设计了对抗性基准测试(人为在代码中注入缺陷),结果表明这个循环能够发现并修正相当一部分”继承自原仓库”的、表现为运行失败的 bug。这一步决定了生成的智能体是”能说”还是”能做”。
输出——一个模块化的论文 MCP 服务器,可以挂接到各种面向用户的智能体前端。用户不需要读文档、配环境,直接用自然语言提出分析需求,智能体就会选择合适的工具、填入参数、执行,并返回结果。
作者以几项代表性方法学工作演示了这一流程,包括基因调控变异效应预测模型 AlphaGenome、单细胞分析主流工具包 Scanpy,以及空间转录组不确定性校准方法 TISSUE。

图2 | Overview of the Paper2Agent-generated AlphaGenome agent.
需要强调的是,作者在大规模评测中坦承:并非每篇论文都能被顺利”智能体化”。相当一部分仓库失败了,原因集中在代码不完整、文档缺失、环境依赖无法解析。作者由此提出一个颇有意思的观点——一篇论文能否被轻松转化为智能体,本身就可以作为其可复现性的一把实用标尺。
核心结论
1. 论文智能体能忠实执行原方法,而不是重新臆造方法。 由于工具直接封装自原作者代码,智能体的行为锚定在已验证的实现上,避免了”从论文文字生成代码”路线常见的偏离。
2. 模块化设计带来可组合性。 每篇论文生成的 MCP 是独立模块,可以接入不同的用户端智能体,也可以彼此连接——这为”多个论文智能体协同解决一个问题”打开了空间。
3. 多智能体协作在真实生物学问题上给出了可验证的结果。 作者把 AlphaGenome、MPRA 偶联 scCRISPRi(一种把大规模并行报告基因实验与单细胞 CRISPR 干扰筛选结合的技术,用于检验调控元件功能)、以及 Perturb-seq(在单细胞水平系统敲低基因并读取转录组变化)三个论文智能体串联起来,用于分析银屑病关联位点 rs887314,并在该位点优先锁定了因果基因候选 GPR137。

图4 | Paper2Agent enables prioritization and experimental support for a psoriasis-associated causal gene.
4. 结论获得了独立实验数据的支持。 分析比较了”扰动 rs887314 所在顺式调控元件(CRE,调控附近基因开关的 DNA 片段)”与”直接敲低候选基因”两种操作所产生的下游基因表达特征。在静息(Rest)、刺激 8 小时、刺激 48 小时三种 T 细胞状态下(各自纳入约 19–21 个下游基因),两类特征之间呈现显著的 Spearman 相关(经 Benjamini–Hochberg 多重检验校正后 FDR < 0.05)。换言之,扰动这个调控元件与敲低该基因,在细胞里产生了方向一致的后果——这正是”该位点通过该基因发挥作用”所预期的证据形态。
5. 评测指标需要谨慎解读。 作者明确指出,对开放式分析任务而言,多个答案都可能是合理的,因此”与单一参考答案的一致性”这类基准,衡量的主要是执行的忠实度,而非分析的有效性。
创新点与意义
范式转变:从静态文档到可交互研究对象。 Paper2Agent 提出的不只是一个工具,而是一种科学知识表达方式的转换——论文成为可被调用、可被组合的活体资产。
用”封装”替代”重写”,解决了忠实性难题。 相比让 AI 从论文文字重新生成实现,直接工具化原作者代码,在科研可靠性上是更务实的路线;而”执行—诊断—修复”闭环让这种封装不止于形式。
大幅降低方法学成果的使用门槛。 对没有计算背景的实验科学家和临床研究者而言,自然语言即可驱动前沿分析方法,这对方法的实际扩散意义重大。
把”可智能体化”变成可复现性的新指标。 作者进一步设想,期刊未来可能出现与”数据可用性””代码可用性”并列的 “智能体可用性”(agent availability) 声明,反过来激励作者以更规范、更透明的方式组织自己的研究产出。
指向智能体之间的科学协作网络。 当方法、数据集、领域知识都被封装为可互相调用的智能体,跨学科连接可能以全新的速度发生。
同时,作者保持了清醒的边界意识:开放式的科学推理——提出假说、解释机制、判断证据——仍然必须由人主导。Paper2Agent 可以大规模生成假说、执行分析,但选择方向与评估证据的责任在研究者身上。此外,把科研代码以可执行智能体形式开放,也带来安全、知识产权与署名归属方面的新问题;论文智能体同样需要随上游代码与依赖的演进而持续维护。作者认为,这些是”发表可执行研究”的内在成本,而非放弃它的理由。
Reference
Reimagining research papers as interactive and reliable AI agents. https://doi.org/10.1038/s41586-026-11044-y