很多人已经在科研中使用 AI,但使用方式通常集中在最后一公里:翻译论文、润色摘要、改写一段 Related Work。
这些当然有用,却也是 AI Agent 最浅的一层用法。
科研真正费时间的地方,分散在整条链路上:问题怎样收敛,文献怎样查全,观点能否追溯到原文,实验是否可复现,图表是否来自真实数据,结论有没有超出证据,以及审稿人会从哪里击穿这篇论文。
这不是一次问答,而是一个会持续几周、几个月甚至几年的项目。
核心公式是:
Agent = LLM + 上下文 + 工具
把它放进科研,我们可以再补上一项:
科研 Agent = 推理模型 + 证据上下文 + 科研工具 + 独立验证
这里最重要的变化是:不再让 AI 直接“帮我写一篇论文”,而是让它维护一条从问题到结论的证据链。

01科研任务,分别放进公式的哪里?
科研工作不是一个超长提示词,而是一套分工明确的系统。
LLM 负责开放判断
模型适合处理没有唯一答案、需要综合判断的工作:
• 把模糊想法拆成可研究的问题; • 设计检索词和文献搜索路径; • 比较不同方法的假设与适用边界; • 提出实验方案、消融变量和潜在混杂因素; • 解释异常结果,生成下一轮待验证假设; • 把已经确认的证据组织成论文结构。
但模型不是事实数据库,也不是实验仪器。
它可以提出“可能是什么”,不能凭自己的语言流畅度把“可能”升级成“已经证明”。
上下文负责保存研究状态
科研 Agent 每一步需要看到的信息,远不止聊天记录。
它至少包括:
• 研究问题、范围与排除项; • 已确认和待验证的假设; • 文献检索记录与证据矩阵; • 数据字典、样本划分和伦理约束; • 代码、配置、运行日志与失败记录; • 图表、统计结果和结论边界; • 目标期刊或会议的格式要求; • 当前进度、未决问题和下一步动作。
这正是“上下文工程”对科研最直接的启发:不要把几十篇 PDF 和全部对话一次塞给模型,而要区分常驻概览与按需细节。
研究目标、关键约束和当前状态应该常驻;论文原文、实验日志和历史讨论则通过检索按需进入上下文。
工具负责接触真实世界
一个科研 Agent 真正有用,必须能调用产生证据的工具,而不是只在文本里推演。
典型工具包括:
• 学术搜索、DOI 与出版信息核验; • PDF 解析、表格提取和图像读取; • 文件系统、Git 与项目环境管理; • Python、R、MATLAB 或领域仿真软件; • 数据库查询、统计检验与可视化; • 引用管理、LaTeX、Word 和幻灯片生成; • 单元测试、结果对比和图表渲染检查。
模型负责决定何时使用这些工具,工具负责返回真实结果。
验证负责阻止“看起来正确”
科研中最危险的不是 AI 明确报错,而是它给出一份结构完整、语气自信、细节却无法追溯的结果。
因此,验证必须独立存在:
• 引用是否真实,DOI、作者、年份是否匹配; • 一句话是否真的得到所引论文支持; • 实验是否真实执行,而不是模型描述了一次执行; • 图表是否来自对应数据和脚本; • 指标、样本量、置信区间和统计检验是否一致; • 结论是否超过实验支持范围; • 换随机种子或环境后能否复现。
科研 Agent 不能因为“回答写完了”就宣布任务完成。它必须拿出可以检查的交付物。
02先搭一个 Artifact 工作区
科研任务一旦超过一次对话,就不应该只存在聊天窗口里。
可以先建立一个最小工作区:
research-workspace/├── README.md├── brief.md├── hypotheses.md├── decisions.md├── literature/│ ├── search-log.md│ ├── evidence-matrix.csv│ └── papers/├── data/│ ├── README.md│ ├── raw/│ └── processed/├── experiments/│ ├── plan.md│ ├── environment.md│ ├── code/│ ├── configs/│ └── runs/├── figures/├── manuscript/├── review/└── run-report.md这里每个文件都不是装饰,而是 Agent 与研究者之间的契约。
brief.md 固定研究问题、范围和成功标准;decisions.md 保存每次人工确认及理由;evidence-matrix.csv 保存每项主张对应的来源和证据强度;data/raw/ 只保存不可静默修改的原始数据;runs/ 保存真实运行产物;run-report.md 记录做过什么、失败在哪里、下一步是什么。
可直接复制的工作区初始化指令
下面这段可以直接交给 Codex、Claude Code、Cursor Agent,或任何具备本地文件读写能力的 Coding Agent。只需先替换四个参数;如果暂时不确定,也可以保留 【待填写】,让 Agent 先提问。
你是一名“科研工作区初始化 Agent”。请实际创建工作区,不要只给建议。【项目参数】工作区路径:research-workspace研究主题:【待填写】研究领域:【待填写】预期成果:【论文/报告/软件/数据集】【本轮目标】创建一个可恢复、可审计、可复现的科研工作区。本轮只初始化文件和规则,不检索文献,不运行正式实验,不撰写论文结论。【执行原则】1. 先检查目标路径和已有文件。2. 保留已有内容,不静默覆盖。3. 缺失信息统一写:“【待确认】”。4. 不虚构引用、数据或实验结果。5. data/raw 中的原始数据只读。6. 所有重要决定写入:decisions.md。7. 所有实际操作写入:run-report.md。8. 遇到权限、伦理或路径冲突时停止。【必须创建的结构】research-workspace/├── README.md├── brief.md├── hypotheses.md├── decisions.md├── literature/│ ├── search-log.md│ ├── evidence-matrix.csv│ └── papers/├── data/│ ├── README.md│ ├── raw/│ └── processed/├── experiments/│ ├── plan.md│ ├── environment.md│ ├── code/│ ├── configs/│ └── runs/├── figures/├── manuscript/├── review/└── run-report.md【文件契约】README.md 必须包含:- 项目标题与一句话目标- 当前状态 初始化/调研/实验/写作/审查- 目录索引和每个目录的用途- 当前人工确认点- 下一步动作brief.md 必须包含:- 研究背景与问题- 研究问题 RQ1、RQ2……- 可证伪假设- 研究范围与排除项- 数据来源、权限与伦理要求- Baseline、主要指标和消融变量- 算力、时间与成本约束- 预期交付物和验收标准- 已知风险、未决问题- “研究者确认”区域hypotheses.md 使用表格。字段为:- ID、假设、理论依据- 可证伪条件、所需证据- 对应实验、当前状态decisions.md 使用追加记录。字段为:- 时间、决定、备选方案- 选择理由、确认人、影响范围literature/search-log.md:逐次记录:- 数据库、检索式、日期- 过滤条件、结果数- 纳入数、排除理由、备注evidence-matrix.csv:将下列字段连接成一行表头,字段之间使用英文逗号:claim_id,claim_text,source_type,title,authors,year,doi_or_url,evidence_location,supporting_excerpt,support_level,limitations,verification_status,notes不要填入任何虚构论文。data/README.md 必须记录:- 数据来源、许可证和访问权限- 数据字典、样本单位和时间范围- 纳排规则、缺失值和异常值约定- raw 到 processed 的处理链路- 训练/验证/测试划分与泄漏风险experiments/plan.md 必须包含:- 实验问题和成功标准- 数据版本与划分策略- Baseline、变量、消融和对照- 指标、统计检验和置信区间- 随机种子、重复次数- 预计命令、输入和输出- 失败判据、停止条件- 正式运行前的人工确认区experiments/environment.md:必须记录:- 操作系统、语言和运行时版本- 依赖及锁定方式- 硬件、模型和外部服务- 环境变量名,不写入密钥值- 安装、运行和复现命令run-report.md 使用追加记录。字段为:- 时间、阶段、执行者- 实际动作或命令- 输入、输出路径- 结果、异常、失败原因- 下一步和待确认事项空目录中不得放置伪造数据或结果。如需让 Git 保留空目录,只创建说明用途的 README.md。【初始化顺序】1. 解析并确认工作区绝对路径。2. 列出现有内容和潜在冲突。3. 创建缺失目录。4. 按文件契约写入初始模板。5. 将未知项标为“【待确认】”。6. 检查所有路径和 CSV 表头。7. 在 run-report.md记录本次初始化。【完成时必须输出】- 工作区绝对路径- 最终目录树- 新建、复用和未修改的文件- 仍需研究者回答的问题- 下一道人类确认门完成初始化后立即停止。必须等待研究者确认 brief.md,才能开始文献检索或实验。这段指令故意把“初始化”和“开始研究”拆成两步。Agent 可以先把文件、模板和审计规则落盘,但不能趁机生成一批看似完整的假设、论文或实验结果。第一次运行结束后,研究者只需要重点检查 brief.md、data/README.md 和 experiments/plan.md 中的 【待确认】 项。
这样即使模型切换、上下文压缩或会话中断,研究状态也不会跟着消失。
其中 Harness 思想在科研里的落点:模型之外必须有一层可恢复、可审计的工程外壳。

03第一阶段:把想法变成研究简报
很多科研任务从一句模糊的话开始:
我想研究一种新的小样本故障诊断方法。
如果直接让 Agent 搜文献、写代码,它很快就会产生大量内容,但方向可能从第一步就偏了。
更稳的做法,是先让它生成 brief.md,至少回答:
1. 具体要解释、预测或比较什么? 2. 核心假设是什么,什么结果会否定它? 3. 研究对象、时间范围和场景边界是什么? 4. 数据从哪里来,是否存在权限、隐私或泄漏风险? 5. Baseline、主要指标和消融变量是什么? 6. 算力、周期和可接受成本是多少? 7. 最终交付物是论文、实验报告、数据集还是软件?
这一阶段适合让模型追问,而不是立即执行。
研究者确认 brief.md 后,Agent 才能进入文献和实验阶段。研究问题、主要假设和验收指标,是第一道人类确认门。
04第二阶段:从“搜到论文”升级为证据管理
普通 AI 搜索最容易制造一种错觉:回答里列了很多论文,就好像调研已经完成。
但科研需要的不是文献列表,而是可审查的证据结构。
其中 Agentic RAG 的思路很适合这里:先分解问题,进行第一轮搜索;阅读结果后识别缺口,再构造第二轮更精确的查询;直到证据覆盖研究问题,而不是搜索接口返回了十篇文章就停止。
建议让 Agent 先填证据矩阵,不急着写综述:
这样做有三个好处。
第一,Agent 无法只靠摘要“脑补”整篇论文;缺少原文支持的字段会直接暴露出来。
第二,写作时可以从主张反查证据,不必让模型凭记忆自动配引用。
第三,当两篇论文结论冲突时,系统可以继续比较样本、方法和场景,而不是随便选一个更顺眼的结论。
chapter3/retrieval-pipeline、agentic-rag 和 contextual-retrieval 可以分别提供混合检索、主动迭代搜索和保留分块背景的实现思路。
但有一条底线:任何引用在进入正文前,都要重新核对出版信息和原文语义。
05第三阶段:让 Coding Agent 管实验,不替实验
代码是科研 Agent 最重要的工具之一,因为它可以把想法变成可运行、可重复、可检查的过程。
例如比较一种新算法能否提升小样本故障诊断性能,Agent 可以协助完成:
• 数据质量审计与类别分布检查; • 训练、验证、测试划分和数据泄漏检查; • Baseline 与候选方法的统一接口; • 配置文件、随机种子和环境锁定; • 批量实验、日志采集与失败重试; • 指标汇总、显著性检验和消融实验; • 从原始结果生成表格与图形。
但“Agent 写出了训练脚本”和“实验结果可信”是两回事。
每次正式运行至少要留下:
• 代码版本或提交哈希; • 数据版本与划分清单; • 环境和依赖版本; • 完整配置与随机种子; • 实际执行命令; • 标准输出、错误日志和原始结果; • 生成图表所用的脚本。
这就是 artifact 模式:不要让模型在对话里搬运大量数据,也不要接受它口头转述结果。让数据、代码、配置和日志落盘,模型只读取必要摘要,最终结论可以一路追溯回真实运行。
昂贵实验、修改原始数据、使用受限数据或操作真实设备之前,还应设置第二道人类确认门。
06第四阶段:图表必须能回到数据
AI 很擅长把图做得“像论文”,这也让科研配图成为高风险环节。
一张合格图表至少要回答四个问题:
1. 它对应哪份原始或处理后数据? 2. 它由哪个脚本和配置生成? 3. 误差线、样本数、单位和统计口径是什么? 4. 图中视觉结论是否与数值结果一致?
可以借用 paper-to-ppt 的 Proposer–Reviewer 机制。
Proposer 负责根据真实结果生成图表;系统把图真实渲染出来;Reviewer 再检查坐标轴、单位、图例、文字尺寸、颜色区分、误差线和结论一致性。不合格就修改脚本重新生成,而不是在图片上手工“修得更像”。
对科研来说,Reviewer 最重要的一句检查不是“好不好看”,而是:这张图有没有让读者看到数据并未支持的东西?
07第五阶段:论文只能从已验证证据生成
进入写作阶段后,Agent 的上下文不应该是“你知道的所有知识”,而应该是当前项目已经确认的材料:
• 审核过的研究简报; • 证据矩阵与已核真文献; • 实验计划、真实日志和结果表; • 可追溯的图表; • 目标期刊或会议的结构要求。
然后按章节生成,并给每个结论附上内部证据指针。
如果证据不足,不要自动补齐。可以明确留下:
[待证据]需要支持该比较结论的直接实验。[待核引]已找到相关论文,但尚未核对原文。[结论过界]当前结果只覆盖数据集 A,不能外推到真实工业场景。这些标记看起来不如一篇“完整初稿”漂亮,却比一段无依据的流畅文字安全得多。
接下来再用独立 Reviewer 做多轮检查:方法审查、统计审查、引用审查、复现性审查和目标期刊适配审查。
Reviewer 不应该只输出“优点、缺点、建议”,而要把每条问题映射到具体证据、文件和修改动作。
08Skills 和多 Agent 应该怎样组合?
科研流程很长,不适合把所有规则和工具永久塞进一个上下文。
更实用的方式,是把重复方法做成按需加载的 Skills:
• literature-search:检索式、纳排标准、证据矩阵和引用核验;• paper-reader:全文解析、图表定位、方法与局限提取;• experiment-runner:环境检查、运行清单、日志和复现记录;• data-analysis:统计检验、效应量、异常值与可视化;• paper-writing:按证据写摘要、方法、结果和讨论;• research-reviewer:从方法、统计、引用和复现性审查交付物。
这对应其中 agent-skills-ppt 的渐进式披露:Agent 启动时只知道有哪些能力,需要时才加载某个 Skill 的完整说明、参考资料和脚本。
多 Agent 则只在确实需要独立性或并行性时使用。
适合并行的任务包括:多个数据库分别检索、不同方法谱系独立调研、多组实验并发监控。
适合隔离的任务包括:让 Reviewer 不读取作者的自我解释,独立检查论文与证据;让统计审查者只依据数据和分析脚本复算结果。
不适合多 Agent 的,是把同一个模糊问题交给五个角色自由聊天。Agent 数量增加不会自动产生可靠性,只会增加上下文同步、结论冲突和成本。
一个稳妥结构是:
• 一个研究管理 Agent 只保存任务索引、状态和确认点; • 专项 Skill 或子 Agent 处理具体阶段; • 所有结果写入共享工作区,而不是只留在消息里; • 独立 Reviewer 检查产物,不替生成者补理由; • 研究者负责问题、取舍、解释和最终责任。
09怎样让系统越做越顺?
科研经验不能只留在一次对话里。
每轮任务结束后,可以让 Agent 从日志中提取两类记忆:
一类是项目事实,例如某数据集存在重复样本、某组参数导致训练不稳定。这些信息只属于当前项目,写入项目的 lessons.md 或数据说明。
另一类是可复用方法,例如“时间序列必须按时间切分,禁止随机打散”“所有性能图必须同时输出样本数和置信区间”。经过人工确认后,可以沉淀进对应 Skill。
这对应第八章的自我进化:把成功和失败轨迹提炼成外部知识,让 Agent 从“每次都重新想”变成“会复用已经验证的方法”。
但错误经验也会被放大。只有经过复现或人工确认的结论,才应该进入长期 Skill;一次偶然成功不能直接升级为通用规则。
10五道人类确认门不能交出去
科研 Agent 可以承担大量执行工作,但至少五类决定仍应由研究者确认:
1. 研究问题与假设:是否值得研究,什么结果具有科学意义。 2. 数据与伦理:数据是否有权使用,隐私、许可和伦理要求是否满足。 3. 实验设计:Baseline、样本划分、指标和统计方法是否合理。 4. 结果解释:相关性与因果、实验范围与外推边界是否被混淆。 5. 对外提交:作者身份、利益冲突、AI 使用披露和最终文本责任。

AI 可以提醒和检查,但不能替研究者承担学术判断与责任。
尤其要守住三条底线:不生成虚假引用,不编造实验数据,不为了让故事更漂亮而选择性隐藏失败结果。
11从一个最小闭环开始
不要第一天就造一个“全自动 AI 科学家”。
先选一个真实、边界清楚的小任务,例如:
比较三种方法在一个公开数据集上的表现,并生成可复现的实验报告。
给 Agent 的任务契约可以这样写:
目标:回答一个明确的比较问题。输入:- 研究简报、公开数据- 已核验文献和代码仓库允许工具:- 学术检索、文件读写- Python、Git、统计和制图必须产物:- 证据矩阵、实验计划- 代码、配置和真实日志- 结果表、图表和审查报告验收条件:- 结果可复跑- 每项结论可追溯- 所有失败与限制被记录禁止事项:- 虚构引用或编造数据- 静默修改原始数据- 绕过人工确认点人类确认:- 研究简报和正式实验- 结果解释和对外提交这个最小闭环跑通后,再逐步增加 PDF 解析、复杂检索、多组实验、论文写作和多 Agent 并行。
参考项目:https://github.com/bojieli/ai-agent-book
《深入理解 AI Agent》真正能带给科研的,不是又一个自动写论文工具。
它提供的是一套工程直觉:让模型负责开放推理,让上下文保存证据与状态,让工具产生真实结果,让验证决定任务是否完成。
当 AI 不再只是生成更多文字,而是帮助你减少不可追溯的步骤、保存失败经验、复现实验并提前暴露证据缺口,它才真正进入了科研流程。
科研的最终产物不只是一篇论文,而是一条任何人都能沿着走回去的证据链。
夜雨聆风