很多人用 AI 做科研,第一反应都是研究“怎么写提示词”。
于是网上出现了大量所谓的“万能 Prompt”:加角色、加背景、加要求、加格式,最后写出一大段复杂指令。但真正用起来,经常还是会遇到同样的问题——模型找不到资料、理解偏了、对话越聊越乱,甚至一本正经地给出错误答案。
所以,提示词优化真正值得研究的,并不是怎么把一句话写得更复杂,而是怎么给模型提供合适的信息、工具和工作环境,并建立一套能够反复使用的工作流程。
最近,James M. Dewar 在 Nature 撰文讨论了如何更有效地与 AI 协作,其中有不少建议对科研人员尤其有参考价值。

原文:https://www.nature.com/articles/d41586-026-02083-6
我把其中比较实用的部分重新整理了一遍,再结合科研场景给出几个可以直接使用的 Prompt。
很多人使用 AI 时,上来就是一句:
“帮我分析一下这篇论文。”
但模型到底能看到什么?
如果没有联网能力,它可能不知道最新研究;如果没有文献检索入口,它无法主动查找 PubMed、Google Scholar 等数据库;如果没有文件读取能力,面对一篇几十页的论文也很难真正开展分析。
所以,一个经常被忽视的问题是:
Prompt 只是输入端,工具和数据才是模型能够调用的“手脚”。
做科研尤其如此。
如果你的任务涉及文献检索,就应该让 AI 能够访问可靠的文献来源;如果要分析实验数据,就应该把数据文件、代码环境等准备好;如果需要查最新信息,就不能只依赖模型训练时已经掌握的知识。
现在 MCP 等开放标准,以及 Claude 中的 connectors、ChatGPT 中的 apps,本质上都在解决类似的问题:
让模型不只是“会说”,而是真正能够调用外部工具完成任务。
因此,与其花半天时间修改 Prompt,不如先问自己一句:
这个任务需要哪些信息和工具?我有没有真正提供给 AI?
这往往比增加几段提示词更加重要。
很多人写 Prompt,就像给同事发微信:
帮我总结这篇论文,重点看看研究方法、结果、局限性,再判断一下结论是否可靠,最好详细一点。
当然也能用,但任务一复杂,模型就容易漏掉要求。
更好的办法,是把任务拆开。
例如:
# 任务分析下面这篇科学论文。## 1. 研究背景- 研究解决了什么问题?- 为什么这个问题重要?## 2. 研究方法- 使用了什么数据?- 核心实验或分析方法是什么?- 是否存在关键假设?## 3. 主要结果- 最重要的发现是什么?- 哪些结果具有统计学意义?- 区分“数据事实”和“作者解释”。## 4. 局限性- 作者明确承认了哪些局限?- 是否存在其他潜在问题?## 5. 结论审查判断论文的核心结论属于:- 充分支持- 部分支持- 不支持- 证据不足并说明判断依据。这样做的好处很简单:模型更容易知道每一部分应该完成什么。
Dewar 还开发了一个免费的工具,可以帮助用户理解如何使用结构化文本来组织内容:
https://structured-writing.jmdewar.com/markdown
简单来说,就是把原本混在一起的一大段话,拆成标题、任务、约束和输出要求。
普通任务使用 Markdown 通常已经够用;如果任务特别复杂,也可以进一步尝试 XML、JSON 等结构化格式。
重点并不是“格式越复杂越高级”,而是:
让模型一眼看清楚你到底要求它做什么。
这是我认为最适合普通用户的一招。
很多人卡在 Prompt 上,是因为不知道应该怎么描述自己的需求。
其实没必要硬憋。
你完全可以先用大白话告诉 AI:
“我想让你帮我读论文,重点看引言、结果、讨论、局限性,还要判断作者的结论有没有被实验真正支持。”
然后让 AI 把这句话变成一条更加完整的 Prompt。
例如:
请优化这条用于总结科学论文的提示词。要求:1. 分别总结引言、结果和讨论;2. 提取作者明确承认的局限;3. 区分论文中的数据事实与作者解释;4. 判断核心结论是否被现有证据支持;5. 不得补造论文没有提供的信息;6. 最后总结结论成立的条件和适用边界。进一步优化后,可以得到一条能够直接用于论文分析的 Prompt:
# 科学论文总结与证据审查请阅读我提供的论文全文、摘要或相关章节,并按照以下结构进行分析。## 1. 引言总结:- 研究背景- 核心问题- 研究目的- 主要假设## 2. 结果总结:- 主要发现- 效应方向- 统计显著性- 关键数据明确区分“数据事实”和“作者解释”。## 3. 讨论分析:- 作者如何解释研究结果- 与已有研究是否一致- 理论意义- 实践意义## 4. 局限性- 列出作者明确承认的局限。- 如果发现论文没有明确说明、但根据文本可以推断出的局限,单独标注为“基于文本的推断”。## 5. 证据审查逐项对应论文的主要结论与支持证据,并判断:- 充分支持- 部分支持- 不支持- 证据不足同时说明判断依据。如果材料没有提供相关信息,请明确写“材料未提供”,不要自行补造数据、文献或结论。最后,用一段话概括论文最可靠的结论,以及这个结论成立的适用边界。Dewar 还提供了一个专门用于生成 Prompt 的工具:
https://prompting.jmdewar.com/meta
对于刚开始使用 AI 的人来说,这种方法其实比背诵所谓“万能提示词”更实用。先把自己的需求说清楚,再让 AI 帮你把需求翻译成机器更容易执行的指令。
这是很多人使用 AI 时特别容易踩的坑。
一个科研任务,从文献搜索一路聊到研究设计、数据分析、论文写作,最后可能积累几百条消息。
刚开始的时候模型表现很好,越到后面越容易出现:
忘记之前确定的条件;
重复已经讨论过的问题;
把已经纠正的错误重新带回来;
忽略对话中间的重要信息;
输出越来越偏离最初目标。
这时候最好的办法,往往不是继续纠正。
把当前阶段的成果压缩下来,然后重新开一个对话。
可以让 AI 先把当前上下文整理成一条新的 Prompt:
## 任务回顾上面的完整对话,生成一条可以直接用于新对话的提示词。新的提示词必须能够独立使用,假设新的模型从未看过当前对话。## 必须保留- 当前工作目标- 已经完成的工作- 已经作出的决定- 我的限制条件和偏好- 下一步需要完成的任务- 下一步工作所依赖的具体事实、名称、数字和原文## 删除- 已经无关的讨论- 已经被纠正的错误- 失败的尝试- 不再影响后续工作的往返内容## 输出要求将内容直接写成给模型执行的指令,而不是对我的总结。只输出最终提示词,并放在一个代码块中。这实际上是在给长对话“做一次断点保存”。尤其是做综述、数据分析、论文修改这类长任务时,非常有用。
还有一个经验特别值得记住:
AI 出现明显错误后,继续在原对话里反复纠正,有时候反而会越来越乱。
例如模型前面把一个变量理解错了。
你纠正一次,它改了。
过了十几轮之后,它又把旧的理解带了回来;你再次纠正,它又开始解释为什么自己之前没有错。
最后整个对话变成了“纠错循环”。
这时候最有效的办法通常不是继续修补,而是回到错误发生之前重新开始。
这和程序调试有点像。如果某一步已经污染了后面的结果,与其在后面不停打补丁,不如回退到正常状态,再重新运行。
因此,可以把重要科研任务拆成几个阶段:
文献检索 → 信息提取 → 分析 → 判断 → 写作
每完成一个阶段,就保存一次关键结果。这样即使后面出了问题,也不用把整个任务推倒重来。
这是科研人员尤其需要警惕的一点。
很多人发现 AI 给出的答案不太稳定,于是连续问几次:
“重新回答。”
“再分析一次。”
“换一种方法。”
如果几次答案越来越接近,就觉得:
“看来这个结论应该是对的。”
其实不是。
重复得到相同答案,只能说明输出比较稳定,不能证明答案正确。
科研中不会因为一个结论被重复写了十遍,就认为它是真的。同样的道理也适用于 AI。
更可靠的方法是让 AI 回到来源,对每一个重要结论进行核验。
例如:
# AI 输出事实核验你是一名严格的事实核查员。请不要默认下面的 AI 输出是正确的,而是逐项检查其是否能够被原始来源支持。## 核查要求对于每一项重要主张,判断其属于:- Supported:来源支持- Partially supported:来源部分支持- Unsupported:来源不支持- Contradicted:与来源矛盾对于每一项判断:1. 指出对应来源;2. 说明来源中的具体证据;3. 标记无法定位或疑似虚构的引用;4. 区分高置信度结论和存在不确定性的结论。如果无法完成核实,请明确说明“无法核实”,不要猜测。最后按照优先级列出最值得人工复核的内容。## 待核查内容<粘贴需要审计的 AI 输出>这一步特别适合论文写作。AI 可以帮你做第一轮审查,但最终涉及数据、引用、关键结论的内容,还是应该回到原始论文或原始数据。AI 是加速器,不是证据本身。
AI 有一个很明显的问题:
你问它:“这个实验设计合理吗?”
它往往很容易顺着你的思路回答。
但科研真正需要的,很多时候不是一个“支持者”,而是一个专门挑毛病的人。
所以在实验设计、研究假设甚至论文投稿之前,可以故意让 AI 扮演“反方”。
例如:
你是一名严谨、怀疑主义的领域专家,负责对下面的研究计划进行红队审查。你的目标不是表示赞同,而是尽可能找出这个方案失败的原因。请重点检查:1. 未明确说明的假设;2. 潜在混杂因素;3. 替代解释;4. 缺失的实验对照;5. 样本量或统计设计问题;6. 可能导致错误结论的环节;7. 哪些结果即使出现,也不足以支持我的核心结论。在提出批评之前,先用最强的形式陈述支持该方案的解释,再进行反驳。按照问题的严重程度排序,并分别标记:- 致命- 严重- 次要不要为了照顾我的观点而弱化批评。最后,只指出一个你认为最应该优先解决的问题。需要审查的研究计划:<粘贴研究方案>这类 Prompt 的价值,并不是让 AI 替你判断实验到底该不该做,而是提前制造一次“压力测试”。如果一个研究假设连 AI 的连续追问都经不起,至少值得你在真正花时间、花经费之前再检查一次。
Prompt 用过一次就扔,是比较可惜的。
真正值得长期积累的,是那些已经被自己验证过、修改过,并且在不同任务中反复有效的 Prompt。
比如可以建立这样的分类:
| 类型 | 可以积累的 Prompt |
|---|---|
然后给它们加上版本号。
例如:
Literature_Review_v1
Literature_Review_v2
Literature_Review_v3
每次使用之后,把真正有效的部分留下来。
再进一步,还可以把这些经过验证的 Prompt 固定成 Skill。这样下一次遇到类似任务,就不是重新想一句“该怎么问 AI”,而是直接调用已经验证过的工作流程。
看完这些方法,我反而觉得,Prompt 本身可能没有很多人想象得那么神秘。
真正拉开差距的,并不是谁能写出一条几百字的“超级 Prompt”,而是谁能够把 AI 放进一个信息完整、工具齐全、过程可控、结果可验证的科研工作流里。
给模型接工具,是为了让它拿得到信息;
给 Prompt 加结构,是为了让它理解任务;
压缩长对话,是为了减少上下文污染;
及时回退,是为了避免错误不断累积;
事实核验,是为了防止“说得像真的”变成“真的”;
让 AI 反驳自己,则是在真正投入实验和写作之前,提前做一次压力测试。
最后,把这些经过验证的流程沉淀成自己的 Prompt 库甚至 Skill,才真正有长期价值。
好的 Prompt 不是写出来的,是在一次次真实任务里跑出来的。
对于科研人员来说,与其收藏一堆所谓“万能提示词”,不如从今天开始,把自己真正用得上的几个工作流留下来。时间久了,它们会变成一套属于你自己的 AI 科研 protocol。
我还整理了从选题写作到润色发表的学术skills包,有全流程的,也有单一功能的,可谓应有尽有!想免费领的,可以私信回复“技能包”领取~

夜雨聆风