夜雨聆风学习资料网

ARTICLE · 1122704

把AI当科研助理:从数据清洗到论文绘图,一份不玄学的实操指南

把AI当科研助理:从数据清洗到论文绘图,一份不玄学的实操指南

📌 点上方【关注 水弓C】,设为星标

💬 评论区已开放,欢迎聊聊你的经历

去年有个师弟拿他的回归结果来找我,R² = 0.94,他自己都不太信。

我让他把清洗脚本打开看。缺失值全填了 0,异常值用 3σ 一刀切,切完剩 89 个样本。问题不在 AI,在他给 AI 的那句话:"帮我清洗一下这份数据。"

模型不知道那个通道里的 0 是"没测到"还是"测出来就是 0",也不知道 3σ 在这个偏态分布上根本不成立。你给一句模糊的话,它给你一个看起来很专业的答案,然后你自己负责。

能让 AI 干的活,和不能让 AI 干的活

我的判断标准只有一条:这个环节错了,后果是"重做一遍",还是"撤稿"。

前者交给 AI 提速。文献筛选、代码起草、图表绘制、语言润色——这些做错了无非返工,AI 能省我一半以上时间。

后者最多让 AI 当个质疑者。实验设计、数据解释、结论定性,做错了要出事的环节,我只用 AI 做一件事:站在审稿人角度挑我的毛病。

AI 不会替你负责,它只是把"没想到"的概率打下来。"想错了"那一部分,永远是你的活。

这个分工不是我的偏好,是它的能力边界决定的。它能生成看起来合理的东西,判断"是否真的合理"需要背景知识,而背景知识在你手上。

六个场景的提示词,可以直接抄

下面这几条我改了不止一轮。共同点是:给它角色、给它输入的字段结构、限定输出格式、强制它标出不确定的地方。

场景
可直接抄的提示词
注意事项
1 数据清洗诊断
你是数据分析顾问。我有【实验类型】数据【N】条记录,字段为【字段名:类型:含义】。请:(1) 列出这类数据最常见的 5 类质量问题,按发生概率排序;(2) 每类问题给一个可执行的检测方法,pandas 伪代码即可;(3) 说明哪些处理方式在学术上不可接受,以及原因。只做诊断,不要替我决定怎么处理。
不要让它直接输出清洗后的数据。先诊断,方案你自己定。
2 统计方法选择
我的研究问题是【一句话】。自变量是【类型】,因变量是【类型】,样本量【N】,数据结构为【独立/配对/重复测量】。请列出 3 种可行方法及各自的前提假设、检验这些假设的具体方法,并指出我若误用,审稿人最可能从哪里攻击。
它天然偏向推荐复杂模型。前提假设那一条必须先过。
3 期刊级绘图
用 matplotlib 画一张【图类型】,投稿目标是【期刊/领域】,数据是【结构描述】。要求:字体 Arial 7pt、线宽 0.75pt、图宽 8.5cm、导出 PDF 矢量图、配色色盲友好。每行代码加中文注释,说明这行在控制什么。不要用 seaborn 默认样式。
图出来之后,坐标轴单位、误差棒的定义必须自己核一次。
4 文献结构化提取
请把以下文献提取成表:研究问题 / 方法 / 样本与数据 / 主要结论 / 局限性 / 与我的研究的关系。最后单列一栏"存疑",标注你无法从原文中确认的信息。
它会编出不存在的数据。每一格回原文核对,数字尤其。
5 结果段落初稿
根据以下数值【粘贴】,写一段 Results。只描述数据不做解释,时态统一用过去时,每句对应一个具体发现,我未提供 p 值的地方不得使用 significant。
它最爱在 Results 里塞讨论。删掉。
6 审稿意见回应
以下是审稿意见【粘贴】。请把每条拆成"他担心的核心问题"和"他建议的做法",判断哪些必须做、哪些可以礼貌反驳;对可反驳的条目给出逻辑框架,但不要替我编数据。
反驳必须基于你真有的证据,编的理由第二轮会崩。

这六条覆盖的是我最常走的流程:拿到数据 → 定方法 → 出图 → 写结果 → 回审稿。中间任何一步直接问"帮我分析一下",基本等于把方向盘交出去。

提示词写得好不好,差别在三个动作

第一,用方括号把可替换字段显式标出来。 你不标,它就自己编一个填进去,而且编得很像真的。

第二,强制它输出结构化格式。 表格、编号、带注释的代码——这三种才可复核。散文式输出你没法逐句验,最后只能凭感觉信。

第三,明确写"不要替我决定"。 这句话看着多余,但它能挡掉一大半越界输出。模型的默认行为是替你走完全程,你得主动把判断权收回来。

最常见的两个错误,我自己都犯过:一次给太多任务("清洗+分析+绘图+写结论"一起丢过去),它会在中间某一步偷偷跳步,你还不容易发现;以及不给背景直接问结论("我这个数据显著吗"),它只能猜,猜错了你看不出来。

三条红线,踩一条就够出事

红线一:涉密和未发表数据不进公网模型。 未公开的实验数据、课题编号、合作单位信息,一律不上传。替代做法是给结构描述加同分布的合成数据——让它写代码,不接触真实值。

红线二:AI 写的代码,必须逐行读懂再跑。 尤其是核心计算——样本量、检验统计量、误差棒。我现在的习惯是,关键结果用手工或独立工具再算一遍,两次对上了才写进稿子。

红线三:引用、数字、结论,必须回到原始来源。 AI 编造参考文献这件事没有例外,它会给你一个格式完美、期刊真实、作者真实、但根本不存在的条目。署名只有你一个,责任也只有你一个。

这套流程用了两年,最大的变化不是变快,是我终于说得清自己每一步在做什么。工具的上限是使用者的判断力,不是反过来。

上面六个场景是结构版——字段和句式都给了,你照着填就能用。我另外整理了一份可下载的完整版:6 张 Word 提示词卡(方括号字段可直接替换)、一份数据清洗自查表 Excel、一张论文图表参数速查表。公众号后台回复关键词「AI助理」自取。

💬 你用 AI 做过哪一步科研工作?有没有被它坑过一次,坑在哪?

© 水弓C·技术规划实战 | 研究所技术规划岗实战经验整理


附件预览

这一篇的配套附件,内容直接贴出来了,能用的直接拿走。后台回复关键词 「AI助理」 领可编辑的 Excel / Word 原件。

附件:AI科研助手提示词卡(6场景)

AI 科研助手提示词卡(6场景可替换版)

配合《把AI当科研助理:从数据清洗到论文绘图》

方括号【】内的内容替换成你自己的。整段复制,不要拆成多次问。

场景 1:数据清洗

你是科研数据处理助手。我给你的数据存在【缺失值/异常值/格式不统一】问题。请:①列出所有问题类型及所在列;②给出处理建议但不要直接修改数据;③对每一个你不确定的地方标注【待人工确认】,不要推测。输出格式为表格:行号|问题类型|原值|建议处理方式。

场景 2:文献综述

你是文献分析助手。我提供了【N】篇文献摘要。请按「已解决什么 / 尚未解决什么 / 卡在哪」三段组织,每个结论后标注来源文献编号。禁止编造文献编号,摘要里没有的信息一律写【摘要未提及】。

场景 3:外文文献速读

把下面这篇英文文献翻译成中文,并输出结构化摘要:研究问题 / 方法 / 主要结论 / 局限性 / 与我的研究的关系。最后单列一栏「存疑」,标注你无法从原文确认的信息。

场景 4:论文图表

你是科研绘图助手。我要画一张【折线图/柱状图】展示【数据含义】。请给出:①Python matplotlib 完整代码;②配色建议(学术发表风格);③坐标轴标签与图例文字(中英文各一版)。不要美化数据,不要平滑曲线。

场景 5:回复审稿意见

你是我的论文修改助手。下面是一条审稿意见:【原文】。请:①用一句话复述审稿人真正的顾虑;②给出回复信的结构(先致谢、再回应、后说明修改位置);③标注我的回复里哪些话是承诺,需要我确认能不能兑现。不要替我说我们完全同意。

场景 6:材料润色

你是科研材料润色助手。请只修改【表达】,不动【事实】:人名、金额、时间、指标数值一个字不许改。改完用表格输出:原句 | 修改后 | 修改理由。凡涉及「国际领先」「填补空白」这类表述,一律提示我补充对比基准,不要替我保留。

三条安全红线

! 不喂涉密内容:人名换职务、项目名换代号,涉密段落不过机器

! 不交判断权:结论、定稿、盖章前的最后判断必须自己做

! 不留假依据:AI 给的文献、数据、法条,一律回溯原文核对

附件:数据清洗自查表

数据清洗自查

序号
列名
问题类型
记录条数
处理方式
已处理
1
缺失值
单独列出,不自动填 0
□
2
异常值
标注来源,人工判断
□
3
格式不统一
统一为 YYYY-MM-DD
□
4
重复记录
按主键去重,保留最早一条
□
5
单位不一致
统一换算并记录换算系数
□

相关学习资料