ARTICLE · 1122704
把AI当科研助理:从数据清洗到论文绘图,一份不玄学的实操指南
📌 点上方【关注 水弓C】,设为星标
💬 评论区已开放,欢迎聊聊你的经历
去年有个师弟拿他的回归结果来找我,R² = 0.94,他自己都不太信。
我让他把清洗脚本打开看。缺失值全填了 0,异常值用 3σ 一刀切,切完剩 89 个样本。问题不在 AI,在他给 AI 的那句话:"帮我清洗一下这份数据。"
模型不知道那个通道里的 0 是"没测到"还是"测出来就是 0",也不知道 3σ 在这个偏态分布上根本不成立。你给一句模糊的话,它给你一个看起来很专业的答案,然后你自己负责。
能让 AI 干的活,和不能让 AI 干的活
我的判断标准只有一条:这个环节错了,后果是"重做一遍",还是"撤稿"。
前者交给 AI 提速。文献筛选、代码起草、图表绘制、语言润色——这些做错了无非返工,AI 能省我一半以上时间。
后者最多让 AI 当个质疑者。实验设计、数据解释、结论定性,做错了要出事的环节,我只用 AI 做一件事:站在审稿人角度挑我的毛病。
AI 不会替你负责,它只是把"没想到"的概率打下来。"想错了"那一部分,永远是你的活。
这个分工不是我的偏好,是它的能力边界决定的。它能生成看起来合理的东西,判断"是否真的合理"需要背景知识,而背景知识在你手上。
六个场景的提示词,可以直接抄
下面这几条我改了不止一轮。共同点是:给它角色、给它输入的字段结构、限定输出格式、强制它标出不确定的地方。
| 1 数据清洗诊断 | ||
| 2 统计方法选择 | ||
| 3 期刊级绘图 | ||
| 4 文献结构化提取 | ||
| 5 结果段落初稿 | ||
| 6 审稿意见回应 |
这六条覆盖的是我最常走的流程:拿到数据 → 定方法 → 出图 → 写结果 → 回审稿。中间任何一步直接问"帮我分析一下",基本等于把方向盘交出去。
提示词写得好不好,差别在三个动作
第一,用方括号把可替换字段显式标出来。 你不标,它就自己编一个填进去,而且编得很像真的。
第二,强制它输出结构化格式。 表格、编号、带注释的代码——这三种才可复核。散文式输出你没法逐句验,最后只能凭感觉信。
第三,明确写"不要替我决定"。 这句话看着多余,但它能挡掉一大半越界输出。模型的默认行为是替你走完全程,你得主动把判断权收回来。
最常见的两个错误,我自己都犯过:一次给太多任务("清洗+分析+绘图+写结论"一起丢过去),它会在中间某一步偷偷跳步,你还不容易发现;以及不给背景直接问结论("我这个数据显著吗"),它只能猜,猜错了你看不出来。
三条红线,踩一条就够出事
红线一:涉密和未发表数据不进公网模型。 未公开的实验数据、课题编号、合作单位信息,一律不上传。替代做法是给结构描述加同分布的合成数据——让它写代码,不接触真实值。
红线二:AI 写的代码,必须逐行读懂再跑。 尤其是核心计算——样本量、检验统计量、误差棒。我现在的习惯是,关键结果用手工或独立工具再算一遍,两次对上了才写进稿子。
红线三:引用、数字、结论,必须回到原始来源。 AI 编造参考文献这件事没有例外,它会给你一个格式完美、期刊真实、作者真实、但根本不存在的条目。署名只有你一个,责任也只有你一个。
这套流程用了两年,最大的变化不是变快,是我终于说得清自己每一步在做什么。工具的上限是使用者的判断力,不是反过来。
上面六个场景是结构版——字段和句式都给了,你照着填就能用。我另外整理了一份可下载的完整版:6 张 Word 提示词卡(方括号字段可直接替换)、一份数据清洗自查表 Excel、一张论文图表参数速查表。公众号后台回复关键词「AI助理」自取。
💬 你用 AI 做过哪一步科研工作?有没有被它坑过一次,坑在哪?
© 水弓C·技术规划实战 | 研究所技术规划岗实战经验整理
附件预览
这一篇的配套附件,内容直接贴出来了,能用的直接拿走。后台回复关键词 「AI助理」 领可编辑的 Excel / Word 原件。
附件:AI科研助手提示词卡(6场景)
AI 科研助手提示词卡(6场景可替换版)
配合《把AI当科研助理:从数据清洗到论文绘图》
方括号【】内的内容替换成你自己的。整段复制,不要拆成多次问。
场景 1:数据清洗
你是科研数据处理助手。我给你的数据存在【缺失值/异常值/格式不统一】问题。请:①列出所有问题类型及所在列;②给出处理建议但不要直接修改数据;③对每一个你不确定的地方标注【待人工确认】,不要推测。输出格式为表格:行号|问题类型|原值|建议处理方式。
场景 2:文献综述
你是文献分析助手。我提供了【N】篇文献摘要。请按「已解决什么 / 尚未解决什么 / 卡在哪」三段组织,每个结论后标注来源文献编号。禁止编造文献编号,摘要里没有的信息一律写【摘要未提及】。
场景 3:外文文献速读
把下面这篇英文文献翻译成中文,并输出结构化摘要:研究问题 / 方法 / 主要结论 / 局限性 / 与我的研究的关系。最后单列一栏「存疑」,标注你无法从原文确认的信息。
场景 4:论文图表
你是科研绘图助手。我要画一张【折线图/柱状图】展示【数据含义】。请给出:①Python matplotlib 完整代码;②配色建议(学术发表风格);③坐标轴标签与图例文字(中英文各一版)。不要美化数据,不要平滑曲线。
场景 5:回复审稿意见
你是我的论文修改助手。下面是一条审稿意见:【原文】。请:①用一句话复述审稿人真正的顾虑;②给出回复信的结构(先致谢、再回应、后说明修改位置);③标注我的回复里哪些话是承诺,需要我确认能不能兑现。不要替我说我们完全同意。
场景 6:材料润色
你是科研材料润色助手。请只修改【表达】,不动【事实】:人名、金额、时间、指标数值一个字不许改。改完用表格输出:原句 | 修改后 | 修改理由。凡涉及「国际领先」「填补空白」这类表述,一律提示我补充对比基准,不要替我保留。
三条安全红线
! 不喂涉密内容:人名换职务、项目名换代号,涉密段落不过机器
! 不交判断权:结论、定稿、盖章前的最后判断必须自己做
! 不留假依据:AI 给的文献、数据、法条,一律回溯原文核对