大家好,我是墨鱼。
这一篇我想停下来认真讲一件具体的事。
我之前在公众号上写过我又发现一个 220k 星的 Claude Skill——是 Karpathy 留下的 4 条编程铁律我以为 26.5k 星已经到顶——直到读到这个 160K 科学家用的科研 skill 库这一批文章,介绍了各种学术 AI 工具。后台有读者一直问我同一个问题。
"墨鱼老师,你自己组里用没用过这些工具?"
我每次都含糊地回答"用了一些"。
我没说实话。
我组里今年 3 月初真的开始系统用这些工具。我让 3 位博士每个人都装了我前面推荐过的工具组合,按指定流程使用,每周记录数据。
6 个月过去了。
今天这一篇,是我把这 6 个月真实数据复盘出来想跟你说的话。这些数据有让我意外的部分,也有让我后悔的部分。如果你也在带学生用 AI,或者你自己作为博士在考虑要不要系统用 AI,这一篇可能对你有用。
一、我让谁用了什么
我先把背景讲清楚,因为没有背景数据无意义。
组里 3 位博士:
第一位是博三的小琳,做教育心理学方向的小样本量纵向追踪研究。她之前在博士师妹 SCI 写不出来 3 个月。我给了她 1 句话,3 天后初稿就出来了那篇里出现过。她是组里完美主义瘫痪最严重的一位。
第二位是博二的小杰,做计算化学方向,具体是基于深度学习的小分子药物设计。他的研究流程涉及大量分子模拟、虚拟筛选、化学数据库查询,是 AI 工具理论上最能帮到的方向。
第三位是博三的小辰,做流行病学方向,主要做大规模队列数据的因果推断分析。她的工作涉及大量统计建模、文献综述、临床数据库查询。
我让他们装的工具组合包括 ChatGPT 网页版(基础)、academic-research-skills(流程管理)、K-Dense Scientific Skills(数据库整合)。3 月后 ToolUniverse 发布后我又让小杰和小辰试装了 ToolUniverse 的部分模块。
我给他们立的规矩很简单。所有论文撰写、文献综述、数据分析中 AI 的使用必须记录在一个共享文档里。每周我们组会前他们把当周记录交我。
6 个月下来累积了 24 周的数据。
二、第一个数据:发文量翻了 2.75 倍
我先报喜。
这 6 个月里,3 个人合计投稿出去 11 篇论文。涵盖 SCI 投稿、会议论文、综述、Letter 几个类型。
我去翻了去年 9 月到今年 3 月的对应 6 个月。同样 3 个人合计投出 4 篇。
发文量增长了 2.75 倍。
这个数字让我第一眼看到时是兴奋的。我之前在Nature 实证:用 AI 的科学家引用 5 倍 + 早 1.4 年成 leader,但这 5 个方向陷阱不躲必栽里引用过 Nature 的数据,AI 使用者发文量增长约 3 倍。我组里这个 2.75 倍跟 Nature 的全球统计基本吻合。
如果我只看这个数字,6 个月的 AI 实验是巨大成功。
但发文量这个数字单独没意义。我必须看下一个数据。
三、第二个数据:接收率从 50% 掉到 27%
我去查了这 11 篇论文当前的处理状态。
接收 3 篇。大修后等待回应 2 篇。直接拒稿 4 篇。仍在审稿过程 2 篇。
把已经收到结果的 9 篇看,接收率是 3/9,约 33%。如果按全部 11 篇算(待审稿的 2 篇大概率有结果),更保守估计的接收率是 3/11,约 27%。
我又翻了去年 9 月到今年 3 月那 4 篇的情况。2 篇接收,2 篇拒稿。接收率 50%。
发文量翻了 2.75 倍,接收率从 50% 掉到 27%。
这两个数据放在一起,意义就完全不一样了。
我第一反应是怀疑样本量。3-4 个人在 6 个月里的论文数据,统计意义有限。但接收率掉了接近 23 个百分点,这不是统计噪声能解释的。
我把 4 篇拒稿信都拿出来重读了一遍。
3 篇拒稿的核心原因是审稿人指出论文的内部一致性问题。具体说是论文的某一段论证(通常是 Discussion 或 Introduction)跟另一段论证之间逻辑链条不连贯。一篇是审稿人直接指出"该段表述疑似 AI 生成"。
读完这 4 篇拒稿信我意识到一件事。
我们写得多了,但每一篇的精细度下降了。
之前没用 AI 的时候,写一篇论文从初稿到投稿大概需要 8-10 周。这 6 个月里平均每篇缩到 3-4 周。但最后两轮的精细修改,过去会改 3-5 轮,现在压缩到 1-2 轮。
效率提高的代价是精度下降。
这件事跟我之前推荐过的工具都不能用错来解释。工具本身没错。错的是我作为导师没把"AI 让你写得快"和"AI 让你写得好"分开管控。
四、第三个数据:6 个月里 11 次 AI 编造引用
这个数据是让我心里咯噔最厉害的一个。
3 月开始,我让 3 位博士在每次用 AI 协助写文献综述或者 Discussion 章节后,必须按《AI 编的引用太逼真?三个翻车案例 + 五步核查实战法》那篇里的五步法人工核查所有引用。
24 周里我们累计抓到 11 次 AI 编造引用。
这 11 次的分布很有意思。前 3 个月(3 月到 5 月)抓到 9 次。后 3 个月(6 月到 8 月)只抓到 2 次。
如果是工具升级了,每次都是同一批工具,无明显升级。如果是 AI 模型版本升级了,6 月之后 ChatGPT、Claude 都有新版,但伪造引用率应该是缓慢下降,不应该是断崖式下降。
我跟 3 位博士聊了之后明白了真相。
他们前 3 个月并没有真的认真核查每条引用。他们觉得五步法太繁琐,跑了流程的前两步觉得"没明显问题"就提交了。前 3 个月的 9 次伪造引用,大部分是我自己在批改 draft 时发现的。
后 3 个月他们意识到我会自己抓,于是开始真的认真核查。结果就是真的抓出来的伪造引用数大幅下降,因为他们在投稿前自己已经先抓掉了。
这个数据告诉我两件事。
第一,AI 编造引用是真的、持续的、不会因为模型升级就消失的问题。哪怕 GPT-5、Claude Opus 4.5 这种新版本,它们的"编引用率"只是降低,没有消除。
第二,更让我反思的是,学生不会主动按你立的规矩做事,除非他们知道你会真的检查。我前 3 个月放任了,结果就是几乎没人真的核查。
这件事之后我重新跟组里立了规矩。每篇论文投稿前必须由我亲自走一遍引用核查清单。我没办法让所有引用都被我亲自核查(论文太多了),但我可以做随机抽查,并明确告诉他们我会随机抽查。
这一条规矩立完之后,前 4 周里他们自己抓到的伪造引用是 7 个。
学生在乎的是导师的检查机制,不是规矩本身。
五、第四个数据:学生焦虑没有像我担心的那样降下来
这件事是 6 个月数据里最让我意外的。
我开始这个实验时最担心的是 AI 工具会"让学生过于轻松,失去对研究的紧迫感"。我预期 6 个月后他们的焦虑分数(我每周组会时主观评分 0-10)会从我之前看到的平均 6.2 下降到 4 分左右。
实际数据是:从 6.2 下降到 5.8。
只下降了 0.4 分。基本没变。
我一开始想不通。AI 工具应该明显降低他们的工作强度。为什么焦虑分数几乎没动?
直到 5 月某次组会,小杰跟我说了一句话。
"墨鱼老师,我现在不焦虑写不出来。我焦虑'我写的这个还算我做的研究吗'。"
我那一刻意识到了一件事。
AI 工具解决了"写不出"的焦虑,但创造了"这还算我的研究吗"的新焦虑。
这种新焦虑在 6 个月里几乎所有用 AI 的博士生身上都出现了。它的表现形式很微妙。小琳在投稿前总要反复读一遍 AI 帮她生成的段落,担心被审稿人识别出 AI 痕迹。小辰则担心"我做的研究有多少是 AI 做的多少是我做的",开始记录每个章节"我的贡献比例"。小杰最直接,他在博士开题答辩时被问了一个问题"如果没有 AI 你能完成这项研究吗",他承认那一刻他答不上来。
这种焦虑跟我之前 10 年带博士见到的焦虑性质不同。之前的焦虑核心是能力焦虑,"我做不到"。现在的焦虑核心是身份焦虑,"我做的不算"。
身份焦虑比能力焦虑更难处理。
能力焦虑可以通过提供工具、提供方法、提供时间来缓解。身份焦虑必须通过重新定义"做研究"这件事才能缓解。
而"做研究"这件事的重新定义,我作为他们的导师,目前还没想清楚。
六、我作为导师的角色变化
写到这里我必须诚实讲一下我自己的角色变化。
6 个月前我作为他们的导师,主要工作是教方法、改 draft、出主意、给方向。我大概每周花 12-15 个小时直接跟学生工作。
6 个月后我每周花在跟学生工作上的时间大约是 6-8 小时。
时间减半了。
但减少的时间并没有用来做我自己的研究。它被换成了另外两件事。第一件是研究 AI 工具本身(也就是你看到的我这一年公众号写的所有文章背后的功课)。第二件是处理 AI 工具带来的新问题,包括应付 AI 率检测、回应审稿人对 AI 使用的质疑、跟学生讨论身份焦虑。
我的"教育时间"减半了。我的"AI 运营时间"翻倍了。
净时间没变。
这件事最让我犹豫的部分是,我减少的"教育时间"是否会让我成为一个差一些的导师。
我不知道答案。
6 个月不够长,看不出来。但我隐隐有种感觉,博士生从导师身上学到的最有价值的东西,恰恰是过去那些"我亲手改你 Discussion 段落"的时刻,是"我跟你逐字逐句争论某个论证"的时刻。这些时刻 AI 没法替代。
而我现在花在这些时刻的时间,变少了。
七、我最后悔的一件事
写到这里要说我最后悔的事了。
我后悔的不是让他们用 AI。
我后悔的是 3 月开始时我没明确立"引用核查"这一条铁规矩。
如果我去年 9 月就明确告诉他们"每篇论文投稿前我会随机抽查 5 条引用,找到任何一条伪造的,论文撤回重写",前 3 个月那 9 次伪造引用不会发生。
那 9 次伪造引用对应着 6 篇论文里嵌入的潜在问题。其中 3 篇我自己发现并要求他们重新修改才投稿,2 篇投出去被审稿人指出,1 篇接收发表后我至今心里都不安宁。
我后悔的不只是这 6 篇论文。
我后悔的是我作为导师,给了 AI 时代的博士生一个错误的初始信号。我没立硬规矩,他们就以为"这件事可以蒙混过去"。
蒙混过去的代价不只是 9 次伪造引用。是他们对"学术诚信"这件事的边界感被慢慢侵蚀。
3 月份的他们会本能地觉得"AI 编了引用很严重,必须改"。如果我那时候立了硬规矩,这种本能会被强化。
我没立。结果是他们这种本能反应在 6 个月里变弱了。他们现在的反应是"应付一下导师就行",而不是"这是学术不端的雷区"。
这种边界感的侵蚀是慢的、是不可见的、是 6 个月数据看不出来的。
但 10 年后看,这种早期形成的边界感差异,可能就是博士毕业后是不是会卷入论文工厂的关键。
我作为他们的导师,没给他们立好这条边界。
八、接下来 6 个月我打算做什么
写到这里得给一个具体的下一步。
我打算做三件事。
第一件,所有论文投稿前我亲自走一遍五步核查。即使数量翻倍我也要做。这是把规矩立硬的唯一方式。如果时间不够,我宁可推迟投稿,不愿意让伪造引用流出去。
第二件,每周组会专门留 30 分钟讨论身份焦虑。我不知道怎么处理这种焦虑,但我至少要给他们一个讨论这件事不会被觉得'矫情'的空间。也许集体讨论本身就有帮助。
第三件,保护我跟学生"逐字逐句争论"的时间。我准备把每周固定 2 小时空出来跟一位学生坐下来逐句改一段她正在写的 Draft。不让 AI 介入这个过程。这件事对我来说有点像是抢救一种正在消失的师生互动方式。
这三件事我都不确定效果会怎样。但比起 3 月份那种"我立了实验然后看着结果"的姿态,主动一点总比被动好。
写在最后
如果你也是导师,正在带学生用 AI 工具,我想分享一个建议。
不要等 6 个月数据出来才立规矩。
3 月就立。立得越早越好。早立和晚立差别可能是几篇论文的伪造引用,是学生学术诚信本能的强弱,是 10 年后他们是不是好的学者。
如果你是博士在读,我也想说一件事。
身份焦虑是真实的,不矫情。你不是在变弱,你是在重新定义"做研究"这件事,而这件事难,但你不孤单。
我自己作为副教授,也在经历相似的身份焦虑。"我做的科普还算研究吗","我花时间研究 AI 工具是不是耽误了我自己的研究"。
这种焦虑我没想清楚怎么处理。
我们只能一起摸索。
如果你也做了类似的实验,或者你自己作为博士有真实的 6 个月使用 AI 的感受,评论区告诉我。
工具会换。焦虑会留下。
夜雨聆风