乐于分享
好东西不私藏

顶刊也没拦住:一篇 AI 参与造假的论文混进 ES&T

顶刊也没拦住:一篇 AI 参与造假的论文混进 ES&T

一篇带着 75 页附录混进顶刊的论文

近日,Environmental Science & Technology 撤稿了一篇文章。

文章题目很长,Release of Fluoro-Contained Free Radicals and Polyfluorinated-Like Molecules from Photoaged Fluorinated Microplastics: Identification and Formation Mechanisms,中文大意是:光老化氟化微塑料释放含氟自由基和类多氟化分子的识别及形成机制。

文章信息

这篇文章原本讲的是 PVDF、PTFE 这类氟化微塑料,在紫外和氧化条件下老化之后,会不会释放含氟自由基,会不会形成一些类似 PFAS 前体的多氟化小分子。它拿出来的材料也很顶,SEM 图像、EPR 自由基检测、质谱分析、DFT 计算、ReaxFF 分子动力学模拟,几乎把环境化学机制论文里最有说服力的几套东西都摆上来了。

如果你做微塑料、PFAS、污染物转化,看到这套组合,第一反应很容易是,嗯,这东西挺扎实。

但这也是这件事最膈应的地方。

它不是那种一眼就能看出来的 AI 垃圾论文,不是标题都不通顺、图片手指多出来、参考文献乱编的低级翻车。至少从外观上看,它是一篇题目完整、实验对象明确、方法堆得很足、还带着 75 页 Supporting Information 的机制论文。

也就是说,它最吓人的地方不是“假”。

是它看起来很真。

整整75页补充材料

这篇文章的原文 DOI 是 10.1021/acs.est.5c08970。Crossref 记录显示,它 2025 年 12 月 10 日 online,2025 年 12 月 23 日正式进入 ES&T 第 59 卷第 50 期,页码 27583-27597。然后,2026 年 5 月 22 日,撤稿通知出来了,撤稿通知 DOI 是 10.1021/acs.est.6c06850

撤稿通知说了什么

撤稿通知

按撤稿通知的完整意思,它说的是下面这些事。

第一,这篇文章是作者自愿撤回的。

第二,撤回背景不是普通勘误,而是康涅狄格大学 Research Integrity Office 提出了要求。通知还写到,通讯作者和资深共同作者在 2026 年 3 月 4 日已经提出过撤稿请求。

第三,根据第一作者承认,论文和补充材料中的图像和结果存在抄袭、编造和/或伪造。

第四,通知明确说,这些问题由第一作者单独实施,方式包括 Artificial Intelligence and other means

第五,通知点名了一个具体抄袭对象,Supporting Information 里的 Figure S20 抄自 Waria 等人在 2009 年发表的论文 Figure 3,那篇论文的 DOI 是 10.2134/jeq2008.0361

第六,通知还点名了更大范围的问题,EPR 光谱数据、大部分计算结果,包括 ReaxFF 分子动力学模拟、质谱分析和 DFT 计算,被认定为通过人为操控与 AI 生成相结合的方式编造和/或伪造。

很尴尬。

这篇论文竟然不是被 ES&T 主动发现的一篇 AI 假论文,在网上也查不到任何相关的打假消息。

至少从通知能看到的流程看,更像是学校的研究诚信流程先把问题推到了台前,作者提出撤稿,ES&T 最后发布撤稿通知

这也让问题变得更尴尬。

图像、结果、EPR、质谱、DFT、ReaxFF 这些构成论文主要支撑的东西,被抄袭、编造或伪造了,而 AI 被写进了实施手段里。

换句话说,这不是文字层面的 AI 痕迹。

这是专业材料层面的造假。

第一处,Figure S20 抄图后换了科学语境

我去翻阅了相关的原文。

Waria 2009 原文的 Figure 3 是一组 atrazine 降解产物的离子色谱图,而这篇撤稿论文的 Supporting Information 第 73 页,Figure S20 也是 atrazine 及其转化产物的 EIC 图。放在一起看,前四条曲线的化合物标签和保留时间直接对上,Atrazine 22.87,Hydroxyatrazine 19.52,Deethylatrazine 18.62,Deisopropylatrazine 15.66。也难怪 ACS 撤稿通知会明确点名,SI 的 Figure S20 抄自 Waria et al. 2009 的 Figure 3。

图像对比

这是一处板上钉钉的证据。

如果只停在这里,这篇文章还像是一个传统的图片挪用案例。

真正让我后背发凉的是,顺着这张图往整个 SI 里看,问题并没有停在一张图上。

补充材料里清晰的 AI 痕迹

撤稿通知提到大部分计算结果造假,但未细说每一处问题。为了更快地找到补充材料的问题,我直接用 Codex 审查了所有材料,果然发现不少 AI 痕迹。

AI 的待办指令

在 SI 第 27 页,Table S7b 后面,出现了最像生成模板残留的一处痕迹:

残留指令

Replace quantifier/qualifier ions and match scores with your instrument’s NIST report values before submission.

在提交之前,请将量词/限定词离子和匹配分数替换为您仪器中的NIST报告值。

如果这些字段已经来自真实仪器报告,为什么最终 SI 里还会残留“投稿前请替换成你仪器报告值”的提示?

这个问题比较隐蔽。因为它出现在第 27 页。不过,我用 AI 审查揪出来了。

审稿人如果只是大致扫一眼 SI,很可能就过去了。

表题错位

再看 SI 第 49 页的 Table S17。

表题错位

表题写的是,0 到 80 天光老化过程中,TFE-O、CF3CHO、DFAA、HFPO、TFA 这些 PFAS-like fragments 的累计释放量,由 Py-GC/MS 和 LC-MS/MS 定量。

但表体不是释放量。

表体的列是 Scission SiteΔG‡ (Homolysis)ΔG‡ (•OH Attack)Barrier Reduction

也就是说,标题在讲分析化学里的“释放量”,表格内容却是计算化学里的“键断裂位置和反应能垒”。

这两个对象差得很远。

它不像一个数字填错了,更像是表题沿着前文的 PFAS release 主题往下续写,表体却接上了另一个 DFT/反应能垒主题。

这类错配,就是生成式拼装最容易露出来的马脚。

但这种马脚也很讨厌。

因为单独看表题,像论文。单独看表体,也像论文。只有把两者放在一起,才会发现它们讲的不是同一件事。

图注错位

Figure S8 也很典型。

图注错位

虽然不是我熟悉的研究领域,但 AI 揪出来了这个问题。

这个图讲的是 PVDF 和 PTFE 在暗处储存时,EPR 信号和自由基浓度怎么随时间衰减。上面两张是不同时间点的 EPR 谱,下面两张是归一化浓度 C/C0 随时间下降的散点。

乍一看没什么。

但你多盯几秒,会觉得很别扭。

上面的 EPR 谱线,0 h、1 h、8 h、33 h、95 h、240 h、320 h、620 h,几条曲线几乎只是被整体往上挪了一下,形状和峰强非常像。可下面的 C/C0 又在告诉你,自由基浓度已经从接近 1 掉到了 0.2 左右。

如果上面的谱图只是为了展示峰形,被归一化以后再垂直错开,那也不是完全不能解释。很多光谱图都会这么画。

问题是,图注没有把这件事讲清楚。更尴尬的是,图注里还写了 tri-exponential fit、95% CI 阴影、residuals、AIC/BIC inset 这些东西,但图里肉眼能看到的,基本就是散点。拟合线、置信区间阴影、残差小图,至少在这张图里并不明显。

这就不是“我看不懂专业图”那么简单了。

它更像是一个生成式拼装的痕迹,图像、数据表、图注,各自都像论文里的东西,但拼到一起的时候,互相对不上。

这也是我觉得它很值得写出来的原因。

很多人以为 AI 造假会留下特别明显的手印,其实未必。更麻烦的情况是,它生成出来的每一块都“像”,但块和块之间没有真正的实验逻辑连着。图像像,图注像,模型说明像,数值表也像。

拼起来就开始漏风。

耿同学.SKILL 的应用

接下来这几处,我换了另一种方式来审查。我使用了小红书上一个博主开发的skill,即 research-integrity-auditor(姑且称作耿同学.SKILL)。

学术打假 SKILL

这个 skill 不会直接写“这里造假了”,而是在图表解析和数字初筛里提示出来可疑模式。

它们的价值不是直接下结论,而是告诉你,这份 SI 里还有一些地方值得继续回到原始数据层面追问。

skill 提醒的模型和残差异常

research-integrity-auditor 把 Figure S6 的图表数据标了出来。

模型和残差异常

在 AI 提取的表格里,MeasuredModel A: 2-comp + g-strainModel B: 3-comp 多行数值完全一致。

接着下面一张残差表,Residual A 整列都是 -0.01Residual B 整列都是 0.01

真实拟合当然可能很接近,尤其是图像数字化之后,很多小差异会被抹平。

但这里的问题是,实测值、两个模型、残差说明同时呈现出一种过于机械的整齐感。它不能单独证明造假,但它和官方点名的 EPR 光谱数据问题放在一起,就不是一个可以轻轻放过的细节。

还有两处 skill 提醒的辅助疑点

我还看到两处可以作为辅助疑点,但不建议写得太满。

一处是 SI 里的 Table S10d 和 Table S10e。两个表的标题不完全一样,但表体几乎是同一套 power-saturation fit parameters,像是重复粘贴或者生成式复用表格。

Table S10d
Table S10e

另一处是 Figure S21 的校准曲线。AI 抽出来的数据里,Atrazine、DEA、DIA 的 data 和 fit 完全重合,表头里反复出现 R²=1.000。这不一定错,标准曲线理论上可以很线性,但“多个曲线全都完美到 1.000”,放在这篇 SI 的整体语境里,也像一个需要回原始仪器数据复核的点。

Figure S21

这两处我不会把它们写成“实锤”。

但它们能说明一件事,这篇 SI 的问题不是只集中在 Figure S20 那一张图上,而是很多地方都呈现出“表格、图注、数值、模型说明被拼装起来”的问题

这就回到了标题里的那个问题。

一篇带着 75 页附录的论文,到底是怎么混进 ES&T 的?

这不是一眼能看出来的假

以前我锤 Ecological indicators 的造假问题时,用肉眼就能识别其中的问题。

突发!一区TOP期刊Ecological indicators发表多篇问题文章

然而,现在的造假越发狡猾。

它不是正文里突然冒出一句“作为一个大语言模型”,不是图片一眼畸形,不是参考文献全是不存在的期刊。它的很多问题都披着专业形式,藏在附录里,藏在图注和表体之间,藏在模型结果和数据关系之间。

这也是为什么我不太想用“AI 假论文”这四个字简单概括它。

这四个字太轻了,会让人误以为它只是 AI 写作翻车。可这篇文章真正暴露的是另一种更难处理的东西,AI 和人为操控混在一起,把一堆看起来像科研材料的东西拼成了一篇可以投稿、可以审稿、可以正式发表的论文。

而且它真的发表了。

AI 让造假的成本降低了

我觉得这个案例真正值得警惕的地方,不是 AI 本身有多邪恶。AI 没有道德主体,真正危险的是,AI 让“伪造一整篇顶刊”这件事变得轻而易举。

过去你想造一篇像样的机制文章,至少要懂很多专业细节,知道 EPR 光谱该长什么样,知道质谱图该怎么编,知道 DFT 结果该怎么摆,知道分子动力学模拟该拿哪些截图。现在,只要有人有足够明确的坏心思,再加上一点专业知识,AI 可以帮他把很多“像真的东西”快速堆出来。

像真的图,像真的数据,像真的机制,像真的补充材料。

不是假东西变成真了,而是假东西越来越像真的。

我们平时读论文的时候,很容易被复杂性说服。图多,方法多,模型多,缩写多,一篇文章从 SEM 讲到 EPR,再讲到质谱,再讲到 DFT,再讲到分子动力学,好像天然就有一种权威感。但这件事提醒我们,复杂性不是可信度,复杂性有时候只是更高级的包装。

尤其是现在,AI 进入科研之后,最容易出问题的地方,可能不是正文里几句漂亮话。正文里的 AI 味儿,很多人一眼就能看出来。真正麻烦的是那些“专业对象”,光谱、图像、模拟结果、补充材料。它们看起来比文字更客观,所以更容易骗过我们的直觉。

你看到一张 EPR 谱,第一反应不会是,这是不是 AI 编的。你看到一个 DFT 计算结果,第一反应也不会是,它背后的输入文件、收敛过程、结构优化记录到底在不在。

这就是问题所在。

AI 时代的科研诚信,不能只盯着“有没有用 ChatGPT 写摘要”。那太浅了。真正需要追问的是,原始数据在哪里,仪器记录在哪里,计算输入文件在哪里,模拟轨迹在哪里,中间结果能不能复现,图像有没有原始文件,质谱峰的指认有没有证据。

顺着这件事再往前问一步,就会问到期刊。

我不想把所有责任都推给 ES&T。同行评审本来就不是刑侦,审稿人也不可能对每一张图都重新跑一遍取证分析。很多时候,审稿依赖的是作者诚信和可疑信号触发后的进一步追问。

但这篇文章的问题在于,可疑信号不是没有。75 页 SI 里有待办提示,有表题和表体错位,有图注声称的拟合要素和图像呈现对不上,有多处过于整齐的数值模式。哪怕其中一些只能算疑点,放在一起也足够让人停下来多问几句。

至少从结果看,很难说这份补充材料被足够细地拆开看过。

这才是 ES&T 在这个故事里最难看的位置。

不是它撤稿了。

是这样一篇东西,先发表了。

以后我们如何看待顶刊

这次 ES&T 的撤稿通知,其实把一个很现实的问题摊开了,高影响期刊、高级表征、多模型计算、漂亮机制图,都不能自动兑换成可信。

可信来自更笨、更慢、更烦人的东西,原始记录、可重复流程、同行能检查的材料,以及作者对每一个数字、每一张图、每一个结论负责。

所以我不想把这件事讲成“不要用 AI”。

这话太武断了。AI 可以帮科研人员整理文献、检查语言、写代码、画草图、做初步数据探索,很多时候它确实能提高效率。但当 AI 被用来生成不存在的数据、补不存在的实验、编不存在的模拟结果时,它就不再是工具箱里的扳手了。

它成了造假流水线的一部分。

这篇文章原本讲的是氟化微塑料老化之后会释放什么东西。现在,它真正留下来的问题反而变成了另一个,当一整套看起来很专业的图、表、谱图和模拟结果都可能被人为操控和 AI 生成混合制造出来,我们以后该怎么相信一篇论文?

我的答案可能很朴素,不要把高影响力当做科学,要相信那些能被追溯、能被复查、能被重复的东西。

AI 可以帮我们写得更快、算得更快、画得更快。但科学最核心的部分,还是那句老话。

你得真的做过。

你得真的有证据。

你得经得起别人问。

写在最后

最后也声明一下,这篇文章本身也用了 AI 工具。

我没有必要在一篇讨论 AI 和科研诚信的文章里装作自己完全没用 AI,那样反而有点荒谬。

这篇稿子里,我主要用了两个 Codex skill。

一个是 research-integrity-auditor,用来辅助检查 MinerU 解析出来的论文和补充材料,帮我建立证据索引,跑数字取证初筛,定位哪些表格、图注、谱图更值得人工复核。

另一个是 khazix-writer,用来帮我把材料整理成更适合公众号阅读的表达。

但这里面有一个边界要讲清楚,AI 能做的是整理、检索、初筛和表达辅助。哪些证据能写,哪些只能说是疑点,哪些话不能说过头,最后还是我自己判断

这也是我想借这篇文章反复强调的事。

AI 可以帮我们更快地看见问题,但不能替我们承担责任。

参考资料

  1. ACS 撤稿通知,DOI: https://doi.org/10.1021/acs.est.6c06850
  2. 原文记录,DOI: https://doi.org/10.1021/acs.est.5c08970
  3. PubMed 原文记录,PMID 41368800: https://pubmed.ncbi.nlm.nih.gov/41368800/
  4. PubMed 撤稿通知记录,PMID 42171226: https://pubmed.ncbi.nlm.nih.gov/42171226/
  5. Crossref 原文元数据: https://api.crossref.org/works/10.1021/acs.est.5c08970
  6. Crossref 撤稿通知元数据: https://api.crossref.org/works/10.1021/acs.est.6c06850
  7. 被撤稿通知点名的 Waria et al. 2009 论文,DOI: https://doi.org/10.2134/jeq2008.0361