乐于分享
好东西不私藏

AI扫描260万篇癌症论文:近10%带“论文工厂”文本指纹

AI扫描260万篇癌症论文:近10%带“论文工厂”文本指纹

如果有一天,你得知那些用来指引人类攻克癌症的研究中,每十篇就有一篇带着论文工厂的文本指纹,你会作何感想?

2026 年初,《英国医学杂志》(The BMJ)刊发了一项大规模筛查研究。来自澳大利亚和法国的统计学家与癌症专家,用 BERT 文本分类器扫描了 1999 年至 2024 年间收录于 PubMed 的 264 万篇原创癌症研究论文。

排查结果令整个医学界不寒而栗:

在扫描的 2,647,471 篇 癌症论文中,有 261,245 篇(占比 9.87%)的标题与摘要,与已撤稿的“论文工厂”论文呈现出相似的文本特征。

▲ 社交媒体对这项大规模筛查的概括

26 万个标记都应交由人工复核它们暗示,论文工厂的污染可能已深入癌症研究文献库。

这项宏观结果指向了一个工业化规模的科学诚信问题。

260万篇论文大体检:AI化身“科学垃圾邮件过滤器”

要想理解这项研究的震撼程度,首先得搞清楚什么是“论文工厂”(Paper Mills)

在学术界,“论文工厂”指批量生产低质量或伪造手稿、再出售论文或署名权的商业组织。

它们常依靠现成模板批量捏造数据、拼接 Western Blot 图片或复用叙述骨架,并把署名权出售给有发表需求的客户。

▲ 《英国医学杂志》(The BMJ)发表的癌症文献大规模筛查研究

过去,打假全靠学术侦探肉眼比对图片、手工核查数据,一年能揪出几百篇就已是极限。但在汹涌的造假洪流面前,这无异于用汤匙去舀干泄洪道里的水。

这一次,昆士兰科技大学(QUT)的统计学家 Adrian Barnett 和悉尼大学癌症专家 Jennifer Byrne 决定彻底改变游戏规则。

他们基于 BERT 变换器模型训练文本分类器。训练集包含数据库中 2,202 篇已撤稿且被标注为“论文工厂”产物的癌症论文,模型另用独立数据集验证。

这套系统的底层逻辑,就像我们手机里的“垃圾邮件过滤器”,骗子发垃圾邮件时往往会复用特定的句式结构和套话,论文工厂为了追求暴利和出产速度,同样会在标题和摘要里反复套用固定的语料模板。

这一方法让百万级文献的统一筛查成为可能。

▲ 线程对模型、时间趋势和高标记率癌种的概括

从1%飙升至16%:二十年间,谁在疯狂造假?

随着研究数据的层层展开,一个令人窒息的恶化趋势浮出水面:

1. 跨越二十年的“指数级繁衍”

在 2000 年代初期,被 AI 标记的疑似工厂论文比例约为 1%到 2022 年,这一数字超过 16%二十年间,标记率增至早期的十几倍

2023 至 2024 年曲线略有走平。研究者提出了出版界治理、模板变化和 PubMed 收录滞后等多种可能解释,现有数据无法判定主因。

2. 胃癌、肝癌与骨癌成为“造假重灾区”

造假者并非随机选择课题,而是极度偏好那些“模板通用、机制单一”的基础生物学赛道。

数据统计显示:

  • 胃癌(Gastric Cancer)
     标记率高达 约 22%
  • 骨癌(如骨肉瘤)
     标记率高达 约 21%
  • 肝癌(Liver Cancer)
     标记率达 约 20%

为什么是这些领域?因为在分子肿瘤学中,只要把“某种非编码 RNA(lncRNA/microRNA)调控某种癌细胞增殖与转移”的故事骨架搭好,中间换几个基因名、编造几组细胞实验图表,一篇“看起来无懈可击”的基础研究论文就出炉了。

临床终点、流行病学和人群队列等研究的标记率较低,约为 2% 以下。

3. 顶刊防线全面失守:影响因子不再是免死金牌

长期以来,学术界普遍存在一种傲慢的假设:“论文工厂只在给钱就发的小水刊里灌水,顶刊有严苛的同行评审,绝对安全。”

然而,BMJ 的这项研究无情地击碎了这个幻想。

在影响因子排名前 10% 的顶级期刊中,被标记的疑似假论文比例随年份一路上扬,2022 年同样突破了 10%。

在《美国国家科学院院刊》(PNAS)发表的另一项针对有组织学术欺诈的独立研究中,科学家们揭示了更残酷的真相:论文工厂不仅卖文章,还通过贿赂特刊客座编辑、操纵同行评审审稿人邮箱、甚至恶意抢注停刊期刊的域名,搭建了一条直通权威期刊的“走私绿色通道”。

细思极恐:假论文被引次数竟是真论文的2倍!

如果说假论文只是烂在故纸堆里,危害或许还算可控。但研究团队在后续追踪中,发现了一个令人毛骨悚然的怪异现象:

研究团队后续分析的一个高影响分子肿瘤学期刊子集显示,带有论文工厂特征的论文,被引次数约为对照论文的 2 倍。这是后续分析结果,不属于本篇 BMJ 论文的主结论。

这背后的运作机制极其险恶:后续分析还发现可疑论文之间存在互引现象,这类“引用圈”(Citation Cartels)可能抬高论文和期刊指标,使低质量成果看起来更具影响力。

而这直接引发了一场当代生物医学的灾难性连锁反应:

灾难一:临床转化研究被带进死胡同

医学科学家在寻找抗癌药物靶点、设计临床前试验时,往往会基于文献库中的高被引靶点展开攻关。一旦某个上游的“关键分子机制”是编造出来的伪命题,下游团队可能会耗费数年时间和大量科研经费,却在肿瘤细胞面前一无所获。

虚假信号会浪费研究资源,并可能拖慢对患者有意义的进展。

灾难二:AI制药的“地基塌陷”

许多“AI 驱动药物研发”(AI for Drug Discovery)系统会使用生物医学文献来训练模型或检索候选靶点。

当经过进一步核验的问题文献进入训练或检索语料,模型可能放大虚假信号。

生物科技从业者 Parmita 将关注点放在了可信数据上:

“生物学的瓶颈可能在于我们能否信任训练数据。”

现实版猫鼠游戏:三大期刊已悄悄开启“无感安检”

面对这项研究揭示的惨烈现状,学术出版界终于坐不住了。

据悉,目前已有某大型出版巨头旗下的 3 本国际期刊,在稿件提交系统中秘密接入了这套 AI 筛查工具。

每当有新的癌症相关投稿上传,系统就会在后台自动完成扫描,对文章的语言指纹进行风险评分。

编辑部决定不向投稿作者透露他们是否被 AI 标记

为什么要保密?

因为研究团队非常清楚:这是一场没有硝烟的算法军备竞赛。

一旦将判定规则公之于众,利润丰厚的论文工厂就会立刻利用大语言模型(如 ChatGPT)对文本模板进行针对性洗稿和对抗性微调,迅速抹掉旧有的 BERT 语法指纹。

这场由 AI 抓捕 AI、算法对抗算法的猫鼠游戏,才刚刚拉开序幕。

撕开遮羞布之后:评价机制也在塑造供需

BMJ 这项研究给出的 9.87% 是一个宏观统计筛查信号在研究设定的约 10% 基准情形下,标记结果的阳性预测值约为 0.7,意味着约三成标记可能是假阳性。对单篇论文的判定仍需人工和多模态证据。

但它像一根刺入学术界肌体的体温计,测出了整个系统正在经历的高烧。

为什么工业化的论文工厂能够长盛不衰?

因为在繁重的临床一线与科研考核双重挤压下,全球许多医疗体系与学术机构,依然将“论文篇数”与“影响因子”作为医生职称晋升、获得编制的唯一刚性指标。

一个每天要做三台手术、管几十个病人的临床外科医生,根本没有可能分身在实验室泡上几年做基础生物学实验。然而,制度却逼着他们必须拿出“第一作者基础研究论文”才能评上主任医师。

有畸形的考核需求,就必然会催生狂暴的灰色供给。

如果考核机制只问“发没发顶刊”,而不看“看好了多少病人”;如果学术期刊只顾收取高昂的版面费,而在同行评审中睁一只眼闭一只眼;那么,抓出一个论文工厂,还会有十个更懂 AI 的新型工厂在暗处野蛮生长。

AI 撕开了现代医学研究最不愿面对的一道伤疤。检测工具能帮助期刊定位可疑线索,评价与出版机制的改变则决定了论文工厂的需求能否被削弱。

毕竟,在与死神的赛跑中,人类经不起在谎言的地图上多绕哪怕一毫米。