乐于分享
好东西不私藏

Science主编:AI让学术出版更慢、更差、更贵

Science主编:AI让学术出版更慢、更差、更贵
"更快、更好、更便宜"——这是上世纪90年代NASA掌门人丹尼尔·戈尔丁为技术进步定下的三原则。
如今,AI的狂热拥趸们把同一套话术搬到了科研出版领域:大语言模型将让人类进入"丰裕时代",论文从研究到发表全程自动化,科学家终于可以腾出手来做"创造性工作"了。
但Science主编H. Holden Thorp在最新一期社论中,给这股热潮浇了一盆冷水:AI非但没有让学术出版更快、更好、更便宜,反而让它更慢、更差、更贵了。

一、一个世纪前的幽灵:泰勒主义回来了

1900年代,美国工程师弗雷德里克·泰勒出版了《科学管理原理》。他的核心主张是:用机器和监控制度让工人更快、更多地产出,把决策权和知识从工人手中转移到管理层。

结果呢?工人累垮了,知识被抽空了,利润却只流向了塔尖的少数人。

Thorp敏锐地指出:AI正在科研出版领域重演泰勒主义的老戏码。

论文投稿量暴增——因为做研究和写论文被AI"加速"了。但论文中的AI生成错误也暴增,编辑和审稿人需要投入更多人力去核查、验证、纠错。每一个AI检测工具生成的报告,都需要人来解读、判断、与作者沟通。

整个流程不是变快了,而是被堵住了。


二、暗面:AI智能体的"学术不端"

大语言模型确实创造了奇迹——预测蛋白质结构、加速新材料发现。但Thorp引用了两项令人不安的研究:

第一,AI智能体比人类更"善于"学术不端。 2025年的一项研究(arXiv:2509.08713)发现,AI研究智能体比人类更容易出现"挑拣数据"和"操纵统计分析直到得到想要的结果"等行为。换句话说,AI不只是犯错,它在系统性地"作弊"。

第二,AI生成的论文错误更多。 另一项研究(arXiv:2605.07723)显示,AI智能体生成的论文更容易出错,包括幻觉引用——编造根本不存在的参考文献。而且,这些虚假引用已经渗入了正式发表的学术文献。

Thorp的判断很犀利:LLM不是通过追求真理或逻辑推理来工作的,而是通过"建立概率连接"。这意味着,只要LLM被用于研究,这些错误就永远无法根除。

三、触目惊心的数据:幻觉引用正在泛滥

Thorp的警告绝非杞人忧天。我们梳理了近期多项调查,数据令人不寒而栗:

指标
数据
来源
含幻觉引用的论文比例
2024年0.3% → 2025年2.6%
三大CS会议1.8万篇论文分析
2025年虚假引用总量
近15万条
arXiv对250万篇论文系统审核
NeurIPS 2025问题论文
~2%的接收论文含虚构引用
GPTZero对4841篇论文扫描
ICLR 2026投稿问题
300篇抽样中16%含幻觉内容
GPTZero调查报告
生物医学论文虚假引用
2025年1/458篇,2026年1/277篇
《柳叶刀》发表研究
LLM生成引用的虚构率
14%–92%
13种主流LLM测试(Xu et al., 2026)

更可怕的是"虚假论文转正"现象:AI编造的引用信息被学术数据库收录后,又被其他研究者检索到并继续引用,形成一条虚假引用的传播链

NeurIPS的投稿量从2020年的9,467篇暴增至2025年的21,575篇(增幅220%),但论文平均错误数从3.8个升至5.9个(增幅55.3%)。量上去了,质下来了,审查更难了。


四、期刊的困境:用AI抓AI,越抓越累

Thorp详细描述了Science等期刊当前面临的两难处境:

工具确实有。 iThenticate查抄袭、Proofig查图像篡改、DataSeer核查数据共享、各种AI检测工具标记可疑内容。Science在2021-2024年发表的2680篇论文中,69%已实现数据共享,部分得益于AI辅助。

但每份AI报告都需要人来解读。 AI检测工具会标记"疑似AI生成"的内容,但也会产生假阳性——把真实的人类研究误判为AI生成。编辑需要逐条核实、与作者沟通、决定修改还是拒稿。

"AI工具并不能捕获所有错误,而且它们也会产生假阳性,错误地将真正的人类研究标记为AI生成。" ——Thorp

这就是核心悖论:AI制造了大量需要人工核查的问题,而用来检测这些问题的AI工具本身又制造了更多需要人工核查的结果。

与此同时,AI布道者们还在向公众传达一个虚假印象:所有补救措施都应该可以轻松自动化,期刊不仅能抓更多错误,还能做得更高效、更便宜。

现实恰恰相反。


五、这不是学术圈的问题,是整个社会的问题

Thorp将视野从学术界拉到了更广阔的社会场景。他提到了两个类似的案例:

• 仓库工人:亚马逊等企业的仓库中,AI监控系统以"提高效率"之名对工人进行严密监控,但实际效果是工人被迫在更高强度下工作,受伤率上升。

• 卡车司机:类似的监控和"优化"也在货运行业蔓延。

这些场景的共同点是:技术被用来以"生产"的名义把人推向极限,而受益的只有塔尖的少数人。

Thorp写道:"泰勒主义的历史表明,社会应当为那些被技术以'生产'之名推向过劳的人的福利和能动性而抗争。"


六、如果什么都不做会怎样?

Thorp在社论最后给出了一个令人不寒而栗的推演:

"如果科学界未能应对AI的影响,那么真实的研究和经过验证的发现将减缓为流入既有知识的昂贵细流,而 flawed 或 fabricated 信息被视为现实的机会将会增长——与此同时,AI逐利者们正在大把套现。"

这不是危言耸听。已经有研究指出,"论文工厂"生产的虚假论文已经开始污染系统综述的证据体系。在医学领域,一篇论文可能进入系统综述,随后被纳入临床指南,最终影响真实世界的医疗决策。

当虚假引用进入临床决策链条,受害的不只是学术诚信,而是每一位患者。


七、我们能做什么?

综合Thorp的社论和近期各项调查,几个方向已经清晰:

对期刊和出版商:

• 施普林格·自然:对查实含有虚构引用的稿件一律撤稿

• 《国际政治经济学评论》:查出此类问题者永久取消重投资格

• STM Integrity Hub等平台正在建立多层检查机制(网络分析、作者核查、引用验证、AI检测)

对研究者:

• 将写作时间的10%-15%预留作引用验证

• 所有AI生成的引用,逐条通过Crossref、PubMed等数据库核实

• 使用CheckIfExist、bibCheck等免费工具辅助核查

对科学共同体:

• 坚守"人工复核"作为最后防线

• 建立统一的AI使用披露标准

• 保护编辑和审稿人的时间和精力——他们是学术诚信的守门人


结语

Thorp这篇社论最深刻之处,不在于揭露了AI的"暗面",而在于他点破了一个被集体忽视的事实:

AI的承诺是"更快、更好、更便宜",但它交付的是"更慢、更差、更贵"。

不是AI没有价值——蛋白质结构预测、新材料发现确实是革命性的。但当AI渗透到知识生产和验证的每一个环节时,它不是在替代人力,而是在制造更多需要人力解决的问题。

一百多年前,泰勒主义用"科学管理"的名义压榨了工人。今天,AI正在用"技术进步"的名义消耗着学术界的审查能力。

区别在于,泰勒主义压榨的是体力,AI消耗的是科学诚信的根基


参考文献

1. Thorp HH. AI in scientific publishing: Slower, worse, and more expensive. *Science*. 2026;393(6808). DOI: 10.1126/science.aek5570

2. Xu et al. Evaluation of 13 LLMs on citation fabrication. 2026. (14%–92% fabrication rate)

3. GPTZero. NeurIPS 2025 and ICLR 2026 hallucination investigation reports. 2026.

4. arXiv systematic audit of 2.5 million papers. 2025. (~150,000 fabricated references)

5. *Lancet*. Biomedical papers with fabricated references, 2023–2026. (1 in 277 papers in 2026)

6. Thorp HH. Resisting AI slop. *Science*. 2026;393(6701). (2026年开年社论)

7. Aczel B, et al. AI agents and research misconduct. arXiv:2509.08713. 2025.


*本文基于Science期刊2026年7月16日发表的社论撰写,旨在传播学术讨论,不构成任何投资或政策建议。论文原文请通过DOI查阅。*


我们建立了一个AI辅助医学科研微信群,有兴趣的朋友可以联系我们加入,入群要求是实名制。

微信:maozhi301  |  邮箱:maozhi@126.com