乐于分享
好东西不私藏

AI 正在制造一场论文海啸

AI 正在制造一场论文海啸

如果 2030 年 CHI (CHI,即 ACM 计算机系统中的人为因素大会,是人机交互领域最重要的国际学术会议之一)收到 3 万篇投稿,会发生什么?

AI 正在把学术论文推向“生产过剩”时代

计算机科学领域正在出现一个很讽刺的局面:创造出大语言模型的 AI 学术共同体,如今正在被这些模型带来的后果反噬。

最直接的后果之一,就是论文投稿数量正在迅速膨胀。论文变得更容易写,投稿也变得更多,而原本依赖同行评审来维持质量的学术系统,正在承受越来越大的压力。

在 2026 年的一场主题演讲中,德国奥格斯堡大学的 Elisabeth André 提到了一个值得 HCI 领域警惕的例子:AAAI,也就是人工智能领域的重要会议。2023 年,AAAI 收到大约 9,000 篇投稿;到 2025 年,这个数字涨到了约 13,000 篇。仅仅一年后,AAAI 2026 的投稿量几乎翻倍,主会场收到了接近 29,000 篇论文,其中约 23,000 篇进入评审流程。参与投稿的作者超过 75,000 人。会议组织者不得不招募 28,000 多名评审委员会成员,几乎是上一年的三倍。

这意味着什么?不只是论文多了,而是整个学术评审系统被推到了极限。会议方需要处理海量投稿、分配评审、协调专家、回复邮件,还要保证每篇论文都能得到相对公平、专业的判断。AAAI 组织者自己也承认,会议的评审系统已经接近承载上限。

那么,这和 CHI 有什么关系?

CHI 是人机交互领域最重要的学术会议之一。它不像 AAAI 那样完全聚焦人工智能,但它同样受到 AI 写作工具的影响。2023 年,CHI 收到大约 3,200 篇论文投稿。到 2026 年,这个数字已经上升到 6,730 篇。也就是说,短短几年内,投稿量已经翻了一倍多,而且增长速度并没有放缓。最近一年的同比增长率高达 34%。

如果这种趋势继续下去,到 2030 年,CHI 可能会收到 15,000 到 20,000 篇投稿。更极端一点,如果它走上类似 AAAI 的增长轨迹,投稿量甚至可能达到 25,000 到 30,000 篇。

这不是一个纯粹的数字游戏。按照现在的评审制度,每篇论文通常需要多名审稿人和会议委员参与。如果 CHI 真有 30,000 篇投稿,就意味着需要十几万份评审意见。问题是,今天的学术评审体系根本不是为这个规模设计的。

表面上看,投稿量增长似乎说明学术研究很繁荣:研究者更多了,项目更多了,经费更多了。但事实并非如此。很多国家和地区的研发投入并没有同步大幅增长。也就是说,论文数量增长,并不一定意味着真正的研究能力也在增长。更可能的情况是:在差不多的资源条件下,人们正在生产更多论文。

这就是问题所在。

学术界早就有“发表或出局”的压力。论文数量、引用次数、h 指数、项目申请、职称评审,这些制度都在鼓励研究者不断发表。过去,写论文本身需要耗费大量时间和精力,这在某种程度上限制了论文生产速度。但现在,大语言模型降低了写作成本:它可以帮助研究者润色语言、组织段落、改写表达,甚至辅助生成文献综述和研究框架。

这对很多人来说当然是好事。尤其对非英语母语的学者来说,AI 写作工具可以降低语言门槛,让他们更公平地参与国际学术交流。作者也承认,自己写这篇文章时同样使用了这类工具。

但真正令人担忧的,并不是个人是否使用 AI,而是整个学术系统正在发生结构性变化。

当论文写作变得更快,投稿数量就会增加;当投稿数量增加,审稿人就会更加疲惫;当审稿人疲惫,他们也可能开始依赖 AI 来辅助评审。于是,一个新的循环出现了:由 AI 辅助写出的论文,正在被 AI 辅助的审稿意见评价。

这样一来,学术交流中最关键的部分可能会被削弱:真正的阅读、理解、判断和批判性思考。

同行评审原本依赖的是专家的细致判断。审稿人不仅要看论文写得是否流畅,还要判断它的问题是否重要,方法是否可靠,证据是否充分,结论是否成立,是否真的推进了知识。但如果写作者和评审者都在把一部分判断交给 AI,学术评价就可能变得越来越表面化。

更麻烦的是,过去我们常常会把“写得好”当成“研究质量高”的某种信号。虽然两者从来不能完全等同,但语言清晰、结构严谨、论证有力,通常意味着作者确实投入了大量思考。可是现在,AI 可以让一篇研究质量一般的文章看起来更流畅、更成熟、更像一篇“好论文”。这会削弱审稿人过去用来判断论文质量的一些线索。

换句话说,论文越来越多,而判断论文好坏的线索却越来越不可靠。

这对人文社科尤其值得警惕。因为人文社科研究本来就高度依赖语言、论证、解释和概念创造。很多时候,文章的价值不只来自数据或实验,也来自问题意识、理论敏感性、历史语境、文本细读和批判性判断。如果 AI 让“像论文的论文”变得越来越容易生产,那么我们就更需要区分:一篇文章只是写得像样,还是它真的提出了值得思考的问题?

作者指出,学术生态原本是为较慢的知识生产速度设计的。写论文曾经是一种智识劳动:它需要长期阅读、反复思考、与材料搏斗、修改论证。这个过程本身就是研究的一部分。但当 AI 大幅压缩写作时间,论文生产的瓶颈就会转移到更前端的问题上:你是否真的有重要的问题?是否真的有扎实的材料?是否真的做出了新的解释?是否真的进行了严肃的判断?

如果这些没有跟上,只是写作速度变快,那么学术界得到的就不是更多好研究,而是更多看起来合格、实际贡献有限的文本。

如果投稿增长不受控制,后果可能很明显:审稿质量下降,评审人疲惫,会议组织者不堪重负,越来越多论文在初筛阶段被拒绝,自动化筛选逐渐变成事实上的把关机制。真正有价值但不够“显眼”的研究,可能会淹没在大量平庸但包装良好的论文中。

更严重的是,学术共同体可能因此变得更加碎片化。大型综合性会议原本有一个重要功能:让不同方向的研究者相遇,产生跨领域交流。但当投稿量太大,会议可能不得不拆分成越来越多的小领域、小会场、小圈子。这样一来,知识之间的连接反而会减少。

作者并没有给出一个现成的解决方案。他更像是在提醒大家:我们应该把“2030 年 CHI 收到 3 万篇投稿”当成一个现实的风险场景,而不是遥远的想象。

这意味着学术共同体需要尽早讨论一些根本问题:现有的同行评审制度是否还能支撑如此规模的投稿?一年一次集中投稿、集中开会的模式是否还适合快速膨胀的研究领域?我们是否需要新的评审机制、新的会议结构、新的筛选标准?更重要的是,我们是否应该改革学术评价体系,让它少奖励“数量”,多奖励“深度”?

说到底,AI 并没有凭空制造学术界的问题。它只是放大了早已存在的问题:发表压力、数量崇拜、指标竞争、同行评审过载。过去这些问题已经存在,只是论文生产速度还没有这么快。现在,生产论文变得更容易了,而评价体系的激励却没有改变,结果自然就是更多论文、更快投稿、更疲惫的审稿人,以及更难判断的学术质量。

如果到 2030 年,CHI 真的收到超过 25,000 篇投稿,那就不只是会议组织上的麻烦了。它将说明,论文生产的速度已经超过了现有同行评审系统的承载能力。

在一个生产论文越来越容易的时代,真正稀缺的也许不再是写作能力,而是提出重要问题的能力、认真阅读的能力、判断证据的能力,以及在写作之前进行批判性思考的能力。

这或许才是 AI 时代学术界最需要守住的东西。

Johannes Schöning 是瑞士圣加仑大学 HCI 教授,同时也是穆罕默德·本·扎耶德人工智能大学的兼职教授。他致力于通过与个人和社群共同开发新型用户界面,帮助人们获得做出更好数据驱动决策所需的信息。