七月的空气里弥漫着一种荒诞。
2026年7月23日深夜,全球数以万计的机器学习研究者同时按下了刷新键,NeurIPS主赛道的审稿意见回来了 博士生们屏住呼吸点开OpenReview,有人看到希望,有人看到绝望但今年,一种前所未有的诡异感正在蔓延:你分不清,写下这些意见的,到底是一个疲惫的人类教授,还是一个不知疲倦的大语言模型
就在这个微妙的时刻,Meta / NYU的AI研究者Ravid Shwartz Ziv发了一条推文,戳破了整个社区的默契:

▲ 那条让整个ML社区集体破防的推文:你用Opus 4.6写论文,审稿人用Opus 4.7写评审,你再用Opus 4.8写rebuttal,只希望讨论期关闭前Opus 5别发布。
但它好笑吗?好笑。它恐怖吗?更恐怖。
同一个供应商,三方对打:一场没有赢家的军备竞赛
先给不混AI圈的读者讲明白这件事为什么炸
NeurIPS(神经信息处理系统大会)是人工智能领域的"奥林匹克"之一你的论文能不能被接收,直接决定你的毕业进度、职称评定、实验室拨款流程是这样的:作者匿名投稿→审稿人阅读并打分写意见→作者收到意见后写rebuttal(反驳与补充)→领域主席(AC)综合讨论做最终决定
过去,这条链上每一环都是人在做。
现在?Ravid的帖子把真相扒了个干净,作者用Claude写论文,审稿人用Claude写评审意见,作者再用更新版Claude写反驳三方都在同一家公司(Anthropic)的产品线上疯狂内卷,唯一的区别是谁手里的版本号更高
这场军备竞赛像是同一个军火商卖给交战双方的荒诞戏剧
评论区的狂欢:当AI研究者开始自嘲
帖子炸开后,评论区迅速变成了一场集体精神分析
MIT背景的Ariel Noyman第一个把玩笑推向极端:

▲ "除非你用更强的Agent系统,它会改你的LaTeX代码、渗透审稿人的电脑、给你满分,顺便把另外67篇结果一样的论文全踩下去。"
Lucas Beyer,Google DeepMind的资深研究者,则把矛头指向了更高层级:

▲ "那AC(领域主席)也要再用一个模型把整条审稿链过一遍?对吧?对吧???"
三个问号,问得人脊背发凉。如果审稿人在用AI,AC在用AI,作者也在用AI,最终接收或拒稿的决定,到底是谁做的?
机器学习教授Andrew Gordon Wilson随后递来一把让人笑不出来的冷刀子:

▲ "如果模型写出'作者已回答我全部问题,我维持原评分',那我们就知道,它达到了AGI。"
这是一句精准的职业自嘲。在现实的rebuttal阶段,人类审稿人经常无论作者怎么回应,都死活不改分数Wilson的意思是:连这种"装死"的技能都学会了?那确实是通用人工智能了。
但另一面更魔幻:有人说AI审稿已经"碾压"人类
就在众人嘲笑"AI对打AI"的时候,一位NeurIPS领域主席站出来泼了一盆完全不同温度的水

▲ NeurIPS AC Peter Richtarik声称:执行得当的AI审稿,比人类审稿强10到100倍,远超20%-50%的幅度。
Peter Richtarik以AC的身份发了一条长推文,措辞近乎激进:在他处理的案例中,AI在数学漏洞检测、关键引用遗漏、新颖性证伪、实验问题定位上全面碾压人类审稿人他甚至提出了一个激进设想,先给所有投稿做一轮彻底的AI审稿,让作者在限期内迭代修改,再由人类AC根据修改轨迹做最终决定
他自己也承认:"一年前这还是无稽之谈"
与此同时,Gantavya Bhatt的声音代表了另一群人的心声,

▲ "说实话我宁愿收到Claude的审稿意见。至少它懂数学,不会问'正半定性跟特征值符号有什么关系'这种问题。"
而另一位审稿人Andreas K. Maier则贡献了全场最冷的评论:"我的审稿人没用AI他选择了,不读论文。"

▲ 有时候,人类根本没读论文。
会议方并没有坐以待毙,但局面已经拧巴
段子归段子,NeurIPS官方其实正在进行一场前所未有的制度试验

▲ NeurIPS 2026启动了正式的AI辅助审稿随机对照实验:无辅助 vs 开放式辅助 vs 结构化辅助,三种条件随机分配。
实验规则写得很明确:人类判断被增强而非替代;作者知情同意;审稿人自愿参与;模型侧零数据留存。 除了这个官方实验通道,任何审稿人私自把论文喂给ChatGPT或Claude都算违规,后果可能牵连其本人投稿,甚至被desk reject
组织方还在送审稿件中埋下了隐藏提示词陷阱

▲ 《The Scientist》报道:NeurIPS在送审材料中植入隐形指令,违规使用AI的审稿意见可能会吐出特征性短语,但这一做法本身引发了巨大争议。
有审稿人把PDF转Word时意外看到了隐藏指令,一度以为是作者搞的鬼批评者怒斥这是"预设恶意、腐蚀信任";支持者指出,其他会议用类似方法确实抓到了大量违规
与此同时,立场论文赛道直接祭出铁腕,

▲ NeurIPS立场论文赛道要求正文必须"实质性由人类撰写",约18.4%的投稿被直接desk reject,另有12.7%被要求提交"人类参与"证据。
近五分之一的投稿被拒之门外。 这已经是实际执行的清洗。
学术界的两极:停下来!vs 拥抱它!
在推文喧嚣的背后,两篇针锋相对的学术论文正在为这场军备竞赛的走向定调
反对派:Baumann等人的论文《Stop Automating Peer Review Without Rigorous Evaluation》(后获ICML 2026口头报告)指出两大致命问题,"蜂群效应",AI审稿人之间的意见高度同质化,削弱多元视角;以及"论文洗稿",用模型按审稿口味改写论文就能显著抬高AI评分,根本不需要改进科学本身

▲ 这篇论文的核心警告:当AI审稿人都说一样的话,"同行评审"就变成了"同模评审"。
建设派:Wei等人的论文则呼吁"ML社区必须建设AI增强的同行评审生态",强调投稿规模危机已刻不容缓,AI的使用方式、责任归属与审计机制都需要尽快落地

▲ 建设派主张让AI充当协作者,同时完善相关基础设施。
燃烧的元审稿者:模型把批评拉满,人类却更累了
军备竞赛最讽刺的后果是什么?AI让工作量暴涨,人的负担一点没少
研究者Djamé在讨论中几乎是带着怒气写下了这段话:
模型把"可批评点"的数量拉到了一个人类不可能逐条处理的量级,而会议流程又要求AC对每一条做出回应结果就是:AI产出了一座文本大山,人类被埋在底下
笑话的尽头,是一个没人能回避的问题
日本研究者荒川豊的引用转发,把整件事从笑话升格为时代注脚:

▲ "内容固然重要,但比内容更重要的,是你用的模型有多强。"
这句话听起来像玩笑。但当NeurIPS用陷阱抓审稿人、立场赛道清洗五分之一投稿、AC声称AI审稿强100倍、元审稿者濒临燃尽,所有这些信号叠在一起,指向的是同一个问题:
当生成式AI同时占领了写作与评价两端,科学评价里"人的判断"还剩下什么?
Opus 4.6写论文,Opus 4.7写评审,Opus 4.8写反驳版本号在涨,笑点在涨,焦虑也在涨。Ravid帖子里那个关于Opus 5的祈祷,透着整个学术共同体对自身存在意义的一声苦笑
模型会越来越强。眼下的问题是,人类准备好证明自己还在了吗?
夜雨聆风