夜雨聆风学习资料网

ARTICLE · 1154252

AI血洗顶会评审!人类神作惨遭垫底,4大巨头模型竟暗中达成“学术合谋”

AI血洗顶会评审!人类神作惨遭垫底,4大巨头模型竟暗中达成“学术合谋”

— 作者 —LinkerZ

— 编辑 —临界点

一篇在世界顶级人工智能会议上斩获最高荣誉口头报告(Oral)的脑科学神作,如果交给如今最聪明的 AI 去审,能拿第几名?

答案出乎所有学者的意料:第 6,274 名。

几乎垫底

这项测试并非恶作剧,更非偶发个案

2026 年 10 月,顶尖 AI 机构 Anthropic 的研究员 Shayne Longpre 与卡内基梅隆大学(CMU)博士生 Seungone Kim,悄悄干了一件“大逆不道”的事:他们把全球机器学习顶级盛会 ICML 2026 录用的整整 6,617 篇论文全部打包,交给全球最强的这批大语言模型,让它们扮演最高权力层级的领域主席(Area Chair)。

通读、批判、两两厮杀,然后重新排出一份属于 AI 自己的“琅琊榜”。

▲ 项目主页首屏:AI 领域主席给出的世界前五篇论文

结果公布的瞬间,迅速在学术圈掀起巨大波澜。

人类评审视若珍宝的研究,被 AI 随手扔进了垃圾桶;而在会议上被人类打低分、只能挤在墙角贴海报的边缘论文,却被 AI 一路捧上了世界之巅。

来自四家互为竞对的大厂模型,在评判标准上展现出高度一致的默契。

一场关于“什么是好科学”、甚至关乎人类探索未来的权力争夺战,就这样在冰冷的服务器机房里悄然打响。

01致命异常:两份榜单的“平行宇宙”

在顶尖学术会议上,论文过审只是第一步。论文会被分为不同的展示层级:只有极少数百里挑一的顶级佳作,才能获得Oral(口头报告),登台向全世界学者演讲;稍次一点的是 Spotlight(聚光灯展示);其余绝大多数,只能分配到一块展板做 Poster(海报展示)。

按常理推断,人类精挑细选出来的 Oral,AI 哪怕品味再怪,也总得给几分薄面吧?

现实却给了人类一记响亮的耳光

▲ 官方统计图:人类眼中的神作,在 AI 榜单里几乎完全失效

研究人员用统计学指标 Kendall’s τ 来衡量 AI 排名与人类评审的一致性。这个数值如果等于 1,说明两边完全步调一致;等于 0,说明两边毫无关联,纯属随机抛硬币。

结果,AI 排名与人类展示层级的相关性只有 0.08,与人类审稿打分的相关性同样只有 0.08。

0.08 是什么概念?这几乎比闭着眼睛抓阄高不了多少!

在人类领域主席评出的全部 Oral 论文中,只有四分之一能挤进 AI 榜单的前 10%;整整 75% 的人类高分成果,在 AI 看来都平平无奇。

反过来,夺得 AI 榜单全球第一名的论文,Spurious Rewards: Rethinking Training Signals in RLVR,在人类评审手里只拿到可怜的 4.00 分(满分 6 分),在 ICML 会场里只能灰溜溜地去站海报展台。

AI 评出的全球前十名里,竟然只有四篇在人类侧获得了 Oral 或 Spotlight!

人类与 AI,仿佛生活在两个完全互不理解的平行宇宙。

02调查追凶:让 6600 篇论文互掐的“超级斗兽场”

为什么会出现如此巨大的撕裂?

难道是模型的幻觉在胡言乱语?还是提示词写得太粗糙?

为了查明真相,研究团队公开了他们设计的六阶段递进式漏斗架构。细看这套流水线,AI 的筛选极为严谨,甚至比疲惫的人类审稿人还要严苛。

▲ 耗资极低却精密运转的六阶段 AI 评审流水线

面对 6,617 篇终稿,最理想的做法本该是让最顶级的大模型两两捉对厮杀。但那样需要比对 2,189 万次,耗资数百万美元,没人烧得起。

于是,他们搭建了一台精密的“学术粉碎机”:

  1. 绝对脱敏(Stage 01)
    :剥离作者姓名、机构、基金和致谢,切除参考文献与附录,只留前 9 页纯正文,禁止联网搜索。消灭任何“看人下菜碟”的学术人脉光环;
  2. 大通量海选(Stage 02)
    :动用 4 款平价模型,每篇论文随机扔进 8 篇一组的卡池,进行强制排序;
  3. 高阶挽救(Stage 03)
    :换用 GPT-5.6 Terra 和 Claude Sonnet 5 开启深度思考模式。这里设置了“分歧挽救机制”:一旦两款模型产生剧烈争议,论文不予淘汰,直接保送下一轮;
  4. 多模态专家门诊(Stage 04)
    :250 篇决赛圈论文,由 GPT-5.6 Sol、Claude Fable 5 和 Gemini 3.1 Pro 逐页精读完整 PDF,给技术可靠性、新颖性、影响力等 6 个维度出具严谨的结构化裁判卡;
  5. 瑞士轮与车轮大战(Stage 05 - 06)
    :172 篇论文展开 10 轮瑞士轮电竞式排位赛,决出前 60 强;前 60 强再进行全通量单循环车轮战(整整 1,770 场肉搏对决),最终由战绩积分敲定王冠归属。

但在这套严丝合缝的工程里,研究人员顺手抓到了一个极其荒诞的模型生理缺陷:

位置偏差(Position Bias)。

大模型居然也会像偷懒的考生一样,习惯性偏心“排在提示词前面的选项”!在第二阶段,只要把论文在输入文本里的顺序调换一下,论文的名次平均会暴动 230 名。原先排名前 50 的论文,校正位置后直接惨死了 27 篇,只剩 23 篇保住席位。

即便修补了人类留下的工程漏洞,榜单结果依然没有向人类妥协半分。

这说明,评价体系的巨大分裂,根源直接指向了两套评价哲学的分道扬镳。

03惊人内幕:四巨头背地里的“审美合谋”

紧接着公布的第三项发现,将这种审美差异推向了高潮:

参与海选的四款模型,分别来自当今 AI 战场上杀得你死我活的四家巨头:英伟达的 Nemotron、谷歌的 Gemini、OpenAI 的 GPT、以及马斯克旗下 xAI 的 Grok。

在商战里,它们为了争夺霸权寸土不让。但在面对同一批科学论文时,奇迹发生了:

▲ 四大巨头模型彼此惺惺相惜,与人类却集体决裂

它们彼此之间的排名相关系数,高达 0.57 到 0.71!而它们任何一个跑去跟人类审稿均分相比,相关系数全在 0.07 到 0.10 的地沟里趴着。

这是什么概念?

人类审稿人经常吵得不可开交,一个打 1 分一个打 5 分是家常便饭。人类的不同意,是向着四面八方的散乱分歧;但四款不同架构、不同公司训练出来的 AI 产生偏离时,却朝着同一个方向死命地拐弯!

它们到底把什么东西踩在了脚下?又把什么捧上了神坛?

翻开数据分类表,真相触目惊心:

在 AI 评出的大奖前列里,可复用的核心算法、评测体系、基础系统被大量塞满;而那些与现实场景结合的“应用方法类论文”(Application Method),在人类 Oral+Spotlight 里占了 11.2%,但在 AI 眼里几乎被直接灭绝,只剩下可怜的 1.5%!

▲ 学者讨论 PhenoBrain 的遭遇:因专注临床应用而惨遭 AI 驱逐

文章开头提到的那篇 PhenoBrain 就是最凄惨的典型。

那是一篇利用脑网络分析预测临床表型的高水平研究,人类评审惊叹于它在医学上的落地价值,慷慨赋予 Oral 桂冠。

但在 AI 的终审裁决卡上,模型冷冰冰地写下一行死刑判决:“该工作的价值主要局限于临床神经科学,缺乏对广义机器学习领域的普遍影响力。”

什么具体病人,什么临床价值只要成果无法通用于大模型基础设施,在 AI 看来,就只是缺乏通用意义的“边角料”。

04终极对决:一场关于“新颖”与“票房”的哲学背叛

为什么 AI 会形成这种近乎冷血的功利主义审美?

第四阶段打分揭开了核心分歧的谜底。研究人员把六个维度的考核分,分别与 AI 总分和人类审稿分做了斜率对照:

▲ 价值取向的彻底对折:AI 崇拜影响力,人类奖励新颖性

两根线条,在图表中央画出了一道残酷的交叉:

  • 预测领域影响力(Predicted ML Field Impact)
    :在 AI 眼里权重排在第一(相关度 0.80);但在人类审稿人眼里,权重排在倒数第一(相关度 0.06)!
  • 方法新颖性(Novelty)
    :在人类审稿人心里是至高无上的第一准则;但在 AI 眼里,被随手扔到了倒数第二。

AI 看重可预期的广泛传播与确定性成效;人类学者则珍视开创性的未知探索,哪怕新想法此时此刻看起来尚显稚嫩。

斯坦福学者 Yoonho Lee 在其著名的《What Is Taste?》一文中曾写下一个极妙的讽刺:

如果你试图用论文未来的“引用量”去训练大模型的学术品味,那就像是用“院线票房”去训练一个奥斯卡影评人。

最后选出来的,一定是流水线制造、工业化堆料、保底十亿票房的爆米花爽片;而那些百年不遇、晦涩难懂的影史杰作,会被当场枪决。

如今的 AI 领域主席,正在扮演这样一个只看票房的影院经理。它喜欢大而化之的算法、通用即插即用的积木,排斥一切扎根于泥土的专业探索。

05最后的警钟:在算法的世界里,人类唯一的职责是“唱反调”

如果事情仅仅停留在“一次有趣的学术打榜”,那不过是一场茶余饭后的谈资。

这项实验带给科学界的深层冲击,在于它对未来科研生态的警示。

当越来越多的博士生、科研人员开始用 AI 找选题、润色论文、甚至协助审稿时,当所有人都习惯性地向那几款主流大模型请教“这个课题值不值得做”时,会发生什么?

来自全世界的青年大脑,将会被引导向同一个平庸的共识。

科学史上那些伟大的突破,往往来自某些不可理喻的偏执狂:或许是因为师承谱系的一个古怪执念,或许是因为昨夜酒桌上与朋友的一场争吵,甚至仅仅是因为某位学者难以割舍的研究直觉。

这些方向绝大多数都死掉了,但那极少数改写文明进程的奇迹,从来没有任何模型能够提前预测。

面对四款模型的步调一致,作者 Seungone Kim 在推特上留下了掷地有声的一句话:

▲ Seungone Kim 的推特独白:在 AI 时代,人类的角色是不同意

“在自主研究代理人(AI Agent)接管一切的世界里,人类唯一的角色,就是去唱反调(to disagree)。”

在社交媒体上随口附和或者出言讽刺,成本极其廉价。但当 AI 调动全部算力、挥舞着概率分布宣告“这个方向毫无前途”时,仍然有人愿意付出自己的五年、十年甚至一生,去死磕那篇被模型排在最后一名、被算法判处死刑的冷板凳。

这种堂吉诃德式的执着与反叛,才是人类赋予科研探索最宝贵的火种。

相关学习资料