
图片由AI生成
约2700字|预计阅读7分钟当生成越来越便宜,验证也正在变成普通人的日常能力。
一 ·
先讲这件事:AI给科学做了一次全面体检
这两天科技圈在传一件事,够劲爆:来自Together AI、NEC Labs America、罗格斯大学和斯坦福大学的研究者,做了一个基于GPT-5的论文检查系统,把发表在ICLR、NeurIPS和TMLR上的2500篇AI论文,拉出来重新查了一遍。
注意他们的规矩定得很克制:只查“客观错误”——公式写没写错,推导有没有漏洞,数据对不对得上。至于论文有没有创新、有没有价值,一概不管。就像质检员只看螺丝拧没拧紧,不评价这台机器设计得妙不妙。
结果出来,全网哗然。
99.2%
被检论文中至少被标记出一个问题的比例
4.66个
平均每篇论文被系统标出的潜在客观问题数量
54.0%
错误类型中占比最高的一类:数学与公式错误
3.8 → 5.9
NeurIPS论文被系统标出的篇均问题数,从2021年到2025年的变化,涨了55.3%
样本来自ICLR、NeurIPS和TMLR,共2500篇已经发表的AI论文。
看到这儿你可能倒吸一口凉气:连科学都这样,那还有什么是靠得住的?先别急,这个数字得拆开看,拆开之后,事情比“科学塌了”有意思得多。
二 ·
按老规矩,先把这个数字拆老实了
我一向的规矩是,越炸裂的数字越要先泼冷水。99.2%这个数,有三层水分得挤出来。
第一层:检查员自己也会看走眼。研究者让人工专家复核了系统标出的316个潜在问题,其中263个被确认,精确率为83.2%;在另一组人为注入的90个错误中,系统检出了60.0%。所以99.2%是“至少被标记一个问题”的比例,不是“已经确认有错”的比例。
第二层:大部分是小错。占比最高的是数学与公式问题,好比一篇好文章里的错别字,难看,但不一定让结论翻车。按不同平台统计,至少被标出一个“可能影响结果解读、复现或后续使用”的实质性问题的论文,占23.8%到36.0%。依然不低,但和99.2%不是一回事。
第三层,也是最重要的一层:这些错误不是这两年才有的,它们一直在那儿,只是过去很难被大规模复核。为什么?因为查不过来。以ICLR为例,年投稿量从2018年的1013篇涨到2026年的19619篇,涨了近二十倍。复核一篇论文费时费力,学术回报又有限,于是许多已经发表的东西,很少再被系统地重新检查。
拆完这三层,这条新闻真正的重点就露出来了。重点不是“科学家水平不行”——他们已经是人类里最严谨的一批人了。重点是另外两件事。

图片由AI生成
三 ·
第一件事:错误重复一千遍,就成了共识
这项研究提醒了一件比99.2%更值得警惕的事:一处错误如果没有被发现,就可能被后来的文献引用、再引用,沿着引用链一路传下去,最后变成“事实上的学术共识”。没人记得源头,也没人再回头查,大家只知道“前人都这么写”。
这个机制你熟不熟?太熟了。它根本不是学术圈的专利,它是所有组织的通病。
你们公司那份报表的口径,为什么是这个算法?没人知道,反正一直这么算。那个流程为什么要多盖两个章?说不清,前任交接的时候就这样。行业里那句人人引用的“经验法则”,源头可能就是多年前某个人拍脑袋的一句话,被转述了一万次之后,成了铁律。
我自己就中过这种招。开公司头几年,行业里流传一条铁律,说某类客户必须先做关系再谈方案,人人都这么讲,我也照着办了好几年,弯路没少走。后来碰上一个不吃这套的大客户,直接问我方案在哪,那单反而谈得最快。我这才回头琢磨:那条铁律到底是谁验证过的?追来追去,谁也说不出源头,它就是被转述出来的。
那一刻的感觉,跟今天看这份研究一模一样:你以为你学的是经验,其实你引用的是一篇没人复核过的论文。
很多所谓的共识,只是一个没人回头查过的错误。
过去这些东西之所以能一直传下去,原因和论文一模一样:查证太贵。谁有空去翻十年前的邮件、考证一个口径的来历?于是“大家都这么干”成了最省事的答案。直到现在,情况变了。
四 ·
第二件事:验证,突然变便宜了
这才是这条新闻真正的分量所在,我把它称为第二只靴子落地。
第一只靴子是“生成变便宜”,这两年大家都见识了:写东西、出图、做视频,成本不断下降,内容迅速增加。与此同时,这项研究在样本中观察到,NeurIPS论文被系统标出的篇均问题数从2021年的3.8个升至2025年的5.9个。产量越来越大,质量控制的压力也越来越重。
而这次的研究宣告了第二只靴子:验证,也变便宜了。过去复查论文高度依赖专家逐篇阅读,现在机器可以先做大规模筛查,再把可疑之处交给人确认。当“查”的成本不断下降,一个新的时代就开始了:生成便宜,让内容迅速增加;验证便宜,让未经核实的内容更容易被发现。
这两只靴子先后落地,合起来是一个完整的闭环。前一只制造了洪水,后一只带来了筛子。洪水冲了两年,筛子刚刚就位——而筛子一旦就位,它筛的就不只是论文了。简历上注水的项目经历,报告里没核实过的引用数据,方案里“据说很有效”的老办法,PPT里那条来路不明的行业铁律,理论上,现在都进入了“随时可以被便宜地查一遍”的射程。
这个变化我在自己的工作里已经用上了。现在我写任何一篇涉及数据的稿子,交出去之前都多一道工序:让AI把文里每个数字的来历过一遍,哪个是多方证实的,哪个只有单一来源,哪个查无出处。这道工序以前想都不敢想,雇个事实核查员比雇个写手还贵;现在成本低了很多,花的主要是几分钟。
说白了,验证从一种奢侈品,变成了一个顺手的习惯,而习惯这东西,谁先养成谁占便宜。
以前,造的成本低;现在,查的成本更低。
五 ·
验证时代,中年人该自查的三件事
说到这儿,落到你我身上。验证时代对普通人意味着什么?我建议每个中年人对着这三条,给自己也做一次“论文体检”。
1 · 查一查:你的本事里,有多少是“引用来的共识”
你深信不疑的那些职业经验,哪些是自己在真实世界里验证过的,哪些只是“师傅当年这么教”“行业一直这么说”?前者是你的资产,后者是挂在你名下的引用文献,而引用文献,是会被查出问题的。分不清这两者的人,验证时代最危险;分得清的人,把“引用”重新验一遍,它们才真正变成你的。
2 · 改一改:交活之前,先让AI当你的审稿人
系统平均每篇论文标出4.66个潜在客观问题,不丢人,关键是别把机器的标记直接当成定论。这个顺序完全可以反过来用:任何要交出去的东西,方案、报表、合同、汇报,发出去之前先丢给AI,让它专挑毛病:数据对不对,逻辑通不通,有没有前后矛盾。它挑出来的未必全对,但哪怕帮你拦下一个硬伤,都值。让AI先挑你的错,好过让别人用AI挑你的错。
3 · 攒一攒:只攒经得起复查的东西
验证时代最大的红利,属于那些东西经得起查的人。你说你带过团队,拿得出当年的成绩和口碑;你说你懂一个行业,经得起内行三个问题的盘问。这种人过去和注水的人混在一起,不好分辨;现在筛子来了,水一退,他们反而显了出来。做实的人等这个时代,等了很久了。
六 ·
最后说句实话
回到那份体检报告。在2500篇已经发表的顶级AI论文中,99.2%至少被系统标出一个潜在问题,平均每篇被标出4.66个。
我看完的感受不是幸灾乐祸,反而有点释然:原来人类的知识大厦,本来就是这样一边出错一边盖起来的。
出错不可怕,可怕的是错了没人查、查了没人改,一路传成共识。
现在,查的能力来了,而且便宜。这对糊弄的人是坏消息,对做实的人是大好消息,因为真功夫从来不怕复查,怕复查的,从来都不是真功夫。
所以今晚可以干的事很简单:把你手头正要交出去的那份东西,先丢给AI查一遍。
体验一下当“被审稿人”的滋味,也顺便看看,自己的活,经不经得起这个刚刚到来的时代。
— · —
王 二 导
50岁不清零 · 换个打法
记录一个中年人
用AI把自己重新组织起来的全过程
夜雨聆风