夜雨聆风学习资料网

ARTICLE · 1087586

AI翻出了科学界几十年的旧账:教科书上的数字,居然错了大半个世纪

AI翻出了科学界几十年的旧账:教科书上的数字,居然错了大半个世纪

AI智能体正在扫描一本沿用了数十年的化学参考手册,书页上被红圈标注的就是长期未被发现的沸点测量错误

学术探索

这是科睿研究院第872篇原创内容。

字数4340字,阅读全文大约需要8分钟。

2026年8月,《自然》杂志刊登了一则听起来有些不可思议的消息。中国浙江实验室的理论化学家塞巴斯蒂安·皮奥斯(Sebastian Pios)在用一个人工智能系统预测几种分子的沸点时,模型输出的数值与一本沿用了75年的权威参考数据库中的长期公认数据出现了冲突。起初他以为是模型出了问题,但当他手动翻查原始文献逐一核对后发现,错的不是AI,而是那本被几代化学家奉为圭臬的参考数据库中的数据。

doi: https://doi.org/10.1038/d41586-026-02235-8

这件事的意义远不止于纠正几个数字。它引出了一个更广泛的问题:在浩如烟海的科学文献和参考资料中,究竟还藏着多少类似的错误?这些错误又在多大程度上影响了后续的研究方向和结论?

01

AI当起了“审稿人”

皮奥斯的经历并非个例。在他使用AI模型核查数据库的过程中,还陆续发现了另外两处问题。一处是较老论文和参考书籍中的拼写错误,另一处则是一个存在了大约一个世纪的沸点测量数值偏差。皮奥斯指出,这两类错误都很可能给那些长期使用该数据库的研究人员带来过不小的麻烦。那些在某个关键节点查错了沸点数据的实验者,可能花了数月甚至数年时间去寻找实验失败的原因,却从未怀疑过自己手头那本翻得卷了边的参考手册。而那个简单的拼写错误,更可能在无数次文献引用中被原样复制,像滚雪球一样越传越广,直到某一天被一个AI模型偶然戳穿。

一个最初的拼写错误被后续无数篇论文原样复制,像滚雪球一样在科学文献体系中传播了数十年

事实上,越来越多的科学家开始把AI当作一种系统性核查科学知识的工具。除了检查数据库中的数值,研究人员还在使用专门的AI工具去搜索期刊论文和会议论文中的各类错误。

2026年7月22日,一家总部位于美国特拉华州的非营利研究评审公司Sal Labs的研究人员在线发布了一项分析结果。他们使用AI智能体对入选2026年国际机器学习大会(ICML)口头报告的168篇论文进行了全面评估。具体做法是,AI智能体首先提取每篇论文的核心主张,然后下载论文附带的实验资源和代码,在条件允许的情况下重新运行实验,最后将复现结果与作者报告的数据进行比对。在至少有五项核心主张可供评估的92篇论文中,AI智能体成功复现了其中34篇论文超过80%的主张。

这项工作如果由人类来完成,无论在时间还是人力成本上都将是难以承受的。168篇顶会论文的逐一复现,即使是一个大型评审团队也需要数月甚至更长时间,而AI智能体在自动化流程下可以在短时间内完成初步筛查。当然,这并不意味着AI的复现结果就可以直接采信,它只是把人工核查的范围缩小到了最需要关注的那些论文和主张上。

AI智能体对海量学术论文进行自动化扫描,绿色对勾标记验证通过的内容,红色叉号标记疑似存在错误的位置

斯坦福大学计算机科学家詹姆斯·邹(James Zou)认为,与人类相比,AI进行事实验证的最大优势在于它能够以人类根本无法企及的速度扫描科学数据库和文献。他和同事在预印本平台arXiv上发表了一项研究,使用AI“检查器”扫描了人工智能领域顶级会议NeurIPS从2021年到2023年间发表的论文。结果发现,论文中的错误比例从2021年的3.8%上升到了2023年的5.9%。

邹在接受《自然》采访时表示,这些论文都是经过同行评审后正式发表的,某种程度上被视为下一代研究的基础性知识。如果这些基础本身就存在错误,那么后续建立在其上的研究就会变得越来越不稳固。这个说法听起来有些危言耸听,但并非没有道理。科学研究的链条是环环相扣的,前一篇论文中的一个计算偏差,可能在后续无数次引用和推导中被放大,最终偏离实际情况十万八千里。

02

错误有多普遍?

邹团队的研究并非漫无目的地扫描所有文献。他们将AI的核查范围严格限定在“客观性”错误上,例如公式中的符号错误、计算结果的偏差、评估指标的引用错误以及图表中的数据矛盾等。对于数据解读是否合理、研究的创新性是否足够这类带有主观判断色彩的问题,他们有意排除在外。

作为该研究的共同作者,位于旧金山的Databricks公司的机器学习科学家费德里科·比安基(Federico Bianchi)明确表示,这是一种有意为之的设计选择。他说,AI不应该包揽所有事情,关于研究新颖性和重要性的判断应当留给人类。换句话说,AI目前更适合处理那些有明确对错标准的硬错误,而不是去评判一个研究的解释框架是否站得住脚。

这条界限的划定,既体现了研究者对AI能力边界的清醒认识,也反映了他们对科学评价中人文判断不可替代性的尊重。毕竟,一个研究的价值不仅取决于计算是否准确,还取决于它提出的问题是否重要、采用的方法是否恰当、得出的结论是否具有普遍意义。这些问题没有标准答案,AI在这方面的判断可靠性目前还没有得到充分验证。

这种对AI能力边界的谨慎态度并非没有依据。一项于2026年5月发布的预印本研究给出了一个令人警醒的数据:即使是在已知包含错误的论文集合中表现最好的AI模型,也只能发现人类审稿人标记出的错误中的不到五分之一。更值得注意的是,这些AI模型还会产生所谓的“假阳性”,也就是把本来正确的内容错误地标记为错误。

这意味着,如果完全依赖AI来筛查论文,大量真正存在的错误可能会被漏掉,同时还有不少本来没问题的论文可能会被冤枉。对于科研工作者来说,无论是漏检还是误判,都会造成实实在在的效率损失。漏检意味着错误的研究结果继续在文献中传播,误导后续的研究者;误判则意味着作者需要花时间去反驳一个本来就不存在的问题,甚至可能因此对投稿工具本身产生抵触情绪。

AI的检测能力如同放大镜的光锥,只能覆盖部分论文和主张,光锥之外仍有大量未被发现的错误,右侧的人形轮廓代表需要人工补充的核查范围

不过,AI工具在科研过程中确实展现出了不可忽视的实用价值。一项对733名向2025年国际学习表征会议(ICLR)投稿的研究人员的问卷调查显示,36%的人表示谷歌推出的Paper Assistant工具在他们的论文中发现了此前被忽略的错误,31%的人表示工具给出的反馈直接促使他们开展了新的实验来验证或修正原有结论。麻省大学阿默斯特分校的数学家勒辉(Hui Le)表示,这些AI系统可以作为第二双眼睛来捕捉一些人类容易忽略的小疏漏,比如公式中的下标错误、图表与正文不一致的地方等。

但他同时强调,不应该在没有人工核实的情况下就盲目相信AI检查工具的输出结果,因为这些工具完全有可能把准确的发现错误地标记为问题。勒辉还指出,AI审稿有时会忽略论文中隐含的某些假设,或者凭空编造出一些实际上并不存在的问题。如果一篇正确的论文因为AI的误判而被认为有问题,那造成的科研资源浪费和学者信誉损失将是难以估量的。

03

人工把关仍是不可替代的环节

挪威科技大学计算机科学家奥德·埃里克·冈德森(Odd Erik Gundersen)的观点更为直接。他认为,目前的AI事实核查工具仍然是科学文献不可靠的仲裁者。这些工具“和人一样会犯错”,因此AI核查的结果必须经过人工监督流程的处理才能被采信。冈德森的话点出了一个核心矛盾:AI被设计出来是为了帮助人类发现错误,但AI自身也是由人开发和训练的,它在训练数据中看到的错误、在模型参数中固化的偏见,都可能导致它在核查过程中产生新的错误。用AI来核查AI时代的论文,某种程度上陷入了一种循环论证。

正是出于这些考虑,目前一些AI核查系统的设计理念已经发生了微妙的转变。与其让AI直接对论文的正误下结论,不如让它只负责标记出可能存在问题的位置,然后把最终的判断权交还给人类专家。这种做法的好处是显而易见的:AI负责处理海量的文本扫描和比对工作,把人类审稿人的注意力引导到最需要关注的地方;人类则利用自己的专业判断力和领域经验,对AI标记出的疑点进行深入核查。这种分工模式既发挥了AI在速度和规模上的优势,又保留了人类在复杂判断上的可靠性。

科研人员在书桌前审阅AI标注后的论文,右侧全息界面显示AI初步筛查结果,最终判断仍由人类专家做出

为了更系统地评估AI核查工具的实际可靠性,一些研究团队也在开展专门的测试工作。一个名为“黑斑项目”(Black Spot)的学术倡议正在做这样一件事:他们先建立一个包含已知错误的论文数据库,然后让不同的AI模型在这个数据库上进行错误识别测试,最后请相关领域的科学家对AI的每一项判断进行复核,确认哪些标记是正确的、哪些是误报。

该项目目前仍在收集和整理数据的阶段,尚未发布最终的评估报告,但它所代表的方向值得关注。只有建立在严格、可重复的评估基础上,AI在科研质量控制中的角色才能被恰当地定义和使用。否则,用一个未经充分验证的工具去审查代表人类最高水平的科学研究,本身就可能制造出比它能解决的问题更多的混乱。

这种人机协作的思路正在成为越来越多研究者的共识。AI在处理大规模、重复性的核查工作上具有天然优势,但在判断研究的创新性是否成立、数据的解读方式是否合理等需要专业洞察力和学术品味的环节,人类的角色依然不可替代。把AI从“裁判”的位置上拉下来,让它做一个称职的“助理”,可能是当前阶段最务实也最负责任的做法。

人类与AI各自留下脚印,在前方汇合,象征科学自我纠错的未来路径

科学进步的历史,在某种意义上也是一部不断发现错误、纠正错误的历史。从这个角度来看,AI被用来查找科学文献中的错误,本身并不是一件令人沮丧的事情。恰恰相反,它说明科学体系正在获得一种前所未有的自我纠错能力。

但问题在于,当AI自己也会犯错的时候,我们究竟应该在多大程度上信任它?一个容易被忽略的事实是:那些被AI揪出来的“百年错误”之所以能够存在如此之久,并不是因为人类不够聪明,而是因为人工核查的范围终究有限。一个化学家一辈子可能核对的参考数据不过成千上万条,而AI在几分钟内就能扫描完一个数据库。AI扩大了核查的范围,但它也引入了新的错误来源。

也许真正值得思考的不是AI能不能取代人类审稿,而是我们是否已经准备好,用一种清醒和谦逊的态度来对待这个新的合作者。科学从来不是一条单向前进的直线,它总是在错误和修正之间曲折前行。AI的加入,不过是让这个过程变得更快、更广而已。至于这条路最终通向哪里,没有人知道确切的答案。

Reference List

Bianchi, F., Kwon, Y., Izzo, Z., Zhang, L. & Zou, J. Preprint at arXiv https://doi.org/10.48550/arXiv.2512.05925 (2025).

Jayaram, R. et al. Preprint at arXiv https://doi.org/10.48550/arXiv.2606.28277 (2026).

Son, G. et al. Preprint at arXiv https://doi.org/10.48550/arXiv.2505.11855 (2025).

【本文中包含的图片均来源于网络,仅用于信息传播和新闻报道目的。我们尊重并保护所有版权拥有者的权利。若有任何版权问题,或版权拥有者不希望图片被使用,请与我们联系,我们将在收到通知后立即处理并删除相关图片。】

 往期推荐 

美国非洲战略全面转向,短视操作正在亲手葬送百年优势?

南极两年增重近7000亿吨,《自然》新研究:这不是好消息

【新闻转载】格鲁吉亚理工大学:中格科研机构携手探索工程领域创新合作

【新闻转载】CORE Academy与格鲁吉亚国家科学院签署合作协议,共建国际欧亚实验室

欢迎转发&点赞哦~

相关学习资料