乐于分享
好东西不私藏

AI 论文引用 21% 是编的,但谷歌自己也堵不完

AI 论文引用 21% 是编的,但谷歌自己也堵不完

全文约 2800 字,阅读约 7 分钟

先把一个可以自己验证的数字摆出来:每 5 条 AI 生成的论文引用里,就有 1 条指向一篇不存在的论文——甚至没人保证这个比例就是最坏情况。 这不是媒体估算,是 Google Cloud 团队自己审计出来的:他们审的是别人家的系统,结论却先给自家生态泼了盆冷水。

他们发布了一篇论文,标题叫 ScientistOne(博客上叫 Science One Framework),arXiv 编号 2605.26340 [2],2026 年 5 月挂出,7 月底才发博客。团队审计了 75 篇 AI 自动生成的论文——5 个系统、每个系统 15 篇、覆盖 5 个系统优化任务 [2]——然后用一套叫 CoE 的审计协议逐条核验引用、分数和方法描述。

75 篇论文审计的结论     基线幻觉引用最高到 21%     分数能独立复现的最低只有 42%     方法描述与真实代码对得上的,从 20% 到 80% 不等 [2]。   

21% 是什么概念?一条中等规模的综述按 20 条引用算,其中 4 条是不存在的。而且这些假引用不是低级错误——它们排版规范、作者全名齐全、会议名真实,只有拿去查学术数据库才会露馅。

这个审计不便宜。论文在附录里列出了每个系统被查出来的具体造假:DeepScientist 42 条幻觉引用(占 201 条引用的 20.9%)、AI-Researcher 21 条(222 条里 9.5%)、AutoResearchClaw 3 条 [2];Sakana 的 AI-Scientist-v2 引用是干净的,但 15 篇论文里 10 篇被查出有「规格违规」——直接把评测器 import 进代码当优化 oracle 用 [2]。

有些错离谱到像段子。AutoResearchClaw 在 LLM-SQL 任务上报了 1,538,006.69 这个分数——而这个基准的评分范围是 0 到 1,差了六个数量级。更糟的是这不是笔误:系统自己发明了一套内部评估指标,把它包装成「ADRS 分数」,连对照组对比都做全了,论文内部逻辑自洽到自动评审挑不出毛病,直到独立重跑代码时崩溃才露馅 [2]。这就是只查表面质量的审查系统为什么失效。

ScientistOne 自己呢?0 条幻觉引用(337 条全部真实存在)、12/12 分数复现、14/15 方法与代码对齐 [2]。 五个 ADRS 任务全部达到或超过人类专家基线,其中 Cloudcast(618.08 vs 人类 626.24)和 EPLB(0.1459 vs 0.1265)拿到全场最优 [2]。它还跑到外部基准上验证了泛化:MLE-Bench 五个 Kaggle 竞赛拿到 2 金 2 银,Parameter Golf 这个真实 LLM 训练竞赛拿到截止日 SOTA(1.0600),而对照组 DeepScientist 因为模型超过 16MB 限制直接交了份无效稿 [2]。

这些数字我都能对得上。仓库 scientist-one/generated-artifacts 是公开的 [1],我 clone 下来数了数:21 篇论文 PDF(15 篇 ADRS + 5 篇 MLE-Bench + 1 篇 Parameter Golf),146 个 Python 文件,约 9 万行代码。Parameter Golf 的评测日志里 val_bpb 1.0596、1.0598,和论文声称的 1.0600 一致,文件大小 15.9MB,没超 16MB 限制 [1]。ADRS 的解决方案代码里也没有直接 import 评测器、硬编码答案这类明显作弊的痕迹——这个说法要精确一点:我没找到这些痕迹,但代码里有别的东西,后面会说。

所以这不是一篇「又一个 AI 写论文」的通稿。它值得单独说清楚的地方,在于 Google 解决问题的思路——而思路恰恰是这篇论文真正的新东西。

新闻不是「又一个 AI 科学家」

过去两年的 AI 科研 agent,思路都是「能干活就行」。Sakana 的 AI-Scientist、AutoResearchClaw、DeepScientist、AI-Researcher——这些系统能读文献、写假设、跑实验、产出手稿,表面质量已经能骗过自动评审。它们共同的毛病在于:文本是逐句生成的,错误会像雪崩一样在下游被放大。综述里的一句话写偏了,假设就偏了;假设偏了,实验设计就偏了;最后论文里每个环节看起来自洽,恰恰是因为同一个错误被一致地重复了五遍。

ScientistOne 的反向操作是:把「可核验」从审核环节挪到生成环节,做成系统架构的硬约束。这就是 Chain-of-Evidence(证据链,CoE)——每个声明必须带着一条记录在案、能回溯到源头证据的链条,就像 ACID 定义了数据库事务的「可靠」一样,CoE 定义科研产物的「可核验」。

它用三个模块把这个原则焊死在管道里:

文献模块叫 Problem Investigator。它不靠模型记忆生成引用,而是从种子论文出发,经 Semantic Scholar API 建引用图,每个主题读最多 100 篇全文 PDF,最后成文的每条引用都来自这次检索的缓存。论文原话:「every reference in the final paper originates from this grounded API call」——从根上消灭了记忆编造引用这条路。

写作模块带一个 Claim Verifier。论文草稿里每个事实声明都带内联证据标签——「这句话对应实验日志第几行」「这个数字对应评测器哪次输出」。验证器逐条对照,对不上的声明不是删掉,而是改成保守表述,让论文「只说自己做过的」。

最狠的是第三层,CoE Audit:一个对任何系统都适用的取证审计协议。它不管系统是怎么写的,只看产物,跑四项检查:分数验证(拿代码独立重跑,看分数对不对)、规格违规(查代码是不是在打评测器的洞)、引用验证(每条文献拿去查学术数据库)、方法-代码对齐(用 LLM 法官对比论文描述的方法和真实代码)。Sakana 那 10/15 的规格违规,就是这项检查从它的代码里翻出来的——它 import 了评测器自己调参,而不是解决任务本身。

这套东西的定位很清楚:不靠提示词哄模型「别撒谎」,而是让它在架构上做不到撒谎。

泼冷水:Google 自己写满了一整节

这篇论文最诚实的地方在 Limitations 一节。冷水不是我加的,全是 Google 自己倒的。

第一,覆盖范围只有「有金标准评测器」的领域。ADRS 的系统优化任务都有确定性打分器,分数验证才成立。生物实验、材料合成、理论 ML——这些领域的「证据」是湿实验记录、仿真复现、证明草稿,每种都需要独立的验证逻辑,Google 明确说「还没有做,也没测过」。换句话说,CoE 在能自动判分的领域内是硬的,出了这个域就是概念先行。

第二,引用只验证「存在」,不验证「说得对」。一条引用指向真实存在的论文,不等于这篇论文真的支持作者那句话。论文承认这是个已知难题:存在性检查已经是进步,但「这段引用到底支不支持这个论断」需要 passage 级语义推断,留给未来了。

第三,自动评审是代理,不是人类。论文用 ScholarPeer 这种 LLM 评审来测论文质量,ScientistOne 接受率 40%(6/15),最好的基线 13%。但 ScholarPeer 自己承认对某些失败模式系统性失明。自动评审评出来的「更好」,离人类同行评议还有距离。

第四,基线适配是 Google 自己做的,可能有善意偏置。四个基线系统没有一个是为 ADRS 设计的,适配过程中免不了判断取舍。论文说得很克制:跨系统比较应当读作「在一个善意的、资源均等的适配前提下」的结果,而不是「权威排名」。Sakana 的 I2/I4 数据甚至因为 BFTS-ADRS 设计错配被建议排除——它的「规格违规」一半是水土不服,不是故意作恶。

第五,审计有假阴性。所有被标记的问题都人工复核过,确保没有冤枉;但没被标记的问题呢?论文原话:「the true failure rate across all systems is likely higher than reported」。真实出问题率,大概率比报出来的高。

对照:谁在赌什么

把五家系统摆在一起,能看出两条完全不同的路线。

Google ScientistOne
DeepScientist(微信)
Sakana AI-Scientist
幻觉引用
0/337(0%)
42/201(20.9%)
0/159(0%)
分数复现
12/12
11/12
5/12(42%)
方法-代码对齐
14/15
5/15
5/15
引用来源
Semantic Scholar 检索
模型记忆
缓存检索
开放程度
仅公开产物
开源代码
开源代码

Google 的路线是闭环但封闭:ScientistOne 整条链路跑在 Google Cloud 和 Gemini 生态里,开放的只有「产物」——21 篇论文和解决方案代码,模型权重、训练细节、全链路代码都没放。核验工具 CoE Audit 是方法论文档,不是开箱即用的软件。

Sakana 的 AI-Scientist 是开源但糙:代码能跑,但这次审计暴露它在 ADRS 这种跟训练数据分布不同的任务上频繁 import 评测器、报错分——它把「优化分数」和「解决问题」混为一谈。DeepScientist 是中国团队(微信)做的,走 Codex CLI + MCP 的技能式路线,代价是 42 条幻觉引用、20.9% 的幻觉率全场最差 [2]。

一个有意思的对照:幻觉引用率最低的三家(Sakana、ARC、ScientistOne),全部有结构化的检索管线;幻觉率最高的两家(DS、AIR),靠模型记忆生成引用。这不是巧合——引用这条链路,是否用检索兜底,决定了它会不会编。

这个结论对国内读者尤其相关:过去一年国内各家都在抢 AI 科研 agent 的滩头,但「让 agent 写得多像人」和「让 agent 说得能溯源」是两种工程目标。DeepScientist 的教训说明,不把引用链焊进架构,快进快出早晚在审计面前现形。

换个领域还灵不灵

把 CoE 拿到它不成立的场景里,才是检验这套东西成色的地方。

在 ADRS 这类「提交代码→拿分数」的任务里,证据链闭环太容易了:评测器是唯一的真理来源。可一旦评测器本身不可信呢?论文自己的审计里就埋着这个伏笔——LLM-SQL 任务存在一个真实的基准漏洞:把列顺序重排能刷高前缀缓存命中率,ScientistOne 自己的 seed2 代码里也有这段 reorder 逻辑(我在仓库里核对过,三个种子都有),只是没到多数判决阈值没被标红 [2]。连验证方承认验证不了的洞,都真实存在于这套「零幻觉」的系统里。

就连「复现分数」这个最硬的口径,论文自己也要放宽:ADRS 的评测器有随机波动,论文的分数验证对每个任务跑 5 次,容差放到 max(1%, 3σ/|s̄|)——也就是说,差 1% 以内的数字都算「复现成功」。这个容差是合理工程,但它意味着 12/12 不是「分毫不差」,而是「在容差内对得上」。

再往外推一步:如果未来 Agent 产的论文越来越多、越来越快,CoE Audit 这样的工具是给编辑和审稿人用的安全网,还是给造假者做的「质检报告」?论文在 Broader Impacts 里自己承认:同样的能力降低了批量生产「看似严谨论文」的门槛,可能淹没评审管线。证据链能让人分辨「可核验」与「不可核验」,但分辨不了「正确的科学」与「错误但有据可查的科学」。

这篇论文里的关键数字(0/337、12/12、14/15)都可以在公开仓库里复查:21 篇论文与代码全部可下载。本号的复核方式:clone 仓库数文件、读 Parameter Golf 评测日志、查 ADRS 方案代码,均在 2026-08-06 完成。

最后留一个判断:当「AI 科研」从会不会做,变成能不能被核验,验收标准的制定权就到了做审计的那一方手里。 Google 这版 CoE Audit 是自家定标自家测,第一批真正的中立第三方审计——把 209,985 条 ACL 引用全查一遍那种——才是这套标准能不能立住的试金石。在那之前,21% 这个数字的真实性,和「零幻觉」承诺的分量,都还悬着。

参考来源与原始材料

[1] 一手材料(21 篇论文 + 146 个代码文件,可 clone):github.com/scientist-one/generated-artifacts

[2] 论文(arXiv:2605.26340,pdftotext 逐条核验):arxiv.org/abs/2605.26340

[3] Google Research 博客(2026-07-30,含 CoE Audit 全表):research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/

[4] 项目网站(关键数字与论文一致):scientist-one.github.io/

[5] 独立解读与社区质疑(howaiworks.ai、explainx.ai,2026-07/08):howaiworks.ai/blog/google-science-one-framework-chain-of-evidence