
现有 AI 科学家「流程齐全、证据残缺」——它们只读摘要、代码和标签,把波形里的时间结构、切片里的空间形态、点云里的三维几何全丢在了接口之外。NUS×牛津这篇 OmniScientist 让 AI 科学家第一次端到端直接处理原始多模态证据:36 个真实数据集 100% 从原始数据跑到成稿,与「只喂标量特征」的盲版对照赢下 85% 头对头;它重审 STEAD 地震库,发现 21.7% 被标成「噪声」的波形其实带着相干瞬态信号。
链接速览
- 🔗 项目页:omni-scientist.github.io(含 demos.html 交互式回放,可逐条查看每个 case 里 agent 看了什么原始证据、做了什么动作、得到什么结论)
- 💻 代码:github.com/Omni-Scientist/OmniScientist(论文配套代码,含统一引擎 + 36 个 case 的规格文件)
- 📄 论文:arXiv:2608.13558(30 页,13 图 19 表,作者 Bobo Li、Hao Fei、Tianjie Ju、Mong-Li Lee、Wynne Hsu)
先看结论
- 这篇做了什么:提出 OmniScientist,一个「开环内核 + 确定性外壳」的全模态 AI 科学家——一层感知能力 + 三个 Agent(选题/实验/写作)跑在确定性流水线里,每个阶段的出口用代码强制检查把关(新颖性、统计有效性、执行溯源、数字可追溯、防 HARKing)。
- 为什么重要:现在几乎所有 AI Scientist(AI Scientist-v2、AIDE、Co-Scientist 等)都通过文本、代码、标签或预计算摘要「间接」接触数据,把解释力最强的空间/时间/跨通道关系丢掉了。这篇是少数把「直接感知原始证据」做进整个生命周期、而不是局部演示的工作。
- 一句话结论:让 AI 科学家直接看原始数据,改变的远不止论文好不好看——它连「提出什么问题、做什么实验、敢下什么结论」都一起改了。
背景与动机
AI Scientist 这两年进展很快:从假设生成、代码执行到稿件写作,整条流水线已经能自动化(AI Scientist-v2、AIDE、Co-Scientist 都在这个方向)。流程覆盖上,它们已经「workflow-complete」。
但论文抓了一个更底层的问题:科学发现的依据,未必过了那道文本/数字接口还能活着。一句图注可以漏掉局部形态,一个无序的特征向量可以抹掉时间顺序,几个标量可以把跨通道的不一致彻底藏起来。作者的原话是:关键不在「什么东西能被序列化成 token」(都能),而在「哪些关系能在接口里幸存下来」(which relations survive the interface)。
于是这些系统虽然流程完整,却「evidence-incomplete」——agent 在提问之前,就已经继承了别人选好的数据表示,能发现的异常、能提出的假设、能支撑的结论都被这个接口框死了。
作者特别点了一句:强多模态模型本身解决不了这个问题。因为现有做法只是把感知用在局部阶段——检查自己生成的图、给图打分、读软件界面、看实验装置——没有一个「闭环」让观察反过来改写研究问题。而且把观察和搜索空间放大,又会让数据泄漏、重复检验、HARKing(看到结果再编假设)、无依据报道的风险跟着变大。所以全生命周期的感知,必须配一套能管住溯源和统计有效性的控制结构。
核心方法
1. 感知层:4 类证据 × 11 种模态,原生数值优先
OmniScientist 把科学证据分成 4 个与学科无关的家族:感知类(图像、视频、谱、波形、3D 结构)、符号类(文献、公式、序列、知识图谱)、量化统计类(表格、测量、分布)、程序/动态类(轨迹、仿真、agent 运行日志)。
关键设计是「原生优先、视觉按需」:一个信号进来,agent 先用 analyze_signal 直接算 FFT 峰值、趋势点这类数值特征;只有当空间/结构关系是决定性的时候才渲染成图给视觉模型看。视觉还被预算约束(自适应图像预算
,
是标签分组数),防止无脑看图。
这套工具的解锁是规格文件驱动的:一个学科一个 spec 文件,写明角色、数据、属性、开放问题 + 成员列表,引擎根据 modality 字段自动挂上对应工具,不需要任何按学科注册的代码。36 例里感知类占 28 例,另外 8 例(符号/统计/程序类)当广度对照——这些场景视觉本来贡献就不大,正好检验引擎不是「只会在图上做文章」。

图注:感知层的「目击现场」:16 个案例、11 种模态、覆盖全部 4 类证据。每个红框是 agent 在原始记录上读到的具体特征,下面的 found 是它据此做出来的已验证发现(图片来源:论文 Figure 4)。
2. 三个 Agent + 确定性流水线:内部自由,边界锁死
架构是「开环内核 + 确定性外壳」:每个阶段内部是自由的 ReAct 循环(观察→推理→行动),但阶段之间的转换和验收全由代码控制。
- Ideation(选题):先盘点素材并用感知工具看几份代表性样本,做至少 3 次聚焦文献检索(实测平均每轮 8.7 次检索调用),脑暴 ≥5 个候选课题并逐个自评新颖性风险,最终选一个「真正新颖 + 全计算可执行 + 可证伪」的写成提案。
- Experiment(实验):把想法翻译成方法,在受控的
run_python沙箱里迭代跑代码(实测每篇平均 31.8 次真实代码执行),强制至少 4 类分析:主检验、baseline、消融、机制/敏感性。 - Writeup(写作):不是套一个万能模板,而是按 5 套 venue 结构(ML/生物医学/地空/物理/化学)分别定骨架和篇幅;每个 section 只从执行记录里分配给它的那部分数据展开,摘要最后写,保证摘要数字和正文一致。
流水线允许最多 2 次回退到 ideation(实验崩了或出 null 结果就回去重来),整个生命周期里感知工具对三个阶段都开放。

图注:OmniScientist 架构:原始证据 → 感知层(底部,虚线箭头表示三阶段通用)→ 选题 → 实验 → 写作,每个阶段出口有代码检查把关(图片来源:论文 Figure 3)。
3. 三道代码检查:论文里每个数字都必须在真实 stdout 里出现过
这是我认为全文最硬核的部分。三道检查(idea / rigour / claim)不是让模型「自我评估」,而是纯 Python 谓词:拿阶段的 finalize payload 和运行记录当输入,不通过就带着失败原因把 agent 打回循环,阶段永远不能靠「嘴硬」结束。
几个让我印象深刻的强制项:
- Provenance(溯源):论文里报的每个数字,必须逐字出现在某次真实
run_python的输出文本里——36 次运行只有 1 次触发拒稿,说明正常流程下数字基本都老老实实从真实输出抄。 - Anti-HARKing:headline 只能来自「通过多重比较校正 + 有效应量 + 不是一堆噪声里挑出来的那个」的分析;没达标就老老实实报
mixed/null。不显著的分析必须降级进 trace,正文提都不提。 - 多重比较校正:按调试循环里实际跑过的所有测试数来校正(包括被降级的),堵死了「跑一堆测试只报显著那几个」的路。
- Novelty 语言守卫:把「first / unstudied / no prior work」这类绝对断言自动改写成「based on this search, appears under-explored」。
- Compilation:稿件必须真能编译出 PDF,且有四级降级链兜底。
这套检查在 36 次运行里一共打回 115 次 finalize 尝试,只有 4/36 一次通过没被返工;其中 26 个 run 试图把不显著的结果当发现、被强制降级——占总拒稿的约三分之二。全部 36 例里 67 个分析被降级进 trace、265 个进了正文(平均每篇 1.9 个被「劝退」)。这些数字本身就说明:无监督的 AI 科研最常犯的错不是造假,是「挑结果」。

图注:两阶段验证流水线:实验结果的 rigour check + 稿件层级的 claim check,两者都以执行记录(bottom band)为唯一事实来源,而不是看 agent 自己写的文字(图片来源:论文 Figure 5)。
关键实验结果
- 完成度:36/36 全部从原始数据一路跑到编译成稿(Sonnet 5 主跑);事实准确度 ≥7.0 的有 30/36 例。
- 整体质量:Sonnet 5 平均综合分 6.3(7 维打分,2 个跨家族 LLM 评委)。事实准确度 7.7 在所有维度里领跑——这直接来自溯源检查把每个数字钉死在真实输出上。
- 跨学科/模态稳定:按学科或证据类型分组,中位综合分都挤在 6.1–7.1,说明引擎的学科无关性是真的。
- 背骨对比:GLM-5.2 6.5 最高、Kimi K2.7 6.2、GPT-5.6 5.6;开源小模型明显崩(Qwen3.5-9B 4.0、Gemma-4-26B 4.2)。且不同背骨对维度敏感度不同:事实准确度/稳健性在强弱模型间差 2.9 分,多模态接地只差 1.2 分——强推理模型不会自动带来感知能力。
- Blind 消融(核心对比):把系统换成只收预计算标量特征的「盲版」,感知版赢下 85% 头对头,7 个维度全涨,最大增益在多模态接地 +2.8、显著性 +1.8;去掉平局后,感知版在 7 个维度上拿到 70%–87% 的胜率。
- 组件消融:去掉文献检索最伤(6.9→5.7,系统会重复发明已发表的想法);去掉 novelty check 新颖性直接掉 1 分。
- 成本:单篇
4.34,实验阶段占大头。

图注:维度级感知增益:5 组盲版对照里,去掉感知(粉)后多模态接地掉得最狠、显著性次之;事实准确度两条几乎重合,因为两边都过同样的溯源检查(图片来源:论文 Figure 7)。
两个值得展开的案例
案例一:重审 STEAD 地震库——21.7% 的「噪声」其实是真信号
这是最能说明「直接看原始数据」价值的案例。输入是 STEAD 目录约 1,500 条三分量宽带地震波形,一半标地震、一半标噪声。agent 在一条明确标为噪声的波形上,看到了清晰的「起振-衰减」包络——于是把标签冲突转化成研究问题:到底有多大比例的「噪声」携带相干瞬态能量?
它的方法:用 STA/LTA 特征函数加振幅、rectilinearity、planarity 和一个跨通道 coincidence 项,阈值设在 3 个与标签无关的替代 null 的第 99 百分位。结论:21.7%(163/750)的噪声标签波形带着相干、极化、跨通道一致的瞬态突发,95% CI [18.8, 24.9]。自主消融显示:去掉 coincidence 项,检出率塌到 2.0% 的纯振幅基线——证明「时序巧合」是机制主因。结论在 50 倍假警率范围、3 种 null 模型、4 种窗口、417 个台站的自举下都稳在 19%–25%。
更有意思的是它「守规矩」:系统事先预注册了一个关于仪器类型的假设,结果经验数据把该假设推翻了——它没有硬凹,而是把 prevalence 发现作为 headline,把仪器问题降级为 boundary result。这正是 anti-HARKing 检查想要的行为。

图注:地震审计一图流:左边 4 条三分量波形(agent 自己按存储的 onset 统计选的,不是人挑的),第 3、4 条标着 noise 却带着相干起振;右边是完整检测器标记的噪声比例 vs 3 个与标签无关的对照,去掉 coincidence 项即塌到 2.0%(图片来源:论文 Figure 11)。
案例二:儿童胸片——「斑驳」比「更亮」更能区分肺炎
第二个案例展示它从零建立正向发现。输入只有带 normal/pneumonia 标签的儿童胸部正位片,没有任何预计算特征。agent 直接看片子,注意到肺炎肺野不是均匀变亮,而是斑驳——亮斑和清晰区交错。它把这个观察量化成「滑动窗口局部 Shannon 熵的空间离散度」,并预注册假设:这种斑驳独立于整体亮度区分两类。
结果:效应量 Cohen's
,在开发集和留出集上都稳定;在多元模型里,空间指标在平均熵之上带来显著增益,留出集 AUC 0.851(只用平均熵 0.840),而朴素 raw-pixel baseline 只有 0.634。窗口尺寸、ROI 范围等超参数消融下都保持显著,且过了 Bonferroni 校正。作者强调:定义「斑驳」这个度量本身就需要直接看片子——这是文本统计挖掘永远跨不过去的归纳一步。

图注:儿童胸片案例:左边是正常/肺炎片子配局部熵图(肺炎的熵图明显更斑驳),右边是留出集分类性能——熵特征 0.840–0.851,raw-pixel baseline 只有 0.634(图片来源:论文 Figure 12)。
思考与启发
先说判断:这篇的真正贡献不是「多模态」,而是「把证据到结论的可信度管起来了」。 让模型看图、听声、读点云,技术上都已有基础;难的是让这些观察全程可控——提的问题是不是假说先行的、做的检验有没有过全量校正、写的数字是不是真跑出来的。OmniScientist 把这几件事从「prompt 里求着模型遵守」变成了「代码层面的硬约束」,我觉得这才是 AI Scientist 能往下走的台阶。
几个我特别认可的设计,也是做 Agent 工程可以直接抄的作业:
- 规格文件驱动:一个学科 = 一个 spec 文件,引擎零改动。这种「引擎与领域解耦」的思路对任何多任务 Agent 系统都成立——加能力不是改内核,而是加描述。
- 确定性外壳:agent 内部随便折腾,但阶段出口是纯函数谓词,不达标就打回。这比「再加一层反思 prompt」靠谱得多。
- anti-HARKing 是数据证明的刚需:36 例里有 26 例试图把不显著结果当发现。没有代码闸门,这类论文会一批批漏出去。
不过照例要泼几盆冷水:
- 评委是 2 个 LLM(deepseek-v4-flash + gemini-2.5-flash-lite),不是人类同行评审。 虽然做了评委自校验(Krippendorff α=0.66、verbosity ρ=0.16),但「AI 论文分数」和「真能发出去」之间还隔着一层。
- 36 例里 8 例是本来就不需要视觉的广度对照,感知优势主要看剩下的感知类;「85% 赢」是对 5 组盲版对照算的,样本不大。
- 弱背骨明显崩。感知模型固定在 Claude Sonnet 5、推理背骨换掉后,小开源模型分掉得很快——「让 AI 看原始数据」的前提是推理模型本身足够强。
- 21.7% 这个结论的溯源是真的,科学意义还要人来判断。系统把数字钉死在真实输出上,保证的是「没造假」,不是「这个发现重要」。
对想跟进的朋友,我的建议就一句:先上项目页把 demos 回放点一遍,看看 agent 到底是怎么「看」的,再决定要不要复现。顺便提醒:2025 年底清华也发过一篇同名的 OmniScientist(co-evolving ecosystem,arXiv:2511.16931),别和这篇 NUS×牛津的搞混——撞名了,内容完全是两个东西。
参考资料
- 论文:Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu. OmniScientist: An Omni-Modal Omni-Discipline AI Scientist. arXiv:2608.13558, 2026. https://arxiv.org/abs/2608.13558
夜雨聆风