乐于分享
好东西不私藏

AI搞科研迎来大逆转!贝叶斯教父剥夺大模型决策权:8次实验干趴Opus 4.7的41次狂轰滥炸

AI搞科研迎来大逆转!贝叶斯教父剥夺大模型决策权:8次实验干趴Opus 4.7的41次狂轰滥炸

这两年,整个科技圈都在疯狂兜售一个宏大的神话:“端到端 AI 科学家”

给大语言模型(LLM)连上网、配上 Python 环境、接入实验仪器,它就能自己读文献、自己提假说、自己跑实验、顺便把顶会论文写出来。

然而,所有做过现实实验的科学家都知道,这幅图景背后藏着一个极其尴尬的隐痛,太能胡扯,也太费钱了

大模型天生是个“曲线拟合狂魔”它可以在你看过的数据集上把折线拟合得天衣无缝;但只要你把旋钮扭到一个前所未有的未知区间,问它一句:“如果我做了这个从没人做过的干预,系统会发生什么?”

大模型瞬间抓瞎,甚至开始一本正经地胡说八道。

▲ Kevin Murphy 在 X 上发文:干预预测需要机制模型,而机制探索必须靠极高的数据效率

因为观测不等于因果,拟合不等于规律

要想摸清世界底层的真实物理机制,就必须主动做实验、做干预。然而,在真实的物理、化学和生物实验室里,每一个实验样本都贵如黄金。如果任由一个充满幻觉的大模型拿着数百万经费去“自由探索”,人类科研的预算分分钟被烧得精光。

就在学术界被大模型的虚火搞得晕头转向时,贝叶斯机器学习界的泰斗、经典教科书《Machine Learning: A Probabilistic Perspective》的作者 Kevin Murphy(@sirbayes) 亲自下场了。

他甩出了一篇重磅论文,直接给狂妄的大语言模型做了一场彻底的“夺权手术”

剥夺大模型的决策权!教父亮出手术刀

Kevin Murphy 的核心主张冷酷而清醒:

在科学发现中,大语言模型必须被“降级”,让它去天马行空地提假说,但绝不能让它来裁定证据,更不能让它拍脑袋决定下一步做什么实验!

基于这一理念,他打造了一个名为 MDA(Model Discovery Agent,模型发现智能体) 的全新闭环架构。

▲ Kevin Murphy 阐释 MDA 架构:LLM 仅负责提出候选机制,实验裁决与决策全归贝叶斯引擎

在这个架构里,大模型原本独揽的大权被硬生生拆成了两半:

  1. 大模型只负责“开脑洞”(Proposer)
    :当系统面对一片未知现象时,利用 LLM 的跨学科常识和代码生成能力,提出各种可能的物理公式、化学动力学方程或生物离子通道机制代码。
  2. 严苛的数学引擎负责“杀假说”与“定乾坤”
    :大模型提完假设就立刻退场。剩下的所有事情,哪个假说是胡扯、哪个假说更可信、以及下一步到底该花钱做哪个实验,全部交给一套冷酷而精准的贝叶斯数学机器来裁决。

这套数学机器由三张王牌组成:

  • SMC(序列蒙特卡洛)
    :给每一个候选机制动态打分。它自带无情的“奥卡姆剃刀”,公式复杂却没有任何解释力的假说,会被瞬间淘汰。
  • SBI(基于模拟的推断)
    :面对复杂的现实噪声(比如神经元的随机放电),就算数学概率算不出来,也能通过超高速仿真推断参数。
  • VoI(信息价值理论,Value of Information)
    这是整个系统的灵魂。它绝不盲目试错,而是精确计算出哪一个实验能让当前互相争吵的假说产生最大的预测分歧

当两个假说都在争论谁才是真理,VoI 就会像一个老练的特级侦探,一眼挑出最刁钻的干预条件:“别吵了,把这个旋钮拧到最大,做这个实验,一秒见分晓!”

8次 vs 41次!一场对黑箱AI的降维打击

把裁决权从大模型手里夺回来之后,奇迹发生了。

在衡量物理规律发现能力的基准测试 FORCEBENCH 上(任务是仅通过发射微小探针,推断出未知的二体天体与粒子力学定律):

▲ 知名 AI 研究者 Rohan Paul 惊呼:MDA 用 8 次实验就达到了 Opus 4.7 狂轰 41 次的效果

  • 拥有无限算力、自由发挥的顶级大模型 Agent(基于 Claude 3.7 / Opus 级别),像只无头苍蝇一样做了 41 次实验,数值准确率依然只有可怜的 31%
  • 而被戴上贝叶斯紧箍咒的 MDA,仅仅用了 8 次实验,不仅完美复现了顶尖大模型消耗海量预算才勉强摸到的精度,其数值通过率更是狂飙到了惊人的 93%,精准符号公式恢复率高达 74%

用 5 到 6 倍更少的实验次数,打出了碾压级的准确度。

在化学基准 CHEMBENCH(学习包含 7 个控制变量的复杂酶动力学速率方程)中,传统的自动化科研工具 SciLab 吭哧吭哧做了 60 次实验,符号准确率只有 42%;而 MDA 仅仅用了 8 次实验 就直接触顶,拿下了 56% 的准确率。

普通的符号回归工具(如 PySR)常常为了凑数拟合,拼凑出一堆数学上误差极低但物理上荒谬绝伦的“垃圾公式”;MDA 交出的则是清晰可读、具备物理因果可解释性的机制代码。

▲ 物理发现任务中的帕累托前沿:MDA 在极少实验预算下直接锁定真实物理定律

一个最具戏剧性的案例发生在对 Yukawa(汤川屏蔽力) 的探索中。

在近距离发射探针时,屏蔽力与普通的幂律衰减力看起来几乎一模一样,任何大模型都会在这里陷入死循环。但 MDA 的 VoI 引擎瞬间看穿了这一盲区,它果断放弃近距离纠缠,直接设计了一次极其罕见的超长程探针发射

数据返回的一刹那,真理在坐标系上一跃而出,作者用了一个非常生动的词来形容这一刻:模型“顿悟(Groks)”了

科学研究的痛点:学会扔掉垃圾假说

推特网友 @suqitah 在论文评论区留下了一句极其毒辣的点评:

“科学探索最难的是判断什么时候该把假说扔进垃圾桶。很高兴有人把这个机制造出来了。”

▲ 网友热评:科学最难的是知道何时放弃假说

这就是为什么纯大模型搞科研总是一地鸡毛。

大模型的本质是文字概率模型它的预训练语料库里塞满了人类几百年间已经成功发表的、光鲜亮丽的科学论文它熟悉所有的修辞,精通所有的公式模板,张口就能给你扯出十几个“看起来极其专业”的假说。

但正如推特用户 @benshanyoufeng 所指出的深刻本质:

大模型的语料库里,根本没有“当实验经费只剩最后三次机会时,一个科学家是如何在极其残酷的不确定性中权衡利弊、艰难做决策”的博弈轨迹!

大模型不懂得什么叫代价,也不懂得什么叫真实的概率分布。让它去主导实验,就像让一个只会背医书但从未摸过手术刀的医学生去指挥抢救,他能给你列出一百种罕见病,但绝不知道下一秒该打哪支肾上腺素。

▲ 评论指出:LLM 缺少“预算约束下的实验决策序列”这一关键训练信号

MDA 的伟大之处,正是把“狂想”与“理智”做了最完美的物理隔离:

  1. M-open 开放式假设突围
    :系统不会把思维局限在死板的预设菜单里。如果所有已知机制在样本外预测上全部崩溃,系统会立即吹哨,勒令 LLM:“以前的思路全错了,结合失败的残差,给我重新写一套全新的机制代码!”
  2. 不留情面的贝叶斯淘汰
    :大模型交出新代码后,立刻被夺走话语权。贝叶斯机器重新接管,用数学刀锋一层层削去伪装,只留下经得起干预检验的硬核机制。

▲ M-open 机制:当现有假设无法解释残差时,触发 LLM 提出全新机制代码

科学哲学交锋:人类探索未知,真的必须懂“机制”吗?

Kevin Murphy 的论文在学术界引发了巨大震动,甚至激起了一场关于科学认识论的高水平论战。

开源 AI 机构 EleutherAI 的负责人 Stella Biderman(@BlancheMinerva) 直接在 Murphy 的推文下方发起了公开反驳:

“想要预测干预、建立伟大的理论,真的必须拥有机制模型吗?科学史上充满了反例:人类在根本不知道有细菌和病毒机制的时候,就成功发明了天花疫苗;卡诺提出热力学第二定律时,脑子里抱着的还是完全错误的热质说;而量子力学在预测上取得了人类史上最惊人的成功,至今却没有一个公认的微观直观机制!”

▲ Stella Biderman 搬出科学史反例,质疑机制模型的必然性

这场交锋瞬间把讨论从工程代码拉升到了科学哲学的高度。

Stella 的质疑完全符合科学史实:经验性的黑箱关联,有时候确实能救命,也能推动技术的单点突破。

但 Kevin Murphy 和众多科学计算学者的反击更加直击本质:

在资源无限、允许一代代人类试错几十上百年的尺度上,黑箱摸索或许终能撞上大运。但在现代科学的前沿,在新药研发、高温超导材料合成、受控核聚变等复杂巨系统中,实验的试错成本已经高到了人类无法承受的地步

如果你不知道膜电位上到底是哪一条离子通道在漏电(论文中专门为此构建了复杂的 NeuronBench 电生理基准),盲目的试药只会带来无穷无尽的失败与生命财产损失。

▲ Murphy 总结论文三项核心贡献:MDA 架构、物理化学 SOTA、以及复杂的 NeuronBench 电生理基准

机制模型谈不上终极绝对真理,却是人类和人工智能面对未知黑暗世界时,能够拿出来的高性价比、低成本、不容易被假象欺骗的导航地图

告别盲盒,科学 AI 正迎来理性清晨

过去两年,科技圈见证了太多“把所有问题都扔给端到端大模型”的狂妄尝试。我们以为只要把参数堆到几千亿、把上下文拉长到几百万,机器就能自动参透宇宙的奥秘。

但现实一次又一次地给这种盲目崇拜泼上冷水。

Kevin Murphy 和他的 MDA 用清脆响亮的实验数据证明了一件事:

单纯的神经网络暴力美学,根本无法替代严谨的因果推断与统计理性。

让大模型做它最擅长的事:像一个脑洞大开的年轻学者,在白板上飞快地画出千奇百怪的狂想;让严谨的数学做它最该做的事:像一个面容冷峻的资深导师,带着奥卡姆剃刀和精密仪器,在每一次扣动扳机做实验之前,把每一分预算花在真理最致命的破绽上。

这不再是“大模型取代科学家”的无脑神话。

这是一个由大模型的无限创造力贝叶斯数学的绝对理性共同铸就的科学发现新黎明。