乐于分享
好东西不私藏

Science长文:斯坦福AI“科研助手”杀入实验室!35分钟干完专家3周的活

Science长文:斯坦福AI“科研助手”杀入实验室!35分钟干完专家3周的活

一个生物学家把458个文件甩给一台机器,转身去倒了杯咖啡。35分钟后回来,分析做完了,图画好了,连假说都给你提了三条。同样的活儿,一位资深人类专家要干三周

这一幕来自刚刚登上Science的真实研究。

▲ Science 官方推文宣布论文发表:一个通用生物医学AI智能体,正在帮助自动化研究工作流

2026年7月9日,Science 以 First Release 形式发表了一篇让整个生命科学圈集体失眠的论文,《Autonomous biomedical research with an artificial intelligence agent》。斯坦福大学联合 Genentech、Arc Institute、华盛顿大学、UCSF、普林斯顿等一众顶尖机构,正式宣告:一个名叫 Biomni 的AI智能体,已经能够自主执行从文献检索、基因组分析、药物重定位到湿实验协议设计的全链条科研任务

而更令人心跳加速的数字是,在论文发表之前,已有超过1.5万名科学家把自己的科研任务"外包"给了它,累计委托了近10万个工作流

从聊天问答走向"科研操作系统"

先别急着把 Biomni 跟你手机上的ChatGPT画等号。

传统AI聊天机器人的逻辑是:你问,我答你说"帮我设计一个CRISPR实验",它吐出一段看起来专业的文字,至于能不能用,你自己去验

Biomni 的野心完全不同它的核心架构被拆成两个模块,像齿轮一样咬合:

第一层:Biomni-E1(环境层)团队让AI系统性地"阅读"了约2500篇横跨25个子领域的论文,从中抽取出一张庞大的"动作地图",150个专用生物医学工具59个数据库105个软件包DNA分析、蛋白结构预测、CRISPR设计、药代动力学建模、单细胞注释……几乎覆盖了一个现代生命科学实验室的全部数字台面

第二层:Biomni-A1(智能体层)当你用自然语言抛出一个问题,比如"分析这批Perturb-seq数据,给我找有意义的假说",智能体会先检索"哪些工具和数据库跟这个任务有关",然后动态生成一套执行计划,把每一步写成可运行的代码,在环境中执行。

没有预设模板,可以根据任务即兴拼装工作流

Jure Leskovec教授,斯坦福计算机科学系教授、论文资深作者,在多个场合用了同一个比喻:"智能体像木匠,工具让它有能力盖房子。"

▲ Leskovec 2025年首次公开宣布Biomni:克隆实验盲测比肩5年以上专家,458文件分析快800倍

35分钟 vs 3周:那些让人头皮发麻的案例

论文和配套报道反复拿出几个"杀手级案例",展示繁琐的数据处理如何占用研究时间。

案例一:可穿戴数据分析 研究者上传了450多个连续血糖监测、饮食与活动记录文件,提了一个开放式问题,"找找有没有生物学上有意义的代谢模式"。Biomni自动完成了数据清洗、时间对齐、可视化与分步分析计划。人类专家估计数十小时到三周,系统35分钟交卷加速比约800倍

案例二:分子克隆实验 Biomni设计了一套克隆工作流,研究团队拿去做了湿实验,菌落长出来了,Sanger测序验证通过。在一项盲测中,Biomni的方案水平与5年以上实验经验的专家相当

案例三:大规模组学假说生成 面对scRNA-seq与scATAC-seq的原始数据,系统跑完标准生信分析后主动提出了新假说,发现了可能调控骨骼谱系的新转录因子,并把工作延伸到可检验的发现线索

▲ 第一作者黄可欣宣布论文登上Science:从组学分析到实验室机器人编排,再到训练新的生物AI模型

社区关心它能做多少

评论区里的质疑集中在能力边界有人追问:"它到底完成了多少分析,又有多少只是标记出来交给人类检查?" 还有人直接发问:"Claude或者Codex也在做类似的事吗?"

▲ 社区追问:实际完成了多少分析,还是仅仅标记供人类检查?

▲ 有人质疑:通用编程智能体是否已覆盖类似能力?

这些质疑恰好击中了当前AI科研智能体的核心张力,领域专用环境到底是"护城河"还是"多此一举"?当Claude和Codex越来越强,一个精心编目的生物医学工具目录,还能领先多久?

三条路线的战国时代

Biomni并不孤独2025到2026年,AI做科研这条赛道上,至少有三股力量在同时狂奔:

Google的AI co-scientist 走的是"多代理辩论"路线,几个AI角色分别负责生成假说、反思、排名、进化,像一场永不散场的学术研讨会它的强项是思考,产出假说和研究提案。

Sakana AI的The AI Scientist 更激进,让AI从想点子到写代码、跑实验、画图、写论文、甚至模拟审稿,一条龙全包据称已有完全由AI撰写的论文被workshop接受。

Biomni选择了执行导向的路径:调工具、跑流水线、出结果、设计能送进通风橱的实验方案。

维度
Google路线:重思考
Biomni路线:重动手
Sakana路线:重闭环
核心产出
假说与研究提案
可运行的分析与协议
代码+论文+审稿
失败模式
看似新颖却不可行
跑通但生物学错误
形式完整但贡献空洞

这三条路线可以在同一实验室并行:用Google的系统想问题,用Biomni跑流水线,再用AI Scientist写初稿Science这次把聚光灯给了Biomni,因为它给出了一个更接地气的承诺降低科学研究中的摩擦

从斯坦福实验室到商业公司:Phylo的诞生

故事还有一条暗线

2025年9月前后,Biomni从斯坦福AI实验室自旋出来,成立了商业实体Phylo第一作者黄可欣出任负责人,Leskovec担任科学联合创始人。开源代码继续维护在GitHub上(Apache 2.0协议,首次下载数据湖约11GB),同时面向高校推出Academic Lab Program,面向企业提供托管平台。

▲ GitHub开源仓库 snap-stanford/Biomni:代码开放,支持多种大模型后端

"论文,开源,创业,再论文",这条路径在2020年代的AI for Science领域已经成了标准剧本。但Biomni的节奏格外紧凑:2024年初立项,2025年5月预印本和平台同步上线,2025年9月商业化,2026年7月Science正式发表。从实验室笔记本到顶刊封面,不到两年半。

关键问题:代码跑通 ≠ 生物学正确

在所有兴奋与焦虑之间,有一个冷水必须泼。

作者自己在论文中承认:已评估的任务仍只是领域子集,关键子域尚未触及;在需要细腻临床判断、全新实验思路或深层生物学综合的任务上,系统仍然吃力。

这指向一个深层悖论:代码跑通了,不代表生物学对了。 一条流水线可以完美执行、输出漂亮的图表,但如果上游假设错了,下游所有结果就是一场精致的幻觉在生物医学领域,一次错误的基因优先级排序或协议步骤,代价可能是数月的湿实验白费,甚至更糟。

所以,人类在环(human-in-the-loop)仍然是默认的安全模式智能体负责加速草稿和流水线,人类负责放行和担责。正如Stanford HAI报道所强调的:研究者可以审阅计划、逐步监控执行,并随时干预纠偏

▲ Stanford HAI以"AI Lab Partner"定位Biomni,强调人机协作而非替代

另一层隐忧来自开放获取讽刺的是,这篇讲述"让科研更高效"的论文本身并非开放获取,你需要机构订阅或付费才能读到全文。评论区里也有人追问NIH公共获取政策与论文访问条件之间的关系。

▲ 有人追问:一篇关于开放科研的论文,为何自己不开放获取?

为什么是现在?

最后一个问题:为什么这件事集中发生在2024-2026年?

答案是两条曲线的交叉点

一条是AI基础设施曲线:工具调用、代码沙箱、长上下文窗口、多步自我纠错……2024年之后,通用agent运行时的成熟速度远超预期。

另一条是生物数据洪峰曲线:单细胞测序、空间组学、长读长测序、可穿戴连续监测,每一项技术都在以指数级速度制造文件堆

当"AI终于能干活"和"数据多到人类干不过来"同时到达临界点,Biomni这样的系统就从科幻变成了工程题。

▲ Nature Medicine将Biomni概括为"加速生物医学研究的AI合作科学家"

Leskovec在采访中把障碍归结为那些拖慢创新的繁琐工序。

这也点出了Biomni的历史定位:它试图解放科学家的双手,让研究者把时间留给问题选择、判断与创造。

后面的故事,将由它在真实实验室里的表现继续书写。