乐于分享
好东西不私藏

斯坦福“AI生物学家”登Science!1.5万科学家使用,60小时工作40分钟干完

斯坦福“AI生物学家”登Science!1.5万科学家使用,60小时工作40分钟干完

你以为AI只会写代码、画图、聊天?斯坦福刚刚告诉全世界:它现在还能做实验了。

一篇登上Science正刊的论文,带来了一个已被15,000名科学家使用、跑通10万个研究工作流的系统。论文给出的愿景是:"AI智能体与人类研究者并肩工作,从基础研究到转化应用,全面加速生物医学发现。"

这个系统叫Biomni它会直接执行研究任务

▲ Science Magazine官方账号转发Biomni论文,配图展示其覆盖的跨学科工具与数据库生态

一个木匠终于拿到了工具箱

故事要从一个比喻说起

斯坦福计算机科学教授Jure Leskovec,这位图神经网络领域的传奇人物,在接受采访时用了一个让人拍案的比喻:"一个没有工具的木匠,只会'说木工话'。给它一套工具,它才能动手建造"

这个比喻点出了过去三年AI在生物医学领域的尴尬:ChatGPT能帮你总结论文、润色摘要、解释某个基因的功能,但要它完成一套分析,比如拿到一组单细胞RNA测序数据,跑完质控、降维、聚类、细胞类型注释、差异表达、通路富集这套完整流程,它立刻露怯。它懂概念,却缺少可用的工具

Biomni要做的,就是给AI装上手

具体怎么装?团队搞了一个被称为Biomni-E1的"环境层":用一套动作发现智能体,从bioRxiv上25个生物医学子领域的海量文献中,自动挖掘出科学家日常使用的工具、数据库和实验协议,再经过人类专家校验,集成进一个统一环境。

最终的数字是:150个专用生物医学工具,105个软件包,59个数据库,从Scanpy到AlphaFold DB,从ClinVar到DiffDock,从CRISPR向导设计到Golden Gate克隆协议,几乎覆盖了一个现代生物医学实验室计算侧的全部武器库。

▲ Biomni项目官网首页,清晰标注150 tools / 59 databases / 105 software的能力矩阵

然后是Biomni-A1,也就是智能体本身。你用自然语言告诉它"我要做什么",它会先检索相关工具和数据库,生成一个多步骤计划,每一步直接输出可执行代码并替你完成。遇到报错?它自己debug中间结果不对?它调整策略继续推进全程留下完整的执行轨迹,每一步都可追溯、可审计。

论文将它描述为一个能规划、行动、纠错并持续执行的研究伙伴。

40分钟 vs. 60小时:一场不公平的效率碾压

说能力容易,证明能力难Biomni论文里的几个真实世界案例尤其让人倒吸凉气,基准测试数字也足够醒目。

第一个案例:可穿戴数据的"大海捞针" 研究者上传了来自约30名参与者、时间跨度数月的数百个异构Excel文件,连续血糖监测、体温、饮食记录,格式五花八门。然后丢给Biomni一个开放性问题:"能不能发现什么有生物学意义的产热模式?"

Biomni自动生成了大约10步分析流水线:从血糖尖峰推断进餐时间→提取餐前餐后体温窗口→跨个体标准化→汇总人群趋势→输出可读报告。最终发现餐后平均升温约2.19°C

整个过程,约40分钟

Leskovec估算,如果让人类研究助理从零做同样的事,光数据清洗和格式统一就能让人崩溃,至少需要60个小时

▲ 斯坦福官方新闻:Meet Biomni – an AI-powered biomedical co-scientist

第二个案例更加暴力 团队给Biomni喂了一个包含约33.6万个单核RNA-seq与ATAC-seq细胞的人类骨骼发育数据集,配上空间转录组数据,要求探究骨骼谱系的转录调控网络。Biomni规划了一条约十阶段的分析流水线,数据装载、pySCENIC基序分析、GRNBoost2网络推断、cisTarget剪枝、AUCell活性打分、ATAC过滤、跨细胞类型与发育阶段分析、报告生成……

运行了超过五个小时过程中遇到变量名不匹配等执行错误,自己修了,最终交出完整的代码、图表、日志与分析目录。

这套演示呈现了真实的、可发表级别的生物信息学工作流

冷冰冰的数字:它到底比谁强多少?

论文同时提供了严格的基准测试在生物医学AI圈广泛使用的LAB-Bench评测中,Biomni在数据库问答任务上达到74.4%准确率,几乎追平人类专家的74.7%在序列问答任务上达到81.9%反超人类参考水平的78.8%。

团队还自建了八项"从未见过"的现实研究任务,覆盖遗传学、基因组学、微生物学、药理学、临床医学等方向:变异优先级排序、GWAS因果基因识别、罕见病诊断、药物重定位、单细胞注释、微生物组分析……在无任何任务专用提示调优的设定下,Biomni相对裸语言模型的平均性能提升达到402.3%,相对编码智能体提升43.0%

平均提升达到四倍

▲ 一作Kexin Huang宣布Biomni登上Science,并展示论文首页

它还能设计湿实验

如果说上面的都还是计算层面的能力,论文补充材料里展示的内容则把边界推得更远:Biomni能生成可操作的分子克隆实验协议,从oligo设计与退火、Golden Gate组装、转化、菌落筛选,到Sanger验证、慢病毒包装与转导,每一步都标注了试剂浓度、温控条件和操作时间。

这样一来,它可以分析数据,也能写出湿实验方案,让你或你的技术员拿着就能走进实验室操作。 论文摘要还提到蛋白稳定性优化与湿实验仪器编排等方向,团队瞄准了从dry lab到wet lab的全链路自动化

从论文到产品:15,000科学家的"真香"现场

学术发表只是故事的一半

▲ Stanford HAI:Stanford Scientists Build an AI Lab Partner

Biomni的代码以Apache-2.0许可开源在GitHub,仓库snap-stanford/Biomni已经积累了约3,700颗Star与此同时,团队早在2025年就把项目从Stanford AI Lab spin-out成了商业公司Phylo,推出云平台Biomni Lab,并设立了面向高校的Academic Lab Program

Stanford HAI在报道中给出了一组惊人的采用数据:开放后约九个月内,15,000名科学家使用Biomni自动化了约100,000个研究工作流斯坦福新闻则称原型已在超过10,000个实验室中使用。一作Kexin Huang在社交平台上还表示:"每天有数以万计的生物学家与智能体协作。"

▲ GitHub开源仓库:约3.7k Stars,Apache-2.0许可,Python为主

免疫学家Derya Unutmaz是Biomni的早期测试者,他公开说它已是顶尖BioAI平台,会推荐给每一个生物医学科学家朋友。

▲ 免疫学家Derya Unutmaz评价Biomni为"顶尖BioAI平台"

它仍需要研究者判断

在一片"效率碾压"的讨论中,团队也清楚系统的边界。

论文讨论部分明确承认:评估任务仍只覆盖领域子集;动作发现偏重近期文献,可能遗漏经典但仍有用的方法;在需要细腻临床判断、全新实验推理或深度生物学综合的领域,系统仍然明显不足Leskovec反复强调:"选择走哪条科学轨迹,仍然依赖人类经验与价值判断。"

这番强调对应着生物医学研究的核心创造力:提出好问题、在矛盾数据中做出取舍、在伦理灰区做出决断,这些能力目前还远在AI的能力边界之外。Biomni主要加速"mechanics"(机械劳动),"insight"(洞见)仍由研究者给出。 它像一个极其高效的研究助理,能帮你把数据从A搬到B、把分析从头跑到尾;至于做什么研究、为什么做、结果意味着什么,仍然需要人类回答。

2026年的AI科学家:不止Biomni一个

把镜头拉远,Biomni并非孤例2024到2026年间,"AI共科学家"的探索已经全面铺开:

Google推出基于Gemini的AI co-scientist,侧重假设生成与多角色科学辩论,它更擅长"想清楚下一个好问题";斯坦福医学院James Zou团队Virtual Lab,用多个LLM智能体模拟一个完整课题组开会讨论,甚至已在Nature发表了设计SARS-CoV-2纳米抗体的成果;Sakana AIAI Scientist系列则更激进,试图实现从构思到写论文到自动审稿的全流程自动化。

Biomni选择了动手执行的路线。一个统一的生物医学工具箱,150把"锤子"和"锯子"随时待命,你说一声要做什么,它自己规划、执行、纠错并输出报告。这条路线聚焦于清理那些折磨了无数博士生的重复性劳动。

Science给了它一个正式的学术背书。15,000名科学家给了它真实世界的投票。

而这场实验,才刚刚开始