以 BAISBench 为例,看 AI agent/AI 科学家 的 benchmark 该怎么做
前面讲到 Biomni正式发表在science上,一大波 类似的AI agent/AI 科学家正在汹涌而来——有大厂的,有新的创业公司做的,也有科研机构和课题组下场做的……
好用吗?有多好用?准确吗?多少有点担心不靠谱,毕竟还有 AI 幻觉这回事。还有不严格按照的指令操作这回事情;以及上下文太长跑偏等等情况。又到底有多聪明——AI scientist 能像人类科学家一样,对分析得到的数据给出结论得出新发现吗?
当然,对 Biomni 这样的系统,作者从知识推理、真实世界数据任务、湿实验方案等三个层面系统评估。这毕竟是自己评估自己,另外任务特别分散,很难讲对某类任务已经做了足够好的评估。面对同样的任务、不同的AI agent/scientist,怎么高效地给出可量化又不失公允的评价?恐怕得想想办法,给出一套系统性的方法了。Benchmark 嘛!
做了一点功课:生物信息领域,单看单细胞和空间组学,就有好几个了——scBench、SpatialBench、BAISBench、sc-HEUREKABENCH。其中 BAISBench 是我看到目前唯一正式经过同行评议发表的,那就以它为例,仔细看看吧。

图 1 BAISBench 总览:双任务设计(图1,Luo et al., Bioinformatics, 2026)
先看出题思路:一张考卷,两层能力
BAISBench 做的第一件事,就是把“AI 科学家”这个笼统的能力拆成两层来考。
第一层考执行力(BAIS-DPTA):丢给 AI 一个单细胞表达矩阵,让它独立完成从质控、归一化、降维、聚类到 marker 基因鉴定的完整流程,最后给每个细胞打上类型标签。15 个数据集来自 hECA 项目,都是专家手工标注的;而且禁用 CellTypist 这类现成工具——考的是 AI 自己的生物学知识,不是会不会调 API。打分也有意思:借助 uHAF 层级分类树(张学工课题组和做合作者一起开发的一套系统,解决细胞分类的复杂性不统一问题),标对精确类型得 1 分,只标对父类(比如把 CD4+ T 细胞标成 T 细胞)得 0.5 分,标对祖类也有 0.2 分。生物学上“部分正确”也算分,这个设计很懂行。
第二层考发现力(BAIS-SD):从 41 篇已发表的单细胞论文里,把论文报告的生物学结论变成 193 道选择题。AI 拿到对应的真实数据集和极简背景,得自己跑分析、做推理,选出和原文一致的答案。题目是 GPT-4o 初拟、人类专家逐题审校的;多选题部分选对还给 0.5 分。
考生呢?5 个代表性 AI 科学家(AutoBA、scChat、Biomni、Pantheon、STELLA),外加两个关键对照:GPT-4o 裸模型——用来回答“套一层 agent 架构到底值不值”;人类基线——1 名研究生用 CellTypist 做注释,5 名研究生分答 193 题。任务还重复跑了 10 次看稳定性。
成绩单:三个要点
第一,跑流程,AI 全部及格;做判断,还差一截。所有系统都完整执行了六步流程,但细胞注释的最高分属于人类 + CellTypist(约 0.41),AI 里最好的 STELLA 约 0.40,还是差一点点。
第二,架构复杂≠ 能力强。扎心的是,好几个精心设计的 agent 系统还不如 GPT-4o 裸写代码(约 0.36)。换底座模型的消融更直接:Claude Opus > Sonnet > Haiku——底座比架构更决定成绩。而且性能和 token 消耗显著正相关,说白了,目前的 AI 科学家很大程度上是“用算力换表现”。
第三,在发现类任务上,STELLA 约 78 分,追平了人类研究生。分题型看更有意思:人类强于关键基因、细胞异质性分析(靠直觉和经验),AI 强于数据驱动推理、发育状态分析(靠穷举高维数据)。人机互补,而不是人机替代——这是目前最真实的图景。

图 2 科学发现任务成绩:STELLA 与人类研究生持平(图6,Luo et al., Bioinformatics, 2026)
最精彩的部分:防作弊
题目来自已发表论文,模型训练时很可能“背过”啊。怎么办?作者做了两个对照实验:不给数据、去掉“答案必须来自数据”的约束,AI 凭记忆也能答对不少——捷径确实存在;保留约束但故意把题目和无关数据集错配,成绩立刻大跌,AI 还频繁报告“信息不足”——说明约束之下,它是真在分析数据。
Benchmark 的有效性本身也需要验证,这一手值得所有做评测的人学。
横向比一比
同类工作已有不少先行者:引言里提到的 scBench 和 SpatialBench 用确定性评分器考“分析步骤快照”的恢复,sc-HEUREKABENCH 用开放题加选择题考已验证的生物学洞见,但都还是预印本;再往外看,BLADE(2024)考“分析决策”,领域偏泛;ScienceAgentBench(2024)考代码生成,最强 agent 也只能独立完成 32.4% 的任务;BixBench(2025)用 50+ 个真实生信场景的开放题,把前沿模型打到 17% 正确率。
BAISBench 的差异在哪?评测对象从“计算输出”升级到了“生物学结论的恢复”,而且它是唯一同时配齐人类基线、裸模型基线、底座消融和防捷径对照的。当然,开放题暴露能力上限、选择题换取客观可规模化,两种取向各有用途,分数本身不必横着比。
可以抄作业的方法论清单
任务贴真实工作流、按能力分层;ground truth 用专家标注和已发表结论;指标容忍“部分正确”,参考细胞的层级标注打分方案;人类基线 + 裸模型基线缺一不可;做底座消融和防捷径对照;过程与结果并重、多跑几次看稳定性;把 token 成本写进成绩单。
局限作者自己也说了:人类基线规模小;测的是“复现已知结论”而不是“新发现”;只覆盖了单细胞转录组。我记得和校内一位生物信息学方向的教授聊过,转录组和单细胞转录组分析恐怕是生物信息里面相对最容易的任务了(限于从表达矩阵开始的分析,不包括其它牵涉原始bam文件的分析)。
一句话总结:AI agent科学家已经能可靠地对单细胞测序数据“做分析”,开始在“做发现”上摸到人类的门槛;而 benchmark 考什么、怎么给分、防什么捷径,决定了这个领域朝哪个方向走,至关重要。现在很多公司推出自己的AI agent系统的时候,甚至推出了自己的benchmark as service,各领域怎么构建自己的benchmark系统,还有很多工作要做。
参考文献:
Kexin Huanget al.,Autonomous biomedical research with an artificial intelligence agent. Science393,eadz4351(2026).DOI:10.1126/science.adz4351
Workman K, Yang Z, Muralidharan H, Abdulali A, Le H. scBench: Evaluating AI Agents on Single-Cell RNA-seq Analysis. LatchBio, arXiv:2602.09063, 2026.
Workman K, Yang Z, Muralidharan H, Le H. SpatialBench: Can Agents Analyze Real-World Spatial Biology Data? LatchBio, arXiv:2512.21907, 2025.
PanigrahiS, et al,HeurekaBench: A Benchmarking Framework for AI Co-scientist. https://arxiv.org/abs/2601.01678
Luo E, Jia J, Xiong Y, et al. Benchmarking AI scientists for omics data-driven biological discovery. Bioinformatics. 2026;42:btag227. https://doi.org/10.1093/bioinformatics/btag227
BAISBench 仓库: https://github.com/EperLuo/BAISBench https://huggingface.co/datasets/EperLuo/BaisBench
Zhou J, Zhang B, Li G et al. An ai agent for fully automated multi-omic analyses. Adv Sci 2024;11:2407094.
Lu Y-C, Varghese A, Nahar R et al. scchat: a large language model-powered co-pilot for contextualized single-cell rna sequencing analysis, bioRxiv, 2024b, 2024–10.
Xu W et al. PantheonOS: an evolvable multi-agent framework for automatic genomics discovery. bioRxiv 2026;2026.02.26.707870.
Jin R, Zhang Z, Wang M et al. STELLA: self-evolving LLM agent for biomedical research. arXiv 2025;2507.02004.
Bian H, Chen Y, Wei L et al. Uhaf: a unified hierarchical annotation framework for cell type standardization and harmonization. Bioinformatics 2025;41:btaf149.
Gu K, et al. BLADE: Benchmarking Language Model Agents for Data-Driven Science, https://arxiv.org/abs/2408.09667,2024.
Chen Z, Chen S, Ning Y et al. ScienceAgentBench: toward rigorous assessment of language agents for data-driven scientific discovery. arXiv 2024;2410.05080.
Mitchener L, et al. BixBench: A Comprehensive Benchmark for LLM-Based Agents in Computational Biology. FutureHouse, 2025.
夜雨聆风