乐于分享
好东西不私藏

OpenAI的新基准考的不是AI,是真实的医学研究能力

OpenAI的新基准考的不是AI,是真实的医学研究能力

这周OpenAI发了一个新基准,名字叫LifeSciBench。750道题,由173位有博士学位或同等学历的生命科学家出题和评审,覆盖7个生物医学领域。每道题有约25条细化评分标准,总共19020条评估点。

但最让我觉得有意思的,不是规模,而是题目类型。

79%的题目需要多步推理——这意味着你没法靠背题库过关。53%的题目要求解读图表、PDF、显微镜图像等附件数据——这意味着纯文本模型直接出局,必须有多模态能力。题目的核心不是"诊断这是什么病",而是"基于这段实验数据,你觉得下一步应该怎么设计实验"。

和现有医学基准的区别

在LifeSciBench之前,AI在生物医学领域最常用的两个基准是MedQA和USMLE。这两个都是选择题——给一段病历描述,四个选项,选对的。

选择题好做。LLM天生擅长模式匹配。去年就有论文指出,GPT-4在USMLE上拿高分,很大程度上是因为训练数据里包含了大量医学考试题目和解析。

LifeSciBench走了完全相反的路。题目是真实的研究场景——比如"给一篇论文的实验数据,让你判断结论是否站得住脚"或"设计一个验证假设的实验方案"。评分是用细则一条条对,而不是对/错二元判断。每道题要同时评两个维度:科学正确性(结论对不对)和实用价值(给出的建议有没有实际可操作性)。

OpenAI官方用o3在LifeSciBench上做了初步评测。目前结果还没公开(也可能永远不会完全公开基准数据,只发布方法论)。但从我拿到的信息来看,这个基准的设计本身就是一篇文章——它重新定义了"AI在生物医学领域有没有用"这个问题。

不是"AI能不能通过医学考试"——这个答案早就是"能"了。真正的问题是"AI能不能像一个有经验的研究者一样,面对不完整的实验数据,提出合理的下一步"。

七个领域的覆盖

LifeSciBench覆盖的七个领域:

  • 分子与细胞生物学
    :基因编辑策略、蛋白互作分析
  • 遗传学与基因组学
    :GWAS数据解读、变异致病性评估
  • 药物发现与开发
    :靶点验证、先导化合物优化
  • 生物信息学与计算生物学
    :序列比对、通路富集分析
  • 神经科学
    :脑成像数据分析、行为实验设计
  • 免疫学
    :免疫组化解读、疫苗设计
  • 临床研究
    :临床试验方案评估、真实世界证据分析

这个覆盖面的野心一目了然:不是测AI懂不懂医学,是测AI能不能真正参与药物研发的全流程——从分子层面到临床试验。

173位科学家出题这件事

另一个值得注意的细节是出题方式。不是找几个博士生出几道题——OpenAI和173位有博士学位的生命科学家合作,每人负责自己最擅长的学科子领域。题目出来后经过互审,去掉有争议的,保留能形成明确评分标准的。

这个流程意味着几件事。第一,题目质量比现有基准高一个档次——不是在堆量,是在堆专业度。第二,19020条评分细则意味着每个任务有大约25条明确的"好答案应该包含什么"——对AI来说这比"对/错"更难,因为要同时满足多条评判标准。第三,这种"领域专家出题+跨审"的模式,可能会成为未来AI基准评测的新范式——尤其是需要专业领域知识的场景。

医药AI的真实进展

LifeSciBench发布的时间点挺微妙。

过去12个月,AI在医药领域的几个标志性时刻:AlphaFold3开放(但走的是商业许可而非开源)、多篇"AI辅助发现新药"的论文(后来被指出部分数据不可复现)、大型语言模型在医学对话中的实用性被重新评估(Mayo Clinic的临床实验显示医生在日常工作中使用率低于预期)。

说的直白一点:AI在医药领域的"公关分"远高于"实际分"。我们看到了很多Demo,但真正在医院里改变诊疗流程的AI应用,一只手数得过来。

LifeSciBench在这种背景下发布,本身就是一个信号。OpenAI没有选择发一篇"我们的模型在某个医药考试上得了最高分"的PR稿,而是发了一个评测方法——告诉行业"目前最能衡量AI医学能力的不是你的模型能考几分,而是它能不能完成一个博士级研究者每天面对的真实任务"。

对中国医疗AI开发者的启示

国内做医疗AI的团队很多——从百度灵医智惠到腾讯觅影,从医渡云到森亿智能。目前的主要方向集中在影像辅助诊断和电子病历结构化,本质上是"模式识别"类任务。

LifeSciBench指向的,是更上一层楼的能力:实验设计、证据评价、多步推理。这些任务目前AI还做不好——但如果有人在LifeSciBench上拿到高分,那就意味着AI在医药领域的角色可以从"辅助诊断工具"升级为"研究伙伴"。

对于有自有数据的国内团队来说,LifeSciBench的评分方法可以直接复用。750个任务题可能不会完全公开(OpenAI在这方面一向保守),但19020条评分细则的制定方法学是公开的。用同样的方法,基于国产医药数据构建一个"中文版LifeSciBench",技术上完全可行。

不过在此之前,先想想一个基本问题:你手头的医药AI产品,能不能回答"基于这段实验数据,下一步实验应该怎么做"?如果答不了,那它和真正的研究能力之间,还有一段路要走。