
📌 6月30日,OpenAI推出GeneBench-Pro——一个覆盖基因组学、定量生物学、转化医学等10个领域的高水平基准,共129道博士级题目。GPT-5.6 Sol在最高推理层级下通过率28.7%,开启Pro模式后达到31.5%。回想GeneBench刚建立时,最强模型通过率还不到5%。进步速度远超预期。更让科研圈坐不住的是成本:一道典型题目,人类专家需要20-40小时,按每小时200美元计算,成本高达数千美元;而AI推理成本只需几美元。差三个数量级。OpenAI已将10道代表性题目开源至Hugging Face,并计划向Artificial Analysis提供50题供第三方独立评测。

💬假设你是一个博士生,花了两天半——20到40个小时——啃完一篇基因组学文献,设计了一套分析方案,反复验证后提交。你的导师按科研项目时薪200美元给你算,这道题的成本大约4000到8000美元。现在,同一个任务,AI只需要几美元,耗时不到你冲一杯咖啡的时间。
这不是假设。这是OpenAI今天发布的GeneBench-Pro基准测试所展示的现实。31.5%——这是AI目前在这些博士级科学题目上的最高通过率。听起来不高,但一年前这个数字还不到5%。科学家们,真的该慌了。
🧠 一、GeneBench-Pro是什么?——科学界的“图灵测试”
GeneBench-Pro是OpenAI专为计算生物学设计的高水平基准,共129道题目,覆盖基因组学、定量生物学、转化医学等10个细分领域。它不是在考AI能不能写文献综述,而是在考AI能不能处理真实的科学研究中遇到的硬核问题。
题目来源是已发表的高水平学术论文。每道题都经过外部专家评审,确保具有真实的科研难度。有些题目需要设计完整的分析流程,有些需要解读复杂的实验结果,有些需要在多个数据库之间做交叉验证——这些正是博士研究生每天在做的事情。
目前最高分是GPT-5.6 Sol的Pro模式,通过率31.5%。也就是说,还有三分之二以上的题目AI做不出来。但关键在于趋势:GeneBench刚建立时,最强模型GPT-5的通过率不到5%。一年多时间,从5%到31.5%,翻了六倍。
“AI在科学基准上的进步速度,已经不是在爬楼梯,而是在踩油门。去年还只能过5%的题,今年已经过了近三分之一。按照这个速度,再过两年,这个数字可能就不是31.5%了。”

💰 二、成本对比——差三个数量级意味着什么?
外部评审给出了这道算术题:典型题目,人类专家需要20-40小时。按科研项目时薪200美元计算,成本4000-8000美元。AI推理成本,只需要几美元。
差三个数量级。
这意味着什么?一个科研团队如果每年有1000道这种级别的分析任务,用人类专家的成本是400万到800万美元。用AI,即使只成功三分之一,也能把成本压缩到不到1万美元——剩下的三分之二继续由人类专家处理。省下的预算,可以再招两个博士后,多跑一个课题方向。
AI不是替代科学家,是让同样的科研预算撬动更大的产出。 实验室里那些重复性高、逻辑链条清晰但极其耗时的分析工作——基因组比对、蛋白质结构预测、药物靶点筛选——AI已经在成本上具备了不可逆的优势。
“科学进步的速度,最终取决于瓶颈在‘思维’还是‘工时’。AI把‘工时瓶颈’打穿了,科学家才能把更多时间花在真正的突破性思考上。”

🔬 三、对科研从业者意味着什么?——三类岗位被推上风口
基础科研助理/RA:文献综述、数据清洗、常规分析——这些工作的替代压力最直接。不是因为AI做得更好,而是因为AI做得够用且极其便宜。
博士研究生:AI还无法独立完成一整套科研流程——提出假设、设计实验、解释意外结果仍然需要人类的直觉和创造力。但AI已经能吃掉科研中最耗时的“体力活”。用AI加速常规分析、腾出时间做核心创新的博士生,和还在手动跑数据的博士生,差距会迅速拉大。
PI/实验室负责人:预算分配的优先级要重新排。是继续花大钱雇RA做基础分析,还是用AI扛下常规工作、把人力集中在需要创造性的环节?这笔账今天开始变得很好算。

⚠️ 四、冷静视角——31.5%不是100%
- 31.5%的通过率意味着还有大量题目AI完全做不了。
这些题目可能涉及需要全新假设的探索性研究,或者需要跨领域知识整合的复杂问题。AI还远没有到“独立做科研”的阶段。 - 基准测试的题目是“已知有解”的。
真实科研最大的挑战是,你甚至不知道问题是什么、答案是否存在。这种“未知的未知”,AI目前还完全无法处理。 - OpenAI开源了部分题目供第三方评测。
这是一个值得鼓励的开放姿态。 科学界 可以亲自验证AI的表现,而不是听一家公司的自评。
🏁几美元挑战几千美元,31.5%挑战100%——AI在科学领域的故事,才刚刚开始。
它不会立刻取代科学家,但会重新定义科学家的工作方式。会做常规分析的科学家不再是稀缺资源,能把AI当成超级助手、把更多时间花在提出好问题和设计好实验上的科学家,才是下一个时代的领跑者。

💬 问:如果AI能帮你做科研,你最希望它先帮你解决哪个难题?文献综述、数据分析、实验设计还是论文润色?评论区说说你的领域和最想外包给AI的那件事。
🔖 收藏这篇,等GeneBench-Pro下一轮评测数据出来时回来看。转发给实验室的同事。
夜雨聆风