| 👆 点击关注「星捷AI前沿」 | 「···」→ 设为星标 ⭐ |
2026年6月17日,OpenAI发了一篇博客,标题很克制:A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry。
翻译过来就是:一个近乎自主的AI化学家,改进了药物化学中一个棘手反应。
但读完细节,这件事的意义远比标题来得重。GPT-5.4不只是在实验室里跑跑腿——它独立提出了一个让人类化学家觉得"意外且有趣"的研究假设,然后通过10,080次实验验证了这个假设,最终改进了一个药物合成中的瓶颈反应。
先说清楚:到底发生了什么
OpenAI把GPT-5.4接入了Maria——这是Molecule.one公司开发的一套AI化学代理,连接着一个高通量自动化实验室。整个系统的分工是这样的:
GPT-5.4:负责提出研究假设、设计实验方案、分析实验数据、提出后续实验方向
Maria AI:把GPT-5.4的高层方案翻译成具体的实验室操作指令,执行实验,返回结构化数据
Maria Lab:物理实验室,机器人执行化学反应,规模是微升级别的高通量筛选
OpenAI给GPT-5.4的目标是开放式的:改进几类重要反应中的某一类。不是做选择题,是自己选题。
GPT-5.4做了一个关键决策:它自主识别出伯磺酰胺(primary sulfonamides)是一个"有挑战性但高价值"的底物类别,然后提出用TEMPO(2,2,6,6-四甲基哌啶氧化物,一种温和的自由基氧化剂)来改进Chan-Lam偶联反应。
这个建议让人类化学家感到意外。TEMPO通常不被用在Chan-Lam偶联中——它是一种氧化剂,而这个反应本身就需要氧化条件,直觉上额外加氧化剂可能带来副反应。但GPT-5.4在文献综述的基础上推断,温和氧化剂可能有助于减少脱硼副反应(oxidative deboronation),同时促进催化循环。
为什么这个反应值得改进
Chan-Lam偶联反应是用来形成碳-氮键的。碳-氮键在药物分子中极其常见——你吃的很多药里都有这个结构。
具体到伯磺酰胺与硼酸的Chan-Lam偶联,这个反应历史上产率很低。磺酰胺基团出现在一大类药物中:抗癌药、抗菌药、利尿剂。如果能让这个反应更可靠,药物化学家就能更高效地合成和筛选候选药物。
药物发现中,合成是瓶颈。科学家只能测试他们能造出来的分子。一个反应产率从16.6%提到25.2%,看起来不多,但如果你要筛选上千个分子,这个提升意味着大量原本"造不出来"的分子变得可造了。
数据说话:10,080次实验
整个验证过程分为两轮实验,Maria Lab总共执行了10,080次反应。
OpenAI在原文里做了一个很直观的对比:一个化学家每天跑3个反应,要跑将近10年才能完成这个工作量。Maria Lab在3个月内做完了。
📊 关键数据
| 指标 | 优化前 | 优化后 | 变化 |
|---|---|---|---|
| 平均产率 | 16.6% | 25.2% | +51.8% |
| 产率>30%的反应占比 | 15.6% | 37.5% | +140% |
| 产率提升的硼酸底物 | — | 88% | — |
| 产率提升的磺酰胺底物 | — | 83% | — |
这些数字不是在几个理想条件下挑出来的——是跨多样底物组合的统计结果。10,080次反应的规模让结论有了统计意义,而不是"挑了几个好的报"。
GPT-5.4还发现了一个实用的优化点:TEMPO可以用便宜得多的4-羟基TEMPO替代,性能几乎没有损失。这种成本优化在工业应用中很重要。
从微升到台面:人工验证
高通量筛选的数字再好看,也存在一个隐患:微升规模的实验结果有时候在放大到常规实验台规模时会消失。
OpenAI没有回避这个问题。人类化学家在台面规模(bench scale)手动重复了代表性反应,结果:
14组底物对中,11组产率提升
其中8组提升幅度超过2倍
这意味着TEMPO的改进效果不是微升实验的假象,在常规实验室条件下也成立。台面验证是发表科学论文前的标准步骤——这组数据让结论从"高通量筛选发现"升级为"可复现的化学发现"。
4位外部化学领域专家审阅了描述这一发现的预印本论文,支持这是一个值得发表的新结果。当然,最终检验将是独立实验室能否复现。
"近乎自主"——注意这个措辞
OpenAI用"near-autonomous"而不是"autonomous",这个措辞是准确的。
人类在整个过程中扮演了关键角色:
方向把控:人类化学家编写引导和评分提示词,从GPT-5.4生成的数千个提案中筛选出4个进入实验
实验修正:最大的修正是否决了DMSO(二甲基亚砜)作为溶剂——因为人类化学师担心它与强氧化剂反应
实验操作:人类协助准备实验室耗材和试剂
独立验证:台面规模的手动重复实验由人类完成
GPT-5.4的贡献是:提出核心研究思路(识别问题+提出意外假设),设计实验方案,分析数据,提出后续实验方向。人类的贡献是:判断、修正、验证。
这不是"AI替代科学家",是"AI作为研究伙伴"——一个能在一周内做完你十年实验量的研究伙伴。
一个被忽略的细节:4个提案,2个成功
GPT-5.4提出的研究提案中,人类选了4个进入实验测试。结果:
OAI-M1-01:被实验证伪
OAI-M1-02:实验验证成功
OAI-M1-03:实验验证成功(就是本文的主角)
OAI-M1-04:实验验证成功
排除1个证伪,3/4的验证成功率。这个数字很有意思——如果AI每次都能猜对,说明它没在提出有风险的新假设;如果全错,说明它不具备化学推理能力。2/3的验证成功率说明GPT-5.4的化学推理是有实质内容的,但远非完美。
这个数据比"AI做对了一件事"更有信息量——它让我们看到AI科学推理的可靠性和边界。
放进更大的图景
这件事不是孤立的。OpenAI正在系统性地推进AI在科学发现中的应用,路线图很清晰:
数学:disproved a discrete geometry conjecture(单位距离问题)
理论物理:胶子振幅的新结果
生物学:GPT-5 + Ginkgo Bioworks,无细胞蛋白合成成本降低40%(36,000+次反应,580块板,6轮闭环实验)
药物化学:本次工作,Chan-Lam偶联反应改进
基础设施:LifeSciBench——750个专家编写任务,173位科学家贡献,19,020条评分标准
专用模型:GPT-Rosalind,面向生命科学研究的定制模型
注意这条线的递进:数学(纯推理)→ 物理学(推理+计算)→ 生物学(推理+实验)→ 药物化学(推理+实验+现实世界约束)。每一步都比上一步多一层"接地"——从纸上推理到需要物理实验验证。
这条路的终点很明确:让AI从"回答问题"进化到"解决问题",从"辅助思考"进化到"驱动发现"。
诚实地谈局限
OpenAI在原文中列出了局限,这些不是客套话,是真正需要关注的:
1. 没有完全自主:人类判断仍然是关键环节,整个流程依赖专业的高通量基础设施
2. 泛化性未验证:这个方法能否推广到其他偶联反应、其他底物类别、工业级生产条件,都还是问号
3. 需要独立复现:4位专家审阅了预印本支持其价值,但科学发现的金标准是独立实验室复现
4. 产率数据来源:来自高通量平台,台面验证只覆盖了14组代表性底物对——更多底物、更广泛条件下的表现有待测试
📌 一个OpenAI没有明说但值得思考的问题
GPT-5.4提出TEMPO的推理过程,是基于文献整合的"知识重组",还是真正的"新推理"?如果只是前者,那它的价值是"比人类更快地扫完文献并找到交叉点";如果是后者,那就意味着AI能产生超越训练数据中已有知识的新推理。
从博客描述来看,TEMPO用于Chan-Lam偶联是"文献中没有直接报道过"的组合——但这不等于"AI创造了新知识",可能只是"AI找到了一个人类没有尝试过的已知组合"。这两者之间的区别,决定了AI在科学发现中的真实定位。
这件事真正意味着什么
跳出这个具体的化学反应,往大了看:
AI正在改变科学发现的吞吐量。 10,080次反应在3个月内完成,这不是人类工作节奏——这是机器工作节奏。当AI能自主提出假设并连接到自动化实验设施,科学发现的迭代速度会发生数量级的变化。
瓶颈从"想"转移到了"做"。 过去,科学家的瓶颈是想不出好假设。现在,AI能提出假设,自动化设施能执行验证——瓶颈变成了"如何确保实验设计的质量和数据解读的准确性"。这是不同类型的瓶颈,需要不同类型的人类专长。
"意外"是关键信号。 人类化学师觉得TEMPO的建议"意外且有趣"——这个"意外"恰恰说明AI的推理不是简单的模式匹配。如果AI只推荐教科书上的标准方案,它就没有价值。真正的价值在于跨域连接——把A领域的知识用到B领域的问题上。
科学验证的标准没有降低。 台面验证、专家审阅、独立复现——这些环节一样不少。AI加速的是发现过程,不是验证过程。这其实是好事:科学严谨性没有因为AI的介入而打折。
写在最后
10,080次反应,3个月,一个让化学家意外的发现。
这件事本身不大——改进一个反应的产率,在化学史上只是一个点。但这个"点"背后展示的模式——AI自主提出假设、机器执行验证、人类把关方向——很可能就是未来科学研究的常态。
不是AI替代科学家。是AI让科学家从"每天跑3个反应"变成"每天审视3个AI提出的研究方向"。
这个变化,比任何一个具体的化学反应改进都值得记住。
参考来源:
OpenAI Blog: A near-autonomous AI chemist improves a challenging reaction in medicinal chemistry (2026-06-17)
OpenAI Blog: Introducing LifeSciBench (2026-06-17)
OpenAI Blog: GPT-5 lowers the cost of cell-free protein synthesis
OpenAI Blog: Introducing new capabilities to GPT-Rosalind
夜雨聆风