乐于分享
好东西不私藏

AI For Science 从定义到未来的完整脉络

AI For Science 从定义到未来的完整脉络
从定义到未来的完整脉络,分六层由浅入深。
核心训练:学会区分"技术上的突破"和"对该领域真实问题的解决"——两者之间往往隔着一条很宽的鸿沟。

全局地图

第一层:认知基础(What is it really?)
  (1) 本质重新定义 —— 不是"给科学家用的AI",而是什么
  (2) 科学流程解剖 —— AI能在哪些节点介入,不能在哪些
  (3) 为什么科学是AI最难啃的骨头

第二层:问题类型(What kinds of problems?) (4) 前向问题:预测与代理建模 (5) 逆向问题:设计与生成 (6) 发现问题:从数据蒸馏规律 (7) 闭环问题:自主实验室

第三层:方法论图谱(How does it work?) (8) 几何深度学习 —— 把对称性编进网络 (9) Physics-Informed ML —— 先验知识的整合 (10) 科学基础模型 —— 迁移学习的科学版本

第四层:领域实战(Where is it working?) (11) 生命科学 —— AlphaFold 之后发生了什么 (12) 材料科学 —— 从预测到设计 (13) 气候与物理 —— 模拟的大替代 (14) 数学与形式推理 —— AI 能做证明吗

第五层:深层结构(What are the hard questions?) (15) 数据困境 —— 为什么科学数据不是互联网数据 (16) 验证危机 —— benchmark 与真实价值的断层 (17) 预测 vs 理解 —— 最深的认识论张力

第六层:商业与未来(So what?) (18) 商业化路径与护城河分析 (19) AI Scientist —— 从工具到研究者的边界在哪

第一层:认知基础

本质重新定义

"AI for Science"这个词被严重滥用了。它在不同人口中指的是完全不同的东西——用神经网络替代数值模拟的人叫它 AI for Science,用 ChatGPT 搜文献的人也叫它 AI for Science,Demis Hassabis 去领诺贝尔奖也是这个旗号。把这些混在一起讨论毫无意义。

AI for Science 的本质,是用机器学习方法加速或替代科学过程中的某个计算/认知瓶颈。 关键词是"瓶颈"——科学不是一个均匀的过程,它在不同环节有完全不同的速率限制:有时瓶颈是实验通量,有时是计算成本,有时是人的分析能力,有时是搜索空间。

不同的瓶颈,需要完全不同的 AI 方法,成熟度也完全不同。

干预类型瓶颈所在典型例子成熟度
替代计算数值模拟太慢太贵天气预报、分子力场★★★★★
加速搜索设计空间太大药物发现、材料设计★★★★☆
处理数据数据量超过人力基因组、天文★★★★☆
自动实验实验通量是瓶颈自驱动实验室★★★☆☆
发现规律规律本身未知符号回归、定律提取★★☆☆☆
生成假设推理与创意LLM 科学助手★☆☆☆☆

最重要的认知校正:今天 AI for Science 最扎实的价值,几乎全部集中在前三行。最后两行是真正的科学意义所在,也是目前最欠兑现的地方。这条鸿沟,是整个领域最大的叙事风险。

科学流程解剖

科学不是一个动作,而是一个循环:

   观测/测量  →  数据处理  →  模式识别  →  假设形成
       ↑                                    ↓
   结果验证  ←  实验执行  ←  实验设计  ←  理论建立

AI 对每个节点介入的方式和成效截然不同:

观测/测量层:硬件自动化 + AI 辅助采集。冷冻电镜自动对焦、自动巡天、碱基识别。技术成熟,价值清晰。

数据处理层:传统 ML 主战场。分类、回归、降维、去噪。AlphaFold 在技术上属于这层的超级版本——给定序列,输出坐标。成功率最高,因为任务定义最清晰。

模式识别层:从数据里提取规律。AI 是一个高维模式检测器,但找出来的是相关性,不是因果性。

假设形成层:科学的核心创造力所在,也是 AI 目前最弱的地方。需要因果推断、类比推理、跨领域整合——LLM 可辅助,不能主导。

实验设计层:贝叶斯优化和主动学习有真实价值——在有限预算下智能选择信息增益最大的下一个实验。

实验执行层:自驱动实验室。目前主要在化学合成和材料制备这类高度标准化的领域。

结论:AI 对科学循环的介入高度不均匀。越靠近"数据→模式",越成熟;越靠近"假设→理解",越弱。当前大多数成功故事发生在数据处理侧,而不是理论创造侧。

为什么科学是 AI 最难啃的骨头

原因一:数据稀缺且异质。 互联网文本有万亿 token,PDB 积累五十年只有 20 万条结构。不同实验室的数据很难直接合并训练。科学数据的规模和质量,天然反抗 scaling law。

原因二:外推是常态,而不是例外。 语言模型做的是内插(在已见分布里预测);科学的本质是外插(提出已知范围之外的预测)。所有 ML 方法在外插上都会退化。

原因三:验证成本极高。 大语言模型的错误是便宜的;科学 AI 的一个错误候选分子,可能要数亿美元和数年才能在临床被否定。

这三个原因加在一起:科学恰好在数据量、外推要求、验证成本三个维度上,都站在深度学习舒适区的对立面。 AlphaFold 之所以能成,正是因为蛋白质折叠恰好拥有罕见的大数据集、清晰的评测标准、和可被实验快速验证的预测——三个困难同时被绕开了。

第二层:问题类型

AI for Science 看起来是一个领域,实际上是四类结构完全不同的问题——不同方法论、不同成熟度、不同价值天花板。

前向问题:预测与代理建模

形式:给定输入,预测输出。这是最成熟、当前工程价值最大的类型。

代理模型(Surrogate Model)的本质:数值模拟是一个确定性但昂贵的函数,用神经网络拟合这个昂贵函数的近似,把"算"变成"查"。

传统:物理状态 → [微分方程求解器,耗时数小时] → 结果
代理:物理状态 → [神经网络推断,耗时毫秒] → 结果(近似)

成立条件:足够多的模拟数据、可接受的精度损失、实质性的速度价值。核心限制是外推——神经网络本质是插值器,遇到训练集未覆盖的状态会静默给出错误结果。

应用被替代的计算速度提升代表工作
天气预报数值天气预报1000x+GraphCast, Pangu-Weather
分子力场DFT/从头算100x~1000xMACE, NequIP, ANI
蛋白结构物理折叠模拟极大AlphaFold2/3, ESMFold
等离子体控制MHD 模拟实时化DeepMind Tokamak

逆向问题:设计与生成

形式:给我想要的性质,找出满足条件的结构。这是设计问题,不是预测问题——前向通常有唯一解,逆向往往有无数解。

核心困难:搜索空间天文数量级(药物约 10^60)+ 设计与验证之间的成本鸿沟。

生成模型(扩散、流匹配)的洞察:与其搜索,不如学习满足条件的结构的概率分布,然后采样——把组合优化转化成采样。

旧范式:目标性质 → [启发式搜索] → 候选 → 验证(盲目低效)
新范式:目标性质 → [条件生成采样] → 候选分布 → 筛选 → 验证(有引导)

标志案例:RFdiffusion(蛋白骨架设计)+ ProteinMPNN(序列补全)+ AlphaFold(验证),形成计算内自洽闭环。

核心困境:生成候选可以无限,但验证每个候选仍需回实验室,成本未降。认知校正:AI 药物公司做的核心是逆向设计,但"生成更好候选"和"得到有效药物"之间隔着临床这座大山,候选质量的提升被后续管线噪声稀释——这是这类公司迟迟无法在临床终点上服众的结构性原因。

发现问题:从数据蒸馏规律

质的跳越:AI 能不能从数据里提取人类还不知道的规律,并以可解释形式表达? 认识论地位最高,成熟度最低。

路径一:符号回归。 SINDy、PySR——从数据里逼出显式方程。输出是人类可读的方程。AI Feynman 从物理数据重新发现费曼讲义的 100 个方程,是激动人心的概念验证——但前提是无噪声理想数据、方程在已知候选类里。真实数据有噪声时表现急剧退化。

路径二:神经网络作为假设生成器。 从网络权重里提取守恒量、对称性、方程结构。哲学前提更大胆,也更难验证。

发现的认识论层级:
最弱(伪发现):找到训练集里的统计相关性
中间(压缩发现):找到更简洁描述已知现象的数学形式
最强(真实发现):预测分布外的新现象,被独立实验证实

当前几乎所有被宣传的 AI 科学"发现"都在第一或第二层,而不在第三层。 第三层才是诺奖级别。

闭环问题:自主实验室

真正把 AI 接进物理世界:机器人执行、传感器采集、AI 分析、决策下一步。

核心价值不是自动化,而是数据密度。 把数周的实验循环压缩到数小时,意味着几个数量级更多的数据点——从根本上改变了科学数据的经济学

核心算法:主动学习与贝叶斯优化——在有限预算下,每次选在"预期改进"和"不确定性探索"间最优平衡的实验点。

贝叶斯优化/主动学习 → [下一个实验点]
       ↑                    ↓
更新概率模型        机器人执行(合成/测量)
       ↑                    ↓
[新数据点]    ←    传感器 + 仪器分析
       数小时内可循环数百次

代表:Berkeley A-Lab(17 天合成验证 41 种新无机材料)、Aspuru-Guzik 的自驱动化学平台。结构性限制:最适合标准化、可机器人可靠执行的场景(化学合成、材料制备);越涉及体内/临床实验,自动化难度越急剧升高。

四类问题对比:

问题类型核心任务成熟度主要价值最大限制
前向预测输入→输出★★★★★速度、成本外推失效
逆向生成性质→结构★★★★☆候选多样性验证成本高
规律发现数据→方程★★☆☆☆真正的科学噪声、验证难
闭环实验AI+机器人★★★☆☆数据密度标准化限制

组合逻辑:最强大的系统往往把多类问题串联——闭环实验室用贝叶斯优化决定实验、用生成模型提议候选、用积累数据发现规律。看它们如何组合,才能理解系统的真实能力。


第三层:方法论图谱

三套方法论的共同主题:如何把人类已有的科学知识,注入到本来一无所知的神经网络里。

几何深度学习:把对称性编进网络

过去十年方法论上最重要的突破。

朴素做法(把原子坐标拉平喂给 MLP)会惨败:同一分子旋转平移后坐标全变,能量却不变,网络必须从海量数据里"学会"这个物理事实。

核心洞察:与其让模型从数据里学物理对称性,不如直接把对称性硬编进架构——把领域知识从"训练数据"搬到"归纳偏置"。

不变性:f(旋转(x)) = f(x)        [标量输出,如能量]
等变性:f(旋转(x)) = 旋转(f(x))   [矢量输出,如力]

对称性由群论描述:SE(3)(旋转平移)、E(3)(加镜像)。演化脉络:Behler-Parrinello(手工对称函数)→ SchNet(连续卷积)→ NequIP/MACE(E(3) 等变张量积消息传递)。结果:数据效率巨大提升——MACE 可用几百到几千样本达到过去需几十万样本的精度,直接缓解了科学数据稀缺困境。AlphaFold2 的 IPA 是同一思想在蛋白领域的体现。

核心判断:在科学领域,正确的归纳偏置比更多数据和更大模型更重要——与互联网 AI 的 scaling 信仰恰好相反。

Physics-Informed ML:先验知识的整合

注入的不只是对称性,而是具体的物理定律本身(通常是微分方程)。

PINN 的想法:用神经网络表示解函数,把"解必须满足微分方程"写进损失函数。

PINN 损失 = 数据拟合误差 + 方程残差 + 边界条件残差
   网络在没有数据的地方,靠"满足方程"来约束自己

独特能力:在几乎没有数据的地方,靠物理定律推断解;无网格,对复杂几何友好。著名困难:多目标尺度差异大、优化景观病态、复杂问题常训不出来——理念优美但工程落地艰难。

知识注入的连续谱:

软约束 ←──────────────────────────→ 硬约束
损失函数惩罚  →  架构设计  →  完全嵌入方程结构
(PINN)        (等变网络)    (Neural ODE)
灵活但不保证    平衡         严格但限制表达力

核心张力:到底该注入多少先验?太少,在稀缺数据和外推下失败;太多,被错误/不完整的先验束缚,失去发现先验之外规律的可能。没有通用答案,取决于对该领域物理定律的把握有多确信——这正是为什么纯 ML 专家做不了真正的 AI for Science。

科学基础模型:迁移学习的科学版本

把大语言模型范式移植到科学数据:海量科学数据自监督预训练 → 通用表征 → 微调。

最成熟案例是蛋白质语言模型。ESM 把蛋白序列当"语言",用掩码预测在数亿序列上预训练,其表征竟隐含了结构和功能信息。ESMFold 据此跳过 MSA,直接从单序列预测结构。

大量无标注科学数据 → 自监督预训练 → 通用科学表征 → 下游微调
        赌注:统计模式里,是否真的编码了科学知识?

尖锐的认知问题:学到的是科学知识,还是数据偏差?蛋白数据库有偏(热门蛋白反复测序),模型可能学到"哪些蛋白被研究得多"而非"内在规律"——内插看不出,外推时暴露。更根本的限制:LLM 成功建立在数据近乎无限上,而科学数据本质稀缺。蛋白序列因测序成本暴跌积累到数十亿条所以成立,绝大多数领域没有这种规模,基础模型范式能否成立是开放问题。

方法论注入什么知识适用场景核心限制
几何深度学习对称性对称性明确、数据稀缺需领域物理知识
Physics-Informed ML具体方程物理已知、数据极少训练困难、落地难
科学基础模型无显式先验,靠数据数据规模大的领域数据偏差、外推存疑

核心判断:三套方法是"先验 vs 数据"轴上的三种押注,没有普适赢家。这解释了为什么 AI for Science 至今没有出现像 Transformer 之于 NLP 那样的统一架构——科学领域内部的异质性决定了它注定方法论多元。


第四层:领域实战

每个领域的成熟度,几乎完全由两个因素决定:数据质量验证成本

生命科学:AlphaFold 之后发生了什么

2024 诺贝尔化学奖授予 Hassabis、Jumper(AlphaFold)和 Baker(蛋白设计)。但 AlphaFold 太成功,反而扭曲了对整个领域的判断。

它解决了:给定序列,预测静态三维结构——困扰结构生物学五十年的问题。AlphaFold3 扩展到蛋白-配体、蛋白-DNA/RNA 复合物。

它没解决的,恰恰是生物学真正关心的:

AlphaFold:序列 → 静态结构  ✓
生物学真正想要的:
   结构 → 功能       ?(结构相同功能可能不同)
   结构 → 动力学     ?(蛋白是动的)
   结构 → 药物有效性 ?(能结合 ≠ 能治病)

残酷事实:AlphaFold 至今没有让任何一款药物被治愈或上市。 离"治好病"还隔着功能、动力学、药效、临床好几座山。把它外推成"AI 即将攻克疾病"是最典型的认知陷阱。

之后真正有意思的是从"预测"转向"设计":RFdiffusion + ProteinMPNN、AlphaProteo——让人类第一次能主动创造生物分子。

子领域代表工作成熟度真实瓶颈
结构预测AlphaFold2/3, ESMFold★★★★★动力学、无序蛋白
蛋白设计RFdiffusion, AlphaProteo★★★★☆实验验证成功率
药物发现Isomorphic, Recursion★★★☆☆临床终点未兑现
基因组学Enformer, 核苷酸模型★★★☆☆因果性、外推

材料科学:从预测到设计

标志事件:DeepMind GNoME(2023)预测 220 万个新稳定晶体结构。配合 A-Lab 形成"预测→合成"闭环故事。

但这是审视"突破 vs 真实价值"鸿沟的最佳案例:

预测稳定 ≠ 能被合成(热力学稳定不代表有合成路径)
能被合成 ≠ 有新颖性(很多是已知结构的微小变体)
有新颖性 ≠ 有useful性质
有用性质 ≠ 能规模化生产(实验室克级 ≠ 工业吨级)

"预测了 220 万个稳定结构"和"发现了 220 万种有用新材料"相差极远——后者会小好几个数量级。根本困难:材料的"验证"比生物还重,从计算到有用要经过合成、表征、性能、规模化、成本、稳定性一长串环节。这是为什么材料 AI 论文亮眼,但传导到真实产业远慢于宣传。

气候与物理:模拟的大替代

"替代计算"型领域,工程上最成熟、兑现最干净。

天气预报是最干净的成功故事。GraphCast、Pangu-Weather 在标准评测上达到或超过传统数值预报,速度快几个数量级。基础:ERA5 四十年高质量数据、客观可验证标准、本质是历史气候范围内插值——避开了外推困难。

天气 vs 气候的根本区别:天气是短期、分布内预测(ML 优秀);气候是长期、面向史无前例浓度的预测(定义上的外推,纯数据驱动天然不可靠)。两者难度天差地别,经常被混为一谈。

物理其他亮点:DeepMind 强化学习实时控制托卡马克等离子体(2022)、湍流建模、神经网络波函数、晶格 QCD 采样加速。

天气预报(历史分布内)  ★★★★★  已实用化
等离子体/控制(有反馈) ★★★★☆  实验验证
流体/湍流建模          ★★★☆☆  研究前沿
气候预测(外推)        ★★☆☆☆  根本性争议

数学与形式推理:AI 能做证明吗

特殊之处:正确性可以被形式化、自动验证——这与所有经验科学的根本区别。一个证明对不对,Lean/Coq/Isabelle 瞬间、零成本、零噪声地检查。这把"验证"这个其他领域的最大瓶颈彻底消除了。

标志进展:AlphaGeometry(奥赛几何金牌水平)、AlphaProof(2024 IMO 银牌水平)。方法:把自然语言问题翻译成 Lean,用强化学习在形式系统里搜索证明,每步被自动验证,训练信号绝对可靠。

LLM 提出证明步骤 → Lean 验证 → 正确/错误(绝对可靠信号)
       ↑                              ↓
       └──── 强化学习从可靠信号学习 ────┘
对比经验科学:实验验证慢、贵、有噪声,信号不可靠

冷静判断:这些成就主要在"已有明确答案的竞赛题"上,而非"提出并证明全新定理"。奥数题是人类已知可解的,AI 在搜索通往已知终点的路径。真正的数学研究是提出新猜想、开辟新领域,需要直觉和品味,AI 远未触及。FrontierMath 这类基准正是为测量研究级数学能力,目前表现仍有限。

溢出价值:形式化验证的思路可能反过来帮助解决经验科学的验证困境。

领域主导问题类型成熟度旗舰成果距真实价值的鸿沟
生命科学预测+设计★★★★☆AlphaFold结构→功能→药效
材料科学搜索+闭环★★★☆☆GNoME, A-Lab预测→合成→产业
气候/物理替代计算★★★★☆GraphCast天气易、气候难
数学形式推理★★★☆☆AlphaProof解题→原创研究

核心判断:判断任何项目的真实前景,问两个问题就够了:它的训练数据有多干净,它的预测验证有多贵。


第五层:深层结构与张力

前面反复出现的"但是",在这一层收拢成三个根本张力——它们是判断任何 AI for Science 主张的免疫系统。

数据困境:为什么科学数据不是互联网数据

互联网 AI 的成功建立在"数据近乎免费且无限"上,scaling law 才成立。科学数据在四个维度上打破这个前提:

稀缺:PDB 五十年只有 20 万条结构,多数子领域数据以千万计而非亿万亿计。 昂贵:每个数据点对应真实实验成本——从"免费背景资源"变成"最稀缺的核心资源"。 异质:不同实验室/仪器/协议的数据难以直接合并。 偏倚(最致命):数据库系统性偏向"成功的、被研究的、能发表的"。

阴性结果不发表 → 数据库全是"有效"例子 → 模型学到"什么能成功"而非"什么是真的"
热门蛋白反复研究 → 数据密集 → 热门区域表现好
冷门蛋白几乎无数据 → 真正未知区域失效
路灯效应:模型只在有数据的地方"看得见",而科学最想去的是没数据的黑暗处

深刻的战略推论:既然数据是最稀缺资源,真正的护城河就不在模型(快速商品化),而在数据生产能力——这正是自驱动实验室的战略意义:把数据从"免费背景"重新定义为"可工业化生产的核心资产"。谁能闭合"实验产数据→模型→指导实验"飞轮,谁就拥有别人无法复制的专有数据流。 押注数据飞轮,而不是押注模型。

验证危机:benchmark 与真实价值的断层

输出端的问题:我们怎么知道一个 AI 的科学"成果"是真的?

机制一:数据泄漏。 训练集和测试集间不该有的信息泄漏(同分子不同构象分两边、高度同源蛋白分两边),benchmark 虚高。许多发表成果修正泄漏后性能大幅缩水。

机制二:分布偏移。 Benchmark 测内插,科学要外推,两者无可靠传导。SOTA 模型面对真正新颖问题时可能断崖式下跌。

机制三:Goodhart 定律。 当指标成为目标,它就不再是好指标。全领域围绕几个 benchmark(CASP、Matbench)优化,越来越擅长 benchmark,但这种擅长与真实科学能力的相关性从未被严格验证。

机制四:与可复现性危机叠加。 不可复现的数据 + 不可解释的黑盒 + 无法验证的预测——两个危机叠加,而非抵消。

尽职调查的实践检验法:不要看 benchmark 分数,要看它的预测有没有被预先登记的、分布外的、独立的实验所验证。回顾性解释已知数据是廉价的;前瞻性预测未知并被证实,才是真功夫。绝大多数主张经不起第二条检验。

预测 vs 理解:最深的认识论张力

没有理解的预测,算科学吗? AlphaFold 能准确预测结构,但不告诉你蛋白为什么这样折叠——给"是什么",不给"为什么"。

工具主义:科学目的是准确预测。能预测就够了。→ AlphaFold 是完美的科学。
实在主义:科学目的是理解真实机制。→ AlphaFold 是极好工具,不是科学。

理解之所以重要(预测给不了的三样东西): - 外推能力:理解机制才能可靠预测全新情况(这把张力 17 和数据困境、验证危机全部连起来——外推失效的根源正是缺乏机制理解)。 - 迁移能力:理解能迁移到相关系统,纯预测的知识是局部的。 - 信任:高风险场景需要知道"为什么"才能信任。

Chris Anderson 2008 "理论的终结"把张力推到极致——大数据时代相关性足够。十几年回看:工程应用部分成立(天气预报不需要理解每步),科学探索基本被证伪(纯相关性无法外推,而科学的本质恰恰是外推到未知)。

正在打开的中间道路(最值得关注的前沿):用可解释性方法从预测模型里反向提取理解。如果能从准确的网络里读出可解释机制(守恒量、对称性、有效自由度),预测和理解就不再对立——先用 AI 找到能预测的模式,再从模式里蒸馏出人类能理解的规律。这其实是科学一直以来的工作方式(开普勒先有数据规律,牛顿才给机制),只是第一步交给了 AI。这条路如果走通,可能是 AI 对科学最深刻的贡献——不是替代科学家理解世界,而是为人类的理解提供前所未有的脚手架。

张力层面核心问题如何相连
数据困境输入端数据稀缺、偏倚数据少→靠记忆而非理解
验证危机输出端benchmark≠真实价值无理解→无法判断可信度
预测vs理解认识论黑盒能算科学吗缺理解→外推失效,三者同源

核心判断:三个张力是同一个根本问题的三个切面——深度学习的预测能力来自分布内的模式拟合,而科学的本质追求是分布外的、机制性的、可外推的理解。这个错位是结构性的,不会被更大的模型或更多算力消除。 谁解决了这个错位,谁就定义了下一个十年。


第六层:商业与未来

商业化路径与护城河分析

价值链是层叠结构:

基础设施层      科学基础模型层    应用/资产层
(算力/数据)      (AlphaFold类)    (药企/材料公司)
问题:价值最终沉淀在哪一层?

根本路线选择:卖工具还是自己挖矿

模式一:卖铲子(工具/平台)。 Schrödinger 卖计算化学平台 + 联合开发拿里程碑。现金流稳定、不押单一管线;但天花板受软件定价权限制,模型层进步可能侵蚀差异化。

模式二:自己挖矿(资产/biotech)。 Recursion、Insilico、Exscientia、Isomorphic——价值兑现在最终产品。天花板极高,但把 AI 的不确定性和药物研发的高失败率叠加在了一起

核心判断:模型本身几乎一定不是护城河(快速商品化,AlphaFold 已开源)。真正的护城河:

潜在护城河逻辑可持续性
专有数据飞轮自驱动实验室产出别人没有的数据★★★★★ 复利最强
工作流嵌入深度嵌入药企/实验室研发流程★★★★☆ 转换成本高
监管/资质壁垒临床数据、审批通过的产品本身★★★★☆ 要先熬过去
模型/算法更好的网络结构★☆☆☆☆ 快速商品化

药物发现至今没兑现核心承诺:喊了十年"更快更便宜发现新药",但没有一款 AI 主导发现的药完成全部临床并大规模上市成功。原因(回到第五层):AI 改善的是研发链最前端(靶点、先导化合物),但药物失败主因在后端(临床二三期的有效性安全性)。前端再快,后端失败率没变——典型的"优化了非瓶颈环节"。

价值投资视角:安全边际来自两个判断——是否真的拥有别人无法复制的专有数据流(而非更好的模型),以及优化的环节是不是该领域真正的瓶颈(而非容易做但不解决问题的前端)。十年后还在的护城河大概率是数据飞轮和监管资质,而非任何算法。卖铲子的生意(Schrödinger、算力/数据基础设施)在现金流确定性上,往往比自己挖矿的 biotech 更经得起周期。

AI Scientist:从工具到研究者的边界在哪

把"AI 做科学"放到能力光谱上:

工具 ──────────────────────────────────► 研究者
计算助手  分析助手  假设生成  实验设计  自主发现  开辟新领域
(已实现)  (已实现)  (初步)   (初步)   (个别案例) (远未到)

朝右端的尝试:Sakana AI "The AI Scientist"(端到端产生论文)、Google "AI co-scientist"(假设生成)。但目前产出主要是已有范式内的增量组合,而非真正的科学创新

AI 做不到的,恰恰是科学最核心的几件事: - 知道哪个问题重要:科学品味——判断哪个问题值得花十年——AI 完全不具备。能解决你给的问题,但选不出值得解决的问题。 - 质疑前提:重大突破往往来自质疑默认前提(相对论质疑绝对时空)。AI 学的是建立在现有前提上的数据,天然倾向强化而非颠覆前提。 - 真正的外推:原创科学是向未知外推,AI 的根基在分布内内插。

最诚实的近未来判断:AI 会成为越来越强大的研究加速器和协作者,但不会很快成为独立研究者。它接管科学中可形式化、可搜索、可验证的部分(这部分相当大,足以极大提升生产力),但依赖品味、判断、前提质疑的核心创造力部分,可见将来仍属于人类。最强大的图景:人类提供方向和判断、AI 提供前所未有的搜索和计算规模——AI 当开普勒(提供精确模式),人类当牛顿(给出机制和意义)。


核心判断框架

1. 它不是一个领域,是四类问题(预测/生成/发现/闭环),
   成熟度从★★★★★到★☆☆☆☆,绝不能混谈。

2. 成败由两个变量决定:数据有多干净、验证有多贵。 天气、数学领先;生物、材料"看着快、实际慢"。

3. 三个结构张力同源:数据困境(输入)、验证危机(输出)、 预测vs理解(认识论)——根子都是"内插能力 vs 外推需求"。

4. 护城河不在模型(商品化),在数据飞轮、工作流、资质。 优化非瓶颈环节是这个领域最常见的价值陷阱。

5. AI 近期是研究加速器,不是独立研究者。 边界划在"品味、前提质疑、真正外推"上。

一句话提炼:AI for Science 真正的价值,不在于让 AI 替人类理解世界,而在于用 AI 的预测和搜索规模,为人类的理解提供前所未有的脚手架——而最大的认知陷阱,是把某个特殊子问题上的工程突破(AlphaFold、GraphCast)误读成整个科学即将被 AI 攻克。