从定义到未来的完整脉络,分六层由浅入深。
核心训练:学会区分"技术上的突破"和"对该领域真实问题的解决"——两者之间往往隔着一条很宽的鸿沟。
全局地图
第一层:认知基础(What is it really?) (1) 本质重新定义 —— 不是"给科学家用的AI",而是什么 (2) 科学流程解剖 —— AI能在哪些节点介入,不能在哪些 (3) 为什么科学是AI最难啃的骨头第二层:问题类型(What kinds of problems?) (4) 前向问题:预测与代理建模 (5) 逆向问题:设计与生成 (6) 发现问题:从数据蒸馏规律 (7) 闭环问题:自主实验室
第三层:方法论图谱(How does it work?) (8) 几何深度学习 —— 把对称性编进网络 (9) Physics-Informed ML —— 先验知识的整合 (10) 科学基础模型 —— 迁移学习的科学版本
第四层:领域实战(Where is it working?) (11) 生命科学 —— AlphaFold 之后发生了什么 (12) 材料科学 —— 从预测到设计 (13) 气候与物理 —— 模拟的大替代 (14) 数学与形式推理 —— AI 能做证明吗
第五层:深层结构(What are the hard questions?) (15) 数据困境 —— 为什么科学数据不是互联网数据 (16) 验证危机 —— benchmark 与真实价值的断层 (17) 预测 vs 理解 —— 最深的认识论张力
第六层:商业与未来(So what?) (18) 商业化路径与护城河分析 (19) AI Scientist —— 从工具到研究者的边界在哪
第一层:认知基础
本质重新定义
"AI for Science"这个词被严重滥用了。它在不同人口中指的是完全不同的东西——用神经网络替代数值模拟的人叫它 AI for Science,用 ChatGPT 搜文献的人也叫它 AI for Science,Demis Hassabis 去领诺贝尔奖也是这个旗号。把这些混在一起讨论毫无意义。
AI for Science 的本质,是用机器学习方法加速或替代科学过程中的某个计算/认知瓶颈。 关键词是"瓶颈"——科学不是一个均匀的过程,它在不同环节有完全不同的速率限制:有时瓶颈是实验通量,有时是计算成本,有时是人的分析能力,有时是搜索空间。
不同的瓶颈,需要完全不同的 AI 方法,成熟度也完全不同。
| 干预类型 | 瓶颈所在 | 典型例子 | 成熟度 |
|---|---|---|---|
| 替代计算 | 数值模拟太慢太贵 | 天气预报、分子力场 | ★★★★★ |
| 加速搜索 | 设计空间太大 | 药物发现、材料设计 | ★★★★☆ |
| 处理数据 | 数据量超过人力 | 基因组、天文 | ★★★★☆ |
| 自动实验 | 实验通量是瓶颈 | 自驱动实验室 | ★★★☆☆ |
| 发现规律 | 规律本身未知 | 符号回归、定律提取 | ★★☆☆☆ |
| 生成假设 | 推理与创意 | LLM 科学助手 | ★☆☆☆☆ |
最重要的认知校正:今天 AI for Science 最扎实的价值,几乎全部集中在前三行。最后两行是真正的科学意义所在,也是目前最欠兑现的地方。这条鸿沟,是整个领域最大的叙事风险。
科学流程解剖
科学不是一个动作,而是一个循环:
观测/测量 → 数据处理 → 模式识别 → 假设形成
↑ ↓
结果验证 ← 实验执行 ← 实验设计 ← 理论建立
AI 对每个节点介入的方式和成效截然不同:
观测/测量层:硬件自动化 + AI 辅助采集。冷冻电镜自动对焦、自动巡天、碱基识别。技术成熟,价值清晰。
数据处理层:传统 ML 主战场。分类、回归、降维、去噪。AlphaFold 在技术上属于这层的超级版本——给定序列,输出坐标。成功率最高,因为任务定义最清晰。
模式识别层:从数据里提取规律。AI 是一个高维模式检测器,但找出来的是相关性,不是因果性。
假设形成层:科学的核心创造力所在,也是 AI 目前最弱的地方。需要因果推断、类比推理、跨领域整合——LLM 可辅助,不能主导。
实验设计层:贝叶斯优化和主动学习有真实价值——在有限预算下智能选择信息增益最大的下一个实验。
实验执行层:自驱动实验室。目前主要在化学合成和材料制备这类高度标准化的领域。
结论:AI 对科学循环的介入高度不均匀。越靠近"数据→模式",越成熟;越靠近"假设→理解",越弱。当前大多数成功故事发生在数据处理侧,而不是理论创造侧。
为什么科学是 AI 最难啃的骨头
原因一:数据稀缺且异质。 互联网文本有万亿 token,PDB 积累五十年只有 20 万条结构。不同实验室的数据很难直接合并训练。科学数据的规模和质量,天然反抗 scaling law。
原因二:外推是常态,而不是例外。 语言模型做的是内插(在已见分布里预测);科学的本质是外插(提出已知范围之外的预测)。所有 ML 方法在外插上都会退化。
原因三:验证成本极高。 大语言模型的错误是便宜的;科学 AI 的一个错误候选分子,可能要数亿美元和数年才能在临床被否定。
这三个原因加在一起:科学恰好在数据量、外推要求、验证成本三个维度上,都站在深度学习舒适区的对立面。 AlphaFold 之所以能成,正是因为蛋白质折叠恰好拥有罕见的大数据集、清晰的评测标准、和可被实验快速验证的预测——三个困难同时被绕开了。
第二层:问题类型
AI for Science 看起来是一个领域,实际上是四类结构完全不同的问题——不同方法论、不同成熟度、不同价值天花板。
前向问题:预测与代理建模
形式:给定输入,预测输出。这是最成熟、当前工程价值最大的类型。
代理模型(Surrogate Model)的本质:数值模拟是一个确定性但昂贵的函数,用神经网络拟合这个昂贵函数的近似,把"算"变成"查"。
传统:物理状态 → [微分方程求解器,耗时数小时] → 结果 代理:物理状态 → [神经网络推断,耗时毫秒] → 结果(近似)
成立条件:足够多的模拟数据、可接受的精度损失、实质性的速度价值。核心限制是外推——神经网络本质是插值器,遇到训练集未覆盖的状态会静默给出错误结果。
| 应用 | 被替代的计算 | 速度提升 | 代表工作 |
|---|---|---|---|
| 天气预报 | 数值天气预报 | 1000x+ | GraphCast, Pangu-Weather |
| 分子力场 | DFT/从头算 | 100x~1000x | MACE, NequIP, ANI |
| 蛋白结构 | 物理折叠模拟 | 极大 | AlphaFold2/3, ESMFold |
| 等离子体控制 | MHD 模拟 | 实时化 | DeepMind Tokamak |
逆向问题:设计与生成
形式:给我想要的性质,找出满足条件的结构。这是设计问题,不是预测问题——前向通常有唯一解,逆向往往有无数解。
核心困难:搜索空间天文数量级(药物约 10^60)+ 设计与验证之间的成本鸿沟。
生成模型(扩散、流匹配)的洞察:与其搜索,不如学习满足条件的结构的概率分布,然后采样——把组合优化转化成采样。
旧范式:目标性质 → [启发式搜索] → 候选 → 验证(盲目低效) 新范式:目标性质 → [条件生成采样] → 候选分布 → 筛选 → 验证(有引导)
标志案例:RFdiffusion(蛋白骨架设计)+ ProteinMPNN(序列补全)+ AlphaFold(验证),形成计算内自洽闭环。
核心困境:生成候选可以无限,但验证每个候选仍需回实验室,成本未降。认知校正:AI 药物公司做的核心是逆向设计,但"生成更好候选"和"得到有效药物"之间隔着临床这座大山,候选质量的提升被后续管线噪声稀释——这是这类公司迟迟无法在临床终点上服众的结构性原因。
发现问题:从数据蒸馏规律
质的跳越:AI 能不能从数据里提取人类还不知道的规律,并以可解释形式表达? 认识论地位最高,成熟度最低。
路径一:符号回归。 SINDy、PySR——从数据里逼出显式方程。输出是人类可读的方程。AI Feynman 从物理数据重新发现费曼讲义的 100 个方程,是激动人心的概念验证——但前提是无噪声理想数据、方程在已知候选类里。真实数据有噪声时表现急剧退化。
路径二:神经网络作为假设生成器。 从网络权重里提取守恒量、对称性、方程结构。哲学前提更大胆,也更难验证。
发现的认识论层级: 最弱(伪发现):找到训练集里的统计相关性 中间(压缩发现):找到更简洁描述已知现象的数学形式 最强(真实发现):预测分布外的新现象,被独立实验证实
当前几乎所有被宣传的 AI 科学"发现"都在第一或第二层,而不在第三层。 第三层才是诺奖级别。
闭环问题:自主实验室
真正把 AI 接进物理世界:机器人执行、传感器采集、AI 分析、决策下一步。
核心价值不是自动化,而是数据密度。 把数周的实验循环压缩到数小时,意味着几个数量级更多的数据点——从根本上改变了科学数据的经济学。
核心算法:主动学习与贝叶斯优化——在有限预算下,每次选在"预期改进"和"不确定性探索"间最优平衡的实验点。
贝叶斯优化/主动学习 → [下一个实验点]
↑ ↓
更新概率模型 机器人执行(合成/测量)
↑ ↓
[新数据点] ← 传感器 + 仪器分析
数小时内可循环数百次
代表:Berkeley A-Lab(17 天合成验证 41 种新无机材料)、Aspuru-Guzik 的自驱动化学平台。结构性限制:最适合标准化、可机器人可靠执行的场景(化学合成、材料制备);越涉及体内/临床实验,自动化难度越急剧升高。
四类问题对比:
| 问题类型 | 核心任务 | 成熟度 | 主要价值 | 最大限制 |
|---|---|---|---|---|
| 前向预测 | 输入→输出 | ★★★★★ | 速度、成本 | 外推失效 |
| 逆向生成 | 性质→结构 | ★★★★☆ | 候选多样性 | 验证成本高 |
| 规律发现 | 数据→方程 | ★★☆☆☆ | 真正的科学 | 噪声、验证难 |
| 闭环实验 | AI+机器人 | ★★★☆☆ | 数据密度 | 标准化限制 |
组合逻辑:最强大的系统往往把多类问题串联——闭环实验室用贝叶斯优化决定实验、用生成模型提议候选、用积累数据发现规律。看它们如何组合,才能理解系统的真实能力。
第三层:方法论图谱
三套方法论的共同主题:如何把人类已有的科学知识,注入到本来一无所知的神经网络里。
几何深度学习:把对称性编进网络
过去十年方法论上最重要的突破。
朴素做法(把原子坐标拉平喂给 MLP)会惨败:同一分子旋转平移后坐标全变,能量却不变,网络必须从海量数据里"学会"这个物理事实。
核心洞察:与其让模型从数据里学物理对称性,不如直接把对称性硬编进架构——把领域知识从"训练数据"搬到"归纳偏置"。
不变性:f(旋转(x)) = f(x) [标量输出,如能量] 等变性:f(旋转(x)) = 旋转(f(x)) [矢量输出,如力]
对称性由群论描述:SE(3)(旋转平移)、E(3)(加镜像)。演化脉络:Behler-Parrinello(手工对称函数)→ SchNet(连续卷积)→ NequIP/MACE(E(3) 等变张量积消息传递)。结果:数据效率巨大提升——MACE 可用几百到几千样本达到过去需几十万样本的精度,直接缓解了科学数据稀缺困境。AlphaFold2 的 IPA 是同一思想在蛋白领域的体现。
核心判断:在科学领域,正确的归纳偏置比更多数据和更大模型更重要——与互联网 AI 的 scaling 信仰恰好相反。
Physics-Informed ML:先验知识的整合
注入的不只是对称性,而是具体的物理定律本身(通常是微分方程)。
PINN 的想法:用神经网络表示解函数,把"解必须满足微分方程"写进损失函数。
PINN 损失 = 数据拟合误差 + 方程残差 + 边界条件残差 网络在没有数据的地方,靠"满足方程"来约束自己
独特能力:在几乎没有数据的地方,靠物理定律推断解;无网格,对复杂几何友好。著名困难:多目标尺度差异大、优化景观病态、复杂问题常训不出来——理念优美但工程落地艰难。
知识注入的连续谱:
软约束 ←──────────────────────────→ 硬约束 损失函数惩罚 → 架构设计 → 完全嵌入方程结构 (PINN) (等变网络) (Neural ODE) 灵活但不保证 平衡 严格但限制表达力
核心张力:到底该注入多少先验?太少,在稀缺数据和外推下失败;太多,被错误/不完整的先验束缚,失去发现先验之外规律的可能。没有通用答案,取决于对该领域物理定律的把握有多确信——这正是为什么纯 ML 专家做不了真正的 AI for Science。
科学基础模型:迁移学习的科学版本
把大语言模型范式移植到科学数据:海量科学数据自监督预训练 → 通用表征 → 微调。
最成熟案例是蛋白质语言模型。ESM 把蛋白序列当"语言",用掩码预测在数亿序列上预训练,其表征竟隐含了结构和功能信息。ESMFold 据此跳过 MSA,直接从单序列预测结构。
大量无标注科学数据 → 自监督预训练 → 通用科学表征 → 下游微调
赌注:统计模式里,是否真的编码了科学知识?
尖锐的认知问题:学到的是科学知识,还是数据偏差?蛋白数据库有偏(热门蛋白反复测序),模型可能学到"哪些蛋白被研究得多"而非"内在规律"——内插看不出,外推时暴露。更根本的限制:LLM 成功建立在数据近乎无限上,而科学数据本质稀缺。蛋白序列因测序成本暴跌积累到数十亿条所以成立,绝大多数领域没有这种规模,基础模型范式能否成立是开放问题。
| 方法论 | 注入什么知识 | 适用场景 | 核心限制 |
|---|---|---|---|
| 几何深度学习 | 对称性 | 对称性明确、数据稀缺 | 需领域物理知识 |
| Physics-Informed ML | 具体方程 | 物理已知、数据极少 | 训练困难、落地难 |
| 科学基础模型 | 无显式先验,靠数据 | 数据规模大的领域 | 数据偏差、外推存疑 |
核心判断:三套方法是"先验 vs 数据"轴上的三种押注,没有普适赢家。这解释了为什么 AI for Science 至今没有出现像 Transformer 之于 NLP 那样的统一架构——科学领域内部的异质性决定了它注定方法论多元。
第四层:领域实战
每个领域的成熟度,几乎完全由两个因素决定:数据质量和验证成本。
生命科学:AlphaFold 之后发生了什么
2024 诺贝尔化学奖授予 Hassabis、Jumper(AlphaFold)和 Baker(蛋白设计)。但 AlphaFold 太成功,反而扭曲了对整个领域的判断。
它解决了:给定序列,预测静态三维结构——困扰结构生物学五十年的问题。AlphaFold3 扩展到蛋白-配体、蛋白-DNA/RNA 复合物。
它没解决的,恰恰是生物学真正关心的:
AlphaFold:序列 → 静态结构 ✓ 生物学真正想要的: 结构 → 功能 ?(结构相同功能可能不同) 结构 → 动力学 ?(蛋白是动的) 结构 → 药物有效性 ?(能结合 ≠ 能治病)
残酷事实:AlphaFold 至今没有让任何一款药物被治愈或上市。 离"治好病"还隔着功能、动力学、药效、临床好几座山。把它外推成"AI 即将攻克疾病"是最典型的认知陷阱。
之后真正有意思的是从"预测"转向"设计":RFdiffusion + ProteinMPNN、AlphaProteo——让人类第一次能主动创造生物分子。
| 子领域 | 代表工作 | 成熟度 | 真实瓶颈 |
|---|---|---|---|
| 结构预测 | AlphaFold2/3, ESMFold | ★★★★★ | 动力学、无序蛋白 |
| 蛋白设计 | RFdiffusion, AlphaProteo | ★★★★☆ | 实验验证成功率 |
| 药物发现 | Isomorphic, Recursion | ★★★☆☆ | 临床终点未兑现 |
| 基因组学 | Enformer, 核苷酸模型 | ★★★☆☆ | 因果性、外推 |
材料科学:从预测到设计
标志事件:DeepMind GNoME(2023)预测 220 万个新稳定晶体结构。配合 A-Lab 形成"预测→合成"闭环故事。
但这是审视"突破 vs 真实价值"鸿沟的最佳案例:
预测稳定 ≠ 能被合成(热力学稳定不代表有合成路径) 能被合成 ≠ 有新颖性(很多是已知结构的微小变体) 有新颖性 ≠ 有useful性质 有用性质 ≠ 能规模化生产(实验室克级 ≠ 工业吨级)
"预测了 220 万个稳定结构"和"发现了 220 万种有用新材料"相差极远——后者会小好几个数量级。根本困难:材料的"验证"比生物还重,从计算到有用要经过合成、表征、性能、规模化、成本、稳定性一长串环节。这是为什么材料 AI 论文亮眼,但传导到真实产业远慢于宣传。
气候与物理:模拟的大替代
"替代计算"型领域,工程上最成熟、兑现最干净。
天气预报是最干净的成功故事。GraphCast、Pangu-Weather 在标准评测上达到或超过传统数值预报,速度快几个数量级。基础:ERA5 四十年高质量数据、客观可验证标准、本质是历史气候范围内插值——避开了外推困难。
天气 vs 气候的根本区别:天气是短期、分布内预测(ML 优秀);气候是长期、面向史无前例浓度的预测(定义上的外推,纯数据驱动天然不可靠)。两者难度天差地别,经常被混为一谈。
物理其他亮点:DeepMind 强化学习实时控制托卡马克等离子体(2022)、湍流建模、神经网络波函数、晶格 QCD 采样加速。
天气预报(历史分布内) ★★★★★ 已实用化 等离子体/控制(有反馈) ★★★★☆ 实验验证 流体/湍流建模 ★★★☆☆ 研究前沿 气候预测(外推) ★★☆☆☆ 根本性争议
数学与形式推理:AI 能做证明吗
特殊之处:正确性可以被形式化、自动验证——这与所有经验科学的根本区别。一个证明对不对,Lean/Coq/Isabelle 瞬间、零成本、零噪声地检查。这把"验证"这个其他领域的最大瓶颈彻底消除了。
标志进展:AlphaGeometry(奥赛几何金牌水平)、AlphaProof(2024 IMO 银牌水平)。方法:把自然语言问题翻译成 Lean,用强化学习在形式系统里搜索证明,每步被自动验证,训练信号绝对可靠。
LLM 提出证明步骤 → Lean 验证 → 正确/错误(绝对可靠信号)
↑ ↓
└──── 强化学习从可靠信号学习 ────┘
对比经验科学:实验验证慢、贵、有噪声,信号不可靠
冷静判断:这些成就主要在"已有明确答案的竞赛题"上,而非"提出并证明全新定理"。奥数题是人类已知可解的,AI 在搜索通往已知终点的路径。真正的数学研究是提出新猜想、开辟新领域,需要直觉和品味,AI 远未触及。FrontierMath 这类基准正是为测量研究级数学能力,目前表现仍有限。
溢出价值:形式化验证的思路可能反过来帮助解决经验科学的验证困境。
| 领域 | 主导问题类型 | 成熟度 | 旗舰成果 | 距真实价值的鸿沟 |
|---|---|---|---|---|
| 生命科学 | 预测+设计 | ★★★★☆ | AlphaFold | 结构→功能→药效 |
| 材料科学 | 搜索+闭环 | ★★★☆☆ | GNoME, A-Lab | 预测→合成→产业 |
| 气候/物理 | 替代计算 | ★★★★☆ | GraphCast | 天气易、气候难 |
| 数学 | 形式推理 | ★★★☆☆ | AlphaProof | 解题→原创研究 |
核心判断:判断任何项目的真实前景,问两个问题就够了:它的训练数据有多干净,它的预测验证有多贵。
第五层:深层结构与张力
前面反复出现的"但是",在这一层收拢成三个根本张力——它们是判断任何 AI for Science 主张的免疫系统。
数据困境:为什么科学数据不是互联网数据
互联网 AI 的成功建立在"数据近乎免费且无限"上,scaling law 才成立。科学数据在四个维度上打破这个前提:
稀缺:PDB 五十年只有 20 万条结构,多数子领域数据以千万计而非亿万亿计。 昂贵:每个数据点对应真实实验成本——从"免费背景资源"变成"最稀缺的核心资源"。 异质:不同实验室/仪器/协议的数据难以直接合并。 偏倚(最致命):数据库系统性偏向"成功的、被研究的、能发表的"。
阴性结果不发表 → 数据库全是"有效"例子 → 模型学到"什么能成功"而非"什么是真的" 热门蛋白反复研究 → 数据密集 → 热门区域表现好 冷门蛋白几乎无数据 → 真正未知区域失效 路灯效应:模型只在有数据的地方"看得见",而科学最想去的是没数据的黑暗处
深刻的战略推论:既然数据是最稀缺资源,真正的护城河就不在模型(快速商品化),而在数据生产能力——这正是自驱动实验室的战略意义:把数据从"免费背景"重新定义为"可工业化生产的核心资产"。谁能闭合"实验产数据→模型→指导实验"飞轮,谁就拥有别人无法复制的专有数据流。 押注数据飞轮,而不是押注模型。
验证危机:benchmark 与真实价值的断层
输出端的问题:我们怎么知道一个 AI 的科学"成果"是真的?
机制一:数据泄漏。 训练集和测试集间不该有的信息泄漏(同分子不同构象分两边、高度同源蛋白分两边),benchmark 虚高。许多发表成果修正泄漏后性能大幅缩水。
机制二:分布偏移。 Benchmark 测内插,科学要外推,两者无可靠传导。SOTA 模型面对真正新颖问题时可能断崖式下跌。
机制三:Goodhart 定律。 当指标成为目标,它就不再是好指标。全领域围绕几个 benchmark(CASP、Matbench)优化,越来越擅长 benchmark,但这种擅长与真实科学能力的相关性从未被严格验证。
机制四:与可复现性危机叠加。 不可复现的数据 + 不可解释的黑盒 + 无法验证的预测——两个危机叠加,而非抵消。
尽职调查的实践检验法:不要看 benchmark 分数,要看它的预测有没有被预先登记的、分布外的、独立的实验所验证。回顾性解释已知数据是廉价的;前瞻性预测未知并被证实,才是真功夫。绝大多数主张经不起第二条检验。
预测 vs 理解:最深的认识论张力
没有理解的预测,算科学吗? AlphaFold 能准确预测结构,但不告诉你蛋白为什么这样折叠——给"是什么",不给"为什么"。
工具主义:科学目的是准确预测。能预测就够了。→ AlphaFold 是完美的科学。 实在主义:科学目的是理解真实机制。→ AlphaFold 是极好工具,不是科学。
理解之所以重要(预测给不了的三样东西): - 外推能力:理解机制才能可靠预测全新情况(这把张力 17 和数据困境、验证危机全部连起来——外推失效的根源正是缺乏机制理解)。 - 迁移能力:理解能迁移到相关系统,纯预测的知识是局部的。 - 信任:高风险场景需要知道"为什么"才能信任。
Chris Anderson 2008 "理论的终结"把张力推到极致——大数据时代相关性足够。十几年回看:工程应用部分成立(天气预报不需要理解每步),科学探索基本被证伪(纯相关性无法外推,而科学的本质恰恰是外推到未知)。
正在打开的中间道路(最值得关注的前沿):用可解释性方法从预测模型里反向提取理解。如果能从准确的网络里读出可解释机制(守恒量、对称性、有效自由度),预测和理解就不再对立——先用 AI 找到能预测的模式,再从模式里蒸馏出人类能理解的规律。这其实是科学一直以来的工作方式(开普勒先有数据规律,牛顿才给机制),只是第一步交给了 AI。这条路如果走通,可能是 AI 对科学最深刻的贡献——不是替代科学家理解世界,而是为人类的理解提供前所未有的脚手架。
| 张力 | 层面 | 核心问题 | 如何相连 |
|---|---|---|---|
| 数据困境 | 输入端 | 数据稀缺、偏倚 | 数据少→靠记忆而非理解 |
| 验证危机 | 输出端 | benchmark≠真实价值 | 无理解→无法判断可信度 |
| 预测vs理解 | 认识论 | 黑盒能算科学吗 | 缺理解→外推失效,三者同源 |
核心判断:三个张力是同一个根本问题的三个切面——深度学习的预测能力来自分布内的模式拟合,而科学的本质追求是分布外的、机制性的、可外推的理解。这个错位是结构性的,不会被更大的模型或更多算力消除。 谁解决了这个错位,谁就定义了下一个十年。
第六层:商业与未来
商业化路径与护城河分析
价值链是层叠结构:
基础设施层 科学基础模型层 应用/资产层 (算力/数据) (AlphaFold类) (药企/材料公司) 问题:价值最终沉淀在哪一层?
根本路线选择:卖工具还是自己挖矿。
模式一:卖铲子(工具/平台)。 Schrödinger 卖计算化学平台 + 联合开发拿里程碑。现金流稳定、不押单一管线;但天花板受软件定价权限制,模型层进步可能侵蚀差异化。
模式二:自己挖矿(资产/biotech)。 Recursion、Insilico、Exscientia、Isomorphic——价值兑现在最终产品。天花板极高,但把 AI 的不确定性和药物研发的高失败率叠加在了一起。
核心判断:模型本身几乎一定不是护城河(快速商品化,AlphaFold 已开源)。真正的护城河:
| 潜在护城河 | 逻辑 | 可持续性 |
|---|---|---|
| 专有数据飞轮 | 自驱动实验室产出别人没有的数据 | ★★★★★ 复利最强 |
| 工作流嵌入 | 深度嵌入药企/实验室研发流程 | ★★★★☆ 转换成本高 |
| 监管/资质壁垒 | 临床数据、审批通过的产品本身 | ★★★★☆ 要先熬过去 |
| 模型/算法 | 更好的网络结构 | ★☆☆☆☆ 快速商品化 |
药物发现至今没兑现核心承诺:喊了十年"更快更便宜发现新药",但没有一款 AI 主导发现的药完成全部临床并大规模上市成功。原因(回到第五层):AI 改善的是研发链最前端(靶点、先导化合物),但药物失败主因在后端(临床二三期的有效性安全性)。前端再快,后端失败率没变——典型的"优化了非瓶颈环节"。
价值投资视角:安全边际来自两个判断——是否真的拥有别人无法复制的专有数据流(而非更好的模型),以及优化的环节是不是该领域真正的瓶颈(而非容易做但不解决问题的前端)。十年后还在的护城河大概率是数据飞轮和监管资质,而非任何算法。卖铲子的生意(Schrödinger、算力/数据基础设施)在现金流确定性上,往往比自己挖矿的 biotech 更经得起周期。
AI Scientist:从工具到研究者的边界在哪
把"AI 做科学"放到能力光谱上:
工具 ──────────────────────────────────► 研究者 计算助手 分析助手 假设生成 实验设计 自主发现 开辟新领域 (已实现) (已实现) (初步) (初步) (个别案例) (远未到)
朝右端的尝试:Sakana AI "The AI Scientist"(端到端产生论文)、Google "AI co-scientist"(假设生成)。但目前产出主要是已有范式内的增量组合,而非真正的科学创新。
AI 做不到的,恰恰是科学最核心的几件事: - 知道哪个问题重要:科学品味——判断哪个问题值得花十年——AI 完全不具备。能解决你给的问题,但选不出值得解决的问题。 - 质疑前提:重大突破往往来自质疑默认前提(相对论质疑绝对时空)。AI 学的是建立在现有前提上的数据,天然倾向强化而非颠覆前提。 - 真正的外推:原创科学是向未知外推,AI 的根基在分布内内插。
最诚实的近未来判断:AI 会成为越来越强大的研究加速器和协作者,但不会很快成为独立研究者。它接管科学中可形式化、可搜索、可验证的部分(这部分相当大,足以极大提升生产力),但依赖品味、判断、前提质疑的核心创造力部分,可见将来仍属于人类。最强大的图景:人类提供方向和判断、AI 提供前所未有的搜索和计算规模——AI 当开普勒(提供精确模式),人类当牛顿(给出机制和意义)。
核心判断框架
1. 它不是一个领域,是四类问题(预测/生成/发现/闭环), 成熟度从★★★★★到★☆☆☆☆,绝不能混谈。2. 成败由两个变量决定:数据有多干净、验证有多贵。 天气、数学领先;生物、材料"看着快、实际慢"。
3. 三个结构张力同源:数据困境(输入)、验证危机(输出)、 预测vs理解(认识论)——根子都是"内插能力 vs 外推需求"。
4. 护城河不在模型(商品化),在数据飞轮、工作流、资质。 优化非瓶颈环节是这个领域最常见的价值陷阱。
5. AI 近期是研究加速器,不是独立研究者。 边界划在"品味、前提质疑、真正外推"上。
一句话提炼:AI for Science 真正的价值,不在于让 AI 替人类理解世界,而在于用 AI 的预测和搜索规模,为人类的理解提供前所未有的脚手架——而最大的认知陷阱,是把某个特殊子问题上的工程突破(AlphaFold、GraphCast)误读成整个科学即将被 AI 攻克。
夜雨聆风