乐于分享
好东西不私藏

AI 做科研,走过概念期

AI 做科研,走过概念期

2024 年,诺贝尔化学奖颁给了谷歌 DeepMind 的两位人工智能科学家德米斯·哈萨比斯和约翰·杰珀,他们开发的 AlphaFold 系统预测了接近两亿种蛋白质的三维结构,相当于全球科学家五十多年实验积累的一千倍。

但颁奖之后,一个被反复追问的问题浮出水面:AlphaFold 之外,AI 还能在哪些科研领域发挥作用?

蛋白质结构预测之所以适合 AI 建模,是因为这个领域五十多年来积累了标准化的数据、成熟统一的检测手段和全球共享的数据库,天然适合 AI。但绝大多数科研领域的数据条件远没有这么好——分子结构是三维坐标、光谱是一维波形、蛋白质是氨基酸序列、科学图像是像素矩阵,格式各异。

2026 年 7 月 18 日,WAIC 期间,智源研究院、中国科学院、深圳河套学院、清华大学四家机构在"AI for Science: Beyond the Concept"(科学智能:从概念走向实践)圆桌论坛上集中展示了各自的阶段性成果。这场对话透露的真正信号是:AI 做科研已经走过了概念期,进入了在不同数据条件下找到适配方法的实践期

但更值得冷静看的是——科学智能当前的能力大概还在 GPT-1 阶段,产业界的关注度已经到了 GPT-3,科学家的使用反馈已经接近 ChatGPT 的前期。需求走在能力前面,应用验证反过来推动模型迭代。这场实践不像 AlphaFold 那么耀眼,但意义可能更大。

帮助中科院上海硅酸盐研究所的研发团队把几个月压缩到 30 分钟的工具,是中科院组织多个研究所联合研发的磐石·科学基础大模型 2.0(ScienceOne Omni)。

今年 7 月,该所团队从两千万种候选配方中锁定了一种新型合金催化剂,活性比市面上的商用催化剂高出 38%,而一次干实验筛选过程只需 30 分钟。

磐石要解决的核心问题是:不同学科的数据长得完全不一样——分子结构是三维坐标,光谱是一维波形,蛋白质是氨基酸序列,科学图像是像素矩阵。

磐石的做法是先把这些格式各异的数据统一编码成模型能处理的形式,再用全球 1.7 亿篇科技文献、中科院科学语料库做对齐训练,让模型在不同学科之间建立关联,最后针对具体科研任务输出结果。训练数据包含 800 万条科学推理样本,平台集成了 8000 余个专业科研工具和技能库。

中科院自动化研究所研究员徐楠在圆桌论坛上表示,磐石 2.0 要做的是"让模型像科学家一样思考"。

因为能跨学科处理数据,磐石的应用范围远不止催化剂

在力学工程领域,磐石与中科院力学研究所合作,将高铁气动问题的仿真分析时间从数小时压缩到了秒级响应,数据稀缺场景下关键参数误差降低 42%。在天文领域,磐石与国家天文台合作构建了恒星参数智能反演工具链,稀有天体的识别准确率相比现有方法提升约 50%。在日常科研中最耗时间的文献调研环节,过去一轮系统性的文献梳理通常需要几天甚至几周,磐石 2.0 把这个过程压缩到了 20 分钟左右。

这些数字放在一起,给出了一个清晰的信号:磐石不是在做一个"科研界的 ChatGPT",而是在做"科研界的操作系统"——它跨学科、跨数据格式、跨工作流,把原本分散在不同工具里的科研能力整合到同一个入口。

但磐石覆盖的学科有一个共性——它们的数据虽然格式各异,但都有成熟的文献体系和公式可以参照,AI 建模有据可依。还有一些学科没有这样的条件,实验数据来自不同类型的设备,格式和维度各不相同,甚至连统一的标注标准都还没建立起来,AI 建模很难找到可靠的起点。

二、智源悟界·Brainμ:用多模态表征空间对齐神经科学"低维投影"

神经科学就是这种"数据条件差"的典型。2026 年 6 月,北京智源人工智能研究院与清华大学联合团队在《科学》(Science)期刊上发表了一项研究,首次证实记忆可以反向调控睡眠,正向记忆让睡眠更连续,负向记忆加剧睡眠碎片化,为抑郁症、焦虑症伴随的睡眠障碍提供了新的干预思路。

支撑这项研究数据分析的,是智源自研的多模态神经科学大模型悟界·Brainμ。

神经科学到今天还没有像蛋白质领域那样的标准化基础。脑电记录的是大脑表面的电信号,钙成像拍下的是局部单个神经元的活动,神经探针采集的是局限区域的脑深部区域的放电,这些信号来自不同设备、不同物种、不同实验范式,格式和维度各不相同。智源研究院研究员雷博在圆桌论坛上甚至提到:"甚至同一组数据,不同实验室也可能给出完全相反的解读。"

面对这样的数据困境,悟界·Brainμ 走了一条不同的路——借助已经训练好的多模态模型作为参照系。雷博解释,大脑是一个高维的存在,每种检测设备只能捕捉它的一个低维投影,就像从不同角度拍同一栋建筑,每张照片都只有一部分信息。Brainμ 利用语言和视觉的多模态模型已有的表征空间,把神经科学各个模态的稀疏数据对齐进来,让模型学到一个比单一模态更完整的大脑表征。

当模型掌握了这个高维表征之后,就可以实现不同模态之间的转换。比如输入一段成本低廉的脑电数据,输出信息量更大但设备昂贵的功能性磁共振成像(fMRI)图像,对缺少高端设备的基层医疗机构来说,医生有可能借助 AI 做到原本只有大型三甲医院才能做出的诊断。

配套的 BrainToken 数据平台整合了人类、猴和小鼠三个物种的数据,覆盖从脑电到双光子钙成像等主要神经科学模态。在与北京生命科学研究所的合作中,悟界·Brainμ 对超过 5000 晚小鼠睡眠数据完成了自动化标注和分析,超过 12 个月的分析结果经过双向验证,与专业睡眠神经科学博士的人工判断保持较高一致性。模型训练覆盖超过 7 万晚睡眠记录。

雷博用大语言模型的发展阶段来衡量科学智能当前的位置:在他看来,模型能力大概还在 GPT-1 阶段,产业界的关注度已经到了 GPT-3,科学家的使用反馈已经接近 ChatGPT 的前期。大语言模型是能力先成熟、应用再跟上,科学智能的逻辑反过来,应用先跑起来,拽着模型往前走。"需求走在能力前面,应用验证反过来推动模型迭代。"

三、深圳河套学院灵鉴:让 AI 像人一样操作精密仪器

做材料研究,需要用不同仪器获取材料的成分、结构和形貌信息。深圳河套学院副院长欧阳万里在圆桌论坛上打了个比方:就像给人做体检需要心电图、B 超、CT 各种设备,材料的"体检"也离不开扫描电子显微镜、X 射线衍射仪、能谱仪等一系列精密仪器。这些仪器的操作极度依赖人——研究人员需要手动制备样品,手动控制仪器软件,反复调整参数等待出图,再手动分析数据,不同设备之间的软件系统相互封闭。

深圳河套学院联合苏州国家实验室推出的灵鉴(AuraID)多智能体无人表征平台,选择了一条不同的路:不要求仪器厂商开放软件接口,让智能体以与人类专家一样的方式操作设备界面——观察屏幕图像,点击按钮,读取数据,调整参数。

在扫描电子显微镜的测试中,灵鉴接管操作后,一开始拍出的图像噪点明显,系统自动调整加速电压和放大倍率,图像逐步清晰,最终停在最佳参数上,自动完成图像捕获和颗粒粒径分析。

目前灵鉴已覆盖 6 类精密仪器、10 余种表征模态,在 micro-CT 对准任务中,AI 独立完成率从 1.0 版本的 33% 提升到 2.0 版本的 80%,晶体结构解析的工作量减少 50.6%,微观形貌分析耗时从 9 分钟缩短到 7.5 分钟。同一套操作规则可以支持能源材料、纳米材料和金属材料三类不同样本的表征。

深圳河套学院代表王智慧表示,合成侧的自动化已经有不少科研机构在推进,但表征侧的无人化和智能化还是空白,灵鉴切入的正是这个环节。

这条路线揭示了一个反直觉的工程判断:在科研仪器接口不统一的现实下,"让 AI 模拟人操作仪器"比"要求仪器厂商开放 API"更容易落地。这是一个非常典型的渐进式创新——不挑战现有生态,而是在现有生态之上叠加智能层。

四、清华大学黑灯实验室:大模型集成仪器形成闭环

清华大学生命科学学院教授、膜生物学全国重点实验室主任俞立在圆桌论坛上介绍了黑灯实验室在生命科学领域的落地思考。

黑灯实验室的核心思想是引入大模型辅助实验设计与流程管理。在没有 AI 之前,实验室需要配备大量研究人员处理重复性事务——制备样品、操作仪器、记录数据、归档文献。引入大模型之后,这些重复性事务可以部分自动化,研究人员可以把精力集中在实验设计、结果解读和科学判断上。

俞立团队在团队扩大 20 人的情况下成本降低 25%。这个数字看似不大,但放在生命科学实验室的实际成本结构里,20% 以上的成本下降已经是非常显著的优化。更激进的设想是,将新药研发从传统的 10 年 10 亿美元压缩到 3 个月 300 万美元——如果这个目标能在某些特定病种上实现,对整个医药行业的冲击是颠覆性的

但需要冷静看待的是:从 10 年 10 亿到 3 个月 300 万,这种跨越不是任何单一 AI 系统能完成的。它需要的是整个药物研发流程的系统性重构——从靶点发现、化合物筛选、动物实验、临床试验到审批监管,每一环都需要 AI 介入。目前能看到的更多是单点突破,要做到全链条压缩,还需要更多环节的技术成熟

五、四家机构放在一起看:科学智能的真实图景

把四家机构的探索放在一起看,能看到一个更立体的科学智能图景。

磐石 2.0 走的是"统一编码"路线——把格式各异的数据映射到同一个表征空间,让模型具备跨学科能力。这种路线适用于"数据条件较好、有成熟文献体系可参照"的学科。

悟界·Brainμ 走的是"对齐到通用多模态空间"路线——借助已经训练好的语言-视觉多模态模型作为参照系,把神经科学的稀疏数据对齐进去。这种路线适用于"数据格式异构、缺乏统一标注标准"的学科。

灵鉴走的是"AI 模拟人操作"路线——不要求仪器厂商开放接口,让智能体通过观察屏幕、点击按钮、调整参数完成操作。这种路线适用于"设备接口封闭、生态难以打通"的场景。

黑灯实验室走的是"大模型闭环集成"路线——把多个 AI 能力嵌入到实验流程中,形成数据采集-分析-反哺的闭环。这种路线适用于"整体流程重塑"的场景。

四条路线不是互相替代,而是互补。AI 做科研不是只有一个正确答案,而是针对不同数据条件、不同设备约束、不同工作流的具体解法

六、值得泼冷水的几点

但这场对话最后,雷博的判断值得反复咀嚼:模型能力大概还在 GPT-1 阶段,产业界的关注度已经到了 GPT-3,科学家的使用反馈已经接近 ChatGPT 的前期

这个判断背后的几个事实需要正视:

第一,绝大多数 AI 科研成果目前还不能独立完成"假设-实验-验证"的完整闭环。磐石 2.0 加速的是"筛选"环节,不是"发现"环节。悟界·Brainμ 加速的是"分析"环节,不是"假设"环节。灵鉴自动化的是"操作"环节,不是"设计"环节。AI 在科研中的位置,目前还是"加速器",不是"替代者"。

第二,跨学科的"AI 操作系统"还远未成型。磐石 2.0 试图跨学科,但实际应用仍然集中在材料、力学、天文这几个领域。神经科学有 Brainμ,材料表征有灵鉴,但这些都是单点突破。真正的"AI 操作系统"应该能跨学科、跨设备、跨工作流,让科学家用同一套工具完成不同领域的实验——这件事现在还做不到。

第三,"应用走在能力前面"的飞轮能否持续。雷博说应用先跑起来,拽着模型往前走。但应用跑起来需要的是真实需求和真实数据,而这些在科研领域是稀缺的。当前的几篇 Science 论文和几十个落地机构,能否支撑起模型持续迭代所需的数据和反馈,是个未知数。

七、概念期之后的真实节奏

回到开篇的问题——AI 做科研走过概念期了吗?从这场对话的成果看,确实走过概念期了。"概念期"的标志是"AI 能不能做科研"这个问题还无法被回答;"实践期"的标志是"AI 在哪些场景下能做、做到什么程度、还有什么做不到"正在被清晰地勾勒出来

磐石 2.0 证明了跨学科数据编码可行,悟界·Brainμ 证明了稀疏数据对齐可行,灵鉴证明了 AI 操作精密仪器可行,黑灯实验室证明了大模型集成实验室可行。这些"可行"加在一起,构成了科学智能在 2026 年的真实图景

但要让科学智能进入"成熟期",还需要模型能力跨过 GPT-2、GPT-3 这样的关键门槛,还需要更多领域出现"AI 主导"的科研突破,还需要科研界对 AI 的接受度从"工具辅助"提升到"合作者"。

真正值得期待的不是 AlphaFold 那样耀眼的单点突破,而是磐石、悟界、灵鉴、黑灯实验室这种"在不同数据条件下找到适配方法"的渐进式创新。这种创新不会上头条,但它们累积起来,会让 AI 在科研领域的角色发生根本性变化——从"工具"变成"伙伴"。

这件事的节奏可能比大多数人预期的更慢,但方向是清晰的。AlphaFold 之后,AI 做科研的故事,远比一个诺奖丰富得多。