夜雨聆风学习资料网

ARTICLE · 1123153

AI天体物理学家的成长路径:从“三人共舞”到科学理解

AI天体物理学家的成长路径:从“三人共舞”到科学理解
封面为AI生成的概念插画,不对应真实台站或观测影像。
设想这样一个夜晚:巡天数据中出现了一个刚刚亮起的光点。AI把它列为超新星候选,查询历史记录,评估天气与设备状态,再向望远镜提交后续观测方案。
过去需要多人接力完成的工作,正在被连接成一个更紧密的过程。
但随之而来的问题更深了一层:当AI能筛选信号、编写程序、调度观测,甚至组织一段研究流程时,它是否已经成为天体物理学家?
回答这个问题,不能只看它完成了多少任务。我们还需要看:它能否解释证据,识别自己的假设,并在新观测面前改变判断。

三人共舞的宇宙舞台

任福继在2025年发表的《人工智能时代的“三人”共舞》中,将自然人、机器人、数字人置于同一个未来图景中。1
借用这一框架,我们可以重新理解天文学中的协作。
自然人提出问题、判断价值,也承担科学结论的责任。望远镜、探测器和航天器构成与宇宙接触的物理端;AI模型与智能体则处理数据、比较解释、提出行动建议。这里的“数字人”是一种功能性的比喻,并不意味着AI已经具有人格或科学家的完整能力。
这样的分工不是三条互不相干的流水线。一个意外信号,可能促使AI调整分析,也可能让人类重新审视问题,再由观测设备取得新的证据。
由此看,AI天体物理学家的成长,是数字智能逐步参与这一循环的过程:先把交给它的任务做好,再学会连接任务,最终接受更严格的考验——它提供的解释,能否经受新的观测?
图1|本文对“三人共舞”的天文场景化表达。中心连接的是可追溯的证据、模型和记录。

宇宙不会按下重来键

天体物理为这种成长提供了一块特殊的试验场。它的困难,来自我们与研究对象之间的距离,也来自证据本身的结构。
第一,我们通常不能直接操控研究对象。我们无法让某颗超新星再爆发一次,也无法调节一颗遥远黑洞的自旋,观察它随后发生什么。但这不等于天体物理“无法验证”:独立观测、多波段测量、不同天体样本以及理论预言之间的相互检验,仍然可以形成有力证据。
AI因此要学会的,是在无法随意重做天体事件的条件下,设计更有区分力的观测与分析。
第二,海量数据与关键证据稀缺可以同时存在。巡天影像、光谱和时间序列不断积累,但罕见事件、可靠标注,以及能够排除竞争解释的观测,并不会同样充裕。
引力波研究正好说明这种区别。2025年发布的GWTC-4.0已经将目录中的候选事件总数扩展到218个,其中新增128个;这一统计采用了论文规定的天体物理来源概率等筛选条件。不能再用“只有数十个事件”概括整个领域,更不能把候选数与所有事件均获同等程度确认混为一谈。
真正困难的,往往是某一类特殊源、某一种联合探测,或某个决定性的物理参数仍然缺少足够证据。
对AI读者,这意味着不能把“数据量”直接等同于“有效信息量”。对天文读者,一个熟悉的例子是选择效应:亮源更容易被探测到,有些源更容易获得后续光谱。若直接把已观测样本的分布当成真实天体总体的分布,模型再精确,也可能只是在复现观测选择。训练样本怎样进入目录,本身就是推断问题的一部分。
第三,不同信使不会自动拼成同一个答案。电磁波、引力波、中微子和宇宙线带来不同信息,也各有测量误差和选择效应。AI必须辨别:一个异常来自仪器、数据处理、模拟近似,还是值得追踪的新现象?物理约束可以帮助判断,却不能替代对约束本身适用范围的检查。
第四,预测之外,还有解释。天体物理当然重视发现新天体、新现象,但更进一步的问题是:为什么会这样?这一机制能否解释其他现象,又会在什么条件下失效?其他基础科学同样追求这些问题;天体物理的特别之处,在于它经常要通过遥远、间接、难以操控的证据来作答。

AI需要同时长出四种能力

如果把成长只理解成模型变大、回答变快,就容易漏掉科研中真正重要的部分。我们可以从四个维度观察AI的进展。

感知 从读懂一张图到连接多种证据

AI首先要知道自己“看见”了什么:图像中的光点是否可信,光变是否异常,不同巡天记录是否对应同一天体。
它还要知道自己在什么条件下看见:云量、风速、湿度、设备状态和可观测时间窗口,都可能改变一次观测的价值。科学信号与观测环境,需要被放在一起判断。

认知 从识别类别到比较物理解释

分类解决“它像什么”,参数推断回答“它可能具有怎样的性质”,机制研究则进一步追问“什么过程产生了这些性质”。这些任务相互连接,却不能用同一项准确率代替。
可以用一个简洁的贝叶斯关系把问题写清楚:p(θ|D, M) ∝ p(D|θ, M) p(θ|M)。这里D是观测数据,θ是待估参数,M是包含物理过程与观测过程的模型;左侧是参数的后验分布,右侧分别是似然与先验。神经网络可以帮助近似其中的计算,但不能让这些假设自动消失。9
例如,从恒星光谱估计有效温度、表面重力和金属丰度,既要考虑恒星大气模型,也要考虑仪器响应与测量噪声。一个点估计很准确,未必意味着它给出的不确定性可信;参数之间的简并,也不会因为换用了更大的网络就自动解除。
但可解释的特征,不等于已经建立了因果理解。尤其在模拟数据上,我们还要追问:模型学到的是稳定的物理关系,还是特定模拟与训练分布留下的痕迹?
物理归纳偏置可以提供帮助。例如,把适用的旋转对称性、守恒关系或量纲约束放进模型结构与损失函数,可以缩小搜索空间。但观测掩膜、仪器响应和样本选择可能破坏数据层面的对称性;约束施加在物理量还是观测量上,必须分清。

行动 从给出建议到接受真实反馈

星语望远镜把这种能力推进到实际观测环节。国家天文台2026年9月18日的报道介绍,相关智能体已接入“司天”探路者和原型机,结合观测需求、天气与设备状态生成并执行方案,再依据结果与专家反馈调整后续任务。
该报道的具体表述是:系统已预警8颗极早期超新星候选,其中2颗在天气允许时触发了后续观测。“预警候选”与“确认发现”,是不同的科学环节。
这里的进步在于,AI开始面对真实约束:一个方案即使写得完整,也要经得起天气、设备和观测结果的检验。

组织 从完成一步到管理一段研究

更高一层,是把提出假设、调用工具、检查结果、调整策略连接起来。
Mephisto是这样一种探索。它将大语言模型智能体与星系光谱能量分布建模软件CIGALE相连,围绕多波段观测进行模型比较,并通过搜索和经验积累改进分析过程。论文把它定位为有潜力的科研协作者。
这说明,AI的工作对象可以从“一个计算任务”扩展到“一段研究流程”。与此同时,研究流程能否通向可靠发现,仍取决于数据质量、模型假设和外部检验。
图2|四个维度可以并行发展,相互促进;这是一张分析框架图,不是系统能力排名。

会写代码之后 还有多远

Codex等编码智能体,让科学意图转化成可执行程序的成本明显降低。它们也可以参与规划、测试与持续迭代,把能力严格限制在“只会执行”并不准确。
需要始终记住的是:编码能力只是科研能力的一部分,程序运行成功也不是物理解释成立的充分条件。
两类评测让这一差别更加具体。
一项2026年的机器人化学实验室研究,在4,608次试验中,仅有3.3%的工作流被专家判断为满足实验室约束、无需人工修补即可执行;最优受测系统的这一比例为28.1%。研究还观察到,实验反馈更多促成局部调整,而没有推动工作流层面的重新规划。7
这衡量的是特定实验室、任务与系统配置下的物理可执行性,不能直接当作“AI做科学的总体成功率”。但它提示我们:生成一个像样的计划,与在真实环境中完成研究,之间仍有距离。
对科研代码,至少要区分三层检查:程序是否按照预定逻辑运行,计算是否忠实实现所选物理模型,以及该模型是否能解释独立观测。单元测试主要覆盖前两层的一部分;第三层还需要检查系统误差、替代模型和观测证据。
另一项2026年9月发布的预印本MechBench,刻意区分了“恢复现象规律”和“恢复背后机制”。在其Core-set上,Codex与GPT-5.6-sol组合的两项准确率分别为35.00%和13.75%。
图3|数据来自MechBench预印本的特定模型组合与测试集。两项指标任务含义不同;结果不能外推为所有AI系统的固定上限。
这不是说AI永远不能理解机制,而是提醒我们:拟合观测规律与识别生成机制,需要分别检验。
归纳帮助我们从数据中发现模式;演绎帮助我们推导一个假设的后果;溯因则尝试提出能够解释现象的候选原因。真正的研究往往在三者之间循环,而不是沿着一条阶梯单向上升。
因此,未来的AI天体物理学家也未必是一种包办一切的智能体。编码、观测调度、模型推断和可解释分析可以各有所长,再通过共同的证据记录协同工作。CKAN是一种网络方法,Mephisto是一种智能体框架,星语是一套观测系统;它们代表不同能力探索,并不是同类产品的排行榜。

其他学科的经验 如何走进天文台

生命科学、材料科学和化学提供了重要参照:候选对象可以大量生成,真正有用的结果却仍要经过实验或其他证据检验。理论研究则提醒我们,问题的难度有时来自概念和假设本身,而非计算量。
这些领域内部的差异很大,不能简单分成“数据多的学科”和“数据少的学科”。对天体物理来说,更有启发的问题是:有限的验证资源,应该用在哪里?
如果两种模型都能解释现有光变曲线,继续把同一条曲线拟合得更精细,未必是最有价值的下一步。一次恰当波段的观测、一条关键光谱,或一次对系统误差的独立检查,可能更能区分它们。
这可以与已有的贝叶斯实验设计思路相接:在采取行动之前,对不同可能观测结果求平均,估计哪种设计最能减少目标参数或模型的不确定性。这类目标常称为“预期信息增益”,天文巡天设计已有相关研究。10
本文进一步建议,把这一原则明确接入科研智能体的决策:不仅推荐“最可能正确的答案”,也推荐“最能改变我们判断的下一条证据”。
例如,面对一个新暂现源,系统可以同时列出几个合理解释,说明它们在哪些观测量上产生不同预言,再结合天气、曝光时间和设备能力,选择最值得争取的观测。评价它的标准,也可以从“找到多少候选”,扩展到“减少了多少关键不确定性”。
需要注意,信息增益取决于当前候选模型、先验与噪声假设。如果真正的机制根本不在候选集合里,一个系统可能越来越自信,却越来越偏离事实。因此还需要模型失配检查,并为无法被现有解释吸收的异常保留观测机会。
把这些环节可靠地集成起来,仍是一项研究方向,而不是所有现有系统都已具备的能力。但它将感知、认知、行动、组织四个维度连接到了同一个科学目标上。

把物理直觉变成可以检验的问题

如果用“灵气”形容更深层的情境理解与科学直觉,那么它指向一个重要追问:AI能否在已有框架之外,发现值得认真对待的新解释?
我们不必急着把它宣布为AI已经跨越、或永远不能跨越的边界。更有建设性的做法,是把这一追问拆成可以检验的要求。
换一批数据,解释是否仍然成立?换一个巡天、一个仪器,或者改变模拟设置,模型还能否保持可靠判断?
面对竞争机制,能否提出有区分力的预言?一个解释的价值,不只在于能讲通已知结果,还在于告诉我们接下来应当看到什么。
证据不足时,能否明确保留多个答案?如果不同机制在当前数据下无法区分,承认不可识别性,是科学判断的一部分。这里的“不可识别”指的是:不同机制或参数组合能够产生相同、或在当前测量精度内难以区分的观测分布。它可能是证据的限制,不能一概归因于模型不够聪明。
出现反证时,能否修改假设与研究路线?只调整参数,和意识到原来的分析方法不再合适,是两种不同能力。
对于本科阶段的学习与训练,可以把这四个问题落实到一个小项目:在同一批光谱或光变数据上建立一个物理基线和一个机器学习模型,按天体划分训练与测试样本,避免同一天体的信息泄漏;再用不同观测条件的数据检验泛化。除预测误差之外,比较误报、漏报及不确定性校准,并写下模型在哪些条件下失败。这样的练习,能够把“物理理解”从抽象口号变成可复现的研究过程。
图4|本文提出的评价思路。它不是已有的统一标准,而是把“理解”转化为可检查行为的一种尝试。
如果要为AI天体物理学家设计成长环境,还可以增加两项基础设施:一本可追溯的“科研账本”,记录每个结论依赖的数据、代码与假设;一套“失败记忆”,保存哪些解释被排除、哪些观测未能取得,以及原因是什么。
这样的“共享大脑”,应当容纳的不只是答案,还有分歧、限制和修正答案的历史。人类提供问题意识与价值判断,设备提供测量,AI参与搜索、比较和执行;任何一方的输出,都要回到共同的证据上接受审视。
AI天体物理学家的成长,最终要走过三道相互关联的门槛:从识别信号到整合证据,从预测现象到检验机制,从完成任务到参与研究路线的修订。四种能力在其中交织发展,没有哪一种能单独代表全部。
也许,有一天,让我们真正感到AI学会了“共舞”的,不是它交来了一张更漂亮的图,而是它指着一个异常,清楚地说明:现有解释为什么不够,下一次观测怎样才能分辨。
星空依然在那里。我们需要更好的工具,也需要更好的提问。
参考资料
[1]任福继.人工智能时代的“三人”共舞.《智能系统学报》,2025,20(5):1053.
[2] LIGO Scientific Collaboration.GWTC-4.0科学摘要.
[3] Huang Z, Shi H, Liu Z, Wang N.An Interpretable AI Framework to Disentangle Self-Interacting and Cold Dark Matter in Galaxy Clusters: The CKAN Approach.2025.arXiv:2509.06788
[4]中国科学院国家天文台.人工智能赋能天文观测:国家天文台“星语望远镜”入选斯坦福《AI Index Report 2026》.2026-09-18.
[5] Sun Z, Ting Y-S, Liang Y, et al.Mephisto: Self-Improving Large Language Model-Based Agents for Automated Interpretation of Multi-band Galaxy Observations.arXiv:2510.08354
[6] OpenAI.Using Goals in Codex.2026-05-09.
[7] Guo L, et al.Stress-testing large language model agents in a robotic chemistry laboratory.2026,预印本.arXiv:2607.23045
[8] Yu Z, Zhang J, Cheng J, Ding J, Li Y.MechBench: Can AI Scientific Agents Discover Mechanisms Beyond Phenomenal Laws? 2026,预印本v1.arXiv:2609.35515
[9] Hogg D W, Foreman-Mackey D.Data analysis recipes: Using Markov Chain Monte Carlo.arXiv:1710.06068
[10] Sparsely sampling the sky: a Bayesian experimental design approach.MNRAS,2013,433:3523–3533.

相关学习资料