ARTICLE · 1032331
AI - 另一种理解星系的方式?


引言

一幅由AI生成的星系图像,能成为研究真实宇宙的依据吗?面对不完整的观测,AI可以尝试利用已有线索之间的联系,辨认被噪声掩盖的信号,预测尚未看清的结构。但天文学家需要的,不只是一张更清晰的照片,而是能帮助我们测量和研究星系的可靠信息。
本文将以星系图像为例,看看AI怎样利用这些联系作出预测,以及如何用独立的真实观测检验这些结果。研究关心的是:这些预测在什么条件下值得信赖,能帮助回答哪些科学问题,又有哪些问题仍需要补充观测才能解决?
认识一个星系,需要多少线索?

认识一个人,通常会先记住他的长相,再通过交谈了解工作、性格和经历。如果想知道身体状况,可能还需要一份体检报告。这些信息描述的是同一个人,却各自回答不同的问题。仅凭一张照片,很难知道一个人的全部情况。
认识一个星系也有些相似。天文学家能拍摄到它的外表,但还想知道:里面的恒星是年轻的多,还是年老的多?还有多少气体可以形成新的恒星?是什么经历塑造出今天的它?星系无法讲述自己的故事,只能从它发来的光中寻找线索。
不同的观测手段各有所长。可见光图像展示恒星分布的轮廓;紫外光让年轻恒星更加醒目;红外光揭示尘埃和一些被遮蔽的恒星形成活动;毫米波中的分子辐射,则帮助我们寻找孕育恒星的冷气体。将星系的光按波长展开,就能得到一份类似“体检报告”的光谱,帮助我们分析物质成分、估计距离、测量运动。把这些线索结合起来,才能逐渐了解这个星系在光发出时的状态。

图1 了解M99星系的不同线索
但了解一个星系,还不足以认识星系演化的普遍规律。需要比较大量星系,看看它们在不同环境、不同时期有何差异。例如,在星系密集的地方,缺少年轻恒星的星系通常占更高比例,提示周围环境可能影响星系的成长。要了解星系随时间的变化,科研人员虽然无法等待数十亿年,看着它们慢慢改变,却可以利用光传播需要时间这一点:遥远星系展现的正是很久以前的样子。望向不同距离,就像翻看来自不同时代的照片。照片里虽然不是同一批星系,仍可以通过比较,研究星系群体如何随时间变化。
看得多了,也更有机会遇到不同寻常的星系。弄清它们为何与众不同,或许能为理解星系演化提供新的线索。可是,无论是这种特别的对象,还是常见的星系,受限于望远镜的观测时间,往往只有部分资料。线索还不完整,能否从已有观测中多了解一些?下面,以星系图像为例,看看AI怎样利用线索之间的联系作出预测,以及这些预测怎样才能用于科学研究。
AI怎样从已有线索中多走一步?

想象一片海面上漂浮着许多冰山。高大的冰山容易认出,小小的冰尖却混在起伏的浪头之间。暗弱天体也有类似的处境:它们发出的光已经被记录下来,却淹没在照片的噪声中。AI能否帮助我们辨认这些线索?
一张星系照片里,相邻位置并非毫无联系。一条旋臂延伸经过许多像素,周围结构的走向和亮度分布,能帮助估计某个看不清的位置原本有多亮。AI可以从大量图像片段中学习这类联系.一些AI降噪方法便暂时遮住部分像素,让AI根据周围信息预测这些位置的亮度,再与它们原本的观测值比较,用差异来调整AI。反复练习时,天体结构的联系能帮助预测,独立的随机噪声却难以猜中。在适当的噪声条件下,AI因此能学会减轻噪声的影响[1]。
多次拍摄还能提供额外的线索。就像多看几次海面,浪头换了,冰尖却仍在相近的位置;同一片天空的照片中,稳定的天体信号反复出现,随机噪声却会变化。天文学家通常将这些照片对齐后叠加,让随机的明暗起伏相互抵消一部分,使暗弱天体更容易显现。基于AI的星衍(ASTERIS)进一步利用这些重复观测:把多次曝光分成两组,根据一组作出预测,以另一组作为训练参照,让AI通过反复练习提取共同的天体信号。在研究测试中,它比传统叠加方法检出了更多暗弱天体[2]。

图2 重复观测中的信号与噪声。冰山代表稳定的天体信号,海浪代表变化的随机噪声。三次观测中,冰山的位置和形状保持不变,浪头却各不相同。利用多次观测中的共同特征,有助于辨认混在噪声中的暗弱信号。本图为概念示意,水下轮廓仅用于说明。
这些联系还可以扩展到不同望远镜之间。地面拍摄的星系图像受到大气扰动,往往比较模糊,空间望远镜则可能看见更精细的结构。AI能否学习两者的对应关系,根据地面照片预测从太空中会看到什么?
Schawinski等人2017年的研究[3]从一个简化实验入手:把星系图像人为模糊、加入噪声,让AI练习预测原图。研究者也可以利用同一天体真实的地面与空间照片,让AI学习两者之间的联系,再为尚无空间观测的星系生成预测[4]。
当细小结构接近或小于现有观测能够分辨的尺度时,不同的真实模样可能在照片里看起来十分相似。AI可以借助学到的经验预测这些细节,但图像变清晰,并不意味着预测一定正确。这些细节是否可靠,能否用于科学测量,还需要独立的、更精细的真实观测来检验。
合理的预测,怎样成为可靠的线索?

预测图像变得清晰、逼真,还不等于能用于科学研究。如果AI总把某类星系预测得偏小,就可能误以为这类星系本来更紧凑,进而错误地解释它们的成长经历。这样的偏差如果没有被识别和处理,样本再多,也可能只是让人更确信一个错误的结论。
因此,检验不仅要看图像像不像,还要看用预测图像测出的物理参数是否可靠,以及误差会不会改变科学结论。这需要拿出训练和调整AI时都未使用过的真实观测,与预测比较,同时考虑观测本身的误差。一种预测也许适合测量星系的整体大小,却不足以研究内部的细小亮斑;检验就是为了弄清它能用来回答哪些科学问题。
为大量星系专门安排验证观测,成本很高。而天文巡天项目分批公开数据,提供了一个机会:先根据已有资料作出预测,将结果公开并固定下来,等后续观测发布后再核对。研究团队的E-BGS工作便采用了这个思路。研究利用已有的DESI与Euclid配对观测训练AI,并在独立测试样本上进行检验;随后,为Euclid DR1预计覆盖天区内的另一批星系提前生成VIS波段预测图像,作为E-BGS数据集公开[4],供后续真实观测进一步检验。

图3 E-BGS数据集示例。每组左图为DESI地面观测的三波段合成图,右图为AI生成的Euclid VIS波段预测图像。这些星系尚无公开的Euclid实测图像,预测中的结构有待检验。
经过这样的检验,AI学到的联系还可能帮助安排下一步观测。如果某类星系的真实观测总与预测不符,可以进一步追查:是AI见过的例子太少、仪器造成了偏差,还是这些星系确实经历了不同的物理过程?如果已有线索支持几种不同解释,也可以进一步研究,增加哪种观测最有助于区分这些解释,把有限的望远镜时间用在最需要补充证据的地方。
AI串联观测线索的价值,最终要体现在它能否帮助我们回答科学问题,或提出值得观测检验的新问题。E-BGS希望通过提前公开预测、等待真实观测核对,为判断这种能力提供依据:究竟能从已有星光中多了解多少,又该向宇宙寻找哪些新的线索?


参考文献:
[1] Liu, T., Quan, Y., Su, Y., et al. 2025, “Astronomical image denoising by self-supervised deep learning and restoration processes,”Nature Astronomy, 9, 608–615. doi:10.1038/s41550-025-02484-z.
[2] Guo, Y., Zhang, H., Li, M., et al. 2026, “Deeper detection limits in astronomical imaging using self-supervised spatiotemporal denoising,” Science. doi:10.1126/science.ady9404.
[3] Schawinski, K., Zhang, C., Zhang, H., Fowler, L., & Santhanam, G. K. 2017, “Generative Adversarial Networks recover features in astrophysical images of galaxies beyond the deconvolution limit,” MNRAS, 467, L110–L114. doi:10.1093/mnrasl/slx008.
[4] Ye, R., & Shen, S. 2026, “From DESI to Euclid: A Generative Bridge to Improve Measurements of Galaxy Structure,” ApJL 1009 L10. Doi:10.3847/2041-8213/ae9cbf