← 最新论文
🔭 astrophysics

Enabling New Discoveries with Machine Learning

本文回顾了 Astronomaly 框架,并论证了如何通过将深度学习与人类的主动输入相结合,实现通过识别下一代望远镜产生的海量数据集中稀有且新颖的天文天体,从而实现科学发现的自动化。

原作者: Michelle Lochner

发布于 2026-09-10✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Michelle Lochner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

宇宙正变得过于喧嚣,以至于仅凭人类的耳朵已无法独自聆听。在未来的几年里,大型新望远镜将开始扫描天空,捕捉图像和信号的速度将令天文学家以往面临的一切都显得相形见绌。其中一个项目——薇拉·鲁宾天文台(Vera C. Rubin Observatory),最终将编目约200亿个光学星系,并且每晚都会发现超过1000万次天空中的变化。另一个项目——平方公里阵列射电望远镜(Square Kilometre Array),将发现超过10亿个射电星系。当数据以如此庞大的数量涌入时,科学家坐下来逐一查看每一张图像或每一个信号的旧方法将变得不再可能。挑战不再仅仅是收集数据,而是在当“干草堆”的大小如同一颗行星时,如何从中找到那根针。

为了解决这个问题,研究人员正转向机器学习,这是一个计算机无需针对每条规则进行显式编程,即可学习识别模式的领域。然而,一个仅仅标记任何异常情况的简单计算机程序是不够的。在一个充满数十亿个物体的数据集中,计算机可能会将摄像机的故障或镜头上的污点标记为“奇怪”,尽管这些并无科学价值。真正的目标是寻找那些真正有趣的异常值:即那些可能改写我们对宇宙理解的罕见、新型或意想不到的天体。这正是米歇尔·洛克纳(Michelle Lochner)及其同事的工作所在,他们提供了一种连接原始计算能力与人类好奇心的新途径。

研究人员开发了一个名为 astronomaly 的工具,该系统旨在帮助科学家高效地筛选这些海量数据集。该系统并非试图教计算机某种新类型物体看起来究竟是什么样子的——如果从未有人见过它,这几乎是不可能的——而是使用一种称为“主动学习”(active learning)的方法。在这个过程中,计算机扫描数据,并将一小部分最有潜力的候选对象呈现给人类科学家。随后,科学家会对这些对象进行标注,将其分为“有趣”或“无趣”。计算机从这些选择中学习,不断精炼其对人类认为有价值之物的理解,进而对剩余的数据进行分类。这创造了一种伙伴关系:机器处理繁重的分类工作,而人类则提供识别真正重大发现的直觉。

这种方法已经取得了实际的研究成果。利用 astronomaly,团队发现了一种名为 SAURON 的新型射电源,其全称为“非热辐射的陡峭且不均匀环”(Steep and Uneven Ring of Nonthermal radiation)。这个天体是在来自 MeerKAT 星系团巡天的数据中发现的,其外观与任何已知源都不同,可能两个超大质量黑洞合并后的遗迹。该系统还帮助发现了被传统方法遗漏的异常变星和星系合并现象。在一次案例中,该工具分析了来自暗能量相机巡天(Dark Energy Camera Legacy Survey)的近400万张光学图像,并突出了十几个人类专家认为最引人注目的特定源,其中包括那些挑战标准分类的对象。

取得成功的关键在于计算机如何理解数据。几十年来,科学家必须手动设计计算机应该寻找的特征,例如星系的形状或恒星随时间变化的亮度。这是一个困难的步骤,往往限制了计算机所能发现的内容。这项新工作表明,使用深度学习(一种更高级的机器学习形式)可以让计算机自行确定这些特征。通过训练计算机识别图像中的复杂模式,系统可以创建一张丰富的数据内部地图。当研究人员应用这种方法时,他们发现计算机能够比以前更准确地将相似的星系归为一类,并将异常的天体区分开来。

然而,研究人员发现了一个关于这些先进系统运作方式的微妙但重要的转折。在使用旧有的、人工设计的特征时,奇特的物体往往位于数据图谱的边缘,因此很容易作为离群值被发现。但使用新的深度学习方法时,奇特的物体往往出现在图谱深处,混杂在正常的物体之中。如果计算机只寻找位于边缘的事物,就会错过它们。为了解决这个问题,团队通过一个名为 astronomaly: protege 的工具版本改进了方法。该版本不再仅仅寻找统计学上的离群值,而是完全专注于人类用户认为有趣的内容,直接从用户的反馈中学习,从而在复杂的数据地图中进行导航。

论文总结道,天文学发现的未来取决于这种人类与机器之间的特定协作模式。随着新望远镜带来的数据洪流不断增长,自动化搜索非凡事物的能力将变得至关重要。研究人员认为,由于“有趣”是一个因科学家而异的主观特质,因此最好的路径不是试图在代码中完美定义它,而是构建能够向我们学习的系统。通过将机器的速度与人类专家的直觉相结合,天文学家可以确保下一个伟大的发现——或许会像 1967 年乔斯林·贝尔·伯内尔(Jocelyn Bell Burnell)发现的第一颗脉冲星那样令人惊喜——不会湮没在噪声之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →