Galaxy Morphology Classification: Uncertainty Modeling and Out of Distribution Detection
本文提出了一个利用 Galaxy Zoo DECaLS 数据集进行星系形态分类的综合框架,该框架将 IsoMaxPlus 损失函数与蒙特卡洛丢弃法(Monte Carlo Dropout)相结合,在保持高分类准确度的同时,显著增强了分布外检测和不确定性量化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
宇宙中充满了数十亿个星系,每一个都是由恒星、气体和尘埃组成的巨大岛屿。近一个世纪以来,天文学家一直根据它们的形状将这些宇宙岛屿进行分类:有些是像巨大的光球一样圆润平滑,而另一些则是带有螺旋臂的扁平螺旋状。这种被称为形态分类的方法不仅仅是为了编目;星系的形状讲述了一个关于其历史、形成方式以及随时间演变的故事。然而,随着现代望远镜以空前的清晰度和规模捕捉天空图像,星系的数量已变得过于庞大,以至于人类无法逐一进行人工检查。为了跟上步伐,科学家们转向了人工智能,教计算机自动识别这些形状。但问题在于:标准的计算机程序往往过于自信。当它们遇到看起来很奇怪或与它们见过的任何事物都不符的星系时,它们仍会强行将其归入一个已知类别并声称非常确定,这可能会让罕见或新的发现被掩盖在虚假自信的围墙之后。
印度理工学院海德拉巴分校的一个研究小组致力于解决这一问题,他们构建了一种更聪明的星系分类方法。他们专注于一个被称为“分布外”(out-of-distribution)检测的特定挑战,这简单来说就是识别图像不属于已知组别的能力。利用来自暗能量相机遗迹调查(Dark Energy Camera Legacy Survey)的大量星系图像,他们训练了一个深度学习系统,该系统不仅能识别九种标准的星系形状,还能承认自己的不确定性。研究人员测试了三种不同的方法。第一种是作为基准的标准方法。第二种引入了一种新技术,该技术衡量一个星系的特征距离其已知组中心的距离,而不仅仅是猜测一个类别。第三种方法将这种距离测量与一种通过对同一图像进行多次轻微变化的重复处理来让系统评估自身不确定性的方法相结合。
结果显示,新方法远优于标准方法。使用基于距离技术的系统在识别异常星系方面表现得显著更好,它将正确识别这些异常星系为“未知”的能力提高了近 90%,同时仍能以 97% 的准确率正确识别已知形状。至关重要的是,这个系统学会了谦逊。当它遇到难以分类或看起来像是多种类型混合体的星系时,它不会强加一个标签。相反,它会发出不确定性的信号,通常是通过显示该星系远离任何已知形状组的中心。这种行为对于未来的巡天观测至关重要,因为巡天的目标不仅是统计已知的事物,更是为了发现那些罕见的、奇特的以及此前未曾见过的现象。
研究人员还发现,将距离法与多次处理技术相结合,使系统变得更加可靠。通过在网络中多次运行图像,计算机可以观察其答案是否随每次处理而发生轻微变化。如果答案出现波动,系统就知道自己正在处理一个模糊不清的情况。这种方法将系统置信度评分的误差降低了约 73%,这意味着当计算机说它很确定时,它是真正确定的;而当它说不确定时,它正确地识别出了一个困难案例。这项研究表明,通过改变计算机衡量相似性的方式——侧重于几何距离而非仅仅是概率——它可以创造出已知星系与那些真正新颖或奇异的星系之间更清晰的分界。
这项工作不仅提高了分类的速度,也改变了整个过程的可靠性。在过去,自动化系统可能会自信地将一个罕见的合并星系误标为一个普通的螺旋星系,从而有效地将一次独特的宇宙事件从记录中抹去。新的框架确保了此类异常情况会被标记出来供人工审查。研究人员验证了计算机正在关注图像中的正确部分,例如螺旋臂或中心核球,而不是随机噪声或背景伪影。当系统出错时,通常是因为星系本身具有混淆性,即特征相互融合,系统通过更高的不确定性正确地反映了这种困惑。
这对天文学的意义重大。即将到来的望远镜很快就会捕捉到数十亿个星系的图像,这种规模使得人工检查变得不可能。拥有一种既能自动分类已知事物,又能可靠地指出未知事物的工具,对于发现下一代宇宙现象至关重要。研究人员指出,虽然他们的方法非常有效,但它确实需要更多的计算能力来运行用于不确定性检查的多次处理。然而,他们认为,为了能够信任自动化目录并确保没有奇怪或罕见的星系悄无声息地溜走,支付这一成本是值得的。通过教会机器识别自身知识的局限性,天文学家终于可以让计算机处理常规工作,从而将精力集中在宇宙中最神秘、最迷人的物体上。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。