← 最新论文
🔭 astrophysics

Trustworthy scientific inference with generative models

本文介绍了 FreB,这是一种严谨的协议,它能将具有潜在偏差的生成式人工智能后验分布转化为统计学上有效的置信区域,从而为传统似然评估难以实现的复杂反问题实现可靠的科学推断。

原作者: James Carzon, Luca Masserano, Joshua D. Ingram, Alex Shen, Antonio Carlos Herling Ribeiro Junior, Tommaso Dorigo, Michele Doro, Joshua S. Speagle, Rafael Izbicki, Ann B. Lee

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: James Carzon, Luca Masserano, Joshua D. Ingram, Alex Shen, Antonio Carlos Herling Ribeiro Junior, Tommaso Dorigo, Michele Doro, Joshua S. Speagle, Rafael Izbicki, Ann B. Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,科学家们一直面临着一个根本性的难题:如何在只能看到结果的情况下,学习宇宙中隐藏的规律?想象一下,看着墙上的影子,试图推断出投射出该影子的物体的确切形状。从天文学到粒子物理学,研究人员观察数据——来自遥远恒星的光、亚原子粒子的碰撞或大气中的模式——并必须通过逆向推导来得出创造这些现象的属性。这被称为“逆问题”。几十年来,科学家依靠复杂的数学公式来进行这些推导,但随着我们的仪器变得越来越强大,产生了海量的、高分辨率的数据,那些旧的公式往往变得过于缓慢或难以使用。作为回应,许多人转向了生成式人工智能。这些计算机系统通过示例进行训练,能够学习以惊人的速度预测观测数据的隐藏成因。它们已成为分析从詹姆斯·韦伯空间望远镜拍摄的早期宇宙图像,到地下探测器中混乱的粒子喷射等各种内容的必备工具。

然而,这种新方法出现了一个关键缺陷。虽然这些人工智能模型非常擅长猜测最可能的答案,但它们往往无法告诉科学家应该对该答案有多大的把握。当一个模型基于一组特定的示例进行训练时,它可能会变得过度自信,提供看似精确但实际上是错误的狭窄且精准的答案,尤其是当它遇到的现实世界数据与其训练数据略有不同时。这对科学发现是危险的。如果科学家认为一个测量结果是精确的而实际上并非如此,他们可能会对新粒子的存在或星系的演化史得出错误的结论。核心挑战不仅在于做出预测,还在于确保计算机提供的可能答案的范围确实以一个已知且可靠的概率包含了真实值,无论这个真实值究竟是什么。

现在,一组研究人员开发了一种解决方案,引入了一种名为“频率论-贝叶斯”(Frequentist-Bayes,简称 FreB)的新协议。这种方法充当了生成式人工智能输出的严格质量控制检查。FreB 不仅仅是接受人工智能的初始猜测,而是将计算机的概率图重新塑造为一个在统计上值得信赖的置信区域。该过程始于在大量带有标签的示例上训练人工智能,其中隐藏属性和产生的数据都是已知的。人工智能学习创建一个“后验”分布,这本质上是一张显示真实答案可能所在位置的地图。研究人员随后使用另一组校准数据来教导系统如何调整这张地图。他们将人工智能的原始概率转化为所谓的“p值函数”。这些函数就像一把经过校准的尺子,确保当系统围绕一组可能的答案划定边界时,该边界包含真实值的频率恰好等于科学家所声称的频率。

这种方法的威力在于其处理现实世界缺陷的能力。在许多科学研究中,用于训练人工智能的数据与正在研究的数据并不完全匹配。这种被称为“数据集偏移”(dataset shift)的失配可能会发生,原因包括望远镜的制造方式、它们能看到的恒星类型,或者用于训练的理论模型略有偏差。传统的 AI 方法在这种情况下往往会产生偏差的结果,过度倾向于训练数据。然而,FreB 旨在纠正这些差异。通过使用校准数据来学习必要的调整,该方法确保了即使当训练数据和目标数据来自不同的分布时,最终的置信区域仍然有效。研究人员证明,即使在人工智能模型本身存在“误设”(misspecified)的情况下——即用于生成训练示例的底层物理模型并非现实的完美表征——这种方法依然奏效。

为了证明其方法的有效性,该团队在物理科学领域的三个不同挑战上进行了测试。在第一个案例中,他们处理了伽马射线(gamma rays)的重建问题。伽马射线是来自太空的高能粒子,无法被直接观测,只能通过它们在地球大气层中产生的次级粒子簇来推断。人工智能是在来自著名的蟹状星云(Crab Nebula)的数据上进行训练的,但随后被要求识别来自暗物质源的信号,后者产生的模式非常不同且更为罕见。标准的 AI 方法在此失败了,产生的估计值偏向于训练数据的能量水平,并且错过了真实的、更高能量的事件。然而,FreB 方法成功地重塑了人工智能的输出,提供了有效的置信区间,能够正确捕捉到罕见事件的真实能量,从而让科学家能够可靠地区分不同的天体物理源。

第二个测试涉及理解我们银河系的演化历史。天文学家使用不同的理论模型来描述恒星的分布和运动。这些模型有时会导致关于恒星年龄或化学成分的冲突结论。当研究人员应用标准的人工智能推断时,不同的模型产生了相互矛盾的结果,且这些结果与真实值也存在偏差,无法提供清晰的解决途径。通过应用 FreB,团队能够调整两个模型的输出。结果是,尽管起始假设不同,两组置信区域都正确地包含了恒星的真实属性。这表明 FreB 可以调和相互竞争的理论,确保无论使用哪种底层模型,其不确定性估计都是诚实且一致的。

最后一个挑战针对的是大规模天文巡天中常见的“选择偏差”(selection bias)问题。望远镜往往无法平等地观测所有恒星;它们更容易探测到明亮、巨大的恒星,而不是微弱、细小的恒星。这意味着用于训练人工智能的数据通常是倾斜的,缺失了科学家最想研究的对象。在这个实验中,研究人员模拟了一个场景:人工智能是在由大型、明亮恒星主导的数据上训练的,但随后被要求估计像太阳这样较小、较暗恒星的属性。未经调整的人工智能产生了系统性的错误估计,未能覆盖这些较小恒星的真实值。FreB 通过使用一小组随访数据来重新校准系统,纠正了这一偏差。调整后的方法产生了既紧凑又准确的置信区域,即使训练数据对这些微弱恒星存在严重的偏差,也能成功覆盖这些微弱恒星的真实参数。

这项工作的意义超越了这些具体的例子。它为这些强大的人工智能工具生成的置信区间提供了数学上的保证,使其是值得信赖的。过去,科学家必须寄希望于他们的模型足够准确,以提供有效的确定性估计。现在,他们拥有了一种协议,可以将快速、灵活的人工智能模型进行重塑,使其输出符合严苛的科学证明标准。这意味着在直接计算变得不可能或成本过高的领域,研究人员可以使用生成式人工智能来探索复杂系统,同时保持与传统方法相同的统计严谨性。该方法非常高效,在应用于新数据时无需重新训练,并且即使在训练数据不完美的情况下也能奏效。通过弥合现代人工智能的速度与经典统计学的可靠性之间的鸿沟,FreB 为更可靠的科学发现开辟了一条道路,确保当科学家观察墙上的影子时,他们能够确信投射出该物体的形状。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →