← 最新论文
🤖 machine learning

On the QUEST for Uncertainty Quantification via Highest Density Regions

本文介绍了 QUEST,一种通过高密度区域体积来表征不确定性的新型不确定性量化框架,它提供了一种在理论上有据可依的替代方案,以取代适当评分规则(proper scoring rules),同时满足单调性和不变性等关键公理,并在选择性预测基准测试中表现优于标准度量指标。

原作者: Sam Goring, Tom Kuipers, Nicola Paoletti, David S. Watson

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Sam Goring, Tom Kuipers, Nicola Paoletti, David S. Watson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试预测天气。你的模型说:“明天会下雨。”但这个模型有多确定呢?它是 99% 确定,还是仅仅在瞎猜?在机器学习的世界里,这种“有多确定”的部分被称为不确定性量化(Uncertainty Quantification, UQ)

长期以来,科学家们一直使用标准的工具来衡量这种不确定性,有点像用一把尺子去测量一切。但 Sam Goring 及其团队的这篇论文作者认为,有时候尺子并不是正确的工具。如果你试图用尺子去测量一只水母的“软糯程度”,你会得到一个奇怪的数字,它并不能真正反映出水母的特性。

以下是他们的新想法——QUEST 的简单拆解,使用了日常生活的类比。

问题所在: “尺子”并不总是奏效

目前大多数方法通过观察平均值(均值)以及事物偏离平均值的离散程度(方差)来衡量不确定性。

  • 类比: 想象你正在观察人群。
    • 场景 A(正常): 每个人都站在一个紧凑、整齐的圆圈里。平均位置就在中心,每个人都离它很近。“不确定性”很低。
    • 场景 B(偏斜): 大多数人在一个紧凑的圆圈里,但有一个巨人站在 10 英里外。人群的“平均”位置现在被那个巨人拉向了那边。
    • 场景 C(双峰分布): 一半的人在左边的圆圈里,另一半人在右边的圆圈里,中间有一个巨大的空隙。

旧的方法(如方差)在这里会产生混乱。在场景 B 中,那个巨人让“离散度”看起来巨大,因此计算机认为不确定性极高,尽管 99% 的人实际上是非常可预测的。在场景 C 中,旧方法可能会因为人群分裂而认为不确定性很高,但它们也可能在无意中为中间的空隙分配了高概率,而这在现实中是不可能的。

论文指出,当我们想要寻找最可能的结果(即“众数”或人群的顶峰)时,这些旧工具会给出误导性的答案。

解决方案:QUEST(“手电筒”法)

作者提出了一个名为 QUEST(通过最高密度区域进行不确定性量化)的新框架。

与其测量从平均值开始的整个分布范围,QUEST 问的是一个不同的问题:“我们需要多大的空间才能捕捉到最可能出现的 90% 的人群?”

  • 类比: 想象你有一个手电筒,它只能照亮房间里最明亮的部分(即人数最多的区域)。
    • 低不确定性: 如果人群紧紧簇拥在一起,你的手电筒只需要一个小圆圈就能捕捉到 90% 的人。此时“光照体积”很小。
    • 高不确定性: 如果人群散布在一大片场地上,你的手电筒必须变得非常巨大才能捕捉到 90% 的人。此时“光照体积”很大。

QUEST 测量的是那个手电筒光束的体积(Volume)

  • 体积小 = 高置信度(人群很聚集)。
  • 体积大 = 低置信度(人群很分散)。

这对于奇特的形状非常有效。如果人群分裂成两组(场景 C),手电筒只需分别照亮这两组即可。它不会在中间的空隙上浪费光线。这提供了一个关于预测到底有多不确定的更诚实的答案。

三种类型的不确定性

论文将不确定性分为三个类别,而 QUEST 衡量了所有这些类别:

  1. 偶然不确定性(Aleatoric Uncertainty,即“噪声”): 这是世界的自然随机性。即使你了解了模型的所有信息,天气可能仍然是不可预测的。QUEST 通过观察真实人群的“紧密程度”来衡量这一点。
  2. 认知不确定性(Epistemic Uncertainty,即“无知”): 这是由于模型掌握的信息不足而导致的不确定性。这就像一个还没学习的学生。QUEST 通过观察模型信念的离散程度来衡量这一点。如果模型的猜测非常狂野,那么“手电筒”就会很大;如果模型很有信心,手电筒就会很小。
  3. 总不确定性(Total Uncertainty): 这是两者的结合。QUEST 将自然噪声和模型的无知结合成一个分数。

为什么这很重要(“公理”)

作者不仅仅提出了一个酷炫的想法;他们还证明了它遵循了一套逻辑规则(公理),任何好的不确定性度量都应该遵循这些规则。

  • 规则 1: 如果你把人群散开,不确定性应该上升。(QUEST 通过了这一点;旧方法有时会失败)。
  • 规则 2: 如果你只是把人群移动到另一个位置而不改变其散布程度,不确定性应该保持不变。(QUEST 通过了这一点;旧方法有时会产生困惑)。
  • 规则 3: 度量值永远不应该是负数。(QUEST 通过了这一点;一些旧的数学工具可能会给出负数,这在衡量“不确定性”时毫无意义)。

结果

团队使用具有复杂数据形状(偏斜人群、分裂人群)的计算机模拟,将 QUEST 与旧方法(方差和熵)进行了对比测试。

  • 结果: QUEST 在识别最可靠的预测方面表现得更好。当研究人员指示计算机仅对“最确定”的数据点进行预测时,相比于旧方法,尤其是在处理奇特数据或异常值时,QUEST 帮助他们更好地避免了错误。

总结

简而言之,这篇论文的观点是:不要再通过平均值距离边缘有多远来测量不确定性了。开始通过你需要多少空间来覆盖“最可能”的部分来测量。

这就像是从测量一堆乱七八糟的衣服两端之间的距离(如果增加一只袜子,这个距离会剧烈变化),转变为测量需要多大的篮子才能装下那 90% 最整洁、折叠得最好的衣服。这是一种更稳健、更符合逻辑且更“诚实”的方式,让我们知道能在多大程度上信任 AI 的预测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →