Subjective Risk Decomposition: A New View for Uncertainty Quantification
本文提出了一种新颖的不确定性量化框架,其中认知不确定性与偶然不确定性度量被视为基于严格适切损失对主观风险进行分解后的结果,从而统一了现有指标,并为一种基于学习理论的不确定性量化方法奠定了基础。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
水晶球之谜
想象一下你正在试图预测未来。也许你在猜测一场足球赛的比分,或者明天的天气,亦或是你的朋友接下来会说什么。在计算机科学领域,特别是在一个被称为机器学习的领域中,我们构建数字化的“水晶球”(模型)来进行这些猜测。但棘手之处在于:一个模型可以表现得非常自信,却依然是错误的。这就是为什么科学家们极其关注不确定性量化(Uncertainty Quantification)。这不仅仅关乎得到正确的答案,更关乎模型对自己有多“确定”。
为了理解这篇论文,我们需要了解两种主要的“未知”类型。首先是偶然不确定性(Aleatoric uncertainty)。你可以将其想象为系统中的噪声——那些你无法控制的事情,比如一阵突如其来的狂风改变了足球的路径。它是现实世界中那种“不可约减”的混乱。其次是认知不确定性(Epistemic uncertainty)。这是“我不知道我不知道什么”的那种不确定性。它源于模型本身,可能是因为模型见过的样本不够多,或者它对规则感到困惑。长期以来,科学家们一直在激烈争论如何衡量这两类不确定性,试图通过编写严格的规则(公理)来定义它们。
论文的核心思想:停止争论,开始分解
这篇题为《主观风险分解》(Subjective Risk Decomposition)的论文指出,所有的这些争论可能都偏离了重点。作者 Raghad Alamri、Michele Caprio 和 Gavin Brown 提出了一种看待问题的新方式。他们认为,与其试图将不确定性定义为一个神秘且独立的客体,不如将其视为一种后果——即由于我们选择评估模型的方式不同而产生的结果。
想象你是一位正在给学生作文评分的老师。你有一套特定的评分标准(一套规则)来决定如何给分。如果你改变了评分标准,即使作文本身没变,分数也会随之改变。作者认为,“不确定性”就像那个分数。它不是一个悬浮在空中的神奇数字;它是基于特定的“评分标准”(他们称之为严格适切损失函数/strictly proper loss)进行特定计算后的结果。
论文引入了**主观风险(Subjective Risk)*的概念。简单来说,这是在问:“如果模型相信世界是以某种方式运行的,那么当真实*世界呈现出另一种面貌时,情况会有多糟糕?”作者表明,如果你将这种“主观风险”进行拆解(分解),你得到的碎片正是科学家们多年来一直试图定义的各种不确定性类型。
魔术是如何运作的
作者使用了一个名为**布雷格曼散度(Bregman divergence)**的数学工具(可以将其想象成一种特殊的尺子,用于测量两种不同看待世界的方式之间的距离)。当他们将这把尺子应用于“主观风险”时,它自然地分裂成了三个截然不同的部分:
- 偏差(Bias,系统误差): 这是指模型的平均信念与现实相比纯粹是错误的部分。就像一个指南针总是指向偏北而非正北一样。论文认为这并不是我们通常理解的那种“不确定性”;它仅仅是模型在基础定位上的失误。
- 方差(Variance,认知部分): 这是“我很困惑”的部分。它衡量了当模型看到略微不同的数据时,其预测值的波动程度。如果一个模型是一个紧张、易变的优等生,每次被问及都会给出不同的答案,那么这个数值就会很高。作者表明,著名的度量标准如互信息(Mutual Information)(一个复杂的数学术语,描述了模型的内部状态能告诉我们多少关于其预测的信息)本质上只是这种方差的一种特殊形式。
- 熵(Entropy,偶然部分): 这是“噪声”部分。它是情境中固有的随机性,任何数据量都无法消除。这就是我们足球类比中的那阵“狂风”。
为什么这改变了一切
论文指出,多年来科学家们发明的所有衡量不确定性的公式并不是相互竞争的敌人。它们只是同一种底层配方的不同风味。
- “Gal 方法”: 一种著名的衡量不确定性的方法(由研究员 Gal 提出)使用了特定类型的数学工具——“对数损失(log-loss)”。作者表明,如果你使用这种特定的损失函数,你的分解过程自然会得出著名的“互信息”公式。
- “Sale 方法”: 另一组研究人员使用不同的数学工具——“平方损失(squared loss)”。作者表明,如果你使用那种损失函数,你会得到另一个公式(基于方差的公式),这对于不同类型的问题也是有效的。
论文明确反对了“我们需要编写新规则(公理)来决定哪个不确定性度量是‘正确’的”这一观点。相反,他们认为“正确的”度量仅仅是当你针对特定问题选择了特定的损失函数后,自然而然产生的那个。如果你选择一个关注“寻模(mode-seeking)”(专注于最可能的结局)的损失函数,你会得到一种不确定性;如果你选择一个关注“寻均(mean-seeking)”(平滑所有可能结果)的损失函数,你会得到另一种。
与学习理论的联系
作者还进一步将这一想法与统计学习理论(Statistical Learning Theory)(即机器如何从数据中学习的数学基础)联系起来。他们引入了诸如“主观近似差距(Subjective Approximation Gap)”和“主观估计误差(Subjective Estimation Error)”等新术语。
他们发现,“认知不确定性”(可约减的部分)实际上是两者的结合:
- 模型在多大程度上与自身产生分歧(即方差/互信息部分)。
- 模型在多大程度上受限于其特定的模型类型(即近似差距)。
这是一个至关重要的洞察。它表明,当我们说一个模型具有“高认知不确定性”时,我们可能混淆了两个不同的问题:模型只是感到困惑(方差),或者是模型本身就是一种错误的工具(近似差距)。论文指出,著名的“互信息”度量仅捕捉了第一部分(困惑),并且由于忽略了第二部分,可能会低估总体的“可约减”不确定性。
总结
简而言之,这篇论文并没有发明一种新的计算不确定性的方法。相反,它提供了一张统一的地图。它告诉我们,许多年来我们使用的许多地图都是正确的,只不过它们是从不同的角度在观察同一座山峰。
作者建议,我们不应该再把不确定性视为一个需要从头定义的神秘原语。相反,我们应该观察主观风险——即根据我们自身的信念出错的代价——并对其进行分解。我们所发现的碎片,正是我们一直寻找的不确定性度量。这是一种从“什么是不确定性?”到“我们是如何选择衡量它的?”的思维转变。
论文谨慎地指出,这是一个理论框架。它解释了为什么存在不同的度量标准以及它们如何相互关联,但它并不声称已经解决了该领域的每一个实际问题。它提供了一个新的视角,使现有的格局变得更加清晰,并暗示领域内的分歧往往源于人们使用的“尺子”(损失函数)的不同,而非不确定性本质本身的矛盾。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。