想象你是一名侦探,正在试图解开一个谜团。你拥有一支专家团队(一个神经网络),他们观察线索(数据),并告诉你他们认为是哪个嫌疑人(类别)干的。
旧方法的问题(标准 EDL)
过去,这些专家团队可以告诉你他们认为是谁干的,并且还能给出一个“置信度分数”。然而,他们计算该置信度的方式有点像黑箱。他们有一套规则,虽然勉强可行,但如果你稍微调整这些规则,他们的置信度就会剧烈波动。有时他们在犯错时过于自信,有时在正确时又过于不确定。
研究人员试图通过创建不同版本的“侦探团队”(称为 I-EDL、R-EDL、RED 等变体)来解决这个问题。每个版本都解决了特定问题,但它们的构建方式各不相同,就像拥有不同引擎的不同汽车型号一样。没有一本统一的说明书能解释它们是如何协同工作的。
新解决方案:GEDL(统一的侦探手册)
本文介绍了GEDL(广义证据深度学习)。将 GEDL 想象成一份主蓝图,它利用贝叶斯统计(一种基于新证据更新信念的方法)的逻辑,解释了侦探团队为何以这种方式运作。
以下是本文如何通过简单的类比来分解这一概念:
1. “证据”就像一堆选票
在这个系统中,神经网络不仅仅猜测一个数字;它为每个嫌疑人收集“证据”。
- 类比:想象一个法庭。网络为每个嫌疑人收集选票(证据)。
- 转折:在旧方法中,关于多少选票才算数的规则是僵化的。而在 GEDL 中,作者表明这些选票实际上是**“伪计数”**。这就像说:“根据我所看到的,这就像我之前已经见过这个嫌疑人 5 次一样。”
- 贝叶斯视角:本文认为,网络本质上是在运行一个模拟,它利用这些新选票来更新其“先验信念”(在看到线索之前所认为的),从而形成“后验信念”(现在的看法)。
2. “不确定性”是陪审团的大小
人工智能中最大的问题之一是:“你有多确定?”
- 类比:如果网络看到一个线索并为嫌疑人 A 收集了 1,000 张选票,那么它非常自信。如果它只收集了 2 张选票,那么它就不确定。
- 本文的见解:作者证明,网络输出的“不确定性”实际上是对陪审团有多小的衡量。
- 如果陪审团很小(证据少),不确定性就高。
- 如果陪审团很大(证据多),不确定性就低。
- 他们从数学上证明,这种不确定性的表现与贝叶斯分布不确定性完全一致。用通俗的话说:这不仅仅是人工智能对自己有多不确定的一种随机猜测;它是基于数学的严谨计算,衡量人工智能的“观点”在看到略微不同的数据时可能产生的变化程度。
3. 修复“训练”(教练的策略)
要教导侦探团队,你需要一名教练(训练目标)。
- 旧方法:教练使用一种混合搭配的策略。有时,他们只在团队答错时进行惩罚。有时,他们使用固定规则来决定在多大程度上信任团队的先验信念。这有点混乱。
- GEDL 方法:本文提出了一种统一的教练策略。
- 自适应先验:GEDL 不再使用固定规则来决定在多大程度上信任团队的“直觉”(先验),而是动态调整这种信任。如果团队收集了大量强有力的证据,教练会更信任证据而减少对直觉的依赖。如果证据很少,教练则更依赖直觉。
- 自适应强度:教练还会调整证据的“响亮”程度。随着团队的训练,教练会改变规则,确保团队学会稳步收集证据,而不是陷入困惑。
他们证明了什么?
作者不仅仅提出了理论;他们进行了测试。
- 性能:他们在标准图像数据集(如识别手写数字或汽车)上进行了实验。他们发现,他们新的"GEDL"侦探团队在识别正确嫌疑人方面,与旧的、零散的团队一样出色。
- 更好的不确定性:更重要的是,GEDL 在发现自己犯错时表现得更出色。当展示给它从未见过的图像(分布外数据)时,GEDL 比其他方法更可靠地发出红旗(高不确定性)。
- “为什么”:他们表明,GEDL 产生的不确定性符合“分布不确定性”的数学定义。这不是魔法;它与概率论所说的不确定性应该如何表现是一致的。
总结
本文对一种流行的 AI 方法(证据深度学习)进行了重组,该方法此前有些杂乱无章,充满了互不关联的修补。它将所有内容在一个清晰、逻辑统一的框架(广义贝叶斯框架)下进行了重组。
- 旧方法:“这里有 5 种不同的工具来解决置信度问题。”
- 新方法(GEDL):“这里有一件主工具,它解释了置信度为何起作用,能自动调整,并能给你一个数学上诚实的答案,说明它有多确定。”
结果是一个系统,它在解决问题方面同样聪明,但在不知道答案时更加诚实和可靠。
技术摘要:广义证据深度学习(GEDL)
问题陈述
证据深度学习(EDL)作为一种无需采样的不确定性估计策略,通过预测共轭分布(通常是分类任务中的狄利克雷分布)的参数而兴起。尽管 EDL 及其变体(如 I-EDL、R-EDL、RED)已取得实证成功,但该领域仍面临理论碎片化的问题。现有方法通常通过孤立的启发式修改来解决特定局限——如证据积累、先验设定或正则化。因此,EDL 的潜在理论结构、其变体之间的关系以及证据不确定性的精确贝叶斯解释仍未得到充分研究。这种碎片化导致了性能的不稳定,并缺乏设计改进的原则性指导。
方法论
1. EDL 的广义贝叶斯解释
作者在广义贝叶斯框架内重新构建了 EDL,建立了贝叶斯生成过程与 EDL 组件之间的形式化联系:
- 先验设定:基础率 a 代表对类别概率的先验信念。标量 W 控制先验强度。本文认为 W 不应被任意固定,而应被视为可调整的超参数或积累证据的函数。
- 后验更新:从网络预测的证据 e(x) 到狄利克雷浓度参数 α(x) 的转换被解释为广义后验更新。具体而言,证据向量充当依赖于输入的伪计数。这与退火贝叶斯更新(tempered Bayesian updating)相一致,其中温度参数 τ 控制似然相对于先验的影响。更新规则从经典的加法形式 α=α0+y 推广为 α(x)=Wa+e(x)。
- 训练目标:标准 EDL 损失源自变分推断视角。最小化变分后验与退火后验之间的 Kullback-Leibler (KL) 散度,产生了一个等价于最小化负证据下界(ELBO)的目标。该目标自然地分解为数据拟合项(负对数似然)和正则化项(到先验的 KL 散度),其中 KL 权重对应于退火参数 τ 的倒数。
- 不确定性解释:本文提供了渐近分析,表明证据不确定性质量 u=W/S(x)(其中 S(x) 为总浓度)以 O(1/S(x)) 的速率缩放。这种行为与已确立的贝叶斯分布不确定性度量(特别是互信息和预测方差)相一致,从而将其与源自参数后验分布的认知不确定性区分开来。
2. 广义证据深度学习(GEDL)框架
基于这一理论基础,作者提出了GEDL,这是一个统一且可扩展的框架,明确解耦并配置了三个核心组件:
- 自适应先验强度(W):GEDL 不将 W 固定为常数(例如类别数 K),而是采用收敛先验方案,其中 W 是总积累证据的有界单调函数。这确保了先验在低证据区域保持影响力,但随着收集到足够证据,其影响逐渐减弱,从而防止过正则化。
- 调度证据强度(τ):该框架用基于原则的证据强度参数 τ 的调度,取代了启发式的 KL 退火调度。τt 定义为训练步骤上预期狄利克雷强度的函数,有效地控制了广义贝叶斯更新的“有效样本量”。
- 统一训练目标:GEDL 利用从 ELBO 推导出的变分目标,无需对样本进行临时性掩码(例如仅惩罚误分类样本)或启发式加权方案。它在所有样本上保留了目标的一致概率含义。
主要贡献
- 原则性贝叶斯解释:本文建立了 EDL 的形式化理论基础,将其组件(证据、先验、损失)映射到广义贝叶斯推断、变分推断和 PAC-Bayes 理论。它特别将证据不确定性解释为贝叶斯分布不确定性。
- 统一框架(GEDL):作者提出了 GEDL,这是一个模块化框架,将现有的 EDL 变体(Vanilla EDL、I-EDL、R-EDL、RED)归纳为广义模型的具体配置。这提供了一个连贯的视角,说明不同的设计选择如何影响后验行为。
- 理论与实证验证:本文证明,EDL 中的不确定性质量在理论上(通过渐近分析)和实证上(通过与互信息和预测方差的相关性)均与贝叶斯分布不确定性度量相一致。
结果
在标准分类基准(MNIST、CIFAR-10)和分布外(OOD)检测任务(使用 FMNIST、KMNIST、SVHN、CIFAR-100)上进行了大量实验。
- 分类性能:在分布内任务上,GEDL 在现有 EDL 变体和基于狄利克雷的基线(如 PN、RKL-PN、PostN)上实现了相当或更优的准确率。
- 不确定性估计与 OOD 检测:GEDL 在不确定性校准和 OOD 检测方面表现出优越或具有竞争力的性能。值得注意的是,在具有挑战性的 CIFAR-10 → SVHN 任务中,GEDL 在最大预测概率(MP)上比强基线 R-EDL 高出 5.01%,在不确定性质量(UM)上高出 8.89%。
- 分布不确定性对齐:实证分析证实,随着数据浓度的增加或破坏严重性的上升,证据不确定性 u=W/S 表现出与贝叶斯分布不确定性度量(互信息和预测方差)一致的单调趋势。相比之下,基于集成方法的认知不确定性显示出不同的趋势,这验证了本文的主张,即 EDL 主要捕捉的是分布不确定性。
意义与主张
本文主张,通过将 EDL 重新构建为广义贝叶斯推断的连贯实例,解决了该领域的理论碎片化问题。其意义在于:
- 提供了一个统一的理论基础,解释了现有变体的行为,并指导了原则性改进的设计。
- 证明了用理论推导的构造(自适应先验、变分目标)取代经验启发式方法(固定先验、临时损失掩码),不仅能产生更可靠的模型,还能保持具有竞争力的预测性能。
- 确立了证据不确定性是贝叶斯分布不确定性的有效代理,为不确定性感知深度学习系统提供了一种无需采样的替代方案。
作者总结道,该框架为原则性不确定性建模开辟了新的方向,旨在促进更可靠、可解释的深度学习系统的设计,同时避免了基于采样的贝叶斯方法所带来的计算成本。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。