技术摘要:认识论不确定性与偶然不确定性的结构化分离
1. 问题陈述
预测不确定性传统上被分解为认识论不确定性(Epistemic Uncertainty, EU)(可减少的模型无知)和偶然不确定性(Aleatoric Uncertainty, AU)(持久的数据歧义)。尽管两者在概念上是截然不同的,但估计这些量值的标准方法往往无法在经验层面实现分离。诸如蒙特卡洛 Dropout、深度集成(Deep Ensembles)和证据网络(Evidential Networks)等技术,都是从同一个预测分布 p(y∣x) 中推导出这两个量值。
这造成了一个“代数陷阱”:由于 EU 和 AU 都是同一个分布的函数,它们继承了共享的代数依赖性。近期的基准测试表明,这两个分量通常具有强相关性(ρ≥0.78),这使得人们无法区分一个模型是因为“困惑”(高 EU)还是因为“数据本身具有固有歧义”(高 AU)。形式化结果(例如 Tomov 等人,2026)表明,任何关于 p(y∣x) 的后验函数都无法唯一地辨别可减少的误差与内在的歧义,因为不同的底层不确定性状态可能会诱导出相同的最优预测分布。
2. 方法论:结构化分离
本文提出将结构化分离作为一种设计原则,以打破这种代数耦合。作者不再从单一的预测对象中推导两种不确定性,而是将 EU 和 AU 分配给监督潜在变量模型(Supervised Latent Variable Models, SLVMs)中不相交的参数路径。
核心架构:信度概念瓶颈模型(Credal Concept Bottleneck Model, CBM)
其主要实现方式是一个基于冻结编码器(如 DistilBERT)的信度 CBM。该架构引入了三条正交的参数路径:
- 均值路径 (μ):预测概念的点估计,并输入至任务头。
- 认识论头 (σepi):旨在追踪可减少的预测误差。它由不相交的参数集 ϕepi 参数化,并受结合了预测误差(带有梯度截断以防止博弈)和 Hausdorff KL 正则化项的损失函数监督。
- 偶然论头 (σale):旨在追踪持久的标签歧义。它由不相交的参数集 ϕale 参数化,并直接受来自多标注者分歧或语料库衍生答案分布的地面真值标签熵(H[p^∗])监督。
关键机制
- 不相交参数化:认识论头和偶然论头使用互不重叠的参数集(ϕepi∩ϕale=∅)。
- 正交投影:编码器输出 h 被投影到正交子空间(Wepih, Waleh),以确保各头接收到的特征输入互不重叠。
- 梯度隔离:训练损失被分解,使得认识论损失 (Lepi) 仅依赖于 ϕepi,而偶然论损失 (Lale) 仅依赖于 ϕale。作者证明(定理 3.3),在这些条件下,交叉梯度恒为零(∇ϕepiLale=0 且 ∇ϕaleLepi=0)。
- 信度集(Credal Sets):模型将概念表示为由均值 μ 和认识论协方差 Σepi 定义的信度集(概率分布的凸集),而偶然论方差 σale 则在信度集之外单独建模。
3. 主要贡献
- 结构化分离原则:本文引入了一个 SLVM 框架,在该框架中,EU 和 AU 是通过不同的监督参数路径计算得出的,而非对 p(y∣x) 进行后验分解。
- 梯度隔离定理:通过形式化证明展示了,通过使用不相交的参数和独立的损失项,EU 和 AU 头在训练期间保持解耦,从而避免了识别出的代数陷阱。
- 信度 CBM 实现:一种具体的实现方案,利用正交投影和混合损失函数来构建信度概念瓶颈模型,从而实现这种分离。
- 综合诊断:作者引入并验证了用于测试不仅是去相关性,更是语义有效性的指标:
- 梯度隔离:验证零交叉梯度。
- 相关性:测量 ρ(Uepi,Uale)。
- 数据规模可还原性:检查 EU 是否随数据增加而减少。
- 歧义追踪:验证 AU 是否与地面真值歧义(H[p^∗])相关。
4. 实验结果
该方法在五个基准测试中进行了评估:三个概念瓶颈数据集(CEBaB, HateXplain, GoEmotions,具有标注者衍生的歧义性)和两个问答数据集(MAQA*, AmbigQA*,具有语料库衍生的歧义性)。
- 去相关性:结构化分离将 EU 与 AU 之间的 Spearman 相关性从基准方法的范围 ρ∈[0.75,0.84](在深度集成和 MC Dropout 等标准方法中观察到)降低到了 ρ≈0.05。即使在没有显式去相关惩罚(λd=0)的情况下,相关性依然保持在较低水平(ρ∈[0.12,0.23]),显著低于“后验底线”。
- 语义有效性:
- 偶然论追踪:偶然论头显示出与地面真值歧义的强相关性(ρ(σale,H)∈[0.42,0.74]),而基准方法对此类追踪能力较弱。
- 认识论敏感性:认识论头对预测误差保持敏感,并展现出预期的可还原性特征(即随着训练数据的增加,梯度范数逐渐减小)。
- 下游效用:该方法实现了基于象限的路由(Quadrant-based routing),成功区分了以下情况:
- 数据需求型(DATA)(高 EU,低 AU):需要更多数据的情况(例如,晦涩的事实)。
- 人工审核型(REVIEW)(低 EU,高 AU):由于固有歧义需要人工干预的情况(例如,主观观点)。
标准基准方法会将这些不同的情况压缩到一条对角线上,从而无法支持此类决策。
- 鲁棒性:结果在不同的编码器架构(DistilBERT, BERT, RoBERTa)下均保持一致,并在自解释神经网络(SENN)的实例化中得到了证实。
5. 意义与主张
本文声称,监督潜在变量架构提供了一条实现不确定性估计的实用路径,使其不仅是统计上的去相关,而且在语义上是有效的。
- 克服不可能结论:通过将估计过程从输出空间(p(y∣x) 的函数)转移到参数空间(具有独立梯度和独立头的参数),该方法规避了适用于后验分解的不可能结论。
- 操作性区分:其主要意义不仅在于统计上的去相关,还在于能够支持不同的决策:高 EU 信号提示需要更多数据或改进模型,而高 AU 信号则提示需要弃权或人工审核。
- 局限性:作者坦诚地指出,该框架依赖于监督潜在结构(概念)以及与歧义相关的监督信号(例如,多标注者数据)的可用性。他们承认,将该框架扩展到大规模语言模型(LLM)的端到端微调可能需要精细的梯度路由以维持分离,且目前的基准测试是专门设计的且规模相对较小。
总而言之,本文认为,架构上的分离结合独特的监督目标,是产生在语义上有效且对决策有用的不确定性估计的必要且有效的条件。