← 最新论文
📊 statistics

Learning from Uncertainty-dependent Missing Labels for Semi-supervised Classification

本文提出了一种针对半监督分类的基于似然的信息论,其中标签缺失依赖于后验不确定性,并证明了这种具有信息量的缺失与标准基准相比,在固定标注预算下能够提高估计效率并降低超额风险。

原作者: You-Gan Wang, Jinran Wu, Geoffrey J. McLachlan

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: You-Gan Wang, Jinran Wu, Geoffrey J. McLachlan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:从依赖不确定性的缺失标签中学习半监督分类

1. 问题陈述

在半监督分类中,缺失标签传统上被视为信息损失的来源,这降低了效率并增加了推理的复杂性。然而,在许多实际场景中(如医学成像、主动学习和在线审核),标签的缺失并非随机缺失(MAR)的被动过程。相反,标签缺失的概率往往取决于观测到的特征 (YY),并且至关重要的是,取决于源自标签模型本身的后验分类不确定性。

本文旨在解决的核心问题是:如何刻画这种依赖于不确定性的缺失标签的信息含量。虽然经典信息论指出,观察一个完整实验的简化版本无法增加超过增强后的全数据实验的信息量,但本文研究了当缺失指示符 (MM) 由一个依赖于不确定性的机制生成时,它本身是否可以作为一个可观测信号,从而在固定预算下,相对于标准的完全标注或无信息部分标注基准,提高估计和分类性能。

2. 方法论

2.1 统计框架

作者考虑了一个具有 gg 个类别、特征 YY 和标签 ZZ 的分类设置。缺失指示符 M{0,1}M \in \{0, 1\} 表示标签是被观测到 (M=0M=0) 还是缺失 (M=1M=1)。缺失机制建模为:
rθ,ξ(Y)=Pr(M=1Y;θ,ξ)=h{ηθ,ξ(Y)}r_{\theta,\xi}(Y) = \Pr(M=1 \mid Y; \theta, \xi) = h\{\eta_{\theta,\xi}(Y)\}
其中 hh 是反向连接函数,ηθ,ξ(Y)\eta_{\theta,\xi}(Y) 是一个取决于标签模型参数 θ\theta、机制参数 ξ\xi 以及后验分类不确定性摘要 u(Y;θ)u(Y; \theta) 的预测器。u(Y;θ)u(Y; \theta) 的示例包括后验香农熵、负对数熵或后验方差。

观测数据似然函数构建如下:
L(θ,ξ)=j=1n{pθ(Yj,Zj)[1rθ,ξ(Yj)}1Mj{pθ(Yj)rθ,ξ(Yj)}MjL(\theta, \xi) = \prod_{j=1}^n \{p_\theta(Y_j, Z_j)[1 - r_{\theta,\xi}(Y_j)\}^{1-M_j} \{p_\theta(Y_j)r_{\theta,\xi}(Y_j)\}^{M_j}
其中第一项适用于标签被观测到的情况,第二项适用于标签缺失的情况(边缘特征密度)。

2.2 信息分解

核心方法论贡献是基于似然的信息理论,它分解了观测费舍尔信息 Iobs(θ)I_{obs}(\theta)

正确设定情形:
利用 Louis 的观测信息恒等式,作者推导出了一个将信息分解为部分标注组件和机制曲率项的分解式:
Iobs(θ)=ICC(θ)ICC(miss,r)(θ,ξ)部分标注组件+Imech(θ,ξ)机制曲率I_{obs}(\theta) = \underbrace{I_{CC}(\theta) - I_{CC}^{(miss,r)}(\theta, \xi)}_{\text{部分标注组件}} + \underbrace{I_{mech}(\theta, \xi)}_{\text{机制曲率}}

  • ICC(θ)I_{CC}(\theta):全数据费舍尔信息。
  • ICC(miss,r)(θ,ξ)I_{CC}^{(miss,r)}(\theta, \xi):加权缺失信息损失。
  • Imech(θ,ξ)I_{mech}(\theta, \xi):一个正定项,量化了由观测到的缺失指示符 MjM_j 贡献的曲率。对于逻辑连接函数,该项取决于缺失概率的方差和不确定性摘要的梯度。

设定错误情形:
考虑到在实践中标签模型和机制都可能存在设定错误,作者将该框架扩展到了 Godambe–Eicker–Huber–White (sandwich) 协方差框架。他们推导出了联合估计 (θ,ξ)(\theta, \xi) 的敏感性和三明治协方差划分,表明即使在设定错误的情况下,结构化分解(部分标注 + 机制曲率)仍然存在,尽管不确定性量化从逆费舍尔信息转向了三明治协方差。

2.3 理论界限

论文阐明了观测的部分标注实验与增强实验(即同时观测到标签和机制指示符的实验)之间的关系。研究证明,虽然依赖不确定性的缺失性可以产生有利的缺失性(比预算匹配的无信息基准具有更高的信息量),但它不能超过增强实验 (Y,Z,M)(Y, Z, M) 的信息界限。观测数据 (Y,M,Zobs)(Y, M, Z_{obs}) 是增强数据的粗化版本,满足标准的信息不等式。

2.4 风险分析

对于插件式分类器(plug-in classifiers),作者将信息分解与基于边际的超额风险界限联系起来。在规则的两成分混合设置中,他们建立了解析出超额风险以 Op(n1)O_p(n^{-1}) 的参数速率收敛。该速率的常数由判别方向上的扰动调整信息决定,这意味着有利的机制曲率可以降低决策边界的渐近方差。

3. 核心贡献

  1. 信息分解: 推导出了费舍尔信息分解,明确分离出了一个非负的“机制曲率”项。该项解释了当缺失指示符依赖于后验不确定性时,如何携带关于分类器的额外信息。
  2. 设定错误下的鲁棒性: 将分解扩展到三明治协方差框架,用于处理标签分布或缺失机制的联合设定错误,为在实际应用中使用工作模型进行推理提供了严谨的基础。
  3. 超额风险速率: 建立了依赖于不确定性的缺失情况下的插件式分类器的基于边际的超额风险界限,证明了有利的缺失性会导致分类性能的提升(降低渐近方差)并在固定标注预算下实现。
  4. 澄清“有利缺失性”: 对“有利缺失性”给出了严谨的定义和证明,即它相对于普通的完全标注或预算匹配的无信息基准而言是一种相对增益,而不是对关于增强全数据实验的经典信息不等式的违反。

4. 结果

4.1 数值演示(高斯混合模型)

  • 信息增益: 在两成分高斯混合设置中,蒙特卡洛模拟表明,与具有相同缺失率的无信息(MCAR)基准相比,熵依赖型缺失机制可以在判别方向上产生三倍的费舍尔信息增益。
  • 机制依赖性: 信息增益随缺失率和设计敏感度呈现非单调变化。当存在适度的类别重叠、非过高的缺失率,以及机制足以将缺失集中在高度不确定性的观测值附近且未达到饱和时,信息增益达到最大。
  • 成本效益分析: 在固定总预算(平衡特征采集成本和标注成本)下,最优缺失率随相对标注成本的增加而增加。依赖不确定性的设计允许在保持或提高估计效率的同时,使用更大的特征样本量。

4.2 案例研究(医学诊断)

该框架应用于一个结肠镜视频数据集,其中的标签源自内窥镜专家的共识。

  • 机制验证: 数据证实,标签缺失(缺乏共识)与较高的后验熵(不确定性)强相关。
  • 性能: 基于熵的半监督模型(SSL)优于仅在 35 个可用标注样本上训练的监督基准。
    • SSLlogit 模型实现了最低的预测错误率(0.1325),而监督基准为 0.1775。
    • SSL 模型表现出更大的拟合费舍尔信息矩阵,表明其估计效率受机制曲率项的驱动而更高。

5. 意义与主张

本文声称提供了一个基于似然的框架,用于理解依赖于不确定性的缺失如何重塑半监督学习的信息几何结构。其重要性在于:

  • 重新定义缺失: 将缺失标签的视角从一个需要填补或忽略的干扰项,转变为一个可以被显式建模以改进推理的结构化信号。
  • 解决悖论: 澄清了“有利缺失性”并不违反经典信息论;相反,它利用了缺失指示符 MM 是一个与分类器不确定性相关的生成机制这一事实。
  • 实际效用: 证明了显式建模缺失机制(例如通过熵依赖掩码)可以带来切实的改进,包括在参数估计(通过增加费舍尔信息)和分类准确度(通过降低超额风险)方面,尤其是在固定资源约束下。
  • 鲁棒性: 提供了一个通过三明治估计器实现的理论基础,即使当用于标签分布或缺失机制的工作模型并不完美时(这在现实应用中很常见),该基础依然有效。

作者得出结论,虽然这些增益是局部且依赖于具体情境的,但该框架提供了一种原则性的方法,可以利用数据采集中的选择效应来实现更高效的半监督学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →