在人工智能领域,机器通过学习海量的示例来进行学习,就像学生通过教科书学习一样。几十年来,研究人员在设计这些系统时,都假设教科书是平衡的,即每个学科都有相等数量的示例。然而,现实世界很少如此有序。在自然、医学和日常生活中,数据往往是倾斜的:少数类别频繁出现,而许多其他类别则非常罕见。这种被称为“长尾分布”的不平衡现象,为机器制造了盲点。它们成为了识别常见事物的专家,但在识别稀有事物时却表现得极其糟糕。当我们考虑到世界的变化时,挑战进一步加深。一个基于某组数据训练的模型,在部署时可能会面临完全不同的示例组合,例如遇到稀有案例的突然激增,或者在常见事物构成上的转变。如果一个系统无法适应这些未知的转变,其可靠性就会崩溃。
一支研究团队通过开发一种新的模型训练方法来解决这一问题,使模型即使在游戏规则发生变化时也能保持稳健。他们专注于这样一种场景:测试数据是未知的,并且可能在任何方向上呈现不平衡。他们并没有试图强迫单个模型去记忆每一种可能的变体,而是构建了一个像灵活专家团队一样的系统。核心思想是将现实世界数据的随机性分解为两个层面:整体景观中宏大且广泛的变化,以及发生在特定数据邻域内的较小局部偏移。以往的方法试图通过将不同的专家分配给固定的、预定义的场景来处理宏观变化。然而,这种方法忽略了发生在这些固定点之间的微妙局部变化,使得模型在面对意外转变时显得脆弱。
由 Zhiyong Yang 及其同事领导的研究人员提出了一种名为 DirMixE 的新策略。想象一个图书馆,书籍不仅按流派分类,还按读者的特定“心情”分类。在他们的系统中,“心情”代表了模型可能遇到的常见项目与稀有项目之间的特定混合比例。他们创建了一个框架,让模型从一个连续的可能性光谱中学习,而不是仅仅从几个静态的快照中学习。他们将不同的专家分配到这个光谱的不同区域,使系统能够同时捕捉到大局的多样性和细粒度的局部变化。为了确保系统在整个光谱上都能表现良好,他们引入了一种方法,该方法不仅仅关注平均成功率。相反,他们训练模型去最小化表现不佳的风险,特别是惩罚那些模型表现低于其通常平均水平的情况。这就像是一个安全网,迫使系统保持一致性,而不仅仅是靠运气。
为了测试他们的想法,该团队将这种方法应用于计算机视觉领域中的几个标准数据集,包括日常物体和自然物种的图像。他们将自己的方法与现有的最先进技术进行了对比。结果显示,他们的方法始终优于其他方法,特别是在测试数据呈现出模型未曾见过的严重不平衡的情况下。该系统在处理“反向”分布(即稀有项目变成常见项目的情况)时表现得尤为出色,而这种场景往往会让传统模型束手无策。此外,研究人员还将这种技术扩展到大型基础模型上,这些模型是驱动现代人工智能的庞大预训练引擎。通过使用一种参数高效的微调方法,他们使这些巨大的模型能够在无需从头开始重新训练的情况下,适应这种新的、灵活的训练策略,从而使该解决方案在实际部署中具有可行性。
该研究还提供了证明其方法具有严谨性的数学证明。他们证明了通过关注结果的方差并使用特定类型的正则化,该模型对未知数据的泛化能力在理论上保证比以往的方法更紧密、更可靠。这意味着该系统不仅在所测试的数据集上表现出色,而且在数学层面上极有可能在不可预测的现实环境中保持稳健。这项工作表明,通过承认数据变化的层级特性——即理解全局性的转变和局部的波动——我们可以构建出不仅聪明而且真正具有韧性的人工智能。
技术摘要:用于测试无关长尾识别的 DirMixE
1. 问题定义
本文研究了测试无关的长尾识别(Test-Agnostic Long-Tail Recognition),这是一个极具挑战性的场景,即模型必须在未知且任意不平衡的测试标签分布下表现良好。与传统的长尾学习(通常假设固定的平衡测试分布)不同,该设置承认现实世界的测试分布会随时间发生显著变化,包括从长尾分布(头部密集型)到近乎均匀分布,甚至到反向长尾分布(尾部密集型)的变化。
核心挑战在于这些变化的层级特性:
- 全局变化(Global Variations): 不同分布类型之间的广泛多样性(例如,长尾分布与反向长尾分布之间的差距)。
- 局部变化(Local Variations): 集中在分布空间特定邻域内的较轻微变化。
现有的方法,例如混合专家(MoE)方法 SADE,通常将专家分配给固定的测试分布。虽然这种方法在捕捉全局变化方面有效,但其固定的点分配无法考虑到不可见的测试数据中固有的连续、局部随机变化。
2. 方法论:DirMixE
作者提出了 DirMixE,这是一个概率框架,它将未知的测试标签分布建模为来自**元分布(meta-distribution)**的一个样本。该元分布被构建为一个 Dirichlet 混合分布(Dirichlet Mixture),使其能够同时捕捉全局和局部变化。
2.1 标签分布的层级建模
- 元分布 (E): 测试标签分布 Pte 被假设为采样自元分布 E。
- Dirichlet 分量: E 被建模为 K 个分量的混合。每个分量 i 是一个具有参数 α(i) 的 Dirichlet 分布。
- 全局变化: 通过不同混合分量之间的多样性来捕捉(例如,一个分量对应前向长尾,一个对应均匀分布,一个对应反向长尾)。
- 局部变化: 通过每个 Dirichlet 分量内部的随机性来捕捉,允许围绕平均分布产生较轻微的偏差。
- 专家分配: 每个元分布分量被分配一个特定的专家模型 f(i)。整体模型是一个组合结构 fθ(i)=g(i)∘ψ,其中 ψ 是共享的不变部分,而 g(i) 捕捉分布特定的特征。
2.2 目标函数与优化
为了确保在整个元分布上的性能稳定,作者针对损失的均值和方差进行了优化。
- 目标: 最小化 EPte∼E[R(f;Pte)]+λ⋅VPte∼E[R(f;Pte)]。
- 半方差正则化(Semi-Variance Regularization): 为了避免过度惩罚表现优于平均水平的模型,作者使用半方差项 (V^+) 替换了标准的方差项,该项仅对超过经验均值的损失进行惩罚。
- 蒙特卡洛估计(Monte Carlo Estimation): 由于期望和方差无法通过闭式解计算,作者采用了蒙特卡洛方法。在训练期间,他们从元分布中采样一组测试标签分布 {Pj,ξj},并计算这些样本在 Logit 调整(LA)损失上的经验均值和半方差。
2.3 基础模型的扩展:潜在技能微调(LSF)
为了将 DirMixE 应用于大规模基础模型,作者引入了潜在技能微调(Latent Skill Finetuning, LSF),这是一种参数高效微调(PEFT)框架。
- 共享潜在技能: LSF 并不为每个元分布训练独立的专家,而是假设所有任务共享一组 nK 个潜在技能。
- 实现方式: 该框架通过 LoRA(低秩自适应)和 Adapter 模块进行实例化。
- 对于 LoRA-LSF,更新矩阵 Δθ(i) 被构建为共享潜在技能矩阵 (A(j),B(j)) 的线性组合。
- 应用相互正交正则化以确保潜在技能保持多样性。
- 初始化: 为 LoRA-LSF 提出了一种基于奇异值分解(SVD)的改进初始化方案,以确保在训练早期阶段具有非平凡的梯度。
3. 理论贡献
论文对所提方法进行了严谨的理论分析:
- 方差与半方差: 作者证明了对于广泛的损失分布(指数分布、Gamma 分布、Pareto 分布),半方差与全方差是相当的 (V≍V+),从而证明了使用半方差正则化的合理性。
- 泛化界限:
- 诱导子类(Induced Subclasses): 为了避免松散的最坏情况界限,作者定义了位于“良好区域”(低损失)中的假设的“诱导子类”。这使得可以得到依赖于数据相关参数 (ρ) 而非全局界限 (B) 的更紧致的泛化界限。
- 层级误差分解: 泛化误差被分解为元分布偏移误差、蒙特卡洛采样误差和数据估计误差。
- PEFT 复杂度: 对于 LSF 框架,作者推导出了一个泛化界限,其中模型复杂度仅随可训练参数的数量而缩放,而非总参数量。这是通过利用局部解周围的泰勒展开以及低秩流形的几何特性实现的(通过对参数空间的 Voronoi 分区)。
4. 实验结果
在 CIFAR-10-LT、CIFAR-100-LT、ImageNet-LT 和 iNaturalist 上进行了广泛的实验。
- 传统深度学习: DirMixE 在各种测试设置下的平均准确率方面优于最先进的方法(包括 SADE、BalPoE、RIDE 和 LDAM)。值得注意的是,它在 Backward-LT(反向长尾)场景中表现出显著提升,而其他方法在这些场景中往往表现不佳。
- 基础模型: 当应用于使用 LoRA 和 Adapter 微调 CLIP 时,DirMixE-LSF 在所有数据集上始终比 LIFT 和 SADE-LSF 等基准方法取得更高的性能。
- 消融研究:
- 半方差正则化被证明对于提高平均性能至关重要。
- 用于 LoRA-LSF 的 SVD 初始化显著提升了性能。
- 增加专家数量通常会提高性能,但在超过一定点后会出现收益递减现象。
5. 重要性与主张
论文声称 DirMixE 代表了测试无关长尾识别迈出的重要一步,其原因在于:
- 建模层级结构: 成功地将测试分布的随机变化分解并建模为全局和局部两个层面,这是以往固定专家方法所缺乏的能力。
- 稳定性: 通过半方差正则化提供了一个更稳定的目标函数,从而能够更好地量化跨多样化分布的性能结果。
- 可扩展性: 通过 LSF 框架将 MoE 范式扩展到基础模型,实现了参数高效的适配,并保持了泛化误差随可训练参数缩放的理论保证。
- 理论严谨性: 提供了一个全新的理论框架,结合了层级集中不等式、诱导子类和低秩流形的几何分析,为标准学习和 PEFT 推导出精确的泛化界限。
作者强调,他们的方法不需要在推理时获知具体的测试分布,而是依靠多样化专家的自监督聚合来适应未知的测试条件。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。