← 最新论文
⚡ electrical engineering

Mitigating Sample-Level Imbalance via Probabilistic Separation for Adaptive Multimodal Fusion

本文提出了一种新颖的框架,通过利用模态间隙(Modality Gap)度量和高斯混合模型(Gaussian Mixture Model)将样本概率性地划分为平衡子集和不平衡子集,从而缓解多模态学习中的样本级模态不平衡问题,进而实现一种动态的两阶段训练过程,以自适应地重新分配优化优先级并纯化数据,从而获得卓越的性能。

原作者: Zhiwen Yu, Zhaocheng Liu, Xiaoqing Liu, Huanqiang Zeng, C. L. Philip Chen

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiwen Yu, Zhaocheng Liu, Xiaoqing Liu, Huanqiang Zeng, C. L. Philip Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类通过视觉、听觉和触觉构成的感官交响乐来感知世界,这些感官结合在一起,创造了比单一感官更丰富的理解。在人工智能领域,研究人员正努力通过构建能够同时处理多种类型数据(如视频和音频)的系统来复制这种能力。这种被称为“多模态学习”的方法在识别语音中的情绪或识别视频中的事件等任务中展现出了巨大的潜力。然而,一个持久的问题阻碍了这些系统发挥其全部潜力。当计算机同时从视觉和听觉中学习时,一种感官往往会变得占据主导地位,从而有效地淹没了另一种感官。如果视觉数据清晰而音频噪声较大,系统就会学会几乎完全依赖图像,而忽略声音。这造成了一种失衡,导致较弱的感官无法得到提升,且组合后的系统表现得比预期的要差,有时甚至逊于仅使用较强感官的系统。

一组研究人员开发了一种新方法来解决这个问题,该方法通过将训练数据中的每一个单独样本视为个体,而不是将整个数据集视为一个统一的整体。他们发现,在任何视频和音频剪辑的集合中,都存在两种截然不同的样本类型。一些剪辑是平衡的,即视觉和音频信息同样清晰且有用;另一些则是失衡的,即其中一种感官过于强大,以至于在学习过程中造成了困扰。研究人员发现,这两组样本会在数据中自然地形成独立的簇,就像人群会根据身高自然分成两个不同的群体一样。通过识别哪些样本属于哪一组,系统可以学会以不同的方式处理它们,从而确保较弱的感官能够获得所需的关注以实现赶超。

他们解决方案的核心包含一个两阶段的训练过程。首先,计算机进入一个“热身”期,在此期间,它在没有任何特殊调整的情况下学习两种感官的基础知识。在此期间,系统会记录每一个剪辑中视觉分支和音频分支的预测结果之间的差异程度。这种差异被衡量为“模态间隙”。在初始阶段之后,研究人员分析了这些间隙的分布情况,并证实了他们的猜想:数据自然分成了由平衡样本组成的大组和由失衡样本组成的小组。为了利用这一发现,他们使用了一种统计工具来绘制这两组数据的图谱,并计算任何新样本属于平衡组或失衡组的概率。

有了这张图谱,系统进入了第二个阶段,即自适应训练阶段。在这里,计算机根据每个样本的概率得分来改变其学习策略。对于那些平衡良好的样本,系统专注于将两种感官融合在一起,以最大化结合信息的益处。对于那些失衡的样本(即其中一种感官表现挣扎的情况),系统会施加更强的惩罚,以迫使两种感官更加紧密地对齐。这种方法确保了计算机不会简单地忽略困难样本,而是通过在这些特定案例中加大纠偏力度,来努力修正偏差。研究人员还引入了一种机制,随着时间的推移逐渐降低纠偏的强度,使系统能够从专注于修复失衡转向完善最终的分类任务。

该方法的成果在涉及语音情绪识别、事件定位和人体动作识别的三种不同数据集上进行了测试。在包含超过7,000个视频剪辑的语音情绪数据集上,新方法达到了80.65%的准确率,显著优于以往的最先进方法。在另外两个数据集上也观察到了类似的提升,准确率分别达到70.40%和72.61%。除了提高最终得分外,研究人员还观察到,该方法成功缩小了音频分支与视觉分支之间的性能差距,使得较弱的感官在不牺牲较强感官优势的前提下得以提升。

在进一步的实验中,研究人员展示了该统计模型也可以用于过滤数据本身。通过选择由其模型识别出的高质量、平衡的样本,他们能够在更小的数据子集上对系统进行微调。即使在样本数量更少的情况下,系统的表现仍优于使用完整、未经筛选的数据集进行训练时的表现。这表明,该方法不仅有助于计算机更高效地学习,还作为一种强大的工具用于清理噪声数据,确保系统能从最可靠的样本中学习。这项研究得出结论:通过识别并适应样本层面的自然数据质量变化,多模态系统可以克服传统训练方法的局限性,从而实现对世界更稳健、更准确的理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →