CAT-GS: Balanced Multimodal Learning via Calibrated Gating and Fusion Surgery
CAT-GS 是一种新型优化控制器,它通过校准可靠性估计、自适应门控策略以及针对特定融合的梯度手术,在不改变模型架构的情况下,稳定了端到端的多模态训练,并缓解了模态不平衡、门控不稳定及融合干扰问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代计算机正越来越多地学习如何同时观察和聆听这个世界,就像人类一样。这些系统不再仅仅依赖单一的摄像头或单一的麦克风,而是共同处理视频和音频流,以识别情绪、识别物体或理解复杂的场景。这种被称为“多模态学习”的方法,有望创造出比仅靠单一类型数据训练的机器更鲁棒、更准确的机器。然而,一个持久的问题一直困扰着这些系统:当计算机试图同时从视觉和听觉中学习时,一种感官往往会压倒另一种。如果视频很清晰而音频噪声很大,计算机往往会完全忽略声音,将所有注意力集中在图像上。反之,如果音频信号很强,视觉数据就会被忽视。这种不平衡导致系统变得脆弱,无法掌握全貌,其表现往往甚至不如仅学习主导感官时的效果。
研究人员长期以来一直试图通过强制计算机关注较弱的感官来解决这个问题,但这些尝试往往会产生新的问题。当计算机被过于严厉地要求忽略一个强信号时,它可能会变得混乱,在不同感官之间反复横跳,表现得极其不稳定。此外,即使计算机试图结合两种信号,来自音频和视频的指令也可能相互矛盾,导致学习过程停滞或崩溃。一项新研究引入了一种名为 CAT-GS 的方法,旨在充当一只冷静、稳定的手,引导计算机度过这些动荡的学习阶段。该方法并不改变计算机的内部结构,也不发明关于它应该学习什么的全新规则,而是在训练过程中在幕后运行,不断调整赋予每种感官的权重以及如何处理冲突的指令。
这种新方法的核心在于计算机如何决定在任何给定时刻信任哪种感官。在以往的系统中,计算机根据原始且未经精炼的数据来猜测哪种感官更可靠,这导致了反复无常的决策,即它可能会在瞬间于不同感官的关注点之间剧烈切换。研究人员通过让计算机向每种感官的“老师”进行咨询解决了这个问题——这些“老师”是已经能够很好识别纯音频或纯视频模式的预训练独立模型。这些老师提供了关于每种感官可靠程度的稳定且平滑的估计值。新系统利用这些估计值做出三种不同类型的决策:如果两种感官同样可靠,系统会进行温和的融合;如果一种感官明显优于另一种,系统会暂时抑制较强的感官,给较弱的感官一个追赶的机会,但会做得非常小心,以避免让较弱的感官失去学习机会;如果信号过于嘈杂以至于无法做出明确决策,系统则会使用一段“热身期”,让较弱的感官在被迫做出选择之前建立信心。
除了决定听从哪种感官之外,该方法还修复了计算机更新知识时的一个隐藏缺陷。当系统被告知要忽略某种感官时,告诉它如何改进的数学信号可能会缩减至几乎为零,导致该部分系统停止学习。研究人员引入了一种机制来防止这种崩溃。即使在某种感官被抑制时,系统也会确保学习信号保持足够强度,以维持该部分网络的活跃与健康。这防止了计算机永久性地忘记如何使用某种感官,确保它在情况发生变化时仍能随时准备使用。此外,当计算机最终结合音频和视频信息时,来自两种感官的指令有时会向相反的方向拉扯。新方法能够识别这些冲突时刻,并手术式地移除指令中相互矛盾的部分,从而让计算机找到一条既尊重两种感官又能继续前进的路径。
研究人员在多个现实世界的数据集上测试了这种方法,包括表达情绪的人员录音和说话数字的视频。在一次涉及情绪识别的测试中,标准训练方法的准确率约为 67%。相比之下,新方法达到了 86.3% 的准确率,这是一个显著的进步,证明了稳定学习过程的价值。在其他数据集上,该方法始终能达到或超过现有最佳技术的性能,特别是在音频和视频信号强度差异巨大的情况下。该系统还表现出了更高的稳定性,计算机在决定信任哪种感官时做出的反复无常的决策更少,且遇到的音频与视频学习指令相互冲突的情况也更少。
虽然该方法在受控数据集和特定基准测试中表现出色,但研究人员指出,当计算机从质量参差不齐的信号中学习时,其优势最为明显。在一个包含数百个不同类别的、由现实世界声音和视频组成的庞大且混乱的数据集中,其提升幅度较为温和。在这些大规模、高噪声的环境中,数据的质量和信息的巨大容量似乎比学习过程的精细调整更为重要。研究人员还发现,该方法依赖于它所咨询的“老师”模型的质量;如果这些老师训练不足或存在偏差,系统的性能就会受到影响。然而,研究表明,该方法具有足够的鲁棒性,能够处理这些老师产生的适度误差而不至于彻底失败。
研究结果表明,实现更好多模态学习的关键不在于构建更复杂的计算机,而在于以更细致的方式管理学习过程。通过将计算机的训练视为一个需要不断校准和解决冲突的动态过程,研究人员得以释放出此前被掩盖的性能。该方法不需要对计算机架构进行重新设计,因此是一种可以应用于许多现有系统的实用工具。随着人工智能不断整合更多感官,如何在不让其中一种感官占据主导地位的情况下平衡这些输入,将可能成为构建真正智能机器的标准要求。这项工作表明,只要有正确的引导,计算机就能学会和谐地听与看,而不是让一种感官淹没另一种感官。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。