← 最新论文
🤖 machine learning

Information-Theoretic Decomposition for Multimodal Interaction Learning

本文引入了基于分解的多模态交互学习(DMIL),这是一种采用变分分解与微调来显式建模并自适应学习样本特有的冗余、独特及协同交互的新型框架,从而克服了传统多模态学习范式的局限性。

原作者: Zequn Yang, Yake Wei, Haotian Ni, Zhihao Xu, Di Hu

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zequn Yang, Yake Wei, Haotian Ni, Zhihao Xu, Di Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图破解一个谜团,但你有两位不同的侦探在协助你:一位负责观察现场(视觉),另一位负责听取证词(音频)。有时,他们告诉你的信息完全一样。有时,其中一人知道另一人不知道的信息。有时,只有通过特定方式将他们的线索结合起来,真相才会变得清晰。

这篇论文是关于如何教计算机更好地“倾听”这两位“侦探”,即理解他们究竟是如何协同工作的。

问题所在:“一刀切”的错误

目前,大多数能够观察图像并聆听声音的计算机系统(多模态学习)都使用一种“一刀切”的方法。它们只是把所有信息胡乱堆砌在一起,然后听天由命。

作者认为,这就像是在盖房子时聘请了一位总承包商,却不询问你是否需要水管工、电工或木工来负责特定的房间。该论文识别了信息交互的三种特定方式:

  1. 冗余(回声): 两位侦探都说:“正在下雨。”他们在重复同一个事实。
  2. 唯一性(专家): 视觉侦探说:“这是一辆红色的车,”而音频侦探说:“那是警笛声。”两者单独来看都无法了解全貌;他们拥有独特的、互不重叠的线索。
  3. 协同(魔术): 这是最棘手的部分。想象一下,视觉侦探看到了一个微笑,而音频侦探听到了讽刺的语气。单独看,他们似乎都很开心。但结合在一起,他们揭示了真相:这个人是在说反话。这个答案只有在两者结合时才会存在。

论文指出,现有的计算机模型在处理这三种类型时表现不佳。有些模型擅长发现“回声”(冗余),但会错过“魔术”(协同)。有些模型擅长处理“专家”线索,但在线索过度重叠时会感到困惑。

解决方案:DMIL(“交互侦探”)

作者提出了一种名为 DMIL(基于分解的多模态交互学习)的新方法。你可以把 DMIL 想象成一位聪明的经理,它不仅仅是混合线索,而是建立了一个特殊的分类站。

以下是 DMIL 的工作原理,我们使用厨房类比:

  1. 分类站(分解):
    与其将所有食材扔进一个锅里,DMIL 使用一个特殊的筛子(称为变分分解)将食材分离到三个不同的碗中:

    • 碗 1(冗余): 两位厨师都认同的食材。
    • 碗 2(唯一性): 只有一位厨师带来的秘密香料。
    • 碗 3(协同): 只有通过混合两位的工具才能制作出的特殊酱汁。
  2. 训练过程(三个阶段):

    • 第一阶段: 系统学习如何将“公认的”事实与“独特的”事实分离开来。
    • 第二阶段: 它学习识别仅在两种模态交互时才会出现的“魔术酱汁”(协同)。
    • 第三阶段: 它将所有东西重新组合在一起,但这一次,它使用了一个“智能门卫”(门控网络)。这个门卫会观察当前处理的具体谜团,并决定:“对于这个特定问题,我需要 80% 的冗余碗和 20% 的协同碗。”

为什么它效果更好

论文在许多任务上测试了该方法,例如识别视频中的情绪或识别电影中的动作。

  • 旧方法: 如果一段视频主要关于“冗余”(音频和视频都在表达同一件事),旧模型有时会感到困惑,因为它们试图在不需要复杂“协同”方案的地方强行套用复杂的方案。如果视频是纯粹的“协同”(如讽刺),旧模型往往会失败,因为它们无法在单一通道中找到答案。
  • DMIL 方法: 由于 DMIL 首先对线索进行分离,因此它可以灵活应变。如果样本是冗余的,它会依赖于共享碗;如果是协同的,它会依赖于魔术酱汁碗。

结果

论文显示,DMIL 始终优于目前的最佳方法。

  • 在一个“冗余度高”的测试中,它的表现优于那些试图将一切混合学习的模型。
  • 在一个“协同度高”的测试中(即答案隐藏在组合之中),它的表现优于那些仅监听单一通道的模型。
  • 它甚至在加入第三个侦探(文本)后依然表现良好,证明了该系统具有处理不仅仅是两种信息源的灵活性。

总结

论文认为,要实现真正的智能化,计算机不应该只是同时“倾听”所有的感官。它需要理解在每一个特定情境下,这些感官是如何相互交流的。通过将信息分解为“共享”、“独特”和“组合”部分,并进行智能性的重新组装,计算机在解决复杂的现实世界问题时会变得更加出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →