← 最新论文
🤖 machine learning

C2^2MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning

本文提出了 C2^2MOE,这是一个通过混合专家架构将表示学习与插补统一起来的新型框架,该架构显式地建模并利用了跨模态的一致性与互补性,旨在解决多模态情感识别中模态缺失的挑战。

原作者: Yuntao Shou, Tao Meng, Wei Ai, Keqin Li

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuntao Shou, Tao Meng, Wei Ai, Keqin Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过观看一段朋友说话的视频来猜测他们的感受。你有三个线索:他们所说的话(文本)、他们的声音听起来如何(音频)以及他们的脸部表情如何(视频)。在人工智能的世界里,这被称为多模态情感识别(Multimodal Emotion Recognition)。这就像是一个超级聪明的侦探,结合所有这些线索,比单一线索更能理解人类的情感。但问题在于,现实世界中总会出差错。也许麦克风断开了,或者摄像头冻结了,又或者网络连接中断了。突然间,你的侦探失去了大半个线索。如果人工智能在构建时没有考虑到处理这些缺失的部分,它就会感到困惑并做出错误的判断。这正是科学家们试图解决的问题:我们如何教计算机在不丢失情感真实含义的情况下,“填补缺失信息”的空白?

本文介绍了一种名为 C2MOE(一致性与互补性引导的专家混合模型)的新型解决方案。把它想象成一个由专业侦探组成的团队,在某些证据缺失时共同破案。研究人员意识到,以往的方法试图通过仅仅复制已知的其他线索来修复缺失的数据,但这往往会导致乏味、重复的猜测,从而错失了独特的细节。C2MOE 做得更聪明。它将工作分成了两个截然不同的角色。一位专家,即“一致性侦探”,寻找线索之间的共同模式——比如,悲伤的声音通常会匹配一张愁容满面的脸。另一位专家,即“互补性侦探”,寻找只有单一线索才能提供的独特细节——比如,只有文本才能揭示的特定措辞。通过使用一个智能“经理”(路由网络)来决定在任何给定时刻应该听从哪位侦探,该系统可以更准确地重建缺失的信息。作者在两个著名的视频评论数据集(CMU-MOSI 和 CMU-MOSEI)上进行了测试,发现 C2MOE 一致地优于现有方法,尤其是在大量数据缺失的情况下。他们指出,通过平衡对共享模式的需求与对独特细节的需求,人工智能即使在数据不完整时也能保持稳健。

侦探团队:C2MOE 如何运作

要理解 C2MOE 如何运作,让我们想象你正在尝试重建一个破碎的拼图,但你手里只有一半的碎片。在过去,AI 模型试图通过仅仅观察已有的碎片并寄希望于好运来猜测缺失的部分。有时它们运气不错,但通常只是反复猜测同样的内容,忽略了让画面变得特别的独特细节。

本文作者认为,我们需要恢复两种不同类型的信息:

  1. 一致性(Consistency): 这是线索之间的“共同语言”。如果有人在喊叫,他们的声音会很大,脸会变红,言语也会具有攻击性。这三者是相互一致的。
  2. 互补性(Complementarity): 这是每个线索的“独特风味”。文本可能会告诉你他们在喊叫什么内容,而音频会告诉你他们有多愤怒,视频则展示了他们在对着谁大喊。这些是互不重叠但又都必不可少的不同拼图碎片。

问题在于,这两个目标经常发生冲突。如果你过于关注让一切保持一致,你可能会抹杀掉独特的细节。如果你过于关注独特的细节,你可能会失去线索之间的联系。

引入专家混合模型(Mixture of Experts, MoE)。
与其使用一个试图完成所有工作的巨大大脑,C2MOE 使用了“专家混合”的方法。想象一个拥有两名专家的侦探机构:

  • 一致性专家: 这位侦探擅长发现模式。如果文本说“我很开心”,这位专家知道声音应该是愉悦的,脸部应该是微笑的。他们的工作是确保缺失的部分能与我们已有的部分完美契合。
  • 互补性专家: 这位侦探擅长发现那些古怪、独特的东西。如果文本说“我很开心”,但声音听起来带有讽刺意味,这位专家就会注意到声音具有一种文本无法捕捉到的独特“风味”。他们的工作是确保我们在填补空白时不会丢失这些独特的细节。

智能经理
AI 如何知道该听哪位侦探的?它使用一个路由网络,充当智能经理的角色。当 AI 看到一段数据时,经理会询问:“我们需要匹配模式,还是需要寻找独特细节?”根据答案,它会为每位专家分配一个分数。如果缺失的部分需要与其他部分相匹配,一致性专家就会获得高分。如果它需要增加一些新东西,互补性专家就会获得认可。最终的答案是两者的结合,并根据经理对每位专家的信任程度进行加权。

实验:将 C2MOE 付诸测试

研究人员在两个大型互联网视频评论集(CMU-MOSI 和 CMU-MOSEI)上测试了他们的新系统。这些数据集包含数千段人们讨论各种话题的视频,AI 必须猜测他们是快乐、悲伤还是愤怒等。

为了使测试更具现实意义,他们通过随机隐藏视频的部分内容来模拟“数据缺失”。有时他们隐藏音频,有时隐藏视频,有时则是文本。他们甚至测试了高达 70% 的数据缺失的情况!

结果
结果令人印象深刻。在几乎所有的场景中,C2MOE 都击败了其他顶尖方法。

  • CMU-MOSI 数据集上,当所有三个线索(文本、音频、视频)都可用时,C2MOE 实现了 88.5% 的准确率(二分类准确率)和 47.4% 的准确率(七分类准确率)。
  • 当他们隐藏了视频和音频,只留下文本时,C2MOE 仍然达到了 87.3% 的准确率,这比次优的方法更好。
  • 即使在缺失率很高(高达 0.7,意味着 7-0% 的数据消失了)的情况下,C2MOE 依然表现得比其他模型更为稳健。当其他模型的性能随着数据的消失而急剧下降时,C2MOE 的性能仅略有下降。

作者还观察了 AI 填充缺失部分的效果如何。他们使用了一种名为 t-SNE 的可视化工具,来观察“重建”的数据与真实数据相比看起来如何。他们发现,C2MOE 的猜测与真实情况更为接近,保持了数据的形状和结构,而其他方法产生的猜测则是混乱且分散的。

为什么这很重要

主要的结论是,仅仅试图强迫一切都变得相同(一致性)是不够的。你还需要尊重线索之间的独特差异(互补性)。通过使用一支由专业专家组成的团队和一个用于切换专家的智能经理,C2MOE 比以往的模型能更好地处理现实世界中混乱、不完整的情况。

本文表明,这种方法是朝着让 AI 即使在数据不完美时也能理解人类情感这一目标迈出的重要一步。虽然作者并未声称他们已经永久解决了数据缺失的问题,但他们的实验有力地证明了这种“一致性与互补性”策略是让 AI 更加稳健可靠的强大方式。正如他们所说,最好的结果来自于平衡共享模式与独特细节,这证明了不同类型的专家之间的一点点协作,可以产生长远的影响。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →