← 最新论文
💬 NLP

Should Missing Modalities Always Be Necessary to Repair for Multi-modal Sentiment Analysis?

本文挑战了所有缺失模态都必须进行修复这一假设,提出了 SIEVE,这是一个即插即用的框架,它通过利用充分性信号和认知不确定性来学习在样本层面做出是否修复缺失输入的决策,从而优化预测性能。

原作者: Yubo Gao, Haotian Wu, Xiaoyu Xu, Yibo Yan, Hong Chen, Ruoshui Peng, Fei Pan, Puay Siew Tan, Zhuoran Gao, Yonghua Hei, Jie Zhang, Xuming Hu

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yubo Gao, Haotian Wu, Xiaoyu Xu, Yibo Yan, Hong Chen, Ruoshui Peng, Fei Pan, Puay Siew Tan, Zhuoran Gao, Yonghua Hei, Jie Zhang, Xuming Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过观察一个人的样子来猜测他们的感受。你可能会观察他们的脸部表情,聆听他们的声音,并阅读他们的文字信息。在人工智能的世界里,这被称为多模态情感分析(Multimodal Sentiment Analysis)。这是一个高级的说法,意指“教计算机通过结合视觉、听觉和文字等不同线索来理解人类的情感”。通常,这些超级智能的计算机程序是在拥有完整数据的完美数据上进行训练的,即它们能同时获得这三种线索。但在现实世界中,情况往往是混乱的。也许麦克风坏了,也许摄像头被遮住了,或者文字信息丢失了。

长期以来,科学家们认为处理这些缺失线索的唯一方法就是玩一场“修理游戏”。如果某个部分的拼图丢失了,计算机就会尝试去猜测它“应该”是什么样子,填补空白,然后再做出判断。这就像一个侦探,在发现丢失的指纹时,立即试图画出一个伪造的指纹,然后再去破案。而这篇论文提出的核心问题是:这总是正确的做法吗? 如果对于某些特定的情况,缺失的部分其实并不重要呢?如果现有的线索已经足以破解谜团,那么尝试去“修复”缺失的部分是否反而会引入噪声或造成混乱呢?

这篇题为《缺失模态是否总是必须修复?——针对多模态情感分析的研究》("Should Missing Modalities Always Be Necessary to Repair for Multi-modal Sentiment Analysis?")的论文,挑战了这种旧有的“先修复再判断”的规则。由 Yubo Gao 和 Xuming Hu 领导的研究团队发现,对于许多特定时刻,计算机根本不需要修复缺失的数据。他们发现,强行对每一个不完整的输入进行修复通常是浪费时间,甚至会损害计算机的准确性。相反,他们提出了一个名为 SIEVE(基于充分性感知的证据验证器,Sufficiency-Informed Evidential ValvE)的新系统。把 SIEVE 想象成一个繁忙路口的聪明交警。它不会自动把每辆车都送往漫长的“修理路”,而是先检查车辆。如果车辆有足够的燃料(线索)可以直接到达目的地,SIEVE 就会让它走快速车道;但如果车辆油量不足,SIEVE 则会将它送往修理站。

研究团队在两个著名的对话数据集 CMU-MOSIIEMOCAP 上测试了这个想法。在构建新系统之前,他们运行了一个“假设”实验(预言机分析/oracle analysis),以观察对于每一个视频片段,完美的答案应该是怎样的。结果令人惊讶:在其中一个测试中,拥有全部三个线索(文本、音频和视频)实际上仅在约 15.5% 的样本中是最佳选择,而在另一个测试中仅为 33.2%。对于其余的片段,拥有部分线索(例如仅有文本和音频)的表现实际上比尝试猜测缺失的视频要好。这证明了缺失数据的“效用”完全取决于具体的样本;有时,过多的信息反而会变成噪声。

为了解决这个问题,SIEVE 使用了一个巧妙的双轨系统。对于每一条数据,它都会运行两个平行的模拟:

  1. 直接分支(The Direct Branch): 它尝试仅利用已有的线索来猜测情感。
  2. 修复分支(The Repair Branch): 它先使用一个“修复模块”来猜测缺失的线索,然后再做出判断。

随后,SIEVE 会对比两者的结果。如果直接分支的表现与修复分支不相上下,SIEVE 就会判定不需要进行修复并跳过该步骤。如果修复分支表现更好,SIEVE 则知道需要进行修复。为了让这一决策可靠,SIEVE 不仅仅是在靠猜,它还使用了**证据深度学习(Evidential Deep Learning)**这一数学概念。这使得系统能够说:“我非常有信心不需要修复,”或者“我不确定,所以稳妥起见,还是进行修复吧。”它甚至会根据某种类型的缺失数据(如缺失音频)通常需要修复的频率,来调整自身的规则。

实验表明,SIEVE 的表现非常出色。当我们将 SIEVE 接入现有的修复系统中时,它能持续提升这些系统的智能化水平。在 CMU-MOSI 数据集上,将 SIEVE 加入到顶尖模型 GCNet 后,其准确率从 0.7027 提升到了 0.7165。在 IEMOCAP 上,它将得分从 0.6816 提高到了 0.6942。这些改进在各种情况下都成立,无论是数据缺失了一点点,还是缺失了很多(缺失率高达 0.7)。更有趣的是,即使在没有任何数据缺失的情况下,SIEVE 依然发挥了作用,这表明有时“修复”步骤本身就会引入不必要的噪声。

研究人员还观察了计算机实际在“思考”什么。他们发现,这两条路径(直接路径和修复路径)学习到的东西截然不同,而不是简单的互相模仿。当计算机决定跳过修复时,通常是因为文本线索足够强大,足以承担起任务;而当它决定进行修复时,通常是因为缺失的线索在那个特定时刻至关重要。该系统学会了比以往任何方法都更接近“完美”的理论答案(预言机),这证明了了解“何时停止并寻求帮助”与了解“如何提供帮助”同样重要。

简而言之,这篇论文表明,我们不应该盲目地尝试修复每一个缺失的数据片段。有时候,我们手中的线索已经足够完美。通过教会人工智能识别何时拥有“足够”以及何时需要“修复”,我们可以构建出不仅更准确,而且更高效、且不易因“过度思考”而犯错的系统。这是一种从“修复一切”到“只修复必要之物”的转变,这一原则可以让 AI 在混乱、不完整的现实世界中变得更加聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →