← 最新论文
💻 computer science

MDRC: Mechanism-Decoupled Retrieval-Guided Conditional Recovery for Incomplete Multimodal Emotion Recognition

本文提出了 MDRC,一种机制解耦的检索引导条件恢复框架,该框架通过建模共享-私有语义,并利用通过受控先验引导和有界残差细化实现的检索证据,来解决不完整的多模态情感识别问题,从而增强对模态缺失的鲁棒性。

原作者: Qianxi Zhang, Shengcai Wang, Nengchao Wu, Junjie Bao, Xinyu Yang, Na Cui, Rangxiang Zhao, Qing Tao, Li Liu

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Qianxi Zhang, Shengcai Wang, Nengchao Wu, Junjie Bao, Xinyu Yang, Na Cui, Rangxiang Zhao, Qing Tao, Li Liu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类的情感很少是单一的音符;它是由言语、语调和面部表情共同奏响的一段复杂的和弦。当我们试图教计算机理解这些感受时,通常会将这三个拼图碎片同时交给它们。但在混乱的现实世界中,技术往往无法捕捉到完整的画面。麦克风可能会失灵,摄像头可能会被遮挡,或者转录服务可能会出错,导致计算机只能获得情感信号的一个片段。这就是不完整多模态识别面临的挑战:当机器丢失了关键证据时,它该如何推测一个人的感受?

多年来,研究人员一直试图通过构建足够强大的模型来解决这个问题,要么让模型能够忽略缺失的部分,要么尝试从剩余信息中重建缺失的数据。其核心理念是填补空白,就像侦探从零散的线索中重建犯罪现场一样。然而,仅仅猜测缺失的部分往往会导致结果虽然平滑却显得空洞。计算机创造出的表征可能看起来像缺失的数据,但却缺乏做出正确预测所需的敏锐且具体的的情感真相。这就像是通过一张模糊的人脸照片来猜测一个人的情绪;轮廓还在,但细微之处已荡然无存。

来自新疆大学和新锐汽车有限公司的研究团队提出了一种处理这些缺口的新方法,称为 MDRC。该方法并不只是试图从头开始重建缺失的数据,而是更像一位通晓故事的图书管理员。当计算机遇到缺失的信息时,它不仅仅是在猜测,而是会从庞大的过往交互库中寻找相似的案例来引导其思考。研究人员发现,通过仔细控制如何使用这些外部信息,可以帮助计算机恢复缺失的情感线索,而不至于被无关细节所干扰。

他们方法的核心包含两个协同工作的不同步骤。首先,系统会获取现有的信息——无论是仅有文本、仅有声音还是仅有视频——并利用这些信息对缺失部分进行初步且稳定的推测。这一步依赖于一种对情感如何在不同类型的信号中普遍呈现的共性理解。这是一个基础性的猜测,建立在计算机已经学习到的模式之上。但研究人员意识到,这种基础性的猜测往往不足以区分微妙的情感状态,尤其是在现有线索较弱的情况下。

为了解决这个问题,系统随后会咨询其过往案例库。它会搜索其他出现类似模式的实例,并利用这些例子作为引导。然而,研究人员非常谨慎,并未让这个库接管一切。他们知道,如果计算机只是简单地复制库中的答案,可能会引入错误或偏差,例如仅仅因为过去某个长相相似的人很开心,就假设当前这个人也是开心的。为了防止这种情况,他们设计了一种机制,以两种非常具体且有限的方式利用库中的信息。首先,它会轻轻地引导初始猜测的方向,使其向更可能的的情感结果靠拢。其次,它会添加少量且受限的额外细节来精炼猜测,但前提是这些细节必须与当前情境保持一致。

这种细致的两步走过程使得系统既能受益于过往数据的智慧,又不会被其淹没。研究人员在两个大型视频集(即人们表达各种情感的视频剪辑,被称为 CMU-MOSI 和 CMU-MOSEI)上测试了他们的方法。在这些测试中,他们刻意去除了文本、音频或视频输入,以模拟现实世界中的故障。结果显示,他们的方法始终优于现有技术,尤其是在文本缺失、计算机必须仅依靠声音或面部表情的最困难场景下。在这些情况下,该系统能够保持较高的准确度,而其他方法则表现出明显的挣扎。

研究还表明,系统学习的顺序至关重要。研究人员发现,如果他们在计算机掌握了猜测缺失部分的基础任务之前,就尝试教它使用案例库,系统会变得不稳定且表现变差。通过先教系统建立稳固的基础,然后再引入外部引导,他们实现了更加可靠的结果。这种两阶段训练策略对于使系统有效地处理数据不确定性至关重要。

最终,这项工作表明,处理缺失信息的最佳方式不是强求完美的重建,而是将外部知识作为一种谨慎的引导。研究人员证明,通过将“恢复过程”与“增强过程”解耦,并严格控制外部示例的影响力,机器可以更好地理解即使在数据不完整时的人类情感。虽然该系统尚不完美,在面对噪声极大或信号极弱的情况时仍可能产生困惑,但它代表了向使人工智能对现实世界的缺陷更具韧性迈出的重要一步。研究结果表明,通过内部学习与外部参考之间的正确平衡,计算机可以学会以惊人的清晰度解读我们沟通中的情感空白。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →