CONFER: Conflict-Aware Evidence Negotiation for Regime-Calibrated Weak Supervision in Multimodal Emotion Recognition
该论文提出了 CONFER,这是一个基于图的框架,通过动态估计模态可靠性并将样本划分为共识、异议和歧义机制,来协商跨模态冲突并校准弱监督,从而实现鲁棒的多模态情感识别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚一位朋友的心情如何。你可能会观察他们的脸部表情,倾听他们的声音,并观察他们的肢体语言。通常情况下,这些线索是统一的:皱眉、颤抖的声音和耷拉着的肩膀都在大声宣告着“悲伤”。但如果你的朋友在微笑(脸部显示快乐),同时声音却在破碎(声音显示悲伤),并且身体还在颤抖(身体显示恐惧)呢?这就是**多模态情感识别(Multimodal Emotion Recognition, MER)**中混乱的现实——这是一个计算机科学领域,机器试图通过结合视频、音频和脑电波等不同类型的数据来理解人类的情感。
棘手之处在于,计算机通常将“答案解析”(即人类用来表达感受的标签)视为绝对真理。但人类是复杂的!我们可能会撒谎、遗忘,或者仅仅是因为那天心情不好而导致对情绪的评分变得不可靠。此外,当计算机的不同传感器发生冲突时(比如脸部与声音不一致),现有的多数程序只是简单地将数据强行合并并寄希望于运气,却忽略了这种冲突。本文针对这种困惑提出了疑问:计算机如何知道在不同线索相互冲突时该信任哪一个,以及它如何意识到“答案解析”本身可能也是错误的?
于是有了 CONFER,一个聪明的系统,它就像一位资深调解员,负责协调一群正在争论不休的专家。CONFER 不会强迫不同的传感器(即“专家”)立即达成一致,而是让它们进行协商。想象一场圆桌会议,一位“脸部专家”、一位“声音专家”和一位“脑电波专家”正试图判定一个人是快乐还是悲伤。在过去,计算机只会进行投票。但 CONFER 更聪明。它知道有时“脸部专家”状态不佳(也许是因为光线较暗),而有时“声音专家”则更为可靠。
CONFER 使用一个“动态图”让这些专家进行交流。他们不仅是喊出自己的观点,还会分享“证据”和“不确定性”。如果“脸部专家”非常不确定(高不确定性),而“声音专家”非常有信心,那么“脸部专家”就会倾听并调整自己的观点。如果两者都很有信心但意见相左,CONFER 则会将此标记为严重的冲突。它并不只是忽略这种分歧,而是利用这种分歧来判断哪位专家实际上是在陈述事实,而哪位可能是在“幻觉”。
该系统还有一个处理“答案解析”(自我报告的标签)的特殊技巧。它意识到,如果所有专家都在激烈争吵,那么人类的标签也可能是不可靠的。因此,CONFER 将每一个时刻归类为三种“机制”之一:
- 共识(Consensus): 所有人达成一致,标签很可能是正确的。
- 异议(Dissent): 专家们存在分歧,但系统仍能判断出谁是对的。
- 模糊(Ambiguity): 一切都陷入了混乱,系统决定极少信任人类的标签,因为标签很可能是错误的。
研究人员在涉及真实人类情感表现的三个主要数据集(AMIGOS、MAHNOB-HCI 和 DEAP)上对 CONFER 进行了测试。他们发现,当传感器发生冲突(高冲突)时,CONFER 成为了救星。例如,在 AMIGOS 数据集上,在必须对从未见过的人群进行情感预测的严格测试条件下,它实现了 0.873 的准确率。在 MAHNOB 数据集上,它达到了 0.854。这些数字令人印象深刻,击败了其他顶尖方法。
或许最令人兴奋的发现是该系统如何处理“受损”数据。研究人员模拟了弄乱人类标签的情况(例如随机翻转答案),以观察计算机是否会因此产生混乱。虽然其他方法因此崩溃,但 CONFER 保持了稳定,即使在 30% 的标签错误时,仍维持了 0.723 的准确率。这表明该系统不仅仅是在死记硬背答案,它实际上是在学习如何信任正确的线索并忽略噪声。
简而言之,CONFER 证明了冲突不仅仅是一个需要修复的漏洞,它更是一个有用的信号。通过让不同的传感器进行协商,并意识到人类标签并非总是完美,该系统在理解人类情感复杂且混乱的现实方面变得更加出色。它表明,有时寻找真相的最佳方式是倾听争论的过程,而不仅仅是看最终的投票结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。