← 最新论文
💻 computer science

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

本文提出了一种用于识别视频中矛盾与犹豫情绪的多模态框架,该框架通过双向交叉注意力机制和门控多模态单元融合文本、音频及视觉特征,在 ECCV 2026 的 ABAW11 挑战赛中实现了 0.7394 的 Macro F1 分数,显著优于单模态基准模型和零样本模型。

原作者: Oussama Berhili, Yassine Ouzar, Larbi Boubchir

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Oussama Berhili, Yassine Ouzar, Larbi Boubchir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅仅通过观察来猜测一位朋友在想什么。有时候这很容易:灿烂的笑容意味着开心,皱眉意味着难过。但那些让人纠结的时刻又该如何处理呢?比如,有人说着“我没事”,但声音听起来却在颤抖,而他们的脸部表情看起来却像是快要哭出来一样。这种复杂交织的情绪被称为矛盾心理(ambivalence)犹豫不决(hesitancy)。这就是那种想要去做某件事与害怕去做某件事之间的内心拉锯战。研究计算机与人类行为的科学家们(一个被称为情感计算的领域)正试图教会机器去识别这些微妙且混乱的信号。他们知道,仅仅观察一种线索——比如只听声音或只看脸部——往往是不够的。为了真正理解一个人,计算机需要表现得像一名超级聪明的侦探,同时将言语、语调和表情拼凑在一起,从而解开一个人真实感受的谜团。

在这篇论文中,由 Oussama、Yassine 和 Larbi 组成的研究团队决定构建一台超级侦探计算机,来解决这个谜题。他们参加了一项名为 ABAW11 的竞赛,目标是识别视频录像中的矛盾心理和犹豫不决。他们首先分别测试了三种不同的“感官”:一个阅读文本转录内容的“大脑”,一个倾听音频的“大脑”,以及一个观察面部视频的“大脑”。他们发现,文本阅读器是表现最好的单兵侦探,其正确率约为 66.6%(以一个被称为 Macro F1 的分数来衡量)。音频监听器紧随其后,得分为 62.8%,而视频观察者则稍弱,为 57.3%。有趣的是,他们尝试了一个著名的“零样本(zero-shot)”AI(即没有针对此特定数据进行训练的 AI),结果仅达到了 28.3% 的正确率,这证明了你确实需要针对这项棘手的任务专门训练你的 AI。

但真正的魔力发生在他们停止让侦探们单独行动,转而让他们组建团队的时候。研究人员构建了一个特殊的系统,让文本、音频和视频的“大脑”能够相互交流。他们使用了一种名为交叉注意力(cross-attention)的技术,这就像是给每位侦探发了一个对讲机,让他们可以互相询问:“嘿,我这里听到一个颤抖的声音,你的面部观察到紧张的表情了吗?”以及“我看到一个犹豫的词汇,你的音频里听到停顿了吗?”这使得他们能够发现矛盾之处,比如当一个人说“好”时,语气却显得很不确定。他们还添加了一个门控多模态单元(Gated Multimodal Unit),它扮演着一名聪明经理的角色。如果其中一位侦探看到的脸部模糊不清,或者听到的音频质量很差,经理就会说:“先忽略那个嘈杂的信号,让我们把注意力集中在清晰的文本上。”

在利用一个名为 Optuna 的智能搜索工具进行参数优化并找到完美设置后,结果令人印象深刻。这个协作团队在测试中取得了 73.9% 的得分,比表现最好的单兵侦探提高了 11.0%。这表明,通过让不同的感官相互校验,计算机可以比任何单一感官更好地捕捉到构成矛盾心理的那些微妙且冲突的线索。研究人员坚信,这种在文本、声音和视频之间进行显式协作的方法,是解锁这些复杂人类情感的关键,并且他们已经公开了代码,以便他人也可以进行尝试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →