想象一下,你正试图仅仅通过观察来猜测一位朋友在想什么。有时候这很容易:灿烂的笑容意味着开心,皱眉意味着难过。但那些让人纠结的时刻又该如何处理呢?比如,有人说着“我没事”,但声音听起来却在颤抖,而他们的脸部表情看起来却像是快要哭出来一样。这种复杂交织的情绪被称为矛盾心理(ambivalence)或犹豫不决(hesitancy)。这就是那种想要去做某件事与害怕去做某件事之间的内心拉锯战。研究计算机与人类行为的科学家们(一个被称为情感计算的领域)正试图教会机器去识别这些微妙且混乱的信号。他们知道,仅仅观察一种线索——比如只听声音或只看脸部——往往是不够的。为了真正理解一个人,计算机需要表现得像一名超级聪明的侦探,同时将言语、语调和表情拼凑在一起,从而解开一个人真实感受的谜团。
在这篇论文中,由 Oussama、Yassine 和 Larbi 组成的研究团队决定构建一台超级侦探计算机,来解决这个谜题。他们参加了一项名为 ABAW11 的竞赛,目标是识别视频录像中的矛盾心理和犹豫不决。他们首先分别测试了三种不同的“感官”:一个阅读文本转录内容的“大脑”,一个倾听音频的“大脑”,以及一个观察面部视频的“大脑”。他们发现,文本阅读器是表现最好的单兵侦探,其正确率约为 66.6%(以一个被称为 Macro F1 的分数来衡量)。音频监听器紧随其后,得分为 62.8%,而视频观察者则稍弱,为 57.3%。有趣的是,他们尝试了一个著名的“零样本(zero-shot)”AI(即没有针对此特定数据进行训练的 AI),结果仅达到了 28.3% 的正确率,这证明了你确实需要针对这项棘手的任务专门训练你的 AI。
但真正的魔力发生在他们停止让侦探们单独行动,转而让他们组建团队的时候。研究人员构建了一个特殊的系统,让文本、音频和视频的“大脑”能够相互交流。他们使用了一种名为交叉注意力(cross-attention)的技术,这就像是给每位侦探发了一个对讲机,让他们可以互相询问:“嘿,我这里听到一个颤抖的声音,你的面部观察到紧张的表情了吗?”以及“我看到一个犹豫的词汇,你的音频里听到停顿了吗?”这使得他们能够发现矛盾之处,比如当一个人说“好”时,语气却显得很不确定。他们还添加了一个门控多模态单元(Gated Multimodal Unit),它扮演着一名聪明经理的角色。如果其中一位侦探看到的脸部模糊不清,或者听到的音频质量很差,经理就会说:“先忽略那个嘈杂的信号,让我们把注意力集中在清晰的文本上。”
在利用一个名为 Optuna 的智能搜索工具进行参数优化并找到完美设置后,结果令人印象深刻。这个协作团队在测试中取得了 73.9% 的得分,比表现最好的单兵侦探提高了 11.0%。这表明,通过让不同的感官相互校验,计算机可以比任何单一感官更好地捕捉到构成矛盾心理的那些微妙且冲突的线索。研究人员坚信,这种在文本、声音和视频之间进行显式协作的方法,是解锁这些复杂人类情感的关键,并且他们已经公开了代码,以便他人也可以进行尝试。
技术摘要:通过交叉注意力与门控融合实现多模态矛盾与犹豫识别
问题定义
本研究旨在解决视频录制中自动检测“矛盾与犹豫”(Ambivalence and Hesitancy, A/H)的挑战,这是 ECCV 2026 中 ABAW11 挑战赛的核心任务。A/H 代表一种微妙的情感状态,即个体经历着冲突的情绪或动机,这往往会导致行为改变的延迟。该挑战在于 A/H 通过多个模态表现出复杂的、有时甚至是相互矛盾的线索:转录文本中的词汇对冲(lexical hedging)、音频中的韵律变化以及面部视频中的微表情。作者利用 BAH 数据集进行开发,该数据集包含 1,427 段带有二元标签(指示存在或不存在 A/H)的视频录像,旨在开发一种超越简单单模态分析或朴素融合的解决方案。
方法论
所提出的方案是一个包含特征提取、单模态基准建立以及新型多模态融合架构的结构化流水线。
特征提取: 为了保留细粒度的时序动态,作者在提取过程中避免了全局池化。相反,他们使用三种最先进的预训练编码器提取完整的序列标记表示(token representations):
- 文本: F2LLM-v2-0.6B(基于 Qwen3-0.6B)处理转录文本,保留完整的
last_hidden_state 序列(Nt×1024)。
- 音频: WavLM-Large 处理 16 kHz 单声道音频,提取完整的时序序列(Na×1024)以捕捉韵律细微差别。
- 视觉: VideoMAE V2 (Base) 处理对齐的面部帧(256x256)。视频被分为 16 帧的块,并通过拼接补丁级(patch-level)标记序列来保留时空上下文(Nv×768)。
单模态基准: 在融合之前,作者通过在每个模态上独立训练经典分类器(MLP、随机森林和 GBDT)来建立稳健的基准。这些模型通过 Optuna(每个分类器 100 次试验)进行优化,并以 Macro F1 作为评价指标。
多模态融合架构: 核心贡献是一个结合了双向交叉注意力和门控多模态单元(GMU)的融合模型:
- 投影与位置编码: 来自所有模态的变长序列被线性投影到一个共享的嵌入维度(dmodel),并辅以正弦位置编码。
- 双向交叉注意力: 一个
MultimodalCrossAttention 模块实现了六个方向的注意力堆栈(例如,文本关注音频、音频关注视频等)。这使得每个模态能够查询并关注其他模态的表示,通过利用互补的线索来消除歧义。
- 池化: 上下文化的标记序列通过可配置的池化策略(均值、最大值或学习注意力)被缩减为单个向量。
- 门控融合 (GMU): 池化后的向量被拼接后进入 GMU 进行处理。该单元计算一个上下文向量,为每个模态生成一个 Sigmoid 门控,从而动态缩放各流的贡献。这种机制允许模型针对特定实例抑制噪声或无信息量的模态(例如,被遮挡的面部)。
- 分类: 最终融合的表示通过一个 MLP 输出二元预测。
核心贡献
- 全面的单模态基准: 本文通过使用特定的 F2LLM、WavLM 和 VideoMAE 配置,建立了强大的单模态基准,证明了领域特定训练显著优于零样本(zero-shot)基准。
- 系统性的分类器评估: 对跨模态的 MLP、随机森林和 GBDT 分类器进行了比较分析,并利用 Optuna 进行了优化。
- 新型融合架构: 将双向交叉注意力与门控多模态单元相结合,并专门通过 50 次 Optuna 搜索进行调优,以建模模态内及模态间的交互。
- 可复现的流水线: 一个模块化的开源框架,在整个流水线中保留变长标记序列,便于未来向交叉注意力或多模态大语言模型(LLM)扩展。
结果
- 单模态性能: 文本特征在孤立状态下表现出最强的判别力,其随机森林分类器在测试集上达到了 0.6659 的 Macro F1。这显著优于零样本 Video-LLaVA 基准(Macro F1: 0.2827)。音频和视觉模态紧随其后,Macro F1 分别为 0.6275 和 0.5727。
- 多模态性能: 所提出的 Cross-Attention + GMU 模型在验证集上实现了 0.7394 的 Macro F1。这相比于最佳单模态基准实现了 11.0% 的相对提升,并且较零样本基准有显著增益。
- 超参数优化: 最佳配置使用了 256 的共享嵌入维度、单个注意力头、每个模态对两个交叉注意力层以及均值池化。
意义与主张
作者声称,其结果证实了以下假设:显式的跨模态交互对于检测 A/H 至关重要。相较于单模态模型的性能提升表明,A/H 涉及任何单一模态都无法单独捕获的互补线索。此外,误差分析表明,虽然单模态模型(尤其是文本)对标记物较为敏感,但可能会对中性特征过度触发;多模态架构通过利用来自音频和视觉流的正交线索,有助于精细化决策边界。
本文将其方法定位为情感计算领域的一个原则性进步,证明了建模模态内及模态间的交互比单纯依赖单模态或朴素后期融合能获得更优的结果。虽然其性能(0.7394)接近了 ABAW10 冠军系统 BROTHER 的结果,但作者指出,由于数据集版本和挑战赛届数的差异,直接对比是谨慎的。研究结论认为,未来的改进方向可能在于更丰富的时序建模、个性化以及多模态大语言模型的参数高效微调。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。