← 最新论文
💻 computer science

Two-Stage Multimodal Framework for Emotion Mimicry Intensity Prediction

本文提出了一种两阶段多模态框架,该框架在独立训练文本、音频、视觉和运动编码器后,通过一个轻量级回归器将其融合,以预测六个连续的情感强度维度,在 Hume-ABAW10 情感模仿强度挑战赛中取得了测试集皮尔逊相关系数为 0.57 的第三名成绩。

原作者: Dinithi Dissanayake, Shaveen Silva, Ovindu Atukorala, Prasanth Sasikumar, Suranga Nanayakkara

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Dinithi Dissanayake, Shaveen Silva, Ovindu Atukorala, Prasanth Sasikumar, Suranga Nanayakkara

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过观看一段视频来猜测一个人的感受。但这里有个转折:你不仅仅是在猜测“快乐”或“悲伤”。你需要猜测六种非常具体情感的强度:钦佩、愉悦、决心、共情痛苦、兴奋和喜悦。

本文描述了一个团队为解决名为"Hume-ABAW10"挑战赛中的这一难题所做的尝试。他们构建了一个计算机系统,该系统像一个侦探,通过整合来自不同来源的线索来做出最佳猜测。

以下是他们系统的运作方式,简单解释如下:

1. 问题:杂乱无章的野生数据集

团队获得了数千段“野生”(非工作室环境)拍摄的视频片段。这些片段杂乱无章:

  • 长度各异:有些视频仅有一秒长;有些则长达 10,000 多帧。
  • 线索缺失:有时文本(人物所说的话)缺失,但音频和视频依然存在。
  • 罕见情感:某些情感,如“共情痛苦”(为他人的痛苦而感到痛苦),在数据中几乎从未出现。这就像试图在只有麻雀照片的情况下,学习识别一种稀有的鸟类。

2. 解决方案:一个“两阶段”专家团队

团队没有试图训练一个巨大的大脑一次性完成所有任务,而是构建了一个两阶段框架。这就像在召集他们开小组会议之前,先聘请一群专家。

第一阶段:专家单独训练
首先,他们针对单一类型的线索训练了四个独立的“专家”(神经网络):

  • 文本专家:阅读所说的内容的转录稿。
  • 音频专家:聆听语调和声音。
  • 视觉专家:观察面部表情。
  • 运动专家(可选):观察头部和面部的细微运动。

每位专家仅利用其特定的线索来学习猜测情感。文本和音频专家被证明是最强的独立猜测者。视觉和运动专家单独表现较弱,但拥有独特的见解。

第二阶段:小组会议(融合)
一旦专家训练完成,团队将他们聚集在一起。他们并没有让他们互相大声喊叫,而是使用了一个轻量级“融合回归器”(一位智能管理者)。

  • 管理者的工作:它收集所有专家的笔记,将它们结合起来,并做出最终预测。
  • 安全网:为了确保系统不会偷懒而仅依赖文本专家,他们使用了一种称为**“模态丢弃”**的技巧。在训练期间,他们会随机隐藏文本或音频线索,迫使管理者在主要线索缺失时学会利用视觉或运动线索。

3. “运动”实验

团队增加了一位第四位专家,专门观察运动(面部随时间的变化)。

  • 结果:这位运动专家并没有显著改变分数。这就像给委员会增加第五个人,他仅拥有一点点额外信息。它略有帮助,但并非主角。论文指出,虽然增益很小,但研究运动如何发挥作用对未来的研究是有趣的。

4. 结果:他们表现如何?

  • 最佳策略:当他们向系统提供所有四种线索(文本、音频、视觉和运动),并使用更大量的训练数据(通过将部分测试数据混入训练集)时,系统表现最佳。
  • 分数:在竞赛中,他们的系统在最终测试中达到了0.57的平均相关性。这意味着他们的猜测与人类评委的评分具有中等程度的吻合。
  • 排名:他们在所有参赛团队中排名第 3

5. 关键要点

  • 文字和声音胜出:如果只能选择一种线索,阅读转录稿或聆听声音是猜测情感强度最有力的方式。
  • 面部和运动有帮助:单独观察面部和运动的效果不如前者,但当与文字和声音结合时,它们增加了一点点额外价值。
  • 简单即好:与获胜者相比,他们的方法相对简单。他们没有使用复杂、笨重的机器;他们只是很好地训练了专家,然后让他们协同工作。

简而言之:该团队构建了一个系统,首先分别针对文本、声音和视频训练独立的专家,然后结合他们的意见来猜测一个人情感的强度。他们获得了第三名,证明了针对这一棘手任务,一种简单的分阶段方法是行之有效的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →