← 最新论文
💻 computer science

Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge

本文提出了一种针对 FG 2026 BLEMORE 挑战赛的混合情绪识别系统,通过融合包括 Gemini Embedding 2.0 在内的六种编码器家族及晚期概率融合策略,结合冻结 Wav2Vec2 特定层特征与软标签训练,在测试集上取得了 0.279 的得分并位列第 6 名。

原作者: Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Masoumeh Chapariniya, Aref Farhadipour, Sarah Ebling, Volker Dellwo, Teodora Vukovic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个团队如何教计算机“读懂”人类复杂且混合的情绪。想象一下,当一个人既生气又害怕,或者既开心又有点悲伤时,他的表情、声音和肢体语言会交织在一起,很难用简单的“开心”或“难过”来概括。这就是BLEMORE挑战的核心:不仅要识别出有哪些情绪,还要判断哪种情绪更占主导地位(比如是 70% 的愤怒 +30% 的恐惧,还是反过来)。

为了在 2026 年的 FG 会议上解决这个问题,作者团队设计了一个像**“超级侦探联盟”**一样的系统。他们不是只派一个侦探去破案,而是召集了六位不同背景的专家,让他们各自提供线索,最后由一位“总指挥”综合所有信息做出判断。

以下是这个“侦探联盟”的运作方式,用生活中的比喻来解释:

1. 六位专家(编码器)的分工

这个系统由六个不同的“专家”组成,他们分别负责观察不同的线索:

  • 面部专家(S4D-ViTMoE):

    • 角色: 就像一位擅长微表情的心理学家。
    • 工作: 他专门盯着人的脸看。为了让他更专业,团队对他进行了“特训”(微调),让他不仅看脸,还能理解“混合情绪”的比例(比如用软标签训练,让他知道愤怒和恐惧是 7:3 的关系,而不是非黑即白)。
    • 特点: 他非常擅长捕捉面部肌肉的细微变化。
  • 声音专家(Wav2Vec2):

    • 角色: 一位听力敏锐的侦探,但他有个特殊的习惯。
    • 工作: 这个挑战里的声音不是说话(没有具体的词),而是笑声、哭声、喘息声。普通的语音模型(像教人认字的老师)如果全学,反而会学偏。
    • 秘诀: 团队发现,这个模型的“中间层”(第 6 到 12 层)最擅长捕捉语调、节奏和情绪,而“顶层”只关心发音。于是,他们只冻结(不训练)中间层,直接拿来用。这就像只借用一位老厨师的“火候感”,而不让他重新学切菜。结果证明,这种“拿来主义”比重新训练整个模型效果好得多,因为数据量太小,重新训练容易“死记硬背”(过拟合)。
  • 肢体语言专家(TimeSformer 和 VideoMAE):

    • 角色: 观察全身动作的侦探。
    • 工作: 有时候脸很平静,但拳头握紧了,或者身体在发抖,这代表了强烈的情绪。这两位专家专门看人的全身动作,补充面部专家看不到的信息。
  • 全能新星(Gemini Embedding 2.0):

    • 角色: 一位来自未来的“超级 AI 助手”,这是第一次在情绪识别中使用这种大模型。
    • 工作: 它非常聪明,但有个限制:它只能看前 2 秒钟的视频。
    • 奇迹: 尽管只能看短短 2 秒,它竟然能猜出情绪,而且猜得很准!这就像只看了一个人进门时的一个眼神,就猜出了他今天的心情。这证明了大模型拥有极强的“直觉”,能从极短的信息中捕捉到丰富的情感语义。
  • 其他辅助专家:

    • 还有几位专家使用了之前别人提取好的现成特征(如 HiCMAE, CLIP 等),作为团队的补充力量。

2. 投票与决策(融合与后处理)

  • 加权投票:
    六位专家各自给出一个概率(比如:愤怒 70%,恐惧 30%)。系统不会简单地取平均值,而是给每位专家分配不同的**“投票权重”**。

    • 结果发现,那些经过专门训练、懂这个特定任务的专家(如面部和肢体专家)获得了62%的票数,而通用的现成模型只占 38%。这说明“术业有专攻”,针对特定任务微调过的模型更靠谱。
    • 有趣的是,那个只能看 2 秒的“全能新星”Gemini,因为表现太出色,获得了最高的单票权重。
  • 最后的“门槛”(阈值调整):
    这是系统最棘手的地方。专家们的投票是连续的分数(比如 0.65),但比赛要求输出离散的结果(比如“愤怒”或“恐惧”)。

    • 这就需要设定两个**“门槛”**:
      1. 存在门槛 (α\alpha): 分数超过多少才算“有这种情绪”?
      2. 主次门槛 (β\beta): 两个情绪分数差多少,才算“谁主谁次”?
    • 大发现: 团队发现,这个“主次门槛”(β\beta) 非常不稳定。对于不同的人,这个门槛从 0.05 变到 0.43,差别巨大。
    • 比喻: 这就像每个人的“情绪表达风格”都不同。有的人即使很生气,表情也很含蓄(门槛低);有的人稍微有点不开心就大喊大叫(门槛高)。目前的模型很难适应这种**“千人千面”**的差异,这是导致系统在不同人身上表现不一的主要原因。

3. 最终成绩与启示

  • 成绩: 这个“超级侦探联盟”在测试中拿到了第 6 名,综合得分 0.279,远超之前的最佳记录。
  • 三个核心启示(用大白话总结):
    1. 少即是多(针对小数据): 对于这种只有几千个样本的小数据集,不要试图让大模型从头学起(全量微调),而是挑选大模型里最合适的“中间层”直接拿来用,效果反而更好。
    2. 大模型的直觉: 即使是像 Gemini 这样只能看 2 秒视频的大模型,也能在情绪识别上大放异彩,这为未来研究打开了新大门。
    3. 人的复杂性是最大瓶颈: 技术已经很强了,但最大的难点在于每个人表达情绪的方式太独特了。目前的“一刀切”的判定标准(阈值)很难适应所有人,未来的方向可能是让系统学会“因人而异”地判断。

总结来说:
这篇论文就像是在说,要读懂人类复杂的情绪,不能只靠一个死板的规则。我们需要组建一个多元化的专家团队,利用大模型的直觉,同时尊重每个人独特的表达习惯。虽然目前我们还在努力克服“千人千面”带来的判断难题,但这条路已经走通了,而且前景非常光明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →