← 最新论文
💻 computer science

From Action Units to Emotions: A Two-Stage Fine-Tuning Framework with Decision-Level Fusion for Facial Expression Recognition

本文提出了一种两阶段微调框架,通过问答数据集以及与专门的小模型进行决策级融合,增强了多模态大模型的面部动作单元识别与情感分类能力,从而显著提高了面部表情识别在细微及低强度表情下的准确性与可解释性。

原作者: Rui Tu, Liguo Zhou, Alois Knoll

发布于 2026-08-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Tu, Liguo Zhou, Alois Knoll

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:从动作单元到情绪

问题陈述

面部表情识别(FER)仍受限于实际挑战,如光照变化、姿态差异以及标注数据的匮乏。现有的深度学习模型往往面临跨领域适应性差、过拟合以及可解释性不足的问题。此外,尽管多模态大语言模型(MLLMs)具备先进的语义理解能力,但它们通常缺乏感知细微面部几何变形和微表情的敏感度。传统的将 MLLMs 在“视频-标签”信号上进行端到端微调的方法,往往忽略了作为情绪表达基础的细粒度中间表示(动作单元/Action Units),从而导致推理链条并非最优。

方法论

本文提出了一种带有决策级融合的两阶段微调框架,旨在架起低层级面部感知与高层级情绪语义之间的桥梁。

1. 两阶段渐进式微调

核心策略是将 FER 分解为两个连续的学习阶段,以实现“三重解耦”:感知与推理的解耦、领域无关知识与领域特定知识的解耦,以及物理观察与情绪标签的解解耦。

  • 第一阶段:AU 检测微调(感知)

    • 数据: 利用提供帧级动作单元(AU)标注的 CAS(ME)³ 数据集。
    • 任务: 将 AU 识别重新构建为视觉问答(VQA)任务。模型被指令根据视觉输入识别活跃的 AU,利用面部动作编码系统(FACS)的先验知识。
    • 模型: 使用 LoRA(低秩自适应)Qwen3-VL-32B-Instruct 多模态大模型进行微调,仅更新一小部分参数(查询矩阵 Query 和值矩阵 Value),在学习 AU 检测的同时保留预训练的视觉-语义知识。
    • 目标: 建立对细微面部微动作的鲁棒且领域无关的感知能力。
  • 第二阶段:表情识别微调(推理)

    • 数据: 迁移至 FER-2013 数据集(具有情绪标签但无 AU 标注的静态图像)。
    • 任务: 模型以第一阶段的权重为初始化,进一步通过微调将检测到的 AU 组合映射到情绪类别。输出格式要求模型从 AU 推理到最终的情绪标签,并保持 VQA 结构。
    • 策略: 仅优化用于情绪识别的新 LoRA 适配器;视觉编码器和第一阶段的适配器保持冻结,以保留 AU 到情绪的推理链。

2. 决策级融合

为了解决纯大模型在感知细粒度几何变形方面的局限性,该框架将微调后的 Qwen3-VL 与 OpenFace 3.0(一种专门的轻量级基于 CNN 的 FER 模型)进行了集成。

  • 机制: 通过加权线性插值融合两个模型的概率分布(PVLMP_{VLM}POpenFaceP_{OpenFace}):
    Pfinal=αPOpenFace+(1α)PVLMP_{final} = \alpha \cdot P_{OpenFace} + (1 - \alpha) \cdot P_{VLM}
  • 原理: OpenFace 3.0 提供了对局部面部地标和几何特征的敏感度,而微调后的 MLLM 则提供了高层级的语义理解和上下文推理能力。

核心贡献

  1. 验证了大模型基准: 系统评估了 Qwen3-VL-32B-Instruct 在 FER 上的零样本和少样本性能,建立了强大的基准。
  2. AU 引导的两阶段微调: 引入了一种课程学习范式,即模型先在 CAS(ME)³ 上学习 AU 检测,然后再在 FER-2013 上将其映射到情绪。这使得模型能够获得 AU 推理能力,并通过可解释的链条进行推理(“先进行 AU 推理,后进行情绪预测”)。
  3. 异构模型协作: 证明了大型多模态模型与专门的小型模型(OpenFace 3.0)之间进行决策级融合的可行性,验证了它们互补的优势。
  4. 稳健的实证表现: 表明所提出的框架显著优于非微调基准模型和独立的专门化 CNN 模型,特别是在提高少数类别的召回率和增强可解释性方面。

实验结果

实验在 FER-2013 测试集上进行,评估指标包括准确率(ACC)、精确率(Precision)、召回率(Recall)和 F1 分数。

  • 性能对比基准:
    • 微调后的 Qwen3-VL 达到了 66.73% 的准确率,比非微调基准(58.73%)提升了 8 个百分点。
    • 融合模型(Qwen3-VL + OpenFace 3.0)达到了 67.37% 的准确率。
    • 与传统 CNN 相比,融合模型略优于 GoogLeNet (67.04%),但落后于 ResNet-50 (69.33%)、VGG-16 (68.75%) 和 DenseNet (69.38%)
    • 尽管在整体准确率上未超越最优的专门化 CNN 模型,但融合模型展示了卓越的加权精确率 (Weighted Precision, 69.47%),与 ResNet50 (69.84%) 相当。
  • 融合优势:
    • 与纯大模型相比,融合模型在 宏观召回率 (Macro-Recall, 62.71%) 上有显著提升(纯大模型为 58.64%),表明其能更好地捕捉少数类别(如厌恶、恐惧)。
    • 与单独使用 OpenFace 3.0(准确率 48.02%)相比,该联合框架将准确率提高了 19.35 个百分点(相对提升 40.3%)。
  • 可解释性: 模型成功生成了将特定 AU 激活(如 AU4, AU7)与情绪判断联系起来的自然语言解释,提供了在“黑盒”CNN 中不存在的可追溯推理链。

重要性与主张

本文声称,所提出的两阶段微调策略有效地激发了大视觉模型中针对细微面部几何变形和低强度表情的判别性特征,而这些特征通常是此类模型难以处理的细节。

作者断言,虽然纯大视觉模型拥有强大的高层语义理解能力,但在感知细微面部变形方面存在内在局限。所提方法通过以下方式解决了这一问题:

  1. 增强可解释性: 使用 AU 作为中间表示,使输出具有可追溯性,从而增加了可信度。
  2. 提高鲁棒性: 决策级融合补偿了大模型缺乏细粒度空间先验的问题,显著提升了在少数类别上的表现,并减少了对头部类别的偏差。
  3. 提供新路径: 本研究提供了一种技术范式,通过利用 MLLM 与专门化几何模型的互补优势,构建高度鲁棒且可解释的 FER 系统,并通过实证结果验证了其在两种模型独立推理时均有实质性提升。

作者总结道,虽然目前的准确率尚未超越绝对最优的专门化 CNN,但该框架在预测置信度、架构可解释性以及在情感计算中应用协同大模型的潜力方面,展现出了明显的优越性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →