← 最新论文
💻 computer science

A Robust and Explainable Multimodal Fusion Framework for Emotion Recognition Using Visual–Textual Feature Learning and Ensemble Optimization

本文提出了一种鲁棒且可解释的多模态融合框架,该框架通过将视觉和文本特征与堆叠集成学习方法相结合,在情感识别方面实现了最先进的准确率(98.41%),在超越单模态方法的同时,通过 SHAP 和 LIME 确保了可解释性。

原作者: Siyu Jia, Xiaoqing Xiaoqing Tang

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyu Jia, Xiaoqing Xiaoqing Tang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:一种用于情绪识别的鲁棒且可解释的多模态融合框架

问题陈述
目前的情绪识别系统通常依赖单模态数据(视觉或文本),这限制了它们捕捉人类情绪多维特性的能力。单模态方法经常受到上下文感知能力差、歧义性和噪声的影响,导致分类性能欠佳。此外,现有的多模态模型通常作为“黑盒”运行,缺乏可解释性,这阻碍了它们在医疗和教育等敏感领域的部署。此外,许多研究缺乏严格的鲁棒性验证,例如交叉验证、统计显著性检验和消融实验,使得难以验证性能提升是具有泛化性的,还是仅仅是特定数据划分下的偶然现象。

方法论
作者提出了一种可解释的多模态融合框架,该框架通过集成学习和严格的验证技术整合了视觉和文本特征。该方法遵循一个结构化的流水线:

  1. 数据集与预处理: 本研究利用了一个包含 5,866 个对齐样本和 14 个情绪类别的多模态音乐情绪数据集。数据经过预处理以处理重复项和缺失值,随后进行 Z-score 标准化。
  2. 特征工程:
    • 视觉与文本特征: 该框架利用了从视觉和文本模态中提取的共计 28 个工程特征。视觉属性包括饱和度、纹理、亮度、色调和运动,以及交互项;而非结构化文本则被转换为结构化的数值表示。
    • 融合: 框架采用早期特征级融合,通过拼接视觉和文本向量来创建一个统一的表示,从而捕捉跨模态关系。
  3. 模型架构:
    • 基分类器: 基准测试了八种监督机器学习算法:逻辑回归(Logistic Regression)、SVM-RBF、梯度提升(Gradient Boosting)、随机森林(Random Forest)、极端随机树(Extra Trees)、XGBoost、LightGBM 和 CatBoost。
    • 集成学习: 实现了一种**堆叠集成(Stacked Ensemble)**方法。异构基分类器生成预测,随后将这些预测输入元分类器(Meta-classifier),由其学习这些预测的最优组合,旨在降低偏差和方差。
  4. 可解释性 (XAI): 为了解决“黑盒”问题,该框架集成了 SHAP (SHapley Additive exPlanations) 用于全局特征重要性分析,以及 LIME (Local Interpretable Model-agnostic Explanations) 用于实例级解释。
  5. 验证与鲁棒性: 研究采用了分层 5 折交叉验证、消融分析、置信区间估计以及统计显著性检验(配对 t 检验、Friedman 检验和 Nemenyi 事后检验),以确保结果的可靠性和泛化性。

核心贡献

  • 多模态集成: 论文提出了一个在特征层面融合互补视觉和文本信息的框架,证明了这种方法比单模态方法能产生更丰富的表情表示。
  • 系统性基准测试: 通过在相同的实验条件下对八种不同的机器学习算法进行全面评估,确定了针对该特定任务的最优基学习器。
  • 堆叠集成优化: 研究表明,通过堆叠集成结合异构基分类器,可以显著提高预测准确性、鲁棒性和泛化能力,优于单个模型。
  • 可解释性实现: SHAP 和 LIME 的集成提供了全局和局部解释,识别了驱动情绪预测的关键因素,并提高了模型的透明度。
  • 严格验证: 与以往许多研究不同,本工作包含了广泛的鲁棒性检查,包括分层交叉验证、消融实验和统计显著性检验,以验证性能提升并非源于随机波动。

结果

  • 多模态优越性: 在所有评估指标上,多模态融合的表现始终优于单模态(仅视觉和仅文本)模型。
  • 分类器性能: 在单个分类器中,Extra Trees 取得了最高的准确率 95.81%,随机森林和 LightGBM 紧随其后。传统的线性模型(逻辑回归、SVM-RBF)表现明显较差。
  • 集成性能: 所提出的堆叠集成实现了最佳的整体性能,其准确率为 98.41%,Macro F1 分数为 98.40%,MCC 为 0.9829,ROC-AUC 为 0.9986。这比表现最好的单个分类器(Extra Trees)高出约 2.6 个百分点
  • 特征重要性: SHAP 分析显示,文本特征对预测的贡献率为 52.11%,而视觉特征的贡献率为 47.89%。识别出的最具影响力的特征包括饱和度、纹理、亮度-对比度交互项、色调和亮度,以及其他交互项。
  • 鲁棒性: 堆叠集成在 5 折交叉验证中表现出最低的标准差(准确率为 0.31%),表明其具有高度稳定性。统计测试证实,多模态和集成结果在统计学上显著优于(p < 0.05)单模态和单分类器基准。
  • 误差分析: 主要的混淆发生在语义或视觉相似的情绪之间(例如,“感伤”与“忧郁”、“神秘”与“阴暗”),这表明错误通常是由内在的情绪歧义而非模型失效引起的。

意义与主张
论文声称,所提出的框架为多模态情绪识别提供了一个鲁棒、准确且可解释的解决方案。通过结合特征级融合、堆叠集成学习和 XAI 技术,该研究解决了当前文献中关于模型透明度、鲁棒性验证以及集成方法在多模态语境下利用不足的关键空白。作者断言,他们的方法为在对可解释性和可靠性要求极高的现实应用场景中部署情绪识别系统提供了可靠的基础。研究结论指出,尽管目前的结果令人鼓舞,但未来的工作应探索集成基于 Transformer 的基础模型以及额外的模态(如音频和生理信号),以进一步增强可扩展性和泛化能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →