A Robust and Explainable Multimodal Fusion Framework for Emotion Recognition Using Visual–Textual Feature Learning and Ensemble Optimization
本文提出了一种鲁棒且可解释的多模态融合框架,该框架通过将视觉和文本特征与堆叠集成学习方法相结合,在情感识别方面实现了最先进的准确率(98.41%),在超越单模态方法的同时,通过 SHAP 和 LIME 确保了可解释性。