← Derniers articles
💻 computer science

From Action Units to Emotions: A Two-Stage Fine-Tuning Framework with Decision-Level Fusion for Facial Expression Recognition

Cet article propose un cadre de réglage fin en deux étapes qui améliore les capacités de reconnaissance des unités d'action faciale et de classification des émotions d'un grand modèle multimodal grâce à un ensemble de données de questions-réponses et une fusion au niveau de la décision avec un petit modèle spécialisé, améliorant ainsi considérablement la précision et l'interprétabilité de la reconnaissance des expressions faciales pour les expressions subtiles et de faible intensité.

Auteurs originaux : Rui Tu, Liguo Zhou, Alois Knoll

Publié 2026-08-31
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Rui Tu, Liguo Zhou, Alois Knoll

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : Des Unités d'Action aux Émotions

Énoncé du Problème

La reconnaissance des expressions faciales (FER - Facial Expression Recognition) reste contrainte par des défis pratiques tels que les variations d'illumination, les différences de pose et la rareté des données annotées. Les modèles de deep learning existants souffrent souvent d'une faible adaptabilité cross-domain, de surapprentissage (overfitting) et d'une interprétabilité insuffisante. De plus, bien que les modèles de langage de grande taille multimodaux (MLLM) offrent une compréhension sémantique avancée, ils manquent fréquemment de sensibilité pour percevoir les déformations géométriques faciales subtiles et les micro-expressions. Le réglage fin (fine-tuning) traditionnel de bout en bout des MLLM sur des signaux « vidéo-étiquette » néglige souvent les représentations intermédiaires fines (Unités d'Action - AU) qui sous-tendent les expressions émotionnelles, menant à des chaînes de raisonnement sous-optimales.

Méthodologie

Le papier propose un cadre de réglage fin en deux étapes avec fusion au niveau de la décision conçu pour combler le fossé entre la perception faciale de bas niveau et la sémantique émotionnelle de haut niveau.

1. Réglage fin progressif en deux étapes

La stratégie centrale décompose la FER en deux étapes d'apprentissage séquentielles pour parvenir à un « triple découplage » : la perception du raisonnement, la connaissance indépendante du domaine de la connaissance spécifique au domaine, et les observations physiques des étiquettes d'émotion.

  • Étape 1 : Réglage fin de la détection des AU (Perception)

    • Données : Utilise le jeu de données CAS(ME)³, qui fournit des annotations d'Unités d'Action (AU) au niveau de la trame.
    • Tâche : Reformule la reconnaissance des AU comme une tâche de Questions-Réponses Visuelles (VQA). Le modèle est instruit d'identifier les AU actives basées sur l'entrée visuelle, en exploitant les connaissances préalables du Facial Action Coding System (FACS).
    • Modèle : Le modèle multimodal Qwen3-VL-32B-Instruct est soumis à un réglage fin via LoRA (Low-Rank Adaptation) pour mettre à jour seulement un sous-ensemble restreint de paramètres (matrices Query et Value), préservant ainsi la connaissance visuo-sémantique pré-entraînée tout en apprenant la détection des AU.
    • Objectif : Établir des capacités perceptuelles robustes et indépendantes du domaine pour les micro-mouvements faciaux subtils.
  • Étape 2 : Réglage fin de la reconnaissance de l'expression (Raisonnement)

    • Données : Transfère vers le jeu de données FER-2013 (images statiques avec des étiquettes d'émotion mais sans annotations d'AU).
    • Tâche : Le modèle, initialisé avec les poids de l'Étape 1, est ensuite soumis à un réglage fin pour mapper les combinaisons d'AU détectées vers des catégories d'émotions. Le format de sortie exige que le modèle raisonne des AU vers l'étiquette d'émotion finale, en maintenant la structure VQA.
    • Stratégie : Seuls les nouveaux adaptateurs LoRA pour la reconnaissance des émotions sont optimisés ; l'encodeur visuel et les adaptateurs de l'Étape 1 restent gelés pour préserver la chaîne de raisonnement AU-vers-émotion.

2. Fusion au niveau de la décision

Pour répondre aux limites des grands modèles purs dans la perception des déformations géométriques fines, le cadre intègre le Qwen3-VL ajusté avec OpenFace 3.0, un modèle de FER spécialisé et léger basé sur des CNN.

  • Mécanisme : Une interpolation linéaire pondérée fusionne les distributions de probabilité (PVLMP_{VLM} et POpenFaceP_{OpenFace}) des deux modèles :
    Pfinal=αPOpenFace+(1α)PVLMP_{final} = \alpha \cdot P_{OpenFace} + (1 - \alpha) \cdot P_{VLM}
  • Raisonnement : OpenFace 3.0 apporte une sensibilité aux points de repère faciaux locaux et aux caractéristiques géométriques, tandis que le MLLM ajusté offre une compréhension sémantique de haut niveau et un raisonnement contextuel.

Principales Contributions

  1. Validation des lignes de base des grands modèles : Évaluation systématique des performances zero-shot et few-shot de Qwen3-VL-32B-Instruct sur la FER, établissant une ligne de base solide.
  2. Réglage fin en deux étapes guidé par les AU : Introduction d'un paradigme d'apprentissage curriculaire où le modèle apprend d'abord la détection des AU sur CAS(ME)³ avant de les mapper vers les émotions sur FER-2013. Cela permet au modèle d'acquérir des capacités d'inférence d'AU et de raisonner via une chaîne interprétable (« inférence d'AU d'abord, prédiction d'émotion ensuite »).
  3. Collaboration de modèles hétérogènes : Démonstration de la faisabilité de la fusion au niveau de la décision entre un grand modèle multimodal et un petit modèle spécialisé (OpenFace 3.0), validant leurs forces complémentaires.
  4. Performance empirique robuste : Montre que le cadre proposé surpasse significativement les lignes de base non ajustées et les modèles spécialisés autonomes, particulièrement en améliorant le rappel pour les classes minoritaires et en renforçant l'interprétabilité.

Résultats Expérimentaux

Les expériences ont été menées sur le test set de FER-2013 en utilisant des métriques incluant l'Exactitude (ACC), la Précision, le Rappel et le F1-Score.

  • Performance vs Lignes de Base :
    • Le Qwen3-VL ajusté a atteint une exactitude de 66,73 %, soit une amélioration de 8 points de pourcentage par rapport à la ligne de base non ajustée (58,73 %).
    • Le Modèle Fusionné (Qwen3-VL + OpenFace 3.0) a atteint 67,37 % d'exactitude.
    • Comparé aux CNN traditionnels, le modèle fusionné surpasse légèrement GoogLeNet (67,04 %) mais reste derrière ResNet-50 (69,33 %), VGG-16 (68,75 %) et DenseNet (69,38 %).
    • Bien qu'il ne surpasse pas les modèles CNN spécialisés optimaux en exactitude globale, le modèle fusionné démontre une Précision Pondérée (Weighted Precision) supérieure (69,47 %), comparable à ResNet50 (69,84 %).
  • Avantages de la Fusion :
    • Le modèle fusionné a montré une amélioration significative du Rappel Macro (62,71 %) par rapport au pur grand modèle (58,64 %), indiquant une meilleure capture des classes minoritaires (ex: dégoût, peur).
    • Comparé à OpenFace 3.0 seul (48,02 % d'exactitude), le cadre conjoint a amélioré l'exactitude de 19,35 points de pourcentage (amélioration relative de 40,3 %).
  • Interprétabilité : Le modèle a réussi à générer des explications en langage naturel liant des activations d'AU spécifiques (ex: AU4, AU7) aux jugements d'émotion, fournissant une chaîne de raisonnement traçable absente des CNN « boîte noire ».

Signification et Revendications

Le papier affirme que la stratégie de réglage fin en deux étapes proposée permet d'extraire efficacement des caractéristiques discriminantes pour les déformations géométriques faciales subtiles et les expressions de faible intensité à partir de grands modèles visuels, qui peinent généralement avec ces détails fins.

Les auteurs soutiennent que si les purs grands modèles visuels possèdent une formidable compréhension sémantique de haut niveau, ils présentent des limitations intrinsèques pour percevoir les déformations faciales subtiles. La méthode proposée répond à cela en :

  1. Améliorant l'Interprétabilité : L'utilisation des AU comme représentations intermédiaires permet des sorties de modèle traçables, augmentant la confiance.
  2. Améliorant la Robustesse : La fusion au niveau de la décision compense le manque de priors spatiaux fins des grands modèles, boostant significativement les performances sur les classes minoritaires et réduisant le biais envers les classes dominantes.
  3. Offrant une Nouvelle Voie : L'étude propose un paradigme technique pour construire des systèmes de FER hautement robustes et interprétables en exploitant les forces complémentaires des MLLM et des modèles géométriques spécialisés, validé par des résultats empiriques montrant des gains substantiels par rapport à l'inférence autonome de l'un ou l'autre type de modèle.

Les auteurs concluent que bien que l'exactitude actuelle ne surpasse pas encore les meilleurs CNN spécialisés absolus, le cadre démontre une supériorité claire en termes de confiance de prédiction, d'interprétabilité architecturale et de potentiel pour des applications synergiques de grands modèles dans l'informatique affective.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →