← Derniers articles
💻 computer science

An AI-Driven Multimodal Emotion-Aware Application Based on IFS Therapy

Cet article présente ANA, une application multimodale pilotée par l'IA qui intègre l'analyse du texte, de la parole et de la vidéo avec les principes de la thérapie des Systèmes Familiaux Intérieurs (IFS) afin de reconnaître avec précision les états émotionnels et les parties psychologiques internes des utilisateurs, atteignant une haute performance à travers les modalités pour permettre des interactions de santé mentale plus riches et incarnées.

Auteurs originaux : Mariam Elbishbeashy, Laura Lucas, Aya Hisham, Mohamed Ihab, Esraa A. Afify

Publié 2026-07-15
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Mariam Elbishbeashy, Laura Lucas, Aya Hisham, Mohamed Ihab, Esraa A. Afify

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : ANA – Une application multimodale pilotée par l'IA et sensible aux émotions basée sur la thérapie IFS

1. Énoncé du problème et motivation

Les systèmes actuels de soutien à la santé mentale utilisant l'intelligence artificielle sont principalement limités à des interactions unimodales basées sur le texte. Ces systèmes manquent souvent de la capacité à discerner les émotions humaines complexes qui sont transmises par le ton, les expressions faciales et les gestes des mains. De plus, les modèles multimodaux existants souffrent fréquemment de stratégies d'intégration faibles, telles qu'une simple concaténation de caractéristiques sans tenir compte des dépendances intermodales, et d'un manque d'alignement avec les théories psychologiques établies.

Plus précisément, il existe une lacune dans les modèles computationnels qui intègrent des données multimodales (texte, voix, vision, gestes) avec la thérapie des Systèmes Familiaux Internes (Internal Family Systems - IFS). L'IFS postule que l'esprit humain est composé de multiples "parties internes" distinctes (par exemple, le Critique Intérieur, le Protecteur, la Partie Submergée) possédant des profils émotionnels uniques. L'article soutient qu'une modélisation efficace de ces construits psychologiques nécessite une approche structurée qui cartographie les indices émotionnels hétérogènes vers des construits psychologiques spécifiques, une tâche que les systèmes unimodaux ne peuvent accomplir.

2. Solution proposée : Le modèle ANA

Les auteurs proposent ANA (A Multimodal Application for Modeling Emotional States and Adaptive Interaction), un système conçu pour imiter les concepts de la thérapie IFS. ANA utilise un paradigme d'apprentissage multimodal pour analyser les entrées de l'utilisateur à travers quatre modalités distinctes : le Texte, la Voix, les Expressions Faciales et les Gestes des Mains.

2.1 Architecture du système et flux de travail

Le système fonctionne via un flux de travail de "Session de Recadrage" (Reframe Session) :

  1. Contrôle d'accès : Avant l'interaction, le système valide le statut de l'utilisateur. Si un utilisateur possède trois ou plus de personnages internes "non guéris", l'accès aux entrées multimodales est restreint pour éviter de submerger l'utilisateur.
  2. Modalités d'entrée :
    • Vidéo : Extrait simultanément le texte, l'émotion vocale, les gestes des mains et les expressions faciales.
    • Texte uniquement : Traite l'entrée écrite.
    • Voix uniquement : Traite les signaux vocaux et le ton.
    • Note : Les entrées en arabe sont automatiquement traduites en anglais avant l'analyse.
  3. Traitement : Chaque modalité est traitée par un encodeur spécifique pour extraire les caractéristiques.
  4. Fusion : Un module de fusion intègre ces signaux pour mettre à jour le profil du personnage interne de l'utilisateur et fournir une évaluation de l'état émotionnel.
  5. Sortie : Le système identifie le "personnage interne" dominant et l'état émotionnel, stockant les données pour le suivi comportemental.

3. Méthodologie

3.1 Prétraitement des données

  • Texte : Comprend la normalisation, la tokenisation, la suppression des mots vides (stop-words), l'encodage du vocabulaire et le bourrage/tronquage (padding/truncation) pour créer des séquences de longueur fixe.
  • Voix : Inclut le rééchantillonnage (16 kHz), la réduction du bruit, la suppression du silence, le découpage en trames, et l'extraction de caractéristiques (MFCC, Chroma, spectrogramme de Mel, ZCR, RMS, centroïde spectral). Les caractéristiques sont standardisées et réduites via l'ACP (PCA).
  • Gestes des mains : Utilise MediaPipe pour détecter 21 points de repère (landmarks) de la main. Les coordonnées sont normalisées (translation et échelle) par rapport au poignet, aplaties en un vecteur de dimension 42, et préparées pour la classification.
  • Expressions faciales : Les images sont converties en niveaux de gris, redimensionnées en 48x48 pixels, et augmentées (rotation, cisaillement, zoom) pendant l'entraînement.

3.2 Encodeurs spécifiques aux modalités

Le système emploie des encodeurs spécialisés pour chaque type d'entrée :

  • Encodeur de Texte : Un modèle hybride CNN + BiLSTM. Les couches CNN extraient les caractéristiques de n-grammes locaux, suivies d'un max pooling et de couches BiLSTM pour capturer les dépendances à long terme. La sortie classifie le "personnage interne" (ex: Critique Intérieur, Protecteur).
  • Encodeur de Voix : Utilise des caractéristiques acoustiques artisanales (MFCC, hauteur, énergie) réduites via ACP (PCA) et classifiées à l'aide d'un algorithme des K plus proches voisins (KNN) pour reconnaître les états émotionnels.
  • Encodeur de Gestes des Mains : Un classifieur de type Perceptron Multicouche (MLP) qui traite les vecteurs de points de repère normalisés pour reconnaître les gestes statiques et dynamiques.
  • Encodeur d'Expressions Faciales : Un Réseau de Neurones Convolutifs (CNN) (basé sur la détection Caffe SSD/ResNet-10) qui classifie les émotions à partir d'images faciales.

3.3 Stratégies de fusion

L'article évalue trois approches de fusion :

  1. Fusion Précoce (Early Fusion) : Concaténation des caractéristiques avant la classification.
  2. Fusion Tardive (Late Fusion) : Chaque modalité prend une prédiction indépendante, qui est ensuite combinée via un vote pondéré.
  3. Fusion Hybride : Une combinaison de la fusion au niveau des caractéristiques et au niveau de la décision.
    Les résultats indiquent que la Fusion Tardive est la stratégie la plus efficace, car elle permet à chaque modalité de prendre des décisions indépendantes avant l'agrégation, rendant le système robuste aux entrées manquantes ou bruitées.

4. Résultats expérimentaux

4.1 Jeux de données

L'étude a utilisé divers jeux de données pour l'entraînement et l'évaluation :

  • Texte : Agrégé à partir de sources telles que Counseling, DailyDialog, GoEmotions et RedditMentalHealth (360 000 échantillons).
  • Voix : Jeux de données de référence incluant RAVDESS, TESS, CREMA-D, SAVEE et EMO-DB (4 800 échantillons).
  • Visage : FER-2013, AffectNet et CK+ (35 887 échantillons).
  • Gestes des mains : Un jeu de données personnalisé (ANAHandGestures.csv) créé avec MediaPipe (6 153 échantillons).

4.2 Métriques de performance

Les modèles unimodaux ont atteint les précisions suivantes :

  • Reconnaissance de l'émotion vocale (KNN) : 98 % (Performance la plus élevée ; attribuée à une forte séparabilité acoustique).
  • Classification du personnage interne par texte (CNN+BiLSTM) : 97 %.
  • Reconnaissance des gestes des mains (MLP) : 93 %.
  • Reconnaissance de l'émotion faciale (CNN) : 88 % (Plus faible en raison de la sensibilité à l'éclairage et au chevauchement des expressions).

4.3 Analyse

  • La Voix et le Texte ont été identifiés comme les prédicteurs les plus forts de l'état émotionnel et du personnage interne.
  • Le Visage et les Gestes des Mains servent de signaux complémentaires, fournissant un retour non verbal qui aide à résoudre les ambiguïtés du texte ou de la voix (ex: détecter un "Protecteur" cachant sa tristesse derrière un sourire).
  • Les Matrices de Confusion ont montré une dominance diagonale dans toutes les modalités, les erreurs se produisant principalement entre des classes émotionnelles similaires (ex: neutre vs triste).
  • L'analyse ROC a confirmé des valeurs AUC élevées pour toutes les modalités, indiquant une forte séparation des classes.

5. Contributions clés

L'article expose les contributions spécifiques suivantes :

  1. Modèle Multimodal Structuré : Développement d'un système intégrant quatre modalités (texte, voix, visage, geste) spécifiquement dans le cadre de l'informatique affective et de la thérapie IFS.
  2. Encodeurs Spécialisés :
    • Un encodeur de texte CNN-BiLSTM pour la classification du personnage interne.
    • Un système de reconnaissance d'émotion vocale PCA-KNN.
    • Un système de reconnaissance d'émotion faciale basé sur le CNN.
    • Un module de reconnaissance de gestes des mains léger basé sur MediaPipe.
  3. Fusion Multimodale : Implémentation d'un système de fusion qui combine ces modalités pour reconnaître à la fois les états émotionnels et les personnages psychologiques internes.
  4. Déploiement : Un service d'inférence web fonctionnel (basé sur Flask) avec une interface mobile qui gère l'analyse multimodale en temps réel, incluant la traduction Arabe-Anglais et le contrôle d'accès basé sur le statut psychologique de l'utilisateur.

6. Signification et affirmations

Les auteurs affirment que le modèle ANA va au-delà des systèmes de chatbots de santé mentale courants en créant un modèle d'interaction plus riche et incarné. En exploitant l'apprentissage multimodal, le système atteint une compréhension plus robuste de l'utilisateur que les systèmes unimodaux.

  • Validation de la Multimodalité : L'étude démontre que la combinaison des modalités compense les faiblesses individuelles (ex: ambiguïté du texte ou occlusion faciale), doublant efficacement la capacité de compréhension du système par rapport aux modes à entrée unique.
  • Alignement Thérapeutique : Le système parvient à mapper les sorties techniques de l'IA (reconnaissance d'émotions) vers des construits psychologiques (parties internes de l'IFS), comblant ainsi le fossé entre l'apprentissage profond et les modèles de thérapie clinique.
  • Utilité Pratique : L'architecture de déploiement supporte le traitement en temps réel et gère les défis du monde réel tels que le bruit, les variations d'éclairage et les modalités manquantes grâce à des stratégies de fusion adaptatives.

L'article conclut que, bien que les modalités individuelles aient des limites (ex: la précision de la reconnaissance faciale chute dans un mauvais éclairage), l'approche multimodale intégrée fournit une évaluation complète et sensible au contexte de l'état psychologique interne d'un utilisateur, validant l'efficacité du modèle proposé pour un soutien de santé mentale personnalisé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →