← Derniers articles
💻 computer science

CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition

L'article présente CALM-AH, un système d'ensemble multimodal amélioré par un mécanisme de consensus multi-experts à porte de fiabilité (RG-MEC) qui atteint un score Macro-F1 de 0,7771 lors du défi ABAW11 en combinant des branches de caractéristiques diverses avec une stratégie de correction à porte d'unanimité pour reconnaître l'ambivalence et l'hésitation au niveau vidéo.

Auteurs originaux : Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

Publié 2026-08-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes assis dans une pièce, essayant de déterminer si quelqu'un est véritablement incertain face à une décision importante. Cette personne pourrait dire : « Je pense que je vais y aller », mais sa voix vacille, elle marque de longues pauses et continue de regarder le sol du regard. Ou peut-être dit-elle : « Je suis tout à fait sûre », tout en s'agitant nerveusement. Ce mélange complexe de mots, de sons et de langage corporel est appelé ambivalence (avoir des sentiments partagés) ou hésitation (être incertain). C'est un état humain subtil qui se produit tout le temps, des entretiens d'embauche aux séances de thérapie, mais il est incroyablement difficile pour les ordinateurs de le détecter. Contrairement à un simple sourire ou une grimace, l'ambivalence est comme un code secret caché dans les interstices entre les mots, le rythme d'une voix et le minuscule tressaillement d'un muscle. Si nous pouvions apprendre aux machines à lire ces indices, nous pourrions construire de meilleurs outils pour aider les gens à faire des choix difficiles ou à mieux se comprendre. C'est le défi que un groupe de chercheurs de l'Université Monash s'est donné pour la résoudre.

Entrez dans l'ère de CALM-AH, une nouvelle équipe de détectives numériques conçue pour percer l'énigme de l'incertitude humaine. Les chercheurs ont réalisé qu'examiner un seul indice — comme lire uniquement la transcription ou seulement regarder le visage — revient à essayer de résoudre un mystère avec une seule photo floue. Il faut l'image complète. Ils ont donc construit un système qui agit comme un jury très organisé. Au lieu d'un seul juge, ils ont 15 « jurés » différents, chacun examinant une combinaison différente d'indices : certains écoutent la voix, d'autres lisent les mots, d'autres observent le visage, et certains suivent même les motifs statistiques étranges de la façon dont la personne se comporte.

Voici comment l'équipe travaille : d'abord, ils rassemblent toutes les preuves. Ils utilisent des outils d'IA intelligents pour transformer les paroles prononcées en texte, analyser le rythme et les pauses dans la voix, et scanner la vidéo pour les expressions faciales. Ensuite, ils mélangent et associent ces indices de 15 manières différentes. Pour chaque mélange, ils choisissent le meilleur « détective » (un type d'algorithme informatique) et lui apprennent exactement quand crier « Coupable ! » (Ambivalent) ou « Non coupable ! » (Non ambivalent). Ces 15 détectives votent ensuite sur la réponse finale. Si la majorité d'entre eux est d'accord, c'est le verdict. Cette partie du système, appelée CALM-AH, était déjà plutôt performante, obtenant un score de 0,7525 lors d'un test conçu pour voir si elle fonctionne sur des personnes qu'elle n'a jamais rencontrées auparavant.

Mais les chercheurs ne se sont pas arrêtés là. Ils savaient que même de brillants détectives font des erreurs. Parfois, un détective peut être confus par un bruit fort ou une phrase complexe. Ils ont donc ajouté un « filet de sécurité » spécial appelé RG-MEC (Reliability-Gated Multi-Expert Consensus). Considérez cela comme une règle très stricte pour modifier le verdict. Le système commence avec un « Juge par défaut » qui rend le premier appel. Pour changer l'avis de ce juge, il ne suffit pas qu'un autre expert soit en désaccord ; il faut que trois experts spécifiques soient tous d'accord sur la même nouvelle réponse au même moment.

Ces trois experts sont :

  1. CALM-AH (l'équipe de 15 détectives que nous venons de rencontrer).
  2. AffectGPT (une IA qui est très douée pour comprendre les émotions et les sentiments).
  3. Un vérificateur basé sur GPT (une IA qui est excellente pour comprendre le sens et la logique de ce qui est dit).

Si le Juge par défaut dit « Non ambivalent », mais que CALM-AH, AffectGPT et le Vérificateur crient tous ensemble « Ambivalent ! », alors le système change d'avis. Si même un seul d'entre eux est incertain ou en désaccord, le système s'en tient à la décision du juge original. Cela empêche le système d'être confondu par un expert bruyant. C'est comme un club où vous ne pouvez changer les règles que si trois membres spécifiques signent la pétition ensemble ; une seule personne qui se plaint ne suffit pas à inverser la tendance.

Le résultat ? Ce « filet de sécurité » a rendu le système plus aiguisé. En utilisant cette règle de vote unanime et stricte, le score final est passé à 0,7771. L'article montre que cette méthode est bien meilleure pour repérer la véritable incertitude sans être trompée par des pauses aléatoires ou des bruits accidentels. Les chercheurs ont découvert que simplement ajouter plus d'experts n'aide pas ; c'est la manière de les organiser qui compte. En donnant au « Juge par défaut » une ancre stable et en ne laissant le « Filet de sécurité » l'outrepasser que lorsque tout le monde est d'accord, le système devient plus fiable.

L'équipe a testé cela sur un ensemble de données de vidéos d'entretiens réels où les personnes des vidéos de test étaient complètement différentes de celles sur lesquelles le système a été entraîné. C'est crucial car cela prouve que le système ne fait pas que mémoriser des visages ; il apprend réellement à repérer le sentiment d'incertitude. L'article exclut explicitement l'idée que l'on puisse simplement faire la moyenne des opinions des experts ou laisser un seul expert fort l'emporter sur les autres. Au lieu de cela, ils ont trouvé qu'une « porte d'unanimité » stricte fonctionne le mieux. Bien que le système soit une grande avancée, les auteurs précisent avec prudence qu'il s'agit d'une solution spécifique pour ce défi particulier, et non d'une solution miracle pour toutes les émotions humaines. Mais pour déterminer quand quelqu'un est véritablement indécis, CALM-AH avec son filet de sécurité RG-MEC est un nouvel outil très intelligent dans la boîte.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →