The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge
L'Atelier et Défi 2026 ACII sur les Conversations Dyadiques (DaiKon) présente une référence et un ensemble de données complets de 945 interactions dyadiques naturalistes et multilingues pour faire progresser la modélisation de l'affect interpersonnel et des dynamiques sociales à travers trois sous-défis axés sur l'influence directionnelle, le tour de parole et la prédiction de la trajectoire de la relation.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez deux personnes assises en face l'une de l'autre, en train de converser. Elles ne se contentent pas de se passer la parole tour à tour ; elles dansent. La blague de l'une fait rire l'autre ; l'hésitation de l'une fait que l'autre marque une pause ; elles tissent un sentiment de connexion (ou de « rapport ») au fil des minutes qui passent.
Pendant longtemps, les ordinateurs ont été performants pour analyser une seule personne dans une pièce — comme un chanteur solo frappant une note haute. Mais ils ont eu du mal à comprendre le duo : comment l'humeur de la personne A modifie celle de la personne B, comment ils coordonnent leur timing, et comment leur relation évolue.
Ce papier présente une nouvelle « salle de sport » pour les informaticiens appelée le Défi ACII-DaiKon. Il s'agit d'une compétition conçue pour apprendre aux ordinateurs à comprendre ces danses à deux personnes.
Voici une décomposition de ce qu'ils font, en utilisant des analogies simples :
1. L'ensemble de données : Une immense bibliothèque de conversations réelles
Les organisateurs ont construit une vaste bibliothèque appelée l'ensemble de données Hume-DaiKon.
- La Collection : Elle contient 945 conversations (plus de 743 heures de vidéo et d'audio) entre des paires de personnes.
- La Variété : Ce ne sont pas des pièces de théâtre scénarisées. Ce sont de vraies conversations naturelles entre des inconnus appariés en ligne. Ils parlent cinq langues différentes (anglais, allemand, espagnol, néerlandais et polonais).
- Le Dispositif : Imaginez un appel vidéo où deux personnes sont invitées à discuter de leur week-end ou de leurs vacances. Le système enregistre chacun d'eux séparément (ainsi l'ordinateur peut voir le visage de la personne A tout en écoutant la voix de la personne B) et capture tout, de l'intonation de la voix aux expressions faciales.
2. Les trois défis (les « épreuves »)
La compétition demande aux participants de construire des modèles d'IA capables de résoudre trois énigmes spécifiques basées sur ces conversations :
Énigme A : L'« Écho Émotionnel » (Influence)
- L'Objectif : Prédire comment se sent la personne B en ce moment même, en fonction de ce que la personne A vient de dire ou de faire.
- La Métaphore : Imaginez que la personne A est une girouette. Si la personne A a l'air en colère, l'humeur de la personne B change-t-elle pour s'aligner ? L'IA doit deviner si la personne B ressent de la « joie », de l'« anxiété » ou de l'« ennui » en se basant sur le comportement de l'autre personne.
- Le Piège : Il ne s'agit pas seulement de deviner ce que ressent la personne B dans le vide ; il s'agit de deviner comment la personne A a influencé ce sentiment.
Énigme B : Le « Passage de la Parole » (Tour de parole)
- L'Objectif : Prédire deux choses : Qui va parler ensuite, et quand ils commenceront à parler.
- La Métaphore : Pensez à un jeu de patate chaude. L'IA doit observer les joueurs et deviner : « Le locuteur actuel va-t-il lâcher la patate (arrêter de parler), ou va-t-il la retenir fermement ? Et s'il la lâche, combien de secondes s'écouleront avant que l'autre personne ne la rattrape ? »
- Pourquoi c'est difficile : Parfois, les gens parlent en même temps (chevauchement), parfois ils s'interrompent, et parfois il y a un long silence. L'IA doit repérer les indices subtils (comme une profonde inspiration ou un regard) qui signalent un changement.
Énigme C : Le « Thermomètre de la Relation » (Rapport)
- L'Objectif : Suivre comment la « connexion » entre les deux personnes change du début à la fin de la discussion.
- La Métaphore : Imaginez un thermomètre qui mesure à quel point deux personnes s'entendent bien. La température monte-t-elle (ils se lient d'amitié) ou descend-elle (ils sont mal à l'aise ou se disputent) au fur et à mesure que la conversation progresse ?
- Le Défi : L'IA doit examiner toute la conversation, pas seulement une phrase, pour voir si la relation se réchauffe ou se refroidit.
3. Les Outils : Ce que les ordinateurs utilisent
Pour résoudre ces énigmes, les chercheurs ont fourni aux participants un ensemble d'« yeux » et d'« oreilles » :
- Les Oreilles (Audio) : L'ordinateur écoute la voix en utilisant un outil appelé Whisper. Il transforme la parole en une liste de nombres qui capturent le ton, la vitesse et l'émotion de la voix.
- Les Yeux (Vidéo) : L'ordinateur observe les visages en utilisant un outil appelé FaceNet. Il transforme les expressions faciales en nombres qui capturent les sourires, les froncements de sourcils et les mouvements de tête.
- Le Résultat : L'ordinateur reçoit un flux de nombres pour les deux personnes, côte à côte, essayant de trouver des motifs.
4. Ce qu'ils ont découvert jusqu'à présent (Les résultats de référence)
Les organisateurs ont fait fonctionner quelques modèles d'IA « de démarrage » simples pour voir à quel point les énigmes étaient difficiles. Voici ce qu'ils ont découvert :
- La Voix est Reine : Pour les trois énigmes, l'ordinateur a beaucoup mieux réussi lorsqu'il écoutait simplement les voix que lorsqu'il regardait simplement les visages.
- Analogie : C'est comme essayer de comprendre une chanson en regardant les lèvres du chanteur plutôt qu'en écoutant la musique. La musique (voix) racontait beaucoup mieux l'histoire que le visuel (visage) dans ces tests spécifiques.
- Le Mélange n'a pas aidé (pour l'instant) : Lorsqu'ils ont essayé de combiner les yeux et les oreilles, les modèles simples ne se sont pas beaucoup améliorés. En fait, pour l'énigme du « Rapport », l'ajout de la vidéo a même légèrement fait baisser le score.
- Pourquoi ? C'est comme essayer de résoudre une énigme en portant des lunettes embuées. Les modèles simples se sont perdus à cause des données visuelles supplémentaires. Le papier suggère que nous avons besoin de moyens plus intelligents pour combiner les deux sens à l'avenir.
- Le Score : Les meilleurs modèles simples ont obtenu environ 40 % à 70 % de précision selon la tâche. Cela signifie que les ordinateurs commencent à saisir l'« essence » de la conversation, mais ils sont encore loin de comprendre la danse profonde et complexe de l'interaction humaine.
Résumé
Ce papier est une invitation aux informaticiens les plus brillants du monde à cesser de regarder les personnes isolément et à commencer à les regarder par paires.
Ils ont fourni les matières premières (la bibliothèque vidéo), les règles (les trois énigmes) et un point de départ (les modèles simples). L'objectif est de construire une IA qui n'entend pas seulement les mots, mais qui comprend le rythme, l'influence et la connexion entre deux personnes qui parlent l'une à l'autre.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.