LeWiDi-2025 at NLPerspectives: Third Edition of the Learning with Disagreements Shared Task
La troisième édition de la tâche partagée LeWiDi à NLPerspectives fait progresser le développement de l'IA sensible au désaccord en élargissant le benchmark à quatre tâches de TAL diversifiées avec des schémas d'étiquetage ordinal, en introduisant à la fois des paradigmes d'évaluation par étiquettes souples et perspectivistes avec de nouvelles métriques, et en fournissant de nouvelles ressources ainsi que des perspectives sur la modélisation de la variation du jugement humain.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot à comprendre le langage humain. Pendant longtemps, nous avons enseigné aux robots en leur montrant des exemples où tout le monde était d'accord sur la réponse, comme « 2 + 2 = 4 ». Mais dans la vraie vie, les humains sont souvent en désaccord. Une personne peut trouver une blague hilarante, tandis qu'une autre la trouve offensante. Une personne peut voir une phrase comme un mensonge, tandis qu'une autre y voit une opinion inoffensive.
Ce document décrit la troisième édition d'un « concours » (appelé LeWiDi-2025) conçu pour apprendre aux modèles d'IA à gérer ces désaccords, plutôt que de faire comme s'ils n'existaient pas.
Voici une décomposition simple de ce qu'ils ont fait, en utilisant quelques analogies de la vie quotidienne :
1. L'objectif : Apprendre à l'IA à écouter la foule
Au lieu de forcer l'IA à choisir une seule réponse « correcte », les organisateurs voulaient voir si l'IA pouvait comprendre l'ensemble du tableau des opinions humaines.
- L'ancienne méthode : Si 10 personnes votent pour un film, et que 6 disent « Bon » et 4 disent « Mauvais », l'ancienne IA dirait simplement : « La réponse est Bon ». Elle ignore les 4 personnes.
- La nouvelle méthode : On dit à l'IA : « Voici l'histoire complète : 6 personnes ont aimé, 4 n'ont pas aimé. Ton travail est de comprendre pourquoi ils ont ressenti cela et de prédire le mélange d'opinions. »
2. Les quatre « jeux » (Jeux de données)
Le concours a proposé aux participants quatre types différents d'énigmes à résoudre, chacune représentant un type différent de désaccord humain :
- Le jeu du sarcasme (CSC) : Imaginez lire un SMS. Est-ce un compliment sincère ou une pique sarcastique ? Différentes personnes évaluent à quel point c'est « sarcastique » sur une échelle de 1 à 6.
- Le jeu de l'ironie (MP) : Un court message et une réponse. La réponse est-elle ironique ? Cela a été joué dans 9 langues différentes (comme l'anglais, l'espagnol et l'arabe), montrant que l'ironie est un problème mondial.
- Le jeu de la paraphrase (Par) : Deux questions sont posées. Demandent-elles la même chose ? Au lieu d'un simple « Oui/Non », les gens ont évalué leur similitude sur une échelle de -5 à 5.
- Le jeu de la logique (VEN) : Une affirmation et un fait. Le fait prouve-t-il l'affirmation, la contredit-il, ou n'a-t-il rien à voir avec elle ? Ici, les gens ont également dû écrire des explications pour leurs réponses.
3. Les deux façons de jouer (Tâches)
Les participants devaient choisir entre deux approches différentes pour démontrer la compréhension de leur IA :
- Tâche A : Le « Prévisionniste météo » (Soft-Label)
Au lieu de deviner une réponse spécifique, l'IA agit comme un prévisionniste météo. Elle ne dit pas seulement « Il va pleuvoir » ; elle dit « Il y a 60 % de chances de pluie, 30 % de soleil et 10 % de neige ». L'IA prédit la distribution de la façon dont les humains voteraient. - Tâche B : Le « Lecteur de pensée » (Perspectiviste)
C'est plus difficile. L'IA doit deviner ce qu'une personne spécifique dirait. Si vous dites à l'IA : « Voici ce que la Personne X pense habituellement », l'IA doit prédire : « D'après l'historique de la Personne X, elle donnera probablement cette réponse ». C'est comme prédire si votre oncle grincheux ou votre tante optimiste sera d'accord avec une blague.
4. La nouvelle fiche de notation (Métriques)
Par le passé, les juges utilisaient une règle simple pour mesurer l'écart de l'IA. Mais cette règle ne fonctionnait pas bien pour des choses comme les « échelles de sarcasme » ou les « multiples langues ».
- La nouvelle règle : Ils ont inventé de nouvelles façons de mesurer le succès.
- Pour les « échelles » (comme de 1 à 6), ils ont utilisé une métrique qui comprend que s'écarter d'un point (dire 4 au lieu de 5) est mieux que de s'écarter de cinq points (dire 1 au lieu de 5).
- Pour la tâche du « lecteur de pensée », ils ont mesuré la capacité de l'IA à imiter les biais et les habitudes spécifiques de chaque individu.
5. Les résultats : Qui a gagné ?
Environ 15 équipes ont participé au concours. Voici ce qu'ils ont découvert :
- L'approche « Grand Cerveau » : Les meilleures équipes ont utilisé des Modèles de Langage Étendus (LLM) — le même type d'IA super intelligente qui écrit des essais et discute avec vous. Ces modèles étaient très doués pour examiner des exemples de la façon dont différentes personnes ont voté et copier ce schéma.
- L'approche « Petit mais costaud » : Certaines équipes ont utilisé des modèles plus petits et spécialisés. Ils ont obtenu des résultats étonnamment bons sur les jeux de données plus petits et plus complexes.
- L'ingrédient secret : Les systèmes gagnants ne se contentaient pas de regarder le texte ; ils regardaient qui écrivait le texte. Ils utilisaient des indices comme l'âge, le genre ou l'historique de vote de l'annotateur pour faire de meilleures suppositions.
- Le bonus de l'« Explication » : Sur le jeu de la logique, les équipes qui ont nourri l'IA avec les explications écrites par les gens (et pas seulement les réponses) ont obtenu de bien meilleurs résultats. C'est comme comprendre pourquoi quelqu'un a voté, et pas seulement comment.
6. Le bémol (Limites)
Les auteurs sont honnêtes sur ce qu'ils n'ont pas testé :
- Le problème du « Nouveau Visage » : Dans le monde réel, vous pouvez rencontrer un inconnu dont vous n'avez jamais vu l'opinion. Dans ce concours, l'IA a été testée sur des personnes qu'elle avait déjà « rencontrées » pendant l'entraînement. Nous ne savons pas encore si ces modèles peuvent gérer une personne totalement nouvelle.
- Texte uniquement : Le concours portait uniquement sur la lecture et l'écriture. Nous ne savons pas si ces méthodes fonctionnent pour les images, les vidéos ou la voix.
Résumé
Ce document est le bulletin de notes d'un concours qui a appris à l'IA à arrêter de prétendre que tout le monde est d'accord. En utilisant de nouvelles méthodes de notation et en se concentrant sur la réalité désordonnée des désaccords humains, les vainqueurs ont montré que les meilleurs modèles d'IA sont ceux qui peuvent observer une foule, comprendre les différentes voix qui la composent, et prédire le mélange d'opinions plutôt que de simplement choisir un vainqueur unique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.