← Derniers articles
💬 NLP

Quantifying and Predicting Disagreement in Graded Human Ratings

Cet article examine les schémas de désaccord dans les notations humaines graduées du langage inapproprié en proposant l'Indice d'Opposition pour quantifier la divergence de perspective et en démontrant que les caractéristiques textuelles peuvent modérément prédire à la fois la variance d'annotation et la difficulté des instances présentant des opinions humaines opposées.

Auteurs originaux : Leixin Zhang, Çağrı Çöltekin

Publié 2026-05-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Leixin Zhang, Çağrı Çöltekin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous organisez un concours où les participants doivent évaluer à quel point une phrase spécifique est « impolie ». Vous demandez à cinq juges différents d'examiner la même phrase et de lui attribuer une note de 0 (pas du tout impolie) à 4 (extrêmement impolie).

Parfois, les cinq juges sont parfaitement d'accord. Ils lui attribuent tous un « 0 ». D'autres fois, les juges sont divisés à parts égales : deux pensent qu'il s'agit d'un « 0 », et trois pensent qu'il s'agit d'un « 4 ». C'est ce que l'article appelle le désaccord.

Les chercheurs voulaient savoir deux choses :

  1. Peut-on examiner la phrase elle-même et deviner à quel point les juges seront en désaccord ? (Seront-ils tous d'accord, ou vont-ils se disputer ?)
  2. Peut-on deviner si les juges auront des opinions complètement opposées ? (La moitié de la salle pensera-t-elle que c'est inoffensif, tandis que l'autre moitié pensera que c'est terrible ?)

Voici comment ils ont abordé ce problème, en utilisant des analogies simples :

1. Le Problème : Tous les désaccords ne se valent pas

Par le passé, les chercheurs traitaient tous les désaccords de la même manière. Mais cet article affirme que c'est comme traiter un léger désaccord sur le choix du dîner de la même manière qu'une vive dispute politique. Certaines phrases sont si claires que tout le monde est d'accord (faible désaccord). D'autres sont délicates, ambiguës ou dépendent de valeurs personnelles, ce qui amène les juges à diviser leurs votes (fort désaccord).

Les chercheurs se sont concentrés sur le « langage inapproprié » (comme les discours de haine ou les commentaires toxiques) car ce sont les domaines où les opinions des gens entrent le plus en conflit.

2. Le Nouvel Outil : L'« Indice d'Opposition »

Pour mesurer à quel point les juges se disputent, les chercheurs ont inventé une nouvelle règle appelée l'Indice d'Opposition.

  • L'Analogie : Imaginez une balançoire.
    • Si tout le monde s'assoit au milieu, la balançoire est à plat. C'est le consensus (indice faible).
    • Si tout le monde s'assoit d'un seul côté, elle est penchée mais stable. C'est un fort accord d'un côté (indice faible).
    • Si la moitié des personnes s'assoient tout à gauche et l'autre moitié tout à droite, la balançoire est parfaitement équilibrée mais chaotique. C'est la polarisation (indice élevé).

L'« Indice d'Opposition » calcule exactement à quel point ce chaos est « équilibré ». Un score de 1 signifie que le groupe est parfaitement divisé entre deux opinions extrêmes. Un score de 0 signifie que tout le monde est sur la même longueur d'onde.

3. L'Expérience : Deviner le Chaos

Les chercheurs ont construit des modèles informatiques (IA) pour examiner une phrase avant que des humains ne l'évaluent et pour essayer de prédire :

  • La Variance : À quel point les notes seront-elles dispersées ? (Seront-elles toutes proches les unes des autres, ou éparpillées ?)
  • L'Opposition : Les notes seront-elles divisées en deux camps opposés ?

Ils ont essayé deux méthodes principales pour enseigner à l'IA :

  • Méthode A (Directe) : Dire à l'IA : « Devine simplement le nombre qui représente le désaccord. »
  • Méthode B (Distribution) : Dire à l'IA : « Devine la répartition complète du nombre de personnes qui choisiront 0, combien choisiront 1, etc., puis calcule le désaccord à partir de cela. »

4. Ce qu'ils ont découvert

  • L'IA est correcte pour deviner la « dispersion », mais pas parfaite. Les modèles informatiques pouvaient prédire le niveau de désaccord avec un taux de réussite « modéré ». C'est comme une prévision météorologique qui dit « il y a une chance de pluie » plutôt que « il va pleuvoir certainement ».
  • La Méthode B était légèrement meilleure. Il était plus utile d'enseigner à l'IA de prédire l'ensemble du tableau (la distribution des votes) plutôt que simplement le chiffre final du désaccord. En comprenant la forme des votes, l'IA a mieux appris la structure du désaccord.
  • L'IA peine avec les disputes extrêmes. Les modèles étaient bons pour repérer quand les gens étaient d'accord ou en désaccord modéré. Cependant, lorsque les juges étaient extrêmement polarisés (la balançoire était parfaitement équilibrée avec des personnes aux extrémités opposées), l'IA avait tendance à la sous-estimer. Elle prédisait une dispute « moyenne » alors qu'il s'agissait en réalité d'une dispute « énorme ».

5. Pourquoi cela arrive-t-il ?

L'article suggère plusieurs raisons pour lesquelles l'IA ne peut pas prédire parfaitement ces disputes extrêmes :

  • Événements rares : Il n'y avait tout simplement pas assez d'exemples de polarisation extrême dans les données d'entraînement pour que l'IA apprenne le motif.
  • Facteurs cachés : Parfois, le désaccord ne concerne pas les mots à l'écran. Il concerne la vie personnelle du juge, ses opinions politiques ou sa culture. L'IA ne peut lire que le texte, pas le cœur du juge.
  • Bruit : Si un juge passe une mauvaise journée et évalue quelque chose de manière étrange, cela peut fausser les calculs, rendant l'IA confuse.

La Conclusion

L'article conclut que, même si nous ne pouvons pas prédire parfaitement les disputes humaines simplement en lisant le texte, nous pouvons obtenir une estimation décente. La conclusion la plus importante est que certaines phrases sont intrinsèquement plus difficiles à juger que d'autres.

Les chercheurs suggèrent que, à l'avenir, lorsque nous aurons besoin d'étiqueter des données (comme entraîner une IA à détecter les discours de haine), nous ne devrions pas traiter chaque phrase de la même manière. Nous devrions consacrer plus de temps et plus de juges humains aux phrases que l'IA prédit comme générant le plus de désaccord, et économiser notre temps sur les cas faciles où tout le monde est d'accord.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →