Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks
Ce papier révèle que les juges basés sur des LLM présentent une incohérence intra-évaluateur significative entre différentes exécutions, ce qui compromet la fiabilité de leurs scores, et examine si de telles évaluations peuvent néanmoins être exploitées efficacement grâce à des directives spécifiques.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'idée principale : Le Juge « Montagne-Russe »
Imaginez que vous engagez un critique gastronomique célèbre pour évaluer un nouveau restaurant. Vous lui demandez de goûter le même plat trois fois de suite, assis à la même table, avec la même serviette devant lui.
- Goût 1 : Il lui donne une note de 5 étoiles, le qualifiant de « chef-d'œuvre ».
- Goût 2 : Il lui donne une note de 2 étoiles, le qualifiant de « fade et trop cuit ».
- Goût 3 : Il lui donne une note de 4 étoiles, disant qu'il est « correct mais qu'il a besoin de plus de sel ».
Si cela se produisait, vous ne feriez plus confiance à ce critique. Vous réaliseriez que son jugement est comme une roue de la fortune : elle tourne et atterrit sur un chiffre différent à chaque fois, même si la nourriture (l'entrée) n'a jamais changé.
C'est exactement ce que les chercheurs ont découvert lorsqu'ils ont demandé aux Grands Modèles de Langage (LLM) d'agir comme juges pour d'autres textes générés par l'IA. Ils ont découvert que ces juges IA souffrent de la « Roulette des Notes ».
Le Problème : Le Juge IA ne peut pas être d'accord avec lui-même
Dans le monde de l'IA, nous utilisons souvent une IA pour noter le travail d'une autre IA. Cela s'appelle « LLM-comme-Juge ». C'est populaire car c'est plus rapide et moins cher que d'engager des humains.
Cependant, les chercheurs ont mené un test simple :
- Ils ont pris un texte (comme un résumé d'actualité ou une conversation de chat).
- Ils ont demandé au même juge IA de le noter trois fois en utilisant les instructions exactes.
- Ils ont vérifié si l'IA donnait la même note à chaque fois.
Le Résultat : Les juges IA étaient complètement incohérents.
- Sur une tâche appelée SummaC (vérifier si un résumé est factuellement vrai), le meilleur juge IA n'était d'accord avec lui-même que dans environ 79 % des cas.
- Sur une tâche appelée MT-Bench (classer des conversations de chatbots), l'accord a encore baissé. Un juge IA n'a donné exactement la même réponse trois fois de suite que pour seulement 61 % des cas.
C'est comme si l'humeur du juge changeait à chaque fois que vous posez une question, même si la question et la réponse n'ont pas changé.
Le « Tour de Magie » qui se retourne contre lui
Vous pourriez penser : « D'accord, disons simplement à l'IA d'arrêter d'être aléatoire. Désactivons la partie « lancer de dés » de son cerveau pour qu'elle donne toujours la même réponse. »
Les chercheurs ont essayé cela. Ils ont réglé l'IA pour qu'elle soit 100 % déterministe (sans aléatoire).
- Est-elle devenue cohérente ? Oui.
- Est-elle devenue un meilleur juge ? Non.
En fait, lorsqu'ils ont forcé l'IA à arrêter de lancer les dés, ses notes sont devenues pires par rapport aux juges humains. C'est comme forcer un chef à utiliser exactement la même recette à chaque fois ; il pourrait arrêter de faire des erreurs, mais il arrête aussi d'être créatif ou adaptable, et la nourriture finit par avoir un goût pire.
Le papier suggère qu'il existe un compromis : pour obtenir une bonne note qui correspond à l'opinion humaine, l'IA a besoin d'un peu de « hasard » (variabilité). Mais ce même hasard rend l'IA incohérente avec elle-même.
La Comparaison Humaine : Les Humains sont-ils meilleurs ?
Les chercheurs ont également examiné les juges humains pour voir si c'était un problème propre à l'IA.
- Experts Humains : Lorsque des experts notaient le même texte, ils étaient raisonnablement d'accord entre eux, mais pas parfaitement.
- Travailleurs de Foule : Lorsque des gens ordinaires (travailleurs de foule) notaient le texte, ils étaient souvent en désaccord les uns avec les autres et avec les experts.
- La Surprise : Dans certains cas, les juges IA étaient en fait plus cohérents avec eux-mêmes que les humains ne l'étaient entre eux. Cependant, parce que les scores de l'IA étaient si volatils, il est difficile de dire si l'IA est réellement « juste » ou simplement « chanceuse ».
Pourquoi cela importe-t-il ? (L'analogie de la « Règle Cassée »)
Imaginez que vous essayez de mesurer la hauteur d'un arbre.
- L'Ancienne Façon : Vous utilisez une règle légèrement tordue. Elle n'est pas parfaite, mais elle est stable.
- La Nouvelle Façon (Juge LLM) : Vous utilisez une règle en caoutchouc. Parfois elle s'étire, parfois elle rétrécit. Même si vous mesurez le même arbre trois fois, vous obtenez trois chiffres différents.
Si vous utilisez une règle en caoutchouc, vous ne pouvez pas faire confiance à la mesure. Le papier soutient que l'utilisation d'un LLM comme juge est actuellement comme utiliser une règle en caoutchouc.
- Si vous lancez le test une fois, vous obtenez un score.
- Si vous le lancez à nouveau, vous obtenez un score différent.
- Si vous le lancez une troisième fois, vous obtenez un troisième score.
Parce que le score change à chaque fois, nous ne savons pas si l'IA est réellement bonne pour juger de la qualité, ou si elle devine simplement.
Qu'ont-ils trouvé dans différentes tâches ?
Les chercheurs ont testé trois types différents de « jeux » que l'IA devait jouer :
- Vrai ou Faux (SummaC) : Le résumé est-il factuellement correct ? (Choix binaire).
- Résultat : Les juges IA étaient incohérents, mais les modèles plus récents et plus grands étaient légèrement meilleurs.
- L'Avis de 1 à 5 Étoiles (SummEval) : Notez le résumé sur la « Cohérence », la « Fluidité », etc.
- Résultat : L'IA était très incohérente, surtout sur la « Fluidité » (à quel point le texte sonne bien). Fait intéressant, l'IA était parfois meilleure pour juger la fluidité que les humains ne l'étaient pour s'accorder entre eux.
- La Bataille Royale (MT-Bench) : Lequel des deux chatbots a donné la meilleure réponse ?
- Résultat : C'était la tâche la plus difficile. Les juges IA étaient extrêmement volatils ici, changeant souvent d'avis sur lequel des chatbots était meilleur.
La Conclusion : Comment Réparer la Roue de la Fortune
Le papier offre quelques conseils pratiques pour les personnes qui souhaitent utiliser des juges IA :
- Ne faites pas confiance à une seule exécution : Si vous demandez à une IA de noter quelque chose, ne prenez pas simplement la première réponse. Demandez-lui de le noter trois fois et prenez la moyenne ou le vote majoritaire. Cela lisse l'effet « roulette » et donne un score plus proche de ce qu'un humain dirait.
- Ne désactivez pas le hasard : Même si le hasard cause de l'incohérence, le désactiver complètement rend l'IA moins bonne pour correspondre aux opinions humaines. Vous avez besoin d'un peu de chaos pour obtenir la bonne réponse.
- Vérifiez votre propre cohérence : Avant de faire confiance à un juge IA, vous devriez vérifier s'il est d'accord avec lui-même. S'il ne peut pas être d'accord avec lui-même, il ne pourra probablement pas être d'accord avec vous non plus.
Résumé
Le papier révèle que les juges IA sont actuellement peu fiables car ils donnent des réponses différentes à la même question à chaque fois qu'ils sont interrogés. Ils sont comme une roue de la fortune plutôt qu'une balance stable. Bien que les modèles d'IA plus récents soient légèrement plus cohérents, ils continuent de lutter pour être fiables. La meilleure solution pour l'instant est de demander à l'IA de jouer le jeu plusieurs fois et de moyenner les résultats, plutôt que de faire confiance à un seul « tour » de la roue.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.