← Derniers articles
💬 NLP

A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

Cette étude révèle que, si les juges LLM et les examinateurs humains convergent sur les essais du barreau thaïlandais dotés de grilles d'évaluation claires, les LLM échouent systématiquement à reproduire une interprétation humaine minoritaire dans les cas ambigus, s'alignant à la place uniformément sur la vision humaine majoritaire et masquant ainsi leur incapacité à saisir l'ensemble du spectre des désaccords d'experts.

Auteurs originaux : Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

Publié 2026-05-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous organisez un concours à haut enjeu pour évaluer la qualité de dissertations juridiques. Vous disposez d'un manuel de règles très précis (la « grille d'évaluation ») qui indique aux correcteurs comment noter les réponses. Habituellement, la grille est claire : si la réponse est juste, attribuez une note élevée ; si le raisonnement est mauvais, attribuez une note basse.

Mais parfois, la grille atteint une « zone grise ». Elle ne précise pas exactement quoi faire lorsqu'un étudiant obtient la réponse finale correcte mais oublie de mentionner une citation juridique spécifique et cruciale. C'est la zone « silencieuse sur le plan réglementaire ».

Cet article présente une expérience en deux parties visant à observer comment des juges humains et des juges d'Intelligence Artificielle (IA) gèrent ces zones grises.

Partie 1 : L'« Examen » (Phase 1)

Tout d'abord, les chercheurs ont placé 8 modèles d'IA différents sur le « siège de l'étudiant ». Ils devaient rédiger des dissertations juridiques, tout comme 42 vrais étudiants en droit thaïlandais. Les modèles d'IA ont été notés à l'aveugle par des experts humains.

  • Le Résultat : Les modèles d'IA ont performé à peu près aussi bien que l'étudiant humain moyen. Certains étaient excellents, d'autres moyens, et d'autres ont lutté. Ils étaient tous « dans la course ».

Partie 2 : La « Correction » (Phase 2)

Ensuite, les chercheurs ont pris les mêmes dissertations et ont demandé à deux groupes de les noter :

  1. Le Panneau Humain : Trois véritables examinateurs juridiques certifiés.
  2. Le Panneau IA : Un vaste groupe de 26 modèles d'IA différents (incluant ceux qui avaient passé l'examen plus tôt, ainsi que de nombreux autres).

Ils ont fourni à tous exactement les mêmes quatre éléments à examiner : la question, la grille d'évaluation, la « réponse idéale » et la dissertation de l'étudiant.

La Grande Découverte : La « Rue à Sens Unique »

Les chercheurs ont découvert une scission fascinante, mais uniquement sur les questions pièges où la grille était silencieuse.

La Scission Humaine :
Les trois experts humains n'étaient pas d'accord.

  • Deux d'entre eux (B et C) ont déclaré : « L'étudiant a compris l'essentiel et le raisonnement était suffisant. Donnez-lui une note élevée (6–8). »
  • L'un d'entre eux (A) a déclaré : « L'étudiant a manqué une citation cruciale. Cela rend le raisonnement « inutilisable ». Donnez-lui une note très basse (1–2). »
  • Pensez-y comme à un arbitre sportif : Deux arbitres disent que le joueur était « en jeu », et un arbitre dit qu'il était « hors jeu ». Tous deux utilisent la même grille de règles, mais ils interprètent la zone grise différemment.

La Scission IA (L'Asymétrie) :
C'est ici que cela devient étrange. Les chercheurs s'attendaient à ce que les 26 modèles d'IA se divisent, certains soutenant peut-être l'humain strict (A) et d'autres les humains indulgents (B et C).

  • Ils ne l'ont pas fait.
  • 22 modèles d'IA sur 26 se sont rangés du côté des deux humains indulgents (B et C). Ils ont attribué des notes élevées.
  • 3 modèles d'IA étaient confus et ont attribué des notes intermédiaires.
  • Zéro modèle d'IA s'est rangé du côté de l'humain strict (A). Même l'IA qui a essayé d'être stricte (GPT-5.4 Nano) n'était pas suffisamment cohérente pour correspondre véritablement au style de l'humain strict.

La Métaphore :
Imaginez un groupe de 26 caméras différentes prenant une photo d'un tableau.

  • Les trois critiques d'art humains regardent le tableau et ne sont pas d'accord : deux disent que c'est un chef-d'œuvre, un dit que c'est un échec.
  • Vous demandez aux 26 caméras de décrire le tableau.
  • Le résultat : Toutes les 26 caméras sont d'accord avec les deux critiques qui ont qualifié l'œuvre de chef-d'œuvre. Aucune des caméras n'est d'accord avec le critique qui l'a qualifiée d'échec. Même si les caméras sont de marques, de tailles et de prix différents, elles « voient » toutes le tableau de la même manière, manquant complètement la perspective du critique strict.

Pourquoi cela compte-t-il ?

L'article soutient que lorsque nous construisons des systèmes d'IA pour noter des dissertations, nous choisissons généralement l'IA qui s'accorde le plus avec le « correcteur humain moyen ».

  • Parce que la majorité des humains dans cette étude (2 sur 3) étaient indulgents, l'IA a appris à être indulgente elle aussi.
  • L'IA n'a pas appris à être « équitable » d'une manière équilibrée ; elle a appris à être asymétrique. Elle s'est convergée vers l'opinion majoritaire et a complètement ignoré l'opinion minoritaire, même si cette opinion minoritaire constituait une interprétation juridique valide.

La Surprise du « Double Rôle »

Les chercheurs ont également remarqué quelque chose d'étrange concernant la personnalité de l'IA.

  • Les modèles d'IA qui étaient de mauvais étudiants dans la Phase 1 (ils ont obtenu de faibles notes sur leurs propres dissertations) sont devenus les juges indulgents les plus cohérents dans la Phase 2.
  • Les modèles d'IA qui étaient d'excellents étudiants dans la Phase 1 sont devenus seulement des juges « moyens ».
  • La Leçon : Être bon pour rédiger la réponse ne vous rend pas bon pour noter la réponse. Les compétences sont totalement différentes.

La Conclusion

L'étude montre que les juges IA sont très stables et cohérents entre eux, mais qu'ils ont un angle mort. Lorsque des experts humains ne sont pas d'accord sur une règle de zone grise, l'IA ne fait pas de compromis ni n'explore toutes les opinions valides. Au lieu de cela, elle choisit massivement l'opinion humaine « majoritaire » et ignore l'opinion « minoritaire ».

Si vous utilisez l'IA pour noter des dissertations, vous n'obtenez pas simplement une deuxième opinion ; vous obtenez un miroir qui reflète l'opinion majoritaire si fortement qu'il fait disparaître complètement l'opinion minoritaire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →