Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
Cet article présente Magis-Bench, un nouveau benchmark dérivé des examens judiciaires brésiliens qui évalue 23 modèles de langage de pointe sur des tâches de raisonnement et de rédaction juridique de niveau magistrat, révélant que même les modèles les plus performants peinent à obtenir des scores élevés dans la production de décisions judiciaires motivées.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez une compétition de cuisine à haut risque. Habituellement, lorsque nous testons l'IA, nous lui demandons de cuisiner un plat (rédiger un argument juridique ou un contrat). Mais dans un véritable système juridique, le travail le plus important n'est pas seulement de cuisiner ; c'est d'être le juge qui goûte le plat, décide s'il est bon et explique pourquoi il réussit ou échoue.
Ce papier, Magis-Bench, porte sur le test de l'IA dans ce rôle de « juge ».
Le Problème : L'IA peut-elle être juge ?
La plupart des tests d'IA en droit demandent à l'ordinateur d'agir comme avocat : « Rédigez une défense pour ce client. » Mais un vrai juge doit faire quelque chose de plus difficile : écouter les deux parties, ignorer ses propres sentiments, appliquer des règles strictes et rédiger une décision finale qui résiste à l'examen critique.
Les auteurs voulaient savoir : Les modèles d'IA actuels peuvent-ils se comporter comme un vrai juge ?
Le Test : L'examen du « Magistrat »
Pour tester cela, les chercheurs n'ont pas inventé de fausses questions. Ils ont récupéré 74 questions réelles issues de concours très compétitifs brésiliens utilisés pour recruter de vrais juges entre 2023 et 2025.
Pensez à ces examens comme au « Bar Exam » pour les juges. Ils incluent :
- Questions de dissertation : « Voici une situation juridique désordonnée ; expliquez la loi. »
- Tâches de rédaction : « Voici les faits ; rédigez la sentence complète et officielle du tribunal (le verdict final). »
Crucialement, chaque question était accompagnée d'une corrigé officiel (une grille d'évaluation). C'est comme une feuille de notation d'enseignant qui indique exactement combien de points vous obtenez pour mentionner une loi spécifique ou suivre une structure particulière.
La Méthode : IA contre IA
Puisque recruter 23 juges humains pour noter 74 dissertations pour 23 modèles d'IA différents serait incroyablement coûteux et lent, les chercheurs ont utilisé un tour de passe-passe ingénieux : Ils ont laissé l'IA noter l'IA.
- Les Concurrents : Ils ont sélectionné 23 des modèles d'IA les plus intelligents disponibles (de sociétés comme Google, OpenAI, Anthropic et d'autres).
- Les Juges : Ils ont utilisé quatre autres modèles d'IA très puissants pour agir en tant que correcteurs.
- Les Règles : Les « IA Juges » ignoraient qui avait rédigé les réponses. Elles examinaient simplement la question, le corrigé officiel et la réponse de l'IA, puis attribuaient une note de 0 à 10.
Les Résultats : Les « Juges » IA se sont mis d'accord
Voici ce qui s'est passé :
- Les Juges s'entendaient : Les quatre juges IA étaient d'accord entre eux presque parfaitement (98,4 % d'accord). C'est comme avoir quatre critiques gastronomiques qui s'accordent tous exactement sur quel restaurant est le meilleur. Cela a donné aux chercheurs la confiance que les notes étaient équitables et non pas aléatoires.
- Les Gagnants : Les meilleurs performeurs étaient Gemini-3-Pro-Preview de Google (note : 6,97/10), suivi par Gemini-3-Flash et Claude-4.5-Opus.
- Le Réality Check : Même le « gagnant » n'a obtenu que 6,97 sur 10. Cela représente moins de 70 %.
Ce Que Cela Signifie
Le papier conclut que si l'IA s'améliore dans les tâches juridiques, se comporter comme un juge reste encore très difficile pour elle.
- L'Écart : Les modèles d'IA actuels ressemblent à des étudiants qui peuvent réciter le manuel mais peinent à appliquer les règles à une situation réelle et désordonnée avec la nuance et l'autorité d'un juge humain.
- La Référence : Les chercheurs ont publié toutes les questions, les réponses et le code de notation afin que d'autres scientifiques puissent continuer à tester et à améliorer ces modèles.
En bref : Nous avons demandé à l'IA de passer un véritable examen de juge. Les plus intelligents ont obtenu un « C » ou un « B », prouvant que si elles deviennent plus intelligentes, elles ne sont pas encore prêtes à remplacer les juges humains dans les tribunaux.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.