← Derniers articles
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

L'article présente Prosa, le premier benchmark de chat en portugais brésilien à plusieurs tours pour utilisateurs réels, et démontre que l'utilisation d'un score de rubrique binaire avec filtrage par plusieurs juges améliore considérablement la stabilité de l'évaluation et le pouvoir discriminatif par rapport aux méthodes traditionnelles de type LLM-as-a-judge holistiques.

Auteurs originaux : Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

Publié 2026-05-05
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de classer les meilleurs chefs d'une ville. Autrefois, vous auriez pu demander à un critique gastronomique de goûter un plat et de lui attribuer une note unique de 1 à 10. C'est ainsi que la plupart des modèles d'IA sont actuellement évalués : une IA « juge » lit une réponse et lui attribue une note globale unique.

Le problème, comme l'explique cet article, est que les différents critiques ont des goûts différents. L'un pourrait aimer la nourriture épicée, tandis qu'un autre la déteste. Si vous demandez à trois critiques différents de classer les mêmes 16 chefs, ils pourraient tous s'accorder sur le pire, mais être totalement en désaccord sur le meilleur. Cela rend le classement peu fiable.

La solution de l'article : la méthode « Liste de contrôle »

Les chercheurs derrière Prosa (un nouveau référentiel pour les chats d'IA en portugais brésilien) ont décidé de changer la donne. Au lieu de demander au juge : « Dans l'ensemble, quelle est la qualité de ce plat ? », ils ont fourni aux juges une liste de contrôle spécifique de questions binaires (Oui/Non).

  • Ancienne méthode (Globale) : « Notez cette conversation de 1 à 10. » (Subjectif, sujet aux biais).
  • Nouvelle méthode (Basée sur une grille) : « L'IA a-t-elle répondu à la question ? Oui/Non. Est-elle restée polie ? Oui/Non. A-t-elle évité d'inventer des choses ? Oui/Non. »

Pensez-y comme à un examen de conduite. Au lieu qu'un instructeur dise : « Vous avez conduit plutôt bien, je vous donne un 8 », il coche des cases spécifiques : « Avez-vous utilisé votre clignotant ? Oui/Non. Avez-vous arrêté au feu rouge ? Oui/Non. »

La magie du « Filtrage »

Les chercheurs ont réalisé que parfois, les éléments de la liste de contrôle eux-mêmes sont défectueux. Peut-être qu'une question est si facile que tous les chefs la réussissent, ou si difficile que tout le monde échoue. Ces « questions défectueuses » faussent le classement.

Ainsi, ils ont ajouté une étape de filtrage. Avant de finaliser les scores, ils ont soumis la liste de contrôle à une équipe de « contrôle qualité ». Ils ont éliminé les questions trop faciles, trop difficiles ou confuses. Cela leur a laissé un ensemble précis et de haute qualité de questions capables de réellement distinguer un bon chef d'un grand chef.

La grande découverte

Voici la partie la plus surprenante de leurs résultats :

  1. Le Juge compte moins que la Méthode : Lorsqu'ils ont utilisé l'ancienne méthode « 1 à 10 », trois juges IA différents (de différentes entreprises) ont produit des classements totalement différents pour les meilleurs chefs. Mais lorsqu'ils sont passés à la méthode « Liste de contrôle + Filtrage », les trois juges se sont mis d'accord sur exactement le même classement pour les 16 chefs.
  2. C'est moins cher : Parce que la liste de contrôle décompose la tâche en simples questions Oui/Non, vous n'avez pas besoin d'une IA « super-intelligente » et très coûteuse pour faire le jugement. Vous pouvez utiliser une IA moins chère et plus rapide (comme Gemini 3 Flash) et obtenir le même classement parfait. Cela coûte environ 2,10 $ pour évaluer un nouveau modèle avec cette méthode, contre des coûts beaucoup plus élevés pour d'autres méthodes.

Qu'est-ce que Prosa ?

Prosa est le premier référentiel de ce type pour le portugais brésilien.

  • Vie réelle : Au lieu d'utiliser des questions d'examen inventées (comme un examen scolaire), ils ont utilisé 1 000 conversations réelles que de vraies personnes ont eues avec une IA au Brésil. Cela capture la façon dont les gens parlent réellement, l'argot qu'ils utilisent et les vrais problèmes qu'ils tentent de résoudre.
  • Le Résultat : Ils ont classé 16 modèles d'IA différents. La première place est revenue au GPT-5.2 d'OpenAI, suivi de près par des modèles de Google et d'Alibaba. Fait intéressant, un modèle open-source (Qwen3-235B) a si bien performé qu'il a battu plusieurs modèles propriétaires coûteux.

En Résumé

L'article soutient que pour classer équitablement les modèles d'IA, nous devons cesser de demander aux juges une « impression » vague de qualité et commencer à utiliser une liste de contrôle stricte et filtrée de faits simples. Cette méthode élimine le biais du juge spécifique, rend le classement beaucoup plus stable et économise de l'argent, tout en utilisant des conversations réelles du Brésil comme terrain d'essai.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →