← Derniers articles
💬 NLP

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

Cet article présente BLUEX v2, un nouveau benchmark comprenant 395 questions ouvertes issues des principaux concours d'entrée à l'université du Brésil (2022–2025) pour évaluer 21 modèles de langage de pointe sur des tâches discursives en portugais, révélant des écarts de performance significatifs et mettant en évidence des défis dans le raisonnement mathématique et la compréhension d'images.

Auteurs originaux : João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

Publié 2026-06-23
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez testé l'intelligence d'un groupe de robots en leur posant des questions à choix multiples simples, du type « Quelle est la couleur du ciel ? A) Bleu, B) Rouge ». Ils ont très bien réussi à choisir la bonne lettre. Mais les chercheurs derrière cet article, BLUEX v2, ont réalisé que choisir une lettre est facile. Le véritable test d'intelligence, c'est d'écrire un essai complet, d'expliquer pourquoi le ciel est bleu, et de dessiner un diagramme pour le prouver.

Cet article présente un nouvel « examen final » beaucoup plus difficile pour les modèles d'IA, spécifiquement conçu pour tester leur capacité à parler et à écrire en portugais.

Voici la décomposition de leur travail en utilisant des analogies simples :

1. Le problème : Le piège du « choix multiple »

Auparavant, les chercheurs testaient l'IA sur les examens d'entrée des universités brésiliennes, mais seulement pour la première phase. Considérez la première phase comme un jeu de culture générale où l'on se contente de cocher la bonne réponse. Il est facile pour une IA de deviner ou de reconnaître des schémas.

La deuxième phase de ces examens (celle sur laquelle BLUEX v2 se concentre) ressemble à une soutenance de thèse finale. Les étudiants doivent rédiger des réponses longues et détaillées, résoudre des problèmes mathématiques complexes étape par étape, et interpréter des cartes ou des graphiques. Les anciens tests ne pouvaient pas mesurer si une IA pouvait réellement penser et écrire comme un humain ; ils mesuraient seulement si elle pouvait reconnaître la bonne réponse.

2. La solution : Un nouvel « examen final » pour l'IA

L'équipe a créé BLUEX v2, un immense ensemble de données comprenant 395 questions réelles issues des meilleures universités du Brésil (UNICAMP et USP) entre 2022 et 2025.

  • Les Questions : Il ne s'agit pas seulement de texte. Environ 56 % d'entre elles incluent des images, des graphiques ou des cartes que vous devez comprendre pour répondre correctement.
  • Le Format : L'IA doit rédiger des réponses libres, et non choisir A, B, C ou D.
  • Les Sujets : Cela couvre 9 matières différentes, de l'Histoire et la Sociologie à la Physique et les Mathématiques.

3. Comment ils ont noté les robots : L'« IA professeur »

Noter un essai de 5 pages est difficile pour des humains à faire rapidement pour des milliers de tests. Ainsi, les chercheurs ont construit un système où une IA joue le rôle du professeur.

  • La Grille de correction : D'abord, ils ont utilisé une IA pour lire la « réponse correcte officielle » et la décomposer en une liste de contrôle (une grille). Par exemple, si la réponse doit mentionner « l'ATP » et la « contraction musculaire », la liste de contrôle contient ces deux éléments.
  • Le Juge : Une autre IA (le « Juge ») lit la réponse du robot étudiant et coche les éléments de la liste. A-t- de mentionné l'ATP ? Oui. A-t-elle mentionné la contraction musculaire ? Non.
  • Le Score : Le robot reçoit une note de 0 à 10 basée sur le nombre d'éléments de la liste de contrôle qu'il a atteints.
  • La Preuve : Pour s'assurer que l'« IA professeur » n'était pas en train d'halluciner, ils ont comparé sa notation par rapport à de vrais professeurs humains. L'IA était d'accord avec les humains 89,5 % du temps. C'est un score très élevé, prouvant que la notation automatisée est fiable.

4. Les Résultats : Qui a réussi et qui a échoué ?

Ils ont testé 21 modèles d'IA différents (les « robots ») sur cet examen.

  • L'Écart : Les scores allaient d'un bas de 4,18 à un haut de 9,10. Cela montre que le test est efficace pour distinguer un robot intelligent d'un robot moins intelligent.
  • Les Gagnants : Les meilleurs performeurs étaient des modèles géants et coûteux comme Gemini 3.1 Pro et GPT-5.
  • Les Perdants : Les modèles plus petits et en open-source ont eu des difficultés, avec les scores les plus bas autour de 4,18.
  • Les Étoiles Brésiliennes : Curieusement, les modèles fabriqués au Brésil (Sabiá-4) ont très bien performé, presque aussi bien que les géants mondiaux, montant que l'entraînement local aide.

5. Les « Parties Difficiles » : Là où les robots trébuchent

Même les meilleurs robots ont eu des problèmes avec deux choses spécifiques :

  1. Le Raisonnement Mathématique : C'était la matière la plus difficile. Tout comme un humain qui peut écrire une excellente histoire mais qui ne sait pas faire une division longue, les IA pouvaient écrire de magnifiques essais en portugais mais faisaient souvent des erreurs dans les étapes mathématiques.
  2. La Compréhension d'Images : Lorsqu'une question incluait un graphique ou une carte, les scores des robots chutaient d'environ 0,5 point en moyenne. C'est comme donner à un élève un problème de mathématiques mais en dessinant les chiffres sur un morceau de papier froissé ; l'IA avait du mal à « voir » les détails assez clairement pour résoudre le problème.

6. Le Coût du Test

Les chercheurs ont été transparents sur le prix. Faire tourner toute cette expérience — poser les questions, générer les descriptions d'images et noter les réponses — a coûté environ 127 $. C'est étonnamment peu cher pour une étude de cette taille, montrant que nous pouvons tester l'IA rigoureusement sans dépenser des millions.

L'essentiel

BLUEX v2 est une nouvelle norme plus exigeante pour tester l'IA en portugais. Elle dépasse le simple jeu de culture générale et force l'IA à écrire, à raisonner et à regarder des images. Les résultats montrent que, bien que l'IA devienne très douée pour écrire et argumenter en portugais, elle éprouve encore des difficultés avec les mathématiques complexes et l'interprétation des données visuelles. Ce benchmark offre aux chercheurs une carte claire pour savoir où concentrer leurs prochaines améliorations.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →