← Derniers articles
💬 NLP

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

Cet article présente Math-PT, un nouveau jeu de données de référence composé de 1 729 problèmes mathématiques en portugais européen et brésilien, issus de concours et d'examens nationaux, qui révèle que, si les modèles de langage de pointe obtiennent de bons résultats sur les questions à choix multiples, leurs capacités déclinent sur les tâches visuelles et à réponse ouverte.

Auteurs originaux : Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

Publié 2026-04-30
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que les grands modèles de langage (LLM) sont comme des étudiants brillants ayant lu presque tous les livres de la bibliothèque mondiale. Depuis des années, nous testons leurs compétences en mathématiques à l'aide d'examens rédigés entièrement en anglais. C'est comme soumettre un étudiant à un test de conduite uniquement en anglais, puis supposer qu'il peut conduire parfaitement dans n'importe quelle langue simplement parce qu'il a réussi ce seul test.

L'article MATH-PT soutient que cette approche présente un énorme angle mort. Il introduit un nouveau « test de conduite » rédigé spécifiquement en portugais (dans ses variantes européenne et brésilienne) pour vérifier si ces étudiants en IA peuvent réellement gérer les mathématiques lorsque la langue change.

Voici la décomposition de leurs résultats à l'aide d'analogies simples :

1. Le Problème : La Bibliothèque « Uniquement Anglaise »

La plupart des benchmarks mathématiques (comme MATH ou MathVista) sont comme une bibliothèque où chaque livre est en anglais. Même lorsque les chercheurs tentent de tester d'autres langues, ils se contentent de traduire les livres anglais. Les auteurs affirment que cela est injuste car cela ne nous dit pas si l'IA comprend vraiment les concepts mathématiques ou si elle se contente de mémoriser des modèles anglais. Ils voulaient construire une bibliothèque de problèmes mathématiques nés en portugais, tirés de véritables olympiades et examens scolaires portugais et brésiliens.

2. Le Nouveau Test : MATH-PT

L'équipe a créé un ensemble de données appelé MATH-PT contenant 1 729 problèmes.

  • La Source : Ils ne se sont pas contentés de traduire ; ils ont fouillé dans les archives originales de compétitions comme les Olimpíadas Portuguesas da Matemática et l'OBMEP brésilienne.
  • La Variété : Le test couvre tout, des énigmes de cinquième année aux défis pré-universitaires.
  • Le Format : Il comprend des questions à choix multiples (comme une feuille de réponses à cocher) et des questions ouvertes (où il faut rédiger la réponse à partir de zéro). Crucialement, de nombreuses questions incluent des diagrammes et des figures (comme des formes géométriques), que l'équipe a soigneusement préservés à l'aide de code afin que l'IA puisse les « voir ».

3. Les Résultats : Le « Intelligent » vs Le « En Difficulté »

Ils ont testé 13 modèles d'IA différents, allant des modèles « frontier » les plus puissants (les super-génies) aux modèles open-source plus petits (les étudiants moyens).

  • L'Avantage des Questions à Choix Multiples : Considérez les questions à choix multiples comme un jeu de « Trouvez la différence ». Les modèles d'IA étaient très bons dans ce domaine. Même les modèles plus petits pouvaient souvent deviner correctement la bonne lettre (A, B, C, D ou E).
  • La Lutte en Ouvert : Lorsque le test est passé aux questions ouvertes (où l'IA doit générer elle-même la réponse), les scores ont chuté de manière significative. C'est la différence entre reconnaître un visage dans une file d'attente et dessiner ce visage de mémoire. L'IA a davantage lutté lorsqu'elle a dû « réfléchir » et écrire la réponse elle-même plutôt que de simplement en choisir une.
  • Le Problème de l'« Image » : C'était le plus grand obstacle. Lorsqu'une question incluait un diagramme (une image), les performances de l'IA ont plongé. Même les modèles les plus intelligents se sont perdus lorsqu'ils devaient interpréter une forme visuelle en plus du texte. C'est comme demander à un étudiant de résoudre un problème de géométrie tout en portant un bandeau sur les yeux ; ils peuvent lire les mots, mais ils ne peuvent pas « voir » la forme.

4. Les Gagnants et les Perdants

  • Les Champions : Les modèles « frontier » (comme GPT-5 et Qwen3-235B) étaient les clairs gagnants. Ils ont bien géré les mathématiques en portugais, en particulier les questions à choix multiples.
  • Les En Difficulté : Les modèles open-source plus petits (comme Llama-3 et Gemma-3) ont trouvé les mathématiques beaucoup plus difficiles. Leur précision a chuté brutalement à mesure que les questions devenaient plus difficiles ou incluaient des images.
  • L'Effet de Mise à l'Échelle : L'article a constaté que pour la famille de modèles Qwen, augmenter la taille du modèle (ajoutant plus de « puissance cérébrale ») a beaucoup aidé. C'est comme passer d'un vélo à une voiture de sport ; les modèles plus grands ont géré les tâches de raisonnement complexe bien mieux que les plus petits.

La Conclusion

L'article conclut que, bien que l'IA devienne très bonne en mathématiques, elle présente toujours un « biais linguistique » et lutte lorsque le test devient plus difficile (ouvert) ou visuel (diagrammes). En publiant cet ensemble de données en portugais, les auteurs offrent aux chercheurs une nouvelle règle plus équitable pour mesurer dans quelle mesure l'IA peut réellement penser dans des langues autres que l'anglais. Ils ne disent pas que l'IA est parfaite pour l'instant ; ils disent : « Voici un nouveau test pour nous montrer exactement où l'IA apprend encore. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →