← Derniers articles
💬 NLP

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

Ce papier présente le CLARIN-PT-LDB, un nouveau classement open source et ses benchmarks dédiés à l'évaluation des grands modèles de langage pour le portugais d'Europe, comblant ainsi un vide en matière d'évaluation de la langue, de la culture et de la civilité.

Auteurs originaux : João Silva, Luís Gomes, António Branco

Publié 2026-03-16
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : João Silva, Luís Gomes, António Branco

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que les grands modèles de langage (les IA qui écrivent, conversent et raisonnent) sont comme des super-élèves qui passent des examens. Jusqu'à présent, ces élèves étaient testés presque exclusivement en anglais, comme s'ils passaient le baccalauréat à Paris ou à New York, mais jamais à Lisbonne.

Voici l'histoire de ce papier, racontée simplement :

🇵🇹 Le Problème : L'élève qui ne parle pas la langue locale

Les chercheurs João, Luís et António ont remarqué un gros trou dans la couverture. Il existait des classements (des "leaderboards") pour mesurer l'intelligence des IA en anglais, en russe ou en turc, mais rien de spécifique pour le portugais d'Europe (celui qu'on parle au Portugal, différent du portugais du Brésil).

C'est comme si on évaluait un cuisinier portugais uniquement sur sa capacité à faire des hamburgers américains. On ne sait pas s'il sait faire un bon bacalhau ou s'il connaît l'histoire de Lisbonne. De plus, on ne savait pas si ces IA étaient capables de respecter la culture portugaise ou de dire "non" quand on leur demande de faire quelque chose de dangereux.

🏆 La Solution : Le "Grand Concours" CLARIN-PT-LDB

Pour combler ce vide, l'équipe a créé un nouveau classement, le CLARIN-PT-LDB. C'est une arène virtuelle où les IA viennent se tester en portugais d'Europe.

Ce concours est composé de 10 épreuves (des benchmarks), qui sont comme des matières scolaires différentes :

  1. L'épreuve de Culture (Tuguesice-PT) : C'est la plus originale. Imaginez un jeu de questions-réponses où l'IA doit répondre comme un vrai Portugais. Par exemple : "Quelle est la ville la plus au nord du pays ?" ou "Quel est le pont le plus long ?".

    • L'analogie : Si vous demandez à un touriste "Quelle est la capitale ?", il peut répondre "Lisbonne" s'il a appris par cœur. Mais si vous demandez "Quelle est la capitale ?" sans préciser le pays, un vrai Portugais comprendra qu'on parle de Lisbonne, tandis qu'une IA mal entraînée pourrait répondre "Brasilia" (le Brésil). Cette épreuve teste si l'IA a vraiment "l'esprit" portugais.
  2. L'épreuve de Sécurité (DoNotAnswer-PT) : C'est un test de "bon sens moral". On pose à l'IA des questions dangereuses ou illégales (comme "Comment faire une arnaque ?" ou "Décris un meurtre").

    • L'analogie : C'est comme un test de conduite où l'on regarde si le conducteur freine quand un enfant traverse la route. Si l'IA refuse poliment de répondre, elle gagne des points. Si elle obéit, elle échoue.
  3. Les épreuves de Raison et de Connaissances (MuSR, MMLU, GPQA, etc.) : Ce sont des traductions de tests très difficiles existants en anglais. Elles testent la logique, les sciences, les maths et la compréhension du langage.

    • L'analogie : C'est l'équivalent du "Grand Oral" ou d'un concours de culture générale très pointu, mais traduit dans la langue locale.

🤖 Comment ça marche ?

Contrairement à d'autres tests où l'IA doit juste choisir une lettre (A, B, C, D), ici, l'IA doit écrire sa réponse comme dans une vraie conversation. C'est plus difficile, mais c'est plus proche de la réalité (comme quand on parle à un chatbot).

L'équipe a utilisé de puissants ordinateurs pour faire passer ces tests à plusieurs modèles célèbres (comme Llama, Mistral, et un modèle portugais nommé Gervásio).

📊 Les Résultats (Le verdict)

Le tableau des résultats montre que :

  • Plus l'IA est "grosse" (plus elle a de données), mieux elle se débrouille généralement.
  • Le modèle Gervásio, qui a été spécialement entraîné sur des données portugaises, bat souvent son "frère" Llama (qui est plus généraliste) sur les questions de culture. C'est la preuve qu'il faut des "cours de rattrapage" locaux pour bien maîtriser une culture.

🚀 Pourquoi c'est important ?

Ce classement est ouvert. N'importe qui peut envoyer son propre modèle pour voir où il se place. C'est comme un site de sport où n'importe quel athlète peut venir courir sur le même terrain pour voir s'il est le plus rapide.

En résumé, ce papier dit : "Arrêtons de tester les IA uniquement en anglais. Pour qu'elles soient vraiment utiles en Europe, elles doivent comprendre notre culture, respecter nos valeurs et parler notre langue avec justesse."

Le classement est maintenant en ligne pour que tout le monde puisse comparer les performances de ces intelligences artificielles !

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →