UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding
Cet article présente UrduMMLU, un benchmark complet de plus de 26 000 questions à choix multiples en langue ourdoue issues de sources éducatives natives pour évaluer la performance de 30 grands modèles de langage, révélant des lacunes significatives dans leur compréhension du contenu ancré régionalement et des sujets de sciences humaines par rapport aux STIM.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez de tester l'intelligence d'un groupe d'étudiants. Pendant des années, vous n'avez pu leur soumettre que des tests rédigés en anglais. Vous savez qu'ils savent lire l'anglais, mais vous n'avez aucune idée s'ils comprennent réellement l'histoire, la littérature et les sciences de leur propre culture, ou s'ils ont simplement mémorisé les traductions anglaises de ces concepts.
Ce document présente URDUMMLU, un nouvel « examen » massif conçu spécifiquement pour la langue ourdou, parlée par plus de 230 millions de personnes. Voici la décomposition de ce qu'ils ont fait et de ce qu'ils ont trouvé, en utilisant quelques analogies simples.
1. Le Problème : L'enjeu du « Menu Traduit »
Jusqu'à présent, si les chercheurs voulaient tester les modèles d'IA sur l'ourdou, ils prenaient principalement des tests en anglais et les traduisaient.
- L'analogie : Imaginez essayer de juger la capacité d'un chef à cuisiner de la cuisine italienne authentique en lui donnant un menu traduit du français. Il pourrait avoir les bons mots, mais il pourrait passer à côté des nuances culturelles, des ingrédients locaux ou de la manière spécifique dont un plat est traditionnellement préparé.
- La réalité : Les benchmarks existants en ourdou étaient comme ces menus traduits. Ils ne capturaient pas la saveur unique de l'éducation, de la littérature ou de l'histoire locale (comme les études pakistanaises ou les études islamiques) de l'ourdou.
2. La Solution : Construire une « Salle d'Examen » Native en Ourdou
Les auteurs ont construit URDUMMLU, un benchmark comprenant 26 431 questions à choix multiples.
- D'où provenaient les questions ? Au lieu de traduire des questions anglaises, ils sont allés directement à la source : de véritables manuels scolaires pakistanais, des anciens sujets d'examen (SSC/HSSC) et des banques de questions locales en ourdou.
- Le système de « Double Vérification » : Comme certains de ces anciens examens ne comprenaient pas de corrigés, l'équipe a engagé 17 locuteurs natifs de l'ourdou (principalement titulaires de diplômes universitaires) pour agir comme « surveillants ».
- La règle : Deux surveillants devaient examiner chaque question et se mettre d'accord sur la réponse. S'ils n'étaient pas d'accord, ou si la question était défectueuse, la question était rejetée. Cela garantissait que les réponses « gold standard » étaient fiables à 100 %.
- Le champ d'application : L'examen couvre 26 matières, allant des Mathématiques et de la Physique (STEM) à la Littérature ourdoue, aux Études Islamiques et aux Études Pakistanaises.
3. Le Test : Mettre 30 Modèles d'IA dans la Salle d'Examen
Les chercheurs ont pris 30 modèles d'IA différents (certains « fermés » célèbres comme le Gemini de Google et d'autres en open-source) et leur ont soumis cet examen d'ourdou. Ils les ont testés de deux manières :
- Instructions en anglais : « Voici une question en ourdou, choisissez la réponse. » (L'instruction est en anglais).
- Instructions en ourdou : « یہاں ایک سوال ہے، جواب منتخب کریں۔ » (L'instruction est en ourdou).
4. Les Résultats : L'écart « STEM vs Culture »
Les résultats étaient révélateurs, comme un bulletin scolaire montrant qu'un élève est excellent en mathématiques mais incapable d'analyser de la poésie.
- Le meilleur performeur : Le modèle Gemini-3.5-Flash a été le grand vainqueur, avec un score de plus de 90 %. C'est le seul modèle à avoir franchi la barre des 85 %.
- L'écart de l'Open-Source : Le meilleur modèle open-source (DeepSeek-V4-Flash) a obtenu environ 82 %. Bien que performant, il accuse un retard d'environ 8 points sur le leader.
- Le « Crash des Humanités » : C'est la découverte la plus importante.
- L'analogie : Imaginez un étudiant capable de résoudre des équations de physique complexes (STEM) mais qui échoue lamentablement lorsqu'on lui demande d'analyser un poème ou d'expliquer un texte religieux (Humanités).
- La réalité : Presque tous les modèles ont bien mieux performé sur les questions de Sciences et de Mathématiques. Lorsque les questions passaient aux Littérature ourdoue, Langue ourdoue et Études Islamiques, de nombreux modèles chutaient de 25 à 40 points de pourcentage.
- Exemple : Un modèle peut obtenir 97 % en Physique mais seulement 67 % en Littérature ourdoue. Cela suggère que les modèles connaissent les faits scientifiques (qui sont universels) mais manquent de la compréhension culturelle et linguistique profonde requise pour les sujets locaux.
5. Autres Découvertes Surprenantes
- La langue des instructions n'avait pas beaucoup d'importance : Que l'IA ait reçu l'ordre de répondre en anglais ou en ourdou, le score ne changeait pratiquement pas. Le problème n'était pas la langue de l'instruction, mais l'absence de connaissances dans le « cerveau » du modèle concernant la culture ourdoue.
- L'apprentissage « Few-Shot » (La « Fiche de triche ») : Les chercheurs ont essayé de donner à l'IA quelques exemples de questions avant le test (comme une fiche de triche). Cela a aidé un peu (augmentant les scores de 1 à 3 points), mais cela n'a pas suffi à combler les grands fossés de connaissances culturelles.
- Les modèles « Spécifiques à l'Ourdou » : Curieusement, les modèles entraînés spécifiquement pour l'ourdou (comme Qalb et Alif) ont été assez peu performants (environ 35 %), souvent moins bien que les modèles généraux. Cela suggère que le simple entraînement sur du texte en ourdou ne suffit pas ; les modèles doivent être entraînés sur du matériel éducatif et de raisonnement, et non seulement sur du chat ou de l'actualité.
Résumé
URDUMMLU est comme un nouveau « examen du permis de conduire » strict pour l'IA en ourdou. Il prouve que si l'IA devient très douée pour répondre à des questions scientifiques en ourdou, elle a encore du mal à comprendre l'âme de la langue — sa littérature, son histoire et sa culture locale. Le « meilleur » IA actuel (Gemini) est un conducteur expérimenté, mais les modèles open-source sont encore en train d'apprendre les règles de la route, surtout en ce qui concerne les nuances culturelles du monde ourdophone.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.