← Derniers articles
💬 NLP

PARSE: An Open-Domain Reasoning Question Answering Benchmark for Persian

Cet article présente PARSE, le premier benchmark de questions-réponses de raisonnement en domaine ouvert pour le persan contenant 10 800 questions rigoureusement validées, ce qui répond à la rareté des ressources pour les langues à faibles ressources et démontre que le prompting et l'ajustement fin sur mesure améliorent considérablement les performances de raisonnement des LLM en persan.

Auteurs originaux : Jamshid Mozafari, Seyed Parsa Mousavinasab, Adam Jatowt

Publié 2026-02-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jamshid Mozafari, Seyed Parsa Mousavinasab, Adam Jatowt

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un groupe de robots très intelligents et multilingues à réfléchir, et non pas seulement à mémoriser. Vous possédez une immense bibliothèque de questions de test en anglais, mais les robots ont du mal avec une langue spécifique : le persan (parlé par environ 130 millions de personnes). Jusqu'à présent, il n'existait pas de bonne « salle de sport » ou de « terrain d'entraînement » en persan pour tester si ces robots pouvaient réellement raisonner face à un problème ou s'ils se contentaient de deviner.

Ce document présente Parse, la toute première salle de sport complète pour le raisonnement en persan.

Voici une décomposition de ce que les auteurs ont accompli, en utilisant des analogies simples :

1. Le Problème : Une boîte à outils manquante

Considérez les modèles de langage étendus (LLM) comme des étudiants brillants. En anglais, ces étudiants ont accès à des milliers d'examens d'entraînement (benchmarks) qui testent leur capacité à résoudre des énigmes logiques, à relier des points entre différents faits et à gérer des questions complexes.

Cependant, pour les locuteurs persans, la boîte à outils était vide. Les tests existants en persan étaient comme avoir seulement quelques feuilles d'exercices de mathématiques, mais aucun examen de sciences ou d'histoire. Ils étaient soit trop simples, soit concentrés sur un seul sujet spécifique (comme la médecine), soit ne testaient pas du tout le « raisonnement ». Les auteurs ont réalisé que pour savoir si un robot comprend vraiment le persan, ils avaient besoin d'un test qui couvrait tout.

2. La Solution : Construire « Parse »

L'équipe a construit Parse, une vaste collection de 10 800 questions. Pour que le test soit équitable, ils n'ont pas simplement écrit des questions au hasard ; ils ont construit un « menu » structuré de défis :

  • Les Formats : Ils ont créé trois types de questions, comme différents modes de jeu :
    • Booléen (Oui/Non) : Comme un videur de boîte de nuit demandant : « Est-ce vrai ou faux ? »
    • Choix multiples : Comme un jeu de quiz où vous choisissez la bonne réponse parmi quatre options.
    • Factuel (Factoid) : Comme une question de type « Jeopardy ! » où vous devez nommer des choses spécifiques (ex. : « Nommez les deux planètes les plus proches du soleil après la Terre »).
  • La Difficulté : Tout comme dans un jeu vidéo, les questions vont de « Facile » (passer une porte) à « Difficile » (escalader une montagne). Certaines nécessitent un simple rappel, tandis que d'autres nécessitent un raisonnement multi-étapes (Multi-hop) — ce qui est comme une chasse au trésor où vous devez trouver l'indice A, l'utiliser pour trouver l'indice B, puis enfin trouver la réponse.
  • Le Contrôle Qualité : Ils n'ont pas simplement demandé à une IA d'écrire ces questions et de s'arrêter là. Ils ont agi comme des éditeurs stricts. Ils ont utilisé des humains pour vérifier chaque question afin de s'assurer que le persan était naturel, que les faits étaient corrects et que la difficulté était réelle. Ils ont même vérifié que les questions « Difficiles » l'étaient parce qu'elles étaient complexes à analyser, et non parce que la grammaire était confuse.

3. L'Expérience : La course des robots

Une fois le test prêt, les auteurs ont mis divers modèles d'IA (les « étudiants ») à l'épreuve. Ils ont testé de grands modèles multilingues célèbres (comme LLaMA et Qwen) ainsi qu'un modèle spécifiquement entraîné pour le persan (appelé Dorna).

Ils ont essayé trois façons différentes de parler aux robots :

  • Zero-Shot (Zéro tir) : Poser la question directement, sans préparation.
  • Few-Shot (Quelques tirs) : Donner quelques exemples au robot au préalable (comme montrer un problème de mathématiques avant de lui demander d'en résoudre un nouveau).
  • Chain-of-Thought (Chaîne de pensée - CoT) : Demander au robot de « montrer son raisonnement » et d'expliquer ses étapes avant de donner la réponse.

Ce qu'ils ont découvert :

  • La langue compte : Les robots ont obtenu des performances nettement meilleures lorsque les questions et les instructions étaient en persan plutôt qu'en anglais. C'est comme raconter une histoire dans sa langue maternelle ; on en saisit bien mieux les nuances.
  • La stratégie compte : Pour les énigmes logiques (Oui/Non et Choix multiples), demander au robot de « réfléchir étape par étape » (Chain-of-Thought) a été le plus efficace. Pour les questions factuelles simples, donner des exemples (Few-Shot) a mieux fonctionné.
  • L'entraînement porte ses fruits : Lorsqu'ils ont pris un robot standard et l'ont fait « étudier » le jeu de données Parse (fine-tuning), il est devenu beaucoup plus intelligent. Le robot spécialisé en persan (Dorna) est devenu le champion après l'entraînement, prouvant que ce jeu de données est un outil puissant pour apprendre aux robots à réfléchir en persan.

L'essentiel

Parse est un jalon important. Il comble un immense vide dans la recherche en IA en fournissant un test de haute qualité, diversifié et rigoureux pour le raisonnement en persan. Il prouve que pour que l'IA soit réellement utile aux locuteurs persans, nous devons construire des outils spécifiques pour eux, et non pas simplement traduire les outils anglais. L'article montre qu'avec les bonnes données d'entraînement, l'IA peut apprendre à raisonner en persan aussi bien qu'elle le fait en anglais.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →