← Derniers articles
💬 NLP

PatiGonit22K: A Comprehensive Dataset for Solving Complex Bengali MWPs

Cet article présente PatiGonit22K, un ensemble de données complet et culturellement adapté de 22 441 problèmes mathématiques énoncés en bengali et annotés, conçu pour faire progresser la recherche en raisonnement mathématique et en traitement automatique des langues (NLP) éducatif pour les langues à faibles ressources.

Auteurs originaux : Swastika Kundu, Azizul Hakim Fayaz, Tashreef Muhammad

Publié 2026-07-28
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Swastika Kundu, Azizul Hakim Fayaz, Tashreef Muhammad

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les ordinateurs sont comme des étudiants brillants et affamés de savoir, capables de lire presque toutes les langues de la Terre, mais qui peinent lorsqu'il s'agit de résoudre des problèmes mathématiques textuels dans des langues qu'ils n'ont pas beaucoup étudiées. C'est le terrain de jeu de la « Compréhension du Langage Naturel », une branche de la science où nous apprenons aux machines non seulement à reconnaître des mots, mais à comprendre les histoires cachées à l'intérieur d'eux et les nombres que ces histoires décrivent. Pendant longtemps, ces étudiants informatiques ont eu énormément de livres d'exercices en anglais et en chinois, mais pour des langues comme le bengali, parlé par des centaines de millions de personnes, la bibliothèque était presque vide. Sans assez de problèmes d'entraînement, les ordinateurs ne pouvaient pas apprendre à raisonner à travers des questions complexes comme : « Si Rachel achète 7 chaises et 3 tables, et qu'il faut 4 minutes pour assembler chaque meuble, combien de temps prendra l'ensemble du travail ? » Cet article s'aventure dans cette bibliothèque vide pour construire un nouveau livre d'exercices massif, spécifiquement conçu pour aider les ordinateurs à devenir plus intelligents dans la résolution de puzzles mathématiques en bengali.

Les auteurs de cet article, une équipe de chercheurs issus d'universités de Dhaka, au Bangladesh, ont remarqué que si une collection précédente de problèmes mathématiques en bengali existait, elle était un peu trop simple. C'était comme une salle de sport avec seulement des haltères légers ; cela aidait les débutants, mais cela ne pouvait pas entraîner les muscles informatiques nécessaires pour les charges lourdes. Pour corriger cela, ils ont introduit PatiGonit22K, un nouveau jeu de données élargi contenant 22 441 problèmes mathématiques textuels. Considérez ce jeu de données comme un immense coffre au trésor de devinettes, soigneusement sélectionné. L'équipe n'a pas simplement fait des copier-coller ; ils ont pris des problèmes existants, les ont traduits avec un soin extrême pour s'assurer que les mots bengalis semblaient naturels et culturellement corrects, puis ont ajouté un énorme lot de nouveaux défis complexes.

La véritable magie de PatiGonit22K réside dans son mélange de niveaux de difficulté. Le jeu de données est divisé en deux groupes principaux : 5 412 problèmes « simples » qui impliquent une seule opération mathématique (comme seulement l'addition ou seulement la soustraction), et un impressionnant total de 17 029 problèmes « complexes » qui nécessitent de jongler avec plusieurs opérations à la fois (comme additionner, puis multiplier, puis diviser). Cet équilibre est crucial car il permet aux chercheurs de tester si un ordinateur peut gérer une tâche arithmétique de base ou s'il peut s'y perdre lorsque le problème devient complexe. Les chercheurs ont vérifié chaque problème avec une équipe d'experts bilingues pour s'assurer que les mathématiques étaient exactes et que la langue était claire, supprimant ainsi toute entrée confuse ou dupliquée.

Qu'est-ce que cela signifie pour l'avenir ? L'article suggère qu'en fournissant cette collection de problèmes plus large et plus diversifiée, les chercheurs peuvent enfin entraîner et tester les modèles d'intelligence artificielle pour voir s'ils comprennent réellement le mathématique en bengali. Des études précédentes avaient montré que les modèles pouvaient résoudre des problèmes simples en bengali avec une grande précision, mais ce nouveau jeu de données repousse les limites pour voir s'ils peuvent s'attaquer aux puzzles multi-étapes plus difficiles qui sont courants dans la vie réelle. Les auteurs présentent ce jeu de données comme un nouveau benchmark robuste, une règle standard contre laquelle les futurs modèles d'IA pourront être mesurés. Ils ne prétendent pas avoir résolu le problème du raisonnement de l'IA pour toujours, mais ils ont remis à la communauté scientifique de bien meilleurs petites roues et un parcours d'obstacles plus difficile pour garantir que la prochaine génération d'IA puisse véritablement réfléchir aux problèmes mathématiques en bengali, et non pas seulement deviner la réponse.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →