← Derniers articles
💬 NLP

Jais 2: A Family of Arabic-Centric Open Large Language Models

Jais 2 est une famille de grands modèles de langage ouverts et commercialement permissifs centrés sur l'arabe, incluant une variante de 70 milliards de paramètres, développée par MBZUAI, Cerebras et Inception pour offrir des performances de pointe sur les benchmarks arabes et culturellement ancrés avec une vitesse d'inférence élevée sur le matériel Cerebras.

Auteurs originaux : Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Eti
Publié 2026-08-17
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Etienne Goffinet, Abhishek Maiti, Ali El Filali, Sarah AlBarri, Samujjwal Ghosh, Rahul Pal, Parvez Mullah, Awantika Shukla, Sajid siddiki, Samta Kamboj, Onkar Pandit, Sunil Kumar Sahu, AbdelRahman Elbadawy, Amr Mohamed, Ahmad Chamma, Evan Dufraisse, Abdelaziz Bounhar, Dani Bouch, Hadi Abdine, Guokan Shang, Fajri Koto, Yuxia Wang, Zhuohan Xie, Ali Mekky, Rania Elbadry, Sarfraz Ahmad, Momina Ahsan, Omar El Herraoui, Daniil Orel, Hasan Iqbal, Kareem Elzeky, Mervat Abassy, Kareem Elozeiri, Saadeldine Eletter, Farah Atif, Nurdaulet Mukhituly, Haonan Li, Xudong Han, Aaryamonvikram Singh, Zainul Abedien Ahmed Quraishi, Neha Sengupta, Larry Murray, Avraham Sheinin, Joel Hestness, Natalia Vassilieva, Hector Xuguang Ren, Zhengzhong Liu, Michalis Vazirgiannis, Preslav Nakov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à parler à un robot. Pendant longtemps, les meilleurs professeurs étaient principalement des anglophones, de sorte que le robot a appris à parler l'anglais parfaitement mais a trébuché sur d'autres langues, en particulier celles aussi riches et complexes que l'arabe. L'arabe est comme un vaste océan avec une version en « eaux profondes » formelle utilisée pour les actualités et les livres, et des dizaines de dialectes en « eaux peu profondes » utilisés dans la vie quotidienne, en plus d'une façon d'écrire unique qui mélange lettres et chiffres. Jusqu'à présent, la plupart des robots ne connaissaient que les eaux profondes ou avaient un vocabulaire très limité. Ce document présente Jais 2, une nouvelle famille de modèles d'IA conçus spécifiquement pour plonger profondément dans l'océan arabe. Considérez ces modèles comme des étudiants super intelligents qui n'ont pas seulement mémorisé un dictionnaire ; ils ont grandi en écoutant des poètes, des chefs cuisiniers, des érudits religieux et des grands-mères racontant des histoires de rêves, tout en apprenant à parler l'arabe formel et ses nombreux dialectes locaux avec fluidité. Le but était de créer une IA qui ne se contente pas de traduire des mots, mais qui comprend véritablement la culture, l'histoire et l'âme du monde arabophone.

Les chercheurs derrière Jais 2, une équipe des Émirats arabes unis, d'Inception et de Cerebras, ont construit deux versions principales de cette IA : un modèle plus petit et agile de 8 milliards de paramètres et un géant massif de 70 milliards de paramètres. Ils n'ont pas simplement ajusté un robot existant ; ils ont entraîné ces modèles à partir de zéro en utilisant une immense bibliothèque de plus de 600 milliards de jetons (tokens) arabes (morceaux de texte) et 1,6 billion de jetons d'anglais et de code. Pour rendre cela efficace, ils ont créé un « vocabulaire » personnalisé de 150 000 mots, comme un dictionnaire spécialisé conçu pour l'arabe, ce qui aide l'IA à lire et écrire beaucoup plus vite. Ils ont également utilisé une recette d'entraînement spéciale qui consistait à nourrir l'IA non seulement de faits, mais de tâches culturellement spécifiques : apprendre à interpréter les rêves, réciter de la poésie, identifier des plats régionaux et répondre à des questions sur la loi islamique.

Les résultats montrent que Jais 2 est une puissance pour l'arabe. Lors de tests sur un classement de modèles arabes open-source, la version de 70 milliards a pris la première place, battant d'autres modèles géants comme Llama 3 et Qwen 2.5 dans la compréhension de la culture, des dialectes et des connaissances générales arabes. Même la plus petite version de 8 milliards a obtenu de meilleurs résultats que la plupart des autres modèles de sa taille. L'IA n'est pas seulement devenue bonne en faits ; elle a appris à gérer les nuances de la langue, comme identifier dans lequel des 17 dialectes arabes une phrase est écrite et comprendre la différence entre un rapport d'actualité formel et un message informel. Elle a également montré de solides compétences en anglais, prouvant que se concentrer sur l'arabe ne l'a pas fait oublier comment parler la langue mondiale. L'équipe a rendu les modèles accessibles à tous et a même construit une application de chat qui fonctionne sur un matériel super rapide, capable de générer 2 000 mots par seconde. Bien que l'IA soit très performante, les auteurs suggèrent qu'elle a encore une marge de progression, particulièrement dans les mathématiques complexes et certaines tâches de lecture en anglais, mais elle représente un bond en avant significatif pour rendre l'IA véritablement accessible et culturellement consciente pour le monde arabophone.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →