← 最新の論文
💬 NLP

Jais 2: A Family of Arabic-Centric Open Large Language Models

Jais 2は、MBZUAI、Cerebras、およびInceptionによって開発された、アラビア語および文化に根ざしたベンチマークにおいて最先端の性能を、Cerebrasハードウェア上での高い推論速度とともに提供することを目的とした、70Bパラメータのバリアントを含む、オープンで商業的に許容されたアラビア語中心の大型言語モデルのファミリーです。

原著者: Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Eti
公開日 2026-08-17
📖 1 分で読めます☕ さくっと読める

原著者: Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Etienne Goffinet, Abhishek Maiti, Ali El Filali, Sarah AlBarri, Samujjwal Ghosh, Rahul Pal, Parvez Mullah, Awantika Shukla, Sajid siddiki, Samta Kamboj, Onkar Pandit, Sunil Kumar Sahu, AbdelRahman Elbadawy, Amr Mohamed, Ahmad Chamma, Evan Dufraisse, Abdelaziz Bounhar, Dani Bouch, Hadi Abdine, Guokan Shang, Fajri Koto, Yuxia Wang, Zhuohan Xie, Ali Mekky, Rania Elbadry, Sarfraz Ahmad, Momina Ahsan, Omar El Herraoui, Daniil Orel, Hasan Iqbal, Kareem Elzeky, Mervat Abassy, Kareem Elozeiri, Saadeldine Eletter, Farah Atif, Nurdaulet Mukhituly, Haonan Li, Xudong Han, Aaryamonvikram Singh, Zainul Abedien Ahmed Quraishi, Neha Sengupta, Larry Murray, Avraham Sheinin, Joel Hestness, Natalia Vassilieva, Hector Xuguang Ren, Zhengzhong Liu, Michalis Vazirgiannis, Preslav Nakov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに言葉を教えようとしている場面を想像してみてください。長い間、最高の教師の多くは英語の話し手でした。そのため、ロボットは英語を完璧に習得しましたが、他の言語、特にアラビア語のように豊かで複雑な言語にはつまずいてきました。アラビア語は、ニュースや書籍に使われるフォーマルな「深海」バージョンと、日常生活で使われる数十もの「浅瀬」のダイアレクト(方言)が存在する、広大な海のようなものです。さらに、文字と数字が混ざり合う独特の書き方もあります。これまでは、ほとんどのロボットが深海の部分しか知らなかったか、あるいは非常に限られた語彙しか持っていませんでした。この論文は、アラビア語という大海原へと深く潜り込むために特別に構築された新しいAIモデルのファミリー、「Jais 2」を紹介するものです。これらのモデルを、単に辞書を暗記しただけではなく、詩人、シェフ、宗教学者、そしておばあちゃんが語る夢の話を聞きながら育った、非常に賢い学生だと考えてみてください。彼らは、フォーマルなアラビア語とその多くの地域的なダイアレクトの両方を流暢に話すことを学びました。目標は、単に言葉を翻訳するだけでなく、アラビア語圏の文化、歴史、そして魂を真に理解するAIを創り出すことでした。

Jais 2の開発者であるUAE、Inception、Cerebrasのチームは、このAIの主に2つのバージョンを構築しました。一つは、小回りの利く80億パラメータの小型モデル、もう一つは、巨大な700億パラメータの巨人です。彼らは既存のロボットを微調整しただけではありません。6,000億個以上のアラビア語トークン(テキストの塊)と、1.6兆個の英語およびコードのトークンを用いた膨大なライブラリを使用して、これらのモデルをゼロから訓練しました。これを効率的に行うために、彼らはアラビア語専用に設計された専門的な辞書のような、15万語のカスタム「語彙」を作成しました。これにより、AIはより速く読み書きができるようになります。また、彼らは単なる事実だけでなく、文化的に特化したタスクをAIに与えるという特別な訓練レシピを用いました。具体的には、夢を解釈すること、詩を朗読すること、地域の料理を特定すること、そしてイスラム法に関する質問に答えることを学ばせたのです。

結果は、Jais 2がアラビア語における強力な存在であることを示しています。オープンソースのアラビア語モデルのリーダーボードでテストされた際、700億バージョンのモデルはトップの座を獲得し、アラビア語の文化、ダイアレクト、および一般的な知識において、Llama 3やQwen 2.5といった他の巨大なモデルを打ち破りました。さらに、より小さな80億バージョンも、その規模の他のほとんどのモデルよりも優れた性能を発揮しました。このAIは単に知識を得意としただけでなく、ある文章が17種類のアラビア語ダイアレクトのうちどれで書かれているかを識別したり、フォーマルなニュースレポートとカジュアルなメッセージの違いを理解したりといった、言語のニュアンスを扱うスキルも習得しました。また、アラビア語に注力したことでグローバルな言語を話すことを忘れてしまったわけではないことを証明するように、英語においても高いスキルを示しました。チームはモデルを誰でも利用できるように公開し、さらに、1秒間に2,000語を生成できる超高速ハードウェア上で動作するチャットアプリも構築しました。このAIは非常に優秀ですが、著者らは、複雑な数学や特定の英語の読解タスクにおいて、まだ成長の余地があることも示唆しています。しかし、これはAIをアラビア語圏の人々にとって真に身近で、文化的に意識の高いものにするための大きな飛躍を象徴しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →