← 最新の論文
🤖 AI

Soro: A Lightweight Foundation Model and Chatbot for Tajik

本論文は、Gemma 3 を基盤とし、タジキスタン語のタスクおよび教育分野において卓越した性能を達成しつつ、英語能力を維持し、量子化による効率的なエッジ展開をサポートする軽量でタジキスタン語に特化した会話型 LLM のファミリーである Soro を紹介する。

原著者: Stanislav Liashkov, Haitz Sáez de Ocáriz Borde, Azizjon Azimi, Khushbakht Shaymardonov, Shuhratjon Khalitbekov, Bonu Boboeva

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Stanislav Liashkov, Haitz Sáez de Ocáriz Borde, Azizjon Azimi, Khushbakht Shaymardonov, Shuhratjon Khalitbekov, Bonu Boboeva

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界を、巨大で賑やかな図書館だと想像してみてください。長年、この図書館は英語と中国語の書籍でほぼ満たされており、他の言語に割り当てられた本棚はごくわずかでした。もしあなたがタジク語(タジキスタンで話され、キリル文字で表記され、ペルシャ語と関連する言語)の書籍を探して図書館に入ると、本棚はほぼ空っぽであることに気づくでしょう。

この論文は、タジク語話者向けにその空いた本棚を埋めるために設計された新しいプロジェクト、Soro(ソロ)を紹介しています。Soro をゼロから建設された全く新しい図書館と考えるのではなく、既存の良質な書籍(Gemma 3というモデルから)を手に取り、それらを書き換え、翻訳し、完全にタジク語で再編成する熟練の司書だと考えてください。

彼らがどのように行ったか、簡単な比喩を用いて説明します。

1. レシピ:「継続的事前学習」と「指示チューニング」

チームは白紙の状態から始めたわけではありません。彼らはすでにタジク語について少しは知っているが、流暢ではないスマートなオープンソースモデル(Gemma 3)から始めました。

  • ステップ 1:「没入コース」(継続的事前学習)
    そのスマートな司書を、タジク語しか話さないサマーキャンプへ送ったと想像してください。彼らは19 億語のタジク語テキストを読みました。このテキストは単なるランダムなインターネットの雑談ではなく、慎重に選別されたものでした。含まれていたのは:

    • フィルタリングされたウェブテキスト: タジク語インターネットの「最良」の部分。
    • PDF とドキュメント: 公式の論文や報告書。
    • 学校教科書: 決定的に重要なのは、タジキスタンの学校(5 年生から 11 年生)で使用されている物理的な教科書をスキャンして入力したことです。これにより、AI はタジキスタンで教えられているタジク語の歴史、文学、科学について深く理解するようになりました。
    • 翻訳された教育資料: 隙間を埋めるために、高品質な英語の科学書や歴史書をタジク語に翻訳しました。
  • ステップ 2:「教員研修」(指示チューニング)
    読むことと、会話することは別物です。チームはその後、モデルが役立つ教師になる方法を教えました。彼らは「教師のようなスタイル」で書かれた4 万個の質問と回答の例を作成しました。これらの例は、AI に事実を吐き出すだけでなく、物事を簡単に説明し、比喩を使い、学生の理解を助けるためにフォローアップの質問をする方法を教えました。

2. 「マージ」の魔法

AI がこれらすべてのタジク語を学んだ後、チームは英語を話す能力や一般的なトピックを扱う能力を失うのではないかと懸念しました。これを修正するために、**線形マージ(Linear Merging)**と呼ばれる技術を使用しました。

これは、2 つのスムージーをブレンドするようなものです。

  • スムージー A: 元の Gemma 3 モデル(一般的な知識に優れ、タジク語はそこそこ)。
  • スムージー B: 新しい Soro モデル(タジク語の専門家だが、一般的な英語の能力は少し劣る可能性あり)。
  • 結果: それらを混ぜ合わせ、新しいタジク語の専門家の約**80%と、元の一般主義者の20%**を維持しました。これにより、タジク語の専門家でありながら、英語を話し、一般的なタスクを処理する方法をまだ覚えているモデルが生まれました。

3. バックパックに収める(量子化)

タジキスタン、特に地方の学校ではコンピューターハードウェアが限られています。標準的なラップトップで巨大な AI モデルを実行することは、フルサイズの冷蔵庫を自転車のカゴに詰め込もうとするようなものです。

チームは**量子化(Quantization)**を使用してモデルを縮小しました。

  • FP8(半サイズ): モデルを圧縮して、メモリ使用量を約半分にし、重いコートを折りたたんで小さなバッグに収めるようにしました。
  • INT4(超小型): さらに圧縮(4 ビット)し、標準的なゲーミングラップトップや高性能なスマートフォンでも実行できるほど小さくしました。これはインターネット接続が不安定な遠隔地の学校にとって不可欠です。AI は巨大なサーバーファームへの常時接続を必要とせず、学校のコンピューター上でローカルに実行できます。

4. 「試運転」(ベンチマークとパイロット)

タジク語 AI の既存のテストが存在しなかったため、チームは独自のテストを作成せざるを得ませんでした。彼らは AI 向けの「運転免許試験」のような6 つの新しい試験スイートを作成しました。

  • タジク語の歴史と文学: サマニード朝の物語や有名な詩人について学んだか?
  • 言語学: タジク語の文法や綴りを理解しているか?
  • 一般教養: タジク語の地理や機関に関する質問に答えられるか?

結果:

  • Soro は、同じサイズの他のモデルよりもこれらのタジク語テストで著しく高いスコアを記録しました。
  • 英語の能力は失われず、強く保たれました。
  • 圧縮された小型バージョン(INT4)でさえ、巨大な非圧縮バージョンとほぼ同等のパフォーマンスを発揮しました。

5. 実世界での利用:学校パイロット

この論文は、Project Soroと呼ばれる実生活での試験について記述しています。

  • 場所: タジキスタン全土の 100 校、首都ドゥシャンベから遠隔の山岳地域まで。
  • 対象: 770 人の教師と 2,000 人以上の生徒。
  • 仕組み:
    • 生徒にとって: 個人家庭教師として機能します。内気な生徒は、クラスの前で恥ずかしがることなく、Soro にタジク語で難しい数学の問題を説明してもらうことができます。
    • 教師にとって: 授業計画の作成や資料の要約を支援し、時間を節約します。
    • 目標: 「AI 入門」を学校科目として教えるための国家戦略の一部です。

6. 彼らが発見したもの(と発見しなかったもの)

  • 成功: 教師も生徒も、AI が流暢で自然なタジク語を話すことを気に入りました。それは知識豊富な地元の友人と話しているようでした。それは生徒が授業により積極的に参加するのを助けました。
  • 課題:
    • 速度: 場所によっては、AI の返信が少し遅く、ライブの教室での使用を難しくしました。
    • 精度: 時折、最近の地方政府の変更など、非常に具体的な地域の事実について誤りを犯しました。これは、まだより多くの「地域知識」のトレーニングが必要であることを示しています。
    • 安全性: チームは、AI が時折「幻覚(ハルシネーション)」を起こして嘘をつく可能性があることを認めており、子供向けにコンテンツを安全に保つためのフィルターを構築しています。

まとめ

Soroは、タジキスタン向けに特別に構築された軽量で専門特化した AI チャットボットです。それはスマートな汎用 AI を取り、タジク語の文化と学校のカリキュラムに関する必要なすべてを教え、ローカルのコンピューターに収まるように縮小し、教師と生徒を支援するために学校で実用化します。これは、低リソース言語に現代の AI を持ち込むためにスーパーコンピューターは必要なく、適切なデータと少しの工学的創造性だけで十分であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →