← 最新の論文
💬 NLP

Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models

本論文は、タイの法的推論のような地域特有のタスクが可能な高品質かつ主権的な大規模言語モデルが、膨大な指示コーパスや複雑な強化学習パイプラインに依存することなく、学術規模のリソース下で開発可能であることを示すために、教師あり微調整、オンポリシー蒸留、およびInK-GRPOを用いた小規模なRFTを組み合わせた、最小限かつオープンなポストトレーニング・レシピであるTyphoon Sを紹介するものである。

原著者: Kunat Pipatanakul, Pittawat Taveekitworachai

公開日 2026-01-27
📖 1 分で読めます☕ さくっと読める

原著者: Kunat Pipatanakul, Pittawat Taveekitworachai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ある優秀で世界的な学生(大規模言語モデル)を想像してみてください。その学生は完璧な英語と中国語を話しますが、特定の国のローカルな方言、文化、そして法律については苦戦しています。通常、こうした問題を解決するために、ビッグテック企業は膨大な資金、スーパーコンピュータ、そして果てしない量のデータを投入します。しかし、もし大学や政府機関のような小規模なチームが、莫大な予算を必要とせずに、自国のコンテキストを理解できる独自の「ソブリン(主権的)」なAIを作りたいとしたらどうでしょうか?

この論文は、限られたリソースを用いて、AIモデルを「役に立つ汎用アシスタント」であると同時に「ローカルで重要なタスク(タイの法律など)のエキスパート」にするための「ミニマリストなレシピ」であるTyphoon-Sを紹介しています。

彼らがどのように行ったのかを、大きく2つのパートに分けて説明します。

パート1:AIを「適応可能」にする(汎用アシスタント)

目的: 生のスマートなベースモデルを、指示に従い、コードを書き、現地の言葉で自然にチャットができる、礼儀正しく役に立つアシスタントへと変えること。

問題点: 単に新しい指示を教える(教師あり微調整、またはSFT)だけでは、モデルが「脆く(brittle)」なってしまうことがあります。それは、教科書の答えを丸暗記したものの、先生から少し異なる質問をされたり、言語が混ざったりした途端にパニックに陥ってしまう学生のようなものです。

解決策:「シャドーイング」技術(オンポリシー蒸留 / On-Policy Distillation)
著者らは2段階のプロセスを用いました。

  1. レッスン(SFT): まず、英語とタイ語の高品質な指示データの小さなミックスをモデルに与えました。これは、学生に短期集中コースを受けさせるようなものです。
  2. シャドーイング(OPD): モデルに単に答えを暗記させるのではなく、モデル自身に回答を生成させ、その間に「教師」となるモデル(より賢いAI)がリアルタイムで観察し、修正を行います。
    • 比喩: 音楽の学生が曲を演奏している場面を想像してください。従来の方法では、録音された音源を聞いてそれをコピーしようとするだけでした。この新しい方法では、学生が演奏している間、マスターミュージシャンが隣に座り、演奏中に直接修正を伝えます。これにより、学生は自分自身のミスからどのように立ち直るかを学ぶことができ、より堅牢で柔軟になります。

結果: 彼らは、大学の研究室レベルの規模(小規模なGPUクラスター)でのわずか数日のトレーニングで、これを実現しました。その結果誕生したモデルTyphoon-S-8Bは、チャット、コーディング、英語とタイ語の切り替えをスムーズに行うことができ、より大規模なモデルにも匹敵する強力な汎用アシスタントとなりました。

パート2:AIに「ソブリン能力」を与える(ローカルのエキスパート)

目的: 現地の法律を理解し、答えを見つけるためにツールを使用する必要がある、複雑で重要なローカルタスク(特にタイの法的推論)を扱えるようにすること。

問題点: 標準的なAIトレーニングは、多くの場合、モデルがすでに知っていることを強化するだけです。もしモデルが特定のタイの法律を知らない場合、標準的なトレーニングではその新しい事実を魔法のように教えることはできません。また、標準的なトレーニングでは、情報を探すためのツール(検索エンジンなど)の使い方をAIに教えることはできません。

解決策:「デュアルブレイン(二重脳)」トレーニング(InK-GRPO)
著者らは、**InK-GRPO(Injected Knowledge GRPO)**と呼ばれる新しいトレーニング手法を考案しました。

  • 脳のゲーム: AIが法的パズルを解いているゲームを想像してください。
    • 脳A(プレイヤー): 推論の精度を高めるための報酬システム(ビデオゲームのスコアのようなもの)を用いて、パズルを解こうとします。
    • 脳B(読書家): 脳Aがゲームをしている間、脳Bは静かにタイの法律文書の束を読んでいます。
    • 魔法: システムはこれら2つのモードをランダムに切り替えます。時にはAIがゲームをプレイし、時には文書を読みます。これにより、AIは新しい事実(法律)を学びながら、同時にそれらをどのように使って問題を解決するかを学ぶことができます。

ツール利用(Agentic RFT):
彼らはAIにツールの使い方も教えました。

  • 比喩: 世界中のあらゆる法律を暗記しようとする代わりに、AIは「その特定の法律については知りません。データベースを検索させてください」と言い、文書を読み、それから回答するという方法を学びます。
  • 彼らは、AIが「考える → 検索する → 読む → 考える → 回答する」というループを行うように訓練しました。

結果: Typhoon-S-4B Legal Agentは、タイの法的推論において驚異的な能力を発揮しました。驚くべきことに、この小さな40億パラメータのモデルは、特定のツールを使って答えを探すという条件下において、有名なはるかに大きなモデル(GPT-5)を凌駕しました。

総括

この論文は、強力なソブリンAIを構築するために、巨大なスーパーコンピュータは必要ないということを証明しています。

  • 汎用利用のために: 「レッスン」と「シャドーイング」のシンプルな組み合わせ(SFT + OPD)があれば、モデルを賢く役に立つものにすることは可能です。
  • ローカルな専門知識のために: 「ゲーム」と「教科書の読書」を巧みに組み合わせる(InK-GRPO)ことで、小さなモデルでも新しいローカルな事実を学び、ツールを効果的に使うことができます。

コスト: 彼らはこれらすべてを、典型的な大学の研究室で利用可能なリソース(4〜8台の高機能GPUによる数日間のトレーニング)で行いました。これは、ソブリンでローカライズされたAIを作成するためには、「力任せの規模拡大(Brute Force Scale)」よりも「スマートな設計(Smart Design)」が重要であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →