Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization
本論文は、教師モデルの分布を共有バイト空間上で再表現することで確率質量を保持し、数学およびプログラミングのベンチマークにおける学習済みモデルの性能を向上させる、新しいクロス・トークナイザー・オンポリシー蒸留手法であるByte-Prefix Marginalization(BPM)を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
異なる設計者が、それぞれ独自の思考言語を用いて構築した、巨大で輝かしいAIの脳が存在する世界を想像してみてください。ある設計者は長く流れるような文章で考え、別の設計者は思考を小さく素早い音節に刻み込むかもしれません。これが現代の「大規模言語モデル(LLM)」の現実です。彼らは非常に賢いのですが、しばしば異なる「トークン」言語を話します。トークンとは、コンピュータが情報を処理するために使用する、単語、単語の一部、あるいは単一の文字といったテキストの塊のことです。
さて、これらの巨大な教師から学ぶことができる、より小さく、より速く、より安価なAIの生徒を作りたいと想像してください。これは「蒸留(distillation)」と呼ばれます。通常、生徒は教師の答えをそのままコピーするだけです。しかし、ここに落とし穴があります。もし教師と生徒が異なるトークン言語を話している場合、直接的なコピー&ペーストは不可能です。それは、英語しか話せない生徒に対して、絵文字や記号のコードだけで書かれた教科書を手渡すようなものです。生徒は記号は見えますが、どの記号がどの英単語に対応しているのかを知りません。無理に一致させようとすると、猫の絵が「リンゴ」を意味すると誤って教えてしまったり、最悪の場合、生徒の辞書に適合しないために教師の知恵の半分を捨て去ってしまうことになるかもしれません。
この論文は、まさにその頭痛の種に取り組んでいます。研究者たちはこう問いかけました。生徒のAIが、全く異なる「トークン」言語を話す教師から学ぶ際、教師の素晴らしさを失ったり、デタラメなことを教え込んだりすることなく学習させることはできるのだろうか?
解決策: 「バイト・プレフィックス」翻訳機
著者の一団(KwaiKATおよび中国科学院のチーム)は、**Byte-Prefix Marginalization(BPM)**と呼ばれる巧妙な新手法を導入しました。その仕組みを理解するために、複雑な数学は一旦置いておいて、コンピュータが実際にテキストをどのように見ているかを考えてみましょう。
異なるAIはテキストを異なるサイズの「トークン」に分割しますが、彼らは共通の基礎となる**「バイト(bytes)」**については一致しています。バイトとは、あらゆる文字、スペース、句読点を構成する、テキストの微細で目に見えない構成要素――すなわち、すべての文字、スペース、句読点を形作る生の0と1のことです。あるAIが「unbelievable」という単語を一つの巨大なトークンとして見るか、あるいは「un」、「bel」、「ievable」へと分割するかに関わらず、彼らは皆、「un」のバイトが最初に来て、次に「bel」のバイトが続く、という点では一致しているのです。
著者は、バラバラでサイズの異なるトークンを一致させようとする代わりに、まず教師の知恵をこの共通の「バイト言語」に翻訳できることに気づきました。BPMのステップは以下の通りです。
- バイト・マップ(The Byte Map): 教師の次の予測は、確率の雲のようなものだと想像してください。教師は「『unbelievable』である確率は30%である」と言っています。
- 最長一致(The Longest Match): 生徒のトークナイザーは「unbelievable」のバイトを確認し、「私の辞書の中で、これらのバイトの始まりに適合する最も長い塊は何だろうか?」と問いかけます。例えば、生徒は「un」というトークンと「belie」というトークンを持っているかもしれません。
- 転送(The Transfer): BPMは、「unbelievable」に対する教師の30%の確率を取り出し、それを生徒のトークン「un」(または「belie」、どちらか長い方のマッチ)に引き渡します。これは、「もし教師が『unbelievable』が高い確率であると考えているなら、生徒は間違いなく『un』が高い確率であると考えるべきである。なぜなら、『un』はその単語の最初の部分だからだ」と言うようなものです。
- セーフティネット(The Safety Net): もし教師が、生徒の辞書では開始すらできないようなことを言った場合はどうなるでしょうか? BPMはその確率を単に捨てるのではなく、特別な「残差(residual)」バケットに入れます。これにより、教師の確率質量が100%保持されることが保証されます。何も失われることはありません。
この手法は、完璧な「質量保存型」のターゲットを作り出します。教師と生徒が異なる言語を話していても、バイトにおいて一致していれば、生徒が教師の意図したことを正確に学習することを保証します。
「空白」の罠とその修正
しかし、研究者たちは奇妙でトリッキーな問題を発見しました。教師と生徒がコードを書いているとき、次の「トークン」が単なるスペースやタブ(インデント)であることがあります。異なるトークナイザーはスペースを異なる方法で分割するため、教師は「3つのスペースを追加している」と言っている一方で、生徒のトークナイザーはそれを「一つの大きなスペース・トークン」として認識してしまうことがあります。
もし生徒がこれらのスペース・トークンの正確な確率をコピーしようとすると、混乱が生じます。生徒はコードの実際の論理ではなく、教師特有の「スペースの切り分けスタイル」を学習し始めてしまうのです。著者らは、この混乱によって、一部のケースで生徒のコードが完全に崩壊することを発見しました。つまり、動作するプログラムを書く能力が49%から悲惨な9%へと急落したのです。
これを修正するために、彼らは単純な「ホワイトスペース・マスク(whitespace mask)」を追加しました。これは審判のようなもので、「おい、もし次のステップが単なるスペースであるなら、教師の正確なスペース・トークンの確率をコピーしようとするな。その部分は無視してしまえ」と指示します。この小さなルールが事態を救い、崩壊を防ぎ、生徒が実際のコードの論理に集中できるようにしました。
結果:より賢い生徒、より速く
チームはこの手法をテストするため、3つの異なる巨大なAI教師(Qwen3-32B、GLM-Z1-9B、MiniMax-M2.7)を使い、それらを単一のより小さな生徒モデル(Qwen3.5-2B)に教える実験を行いました。これらの教師は非常に異なるトークン言語を持っており、このタスクを極めて困難なものにしていました。
彼らは、この新しいBPM手法を、異なるトークナイザーを扱う既存の他の手法と比較しました。結果は明白でした。
- 優れたスコア: 数学とコーディングに関する6つの厳しいベンチマークにおいて、BPMで訓練された生徒は、他の手法を一貫して上回りました。彼らは、最強の従来手法に対して平均で3.7〜6.6ポイントスコアを向上させました。
- 格差の解消: この手法は、小さな生徒と巨大な教師の間のパフォーマンスの差を**33.5%〜43.9%**埋めることに成功しました。これは、教師の脳力の大きな部分が生徒に転送されたことを意味します。
- 堅牢性: この手法は、教師と生徒が大きく異なる場合(MiniMaxの教師など)でもうまく機能し、「バイト・プレフィックス」のアプローチが普遍的な翻訳機であることを証明しました。
なぜこれが重要なのか
この論文は、AIモデルが互いに学ぶために、全員が同じ辞書を使うように強制する必要はないことを示唆しています。共有された「バイト」言語を架け橋として使用することで、異なる系統の最高の教師を組み合わせ、その知識を失うことなく効率的な生徒に教えることができます。それは、たとえ人々が異なる方言を話していても、全員がアルファベットには同意していることに気づくようなものです。生徒にまずアルファベットの読み方を教えれば、教師が誰であっても、どんなことでも教えることができるのです。
著者らは、このアプローチが単なる理論的なアイデアではなく、今日実際に機能する実用的なツールであることを示しました。これにより、巨大な教師のような膨大な計算能力を必要とせずに、複雑な数学やコーディングの問題を解決できる、より小さく、より速く、よりスマートなAIモデルを作成することが可能になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。