ZAYA1-8B Technical Report
本論文は、AMD 基盤上で完全にトレーニングされた高度に効率的な 80 億パラメータの MoE 推論モデルである ZAYA1-8B を紹介し、専門的な 4 段階の RL カスケードと新規のマルコフ的 RSA テスト時計算手法を通じて数学およびコーディングベンチマークで最先端のパフォーマンスを達成し、はるかに大規模なモデルとの格差を実質的に縮小します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、ZAYA1-8B 技術報告書の解説を、創造的な比喩を用いて平易な言葉で翻訳したものです。
全体像:超能力を持つ小さな脳
ZAYA1-8B という名前の、小さくて非常に賢い生徒を想像してください。この生徒の脳には、たった7 億個の活動ニューロンしかありません(AI としては非常に小さいサイズですが)、彼らは80 億個のニューロンを総計する大きな「学校」の一部です。
通常、難しい数学の問題を解いたり複雑なコードを書いたりするには、巨大な脳(数十億のパラメータを持つ大規模 AI のようなもの)が必要です。しかし、ZAYA1-8B は特別です。小さくても、はるかに大きな「天才」生徒たちと同じくらい、あるいはそれ以上にこれらの難しい問題を解決できるからです。
その方法は、3 つの秘密兵器を使っているからです:新しい思考法、特別なトレーニングキャンプ、そして自分の作業をチェックする独自の手法です。
1. アーキテクチャ:専門化されたチーム
ほとんどの AI モデルは、一人で全てをこなそうとする一人の人のようなものです。ZAYA1-8B は、「エキスパートの混合(Mixture of Experts: MoE)」と呼ばれる、専門化されたチームのように構築されています。
- チーム: 16 人の異なる教師(エキスパート)がいる教室を想像してください。質問が入ってくると、「ルーター」(学級委員)が、誰が最も適切に答えられるかを決定します。
- 新しいルーター(ZAYA1 ルーター): 古いモデルでは、ルーターは単純な規則の追従者でした。ZAYA1-8B は、誰が教えるべきかをより良い判断をする、多層構造の賢いルーターを使用しており、毎回適切なエキスパートが仕事を処理するように保証します。
- 圧縮された図書館(CCA): 長い本を読んだり、長い物語を記憶したりするために、モデルは「圧縮された図書館」システムを使用します。すべての本のページを頭の中に持ち歩く代わりに、重要な詳細をすべて保ちながらスペースとエネルギーを節約する、要約された圧縮版を保存します。これにより、疲れずに非常に長い会話を処理することができます。
2. トレーニング:話す前に考えることを学ぶ
この論文は、この生徒を推論マシンに変えるために設計された、独自のトレーニングプロセスを説明しています。
- 「回答保持」トリム: 教師たちは往々にして、教科書の 1 ページに収まらないほど長く詳細な説明(推論の痕跡)を持っています。物語の途中を切り捨てる(論理を壊すことになる)のではなく、ZAYA1-8B は特別なトリックを使用します:説明の末尾を切り捨てますが、最終的な回答は保持します。これにより、思考プロセス全体が一度に収まらない場合でも、モデルが計画を立てて考える方法を学びます。
- 4 段階のボートキャンプ: 基礎を学んだ後、モデルは厳格な「強化学習(RL)」ボートキャンプを経験しました:
- ウォームアップ: 難しい思考に慣れるために、簡単なパズルや数学の問題を解く。
- ジム: モデルが上達するにつれて難しくなる、400 種類の異なるパズル生成器を備えたカスタム環境。
- メインイベント: 実際の数学やコーディングの課題に取り組むこと。これには、複数の可能な回答を生成して最良のものを選ぶように学ぶ特別な「テスト時計算(TTC)」フェーズが含まれます。
- 磨き上げ: 良きアシスタントのように、丁寧に会話し指示に従う方法を学ぶ最終段階。
3. 秘密の調味料:「マルコフ的 RSA」(集団思考)
これがこの論文で最も革新的な部分です。通常、AI が難しい問題を解決する際、一つの長い連続したストリームで答えを考えようとします。ストリームが長すぎると、AI は混乱してしまいます。
ZAYA1-8B は、マルコフ的 RSA という手法を使用します。これは、捻じ曲げられたリレーレースのようなものです:
- レース: 一人のランナーがマラソン全体を走るのではなく、モデルは同時に16 人のランナー(候補)を送り出します。
- バトンタッチ: 各ランナーは、短く安全な距離(4,000 語の「テール」)を走ります。彼らはレース全体の歴史を運ぶのではなく、次のラウンドに最後の数歩(テール)だけを渡します。
- 集約: 「コーチ」が 16 人のランナー全員の最後の数歩を見て、最良のアイデアを組み合わせ、次のラウンドのためにそれらを送り出します。
- 結果: 思考プロセスを小さく管理しやすいチャンクに分割し、チームが最良の経路について投票することで、ZAYA1-8B は通常、はるかに大きな脳を必要とする非常に難しい数学の問題(AIME や HMMT のコンペティションなど)を解決できます。
比喩: 巨大なジグソーパズルを解こうと想像してください。
- 古い方法: 一人の人がパズル全体を頭の中に一度に保持しようとします。圧倒されてしまいます。
- ZAYA1-8B の方法: 16 人の人を小さなセクションに取り組むために送り出します。彼らは自分のセクションのいくつかのピースだけを次のグループに渡します。グループはこれらの小さなピースを組み合わせて、全体の絵を完成させます。それは速く、メモリを少なく使い、より良い結果をもたらします。
4. ハードウェア:AMD 上で構築
このモデル全体は、AMD のコンピュータチップ(具体的には MI300X GPU)を使用してトレーニングされました。これは大きな意味を持ちます。なぜなら、トップクラスの推論モデルをトレーニングするために、最も高価で独占的なチップは必要ないことを証明しているからです。チームは、適切なソフトウェアとハードウェアのセットアップがあれば、AMD チップが複雑な AI のトレーニングという重労働を処理できることを示しました。
5. 結果:小さくても強力
この論文は、このセットアップにより以下のことが実現されると主張しています:
- ZAYA1-8B(活動パラメータがわずか 7 億)は、数学とコーディングのテストにおいて、DeepSeek-R1(活動パラメータが 370 億)を凌駕するか、同等の成績を収めています。
- 「マルコフ的 RSA」という集団思考メソッドを使用すると、Gemini-2.5 Pro や GPT-5-High のような巨大で高価なモデルに非常に近いスコアを、難しい数学コンペティションで獲得します。
まとめ
ZAYA1-8B は、天才になるために巨大な脳は必要ないことを証明する、小さく効率的な AI です。賢いチーム構造、回答を安全に保つ特別なトレーニング方法、そして思考のための「集団リレーレース」戦略を使用することで、競合他社の数分の一の計算電力で、最も難しい数学とコーディングの問題を解決することができます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。