Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Mode
本論文は、28兆トークンで事前学習されたLooped Transformerアーキテクチャと高度なRLトレーニングを備えた、コンパクトな3Bパラメータの汎用エージェントモデルであるNanbeige4.2-3Bを紹介しており、これは強力な推論能力を維持しつつ、多様なエージェント・ベンチマークにおいてQwen3.5-9BやGemma4-12Bといった大幅に大きなモデルを大きく上回る性能を発揮する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータが巨大で超スマートな図書館のような世界を想像してみてください。長い間、これらの図書館から本当に優れた答えを得る唯一の方法は、図書館をより大きく、より多くの本(データ)とより多くの棚(パラメータ)を詰め込むことでした。考え方は単純でした。「もし天才が欲しいなら、巨大な脳が必要だ」というものです。しかし、もしポケットサイズの天才を作れるとしたらどうでしょうか?これは現在、人工知能の分野における大きな問いです。私たちは、巨大でエネルギーを大量に消費する巨人たちと同じくらい複雑な問題を解決できる、小さく効率的なAIモデルを作ることができるのでしょうか?
この課題を理解するために、AIモデルを学生だと考えてみてください。「推論」が得意な学生は数学や論理パズルに強く、「エージェント的(行動的)」な学生は、電卓を使ったり、インターネットで検索したり、レポートを書いたりといった、実際に「何かを行う」ことに長けています。通常、小さな学生は片方には優れていますが、もう片方は苦手です。彼らは数学の達人であってもコンピュータの使い方は分からなかったり、あるいはボタンを押すことは得意でも、そのタスクの背後にある論理を理解できなかったりします。この研究の目標は、巨大な脳を必要とせずに、論理と行動の両方に精通した単一の小さな学生を育てられるかどうかを確認することです。
そこで登場するのが、Nanbeige LLM Labによる新しいモデル、Nanbeige4.2-3Bです。このモデルは、このパズルを解こうとする試みです。このモデルを「コンパクトな汎用エージェント」と考えてください。これは、自身のサイズに制限されることを拒む、30億パラメータの小さな脳です。研究者たちは、モデルを賢くするために規模を大きくする必要はなく、ただ脳をより効率的に使う方法を教える必要があることを発見しました。
秘伝のソース: 「ループする」脳
Nanbeige4.2-3Bが使う最初のトリックは、Looped Transformerと呼ばれる巧妙なアーキテクチャのハックです。標準的なAIモデルを、30のステーションがある工場の組立ラインだと想像してください。データ(質問など)はステーション1、2、3と進み、30まで到達して完了します。工場をよりスマートにするために、通常はステーションを追加して大きくしますが、これでは巨大で高価になってしまいます。
しかし、Nanbeigeは工場を小さく保ったまま、ワーカーをもっと一生懸命働かせることにしました。新しいステーションを追加する代わりに、彼らは「ループ」を構築しました。データが30のステーションを一度通過した後、再び最初に戻され、同じ30のステーションを二度目に通過します。これは、学生が難しい段落を読み、その後、最初に読み飛ばした詳細を捉えるために、もう一度同じ段落を読み直すようなものです。この「ループ」により、モデルは新しいパーツを脳に追加することなく、情報をより深く処理できるようになります。論文では、既存のモデルに単にループを追加するのではなく、このループを用いてモデルをゼロからトレーニングすることが、成功の鍵であったと述べています。
ポケットサイズの天才を育てる
脳を構築した後は、教えなければなりません。研究者たちは単にランダムな事実をモデルに食べさせたわけではありません。彼らは、スポーツチームのトレーニングスケジュールのようにな、3つの明確なフェーズを持つ厳格なトレーニングキャンプを作成しました。
フェーズ1:基礎(事前学習)
タスクを学ぶ前に、モデルは28兆トークン(トークンとは、単語や単語の一部のようなテキストの塊のこと)という膨大なライブラリを読み込みました。彼らは、モデルが強力な論理的バックボーンを持つように、この読書リストを数学、コード、科学を多く含むように特別に調整しました。
フェーズ2:実践ドリル(教師あり微調整)
次に、モデルに実際に「行う」方法を教えました。彼らは「軌跡(トラジェトリー)」と呼ばれる、問題解決のためのステップ・バイ・ステップの記録の膨大なコレクションを作成しました。これらは単なる単純な質問ではなく、壊れたコンピュータプログラムの修正、散らかったオフィスの整理、あるいは情報を探すための様々なツールの使用といった、複雑なシナリオでした。
- 戦略: 彼らは短い論理的問題(コンテキスト64K)から始め、徐々に長く複雑なタスク(最大256Kトークン)へと移行しました。
- フィルター: 彼らはどんな回答も受け入れたわけではありません。もしモデルが長いタスクの途中でミスをした場合、それをどのようにリカバリーするかを教えました。彼らは「損失マスク(loss mask)」を使用し、モデルに対して「おい、ステップ3で間違えたけれど、ステップ4で修正できるように、そこで何が起きたのかを忘れないように」と伝えました。これにより、モデルは単に完璧であるだけでなく、回復力(レジリエンス)を持つように訓練されました。
フェーズ3:コーチの笛(強化学習)
最後に、モデルの振る舞いを磨き上げるために、強化学習(RL)という手法を用いました。これは、コーチがプレイヤーを観察し、良い動きにはポイントを与え、悪い動きにはポイントを引くようなものです。
- とりとめもない話の停止: モデルがループに陥り、同じことを繰り返したり、延々と話し続けたりすることがあることに彼らは気づきました。彼らは、仕事が終わったら停止するように訓練し、回答をより短く、効率的にしました。
- 「長さの制御」: 難しい数学の問題については、モデルが必要なだけ考えられるようにしました。しかし、簡単な問題については、時間がかかりすぎるとペナルティを与えました。これにより、モデルは可能なときは簡潔に、必要なときは徹底的に、という使い分けができるようになりました。
- アクション報酬: 彼らは、ツールを正しく使った場合には追加のポイントを与え、同じ間違いを二度した場合にはポイントを引きました。これにより、長くて複雑なタスクにおけるパフォーマンスを安定させました。
結果:小さくとも強力
では、この小さな30億パラメータのモデルは本当に機能するのでしょうか?結果は、驚くほど強力であることを示唆しています。テストにおいて、このモデルはより大きなモデルと対峙した際、単に持ちこ{いできた}だけでなく、しばしば勝利しました。
- 巨人を打ち負かす: パーソナルアシスタントとしての能力(事務作業の処理、ツールの使用、コーディングなど)を測定するテストにおいて、Nanbeige4.2-3Bは90億および120億パラメータを持つモデルを上回りました。例えば、SWE-bench Verified(ソフトウェアのバグ修正のテスト)において、モデルは**63.6%**を記録し、90億パラメータのQwen3.5(53.1%)や120億パラメータのGemma4(44.2%)を打ち破りました。
- 推論能力: サイズのために脳の力(知能)を犠牲にすることはありませんでした。GPQA-Diamondのような難解な数学・科学テストにおいて、モデルは**87.4%**を記録し、これはより大きなモデルよりも高い数値です。
- 実世界での活用: OpenClawと呼ばれる現実世界の「パーソナルアシスタント」環境に投入された際、モデルは日常業務、オフィスワーク、深いリサーチにおいて、より大きなモデルよりも優れた処理を行い、これが単なる実験室の実験ではなく、実用的なツールであることを証明しました。
これが意味すること
論文は、モデルを賢くするためには必ずしも大きくしなければならないという考えに対し、明確に反論しています。適切なアーキテクチャ(ループ)、適切なデータ(28兆トークンの高品質なミックス)、そして適切なトレーニング方法(段階的な強化学習)があれば、小さなモデルでも、以前は巨大な脳が必要だと考えられていた「エージェント的」な能力を達成できることを示唆しています。
しかし、著者たちは、これはこの特定のモデルサイズとアーキテクチャにおける特筆すべき成果であると注意深く述べています。彼らは、これがすべてのAIの問題を永遠に解決すると主張しているわけではありません。むしろ、このアプローチは新しい扉を開くものであると示唆しています。つまり、クラウド上のスーパーコンピュータを必要とせず、個人のコンピュータ上でローカルに動作し、複雑で多段階の仕事をこなすことができる、コンパクトで効率的なAIアシスタントを構築できるようになったのです。未来は、より大きな脳を作ることではなく、より小さな脳に「ループの中で考える方法」を教えることにあるのかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。