Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
Nemotron-Cascade 2 は、30B パラメータ(活性化 3B)の MoE モデルであり、Cascade RL とマルチドメインのオンポリシー蒸留を組み合わせることで、数学・コーディング・エージェント能力において最先端のモデルに匹敵する性能を達成し、2025 年の IMO、IOI、ICPC 世界大会で金メダルレベルの成績を収めたオープンウェイトモデルです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ネモトロン・カスケード 2:AI の「天才化」への道程
~300 億パラメータという小さな体で、数学のオリンピックで金メダルを取る方法~
こんにちは!今日は、NVIDIA が発表した最新の AI モデル「Nemotron-Cascade 2(ネモトロン・カスケード 2)」について、難しい専門用語を使わずに、誰でもわかるようにお話しします。
この AI は、**「300 億パラメータ」という、巨大な AI に比べるとかなりコンパクトな体(脳)を持ちながら、「国際数学オリンピック(IMO)」や「情報オリンピック(IOI)」**といった、世界トップクラスの天才たちが挑む難問で、金メダルレベルの成績を収めました。
まるで、**「背は小柄でも、頭脳明晰な天才少年」**のような存在です。
1. この AI のすごいところ:「小さな体に、巨大な知能」
通常、AI が難しい問題を解くには、膨大なデータと巨大な脳(パラメータ数)が必要です。しかし、この Nemotron-Cascade 2 は、**「知能の密度」**が異常に高いのです。
- 比較対象: 前回の記録保持者である「DeepSeek」は、6710 億パラメータという巨大な脳を持っていました。
- Nemotron-Cascade 2: 300 億パラメータ(約 20 分の 1 のサイズ)で、同じような、あるいはそれ以上の成績を出しました。
これは、**「巨大な図書館全体を丸ごと記憶する代わりに、必要な本だけを瞬時に読み取り、深く理解する」**ような技術の進歩と言えます。
2. 学習の秘密:「カスケード RL」と「料理のレシピ」
この AI がどうやって这么までに成長したのか?その秘密は**「カスケード RL(連鎖型強化学習)」**という学習方法にあります。
🍳 アナロジー:「料理の修行」
AI の学習を「料理の修行」と想像してください。
- SFT(監督付き微調整):基礎料理の習得
まず、優秀なシェフ(教師 AI)が作ったレシピを見て、基本的な料理の作り方を学びます。 - カスケード RL:分野ごとの特訓
ここがポイントです。AI は一度にすべてを学ぼうとせず、**「分野ごとに順番に特訓」**します。- 第 1 段階:指示に従う練習(「塩を 3 グラム入れて」と言われたら、正確に 3 グラム入れる練習)。
- 第 2 段階:数学の料理(複雑な計算が必要な料理に特化)。
- 第 3 段階:プログラミングの料理(新しい食材を組み合わせる練習)。
- 第 4 段階:人間好みの味付け(「もっと美味しい感じにして」という人間の評価を学ぶ)。
このように**「一つずつ完璧に仕上げてから次に進む」**ことで、ある分野を学ぶと、別の分野の能力が忘れてしまう(これを「忘却」と言います)のを防ぎます。
🔄 魔法の技術:「マルチドメイン・オンポリシー・ディストーション(MOPD)」
でも、特訓を繰り返すと、たまに「前の分野の味が薄れてしまう」ことがあります。
そこで、この AI は**「各分野の最優秀シェフ(中間モデル)」を呼び出し、「今、自分が作っている料理の味を、その分野の天才シェフに教えてもらう」**という作業を挟みます。
- 数学が苦手になったら? → 数学の天才シェフに味見させて、正しい味を取り戻す。
- プログラミングが下手になったら? → プログラミングの天才シェフに指導してもらう。
これを**「オンポリシー・ディストーション(その場で教える)」と呼びます。これにより、AI は「すべての分野でバランスよく、かつ最高レベル」**を維持できるようになりました。
3. 具体的な成果:オリンピックでの活躍
この学習方法のおかげで、Nemotron-Cascade 2 は以下のような驚異的な結果を残しました。
- 数学オリンピック(IMO 2025): 6 問中 5 問を正解し、金メダル獲得。
- 情報オリンピック(IOI 2025): プログラミングコンテストで金メダル獲得。
- ICPC 世界大会: 12 問中 10 問を正解し、金メダル獲得。
これらは、これまで「巨大な AI しか解けない」と思われていた難問です。300 億パラメータというコンパクトなサイズでこれを実現したことは、**「AI の効率化」**において歴史的な転換点と言えます。
4. なぜこれが重要なのか?
この技術の進歩は、単に「賢い AI ができた」というだけではありません。
- コストの削減: 巨大な AI を動かすには莫大な電力とコストがかかりますが、このように「小さな体に高知能」な AI が実現すれば、より多くの場所で、より安く、高性能な AI を使えるようになります。
- オープンソース: NVIDIA はこのモデルの重み(脳)や学習データを無料で公開しています。これにより、世界中の研究者や開発者がこの「カスケード学習」の技術を研究し、さらに進化させることができます。
まとめ:「小さな天才」の誕生
Nemotron-Cascade 2 は、**「一度にすべてを学ぼうとせず、分野ごとに順番に特訓し、その都度天才シェフに指導してもらう」という、非常に人間らしい(そして効率的な)学習方法によって、「小さな体で世界最高峰の知能」**を実現しました。
これは、AI 開発の新しいパラダイム(考え方)を示すもので、今後の AI がどのように進化していくかを示す、非常にワクワクするニュースです。
**「背は低くても、頭は世界一」**な AI が、私たちの未来をどう変えてくれるのか、楽しみですね!
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。