Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
Nemotron 3 Ultraは、100万トークンのコンテキストウィンドウと高度なトレーニング技術を備えた5,500億パラメータのオープンソースのハイブリッドMamba-Transformerモデルであり、最先端の精度を提供すると同時に、推論スループットを最大6倍に高めることができ、複雑なエージェンティックな推論タスクに理想的です。
原著者: NVIDIA (Allan), : (Allan), Aaron Blakeman (Allan), Aaron Thomas (Allan), Aastha Jhunjhunwala (Allan), Abhibha Gupta (Allan), Abhinav Khattar (Allan), Adam Rajfer (Allan), Adi Renduchintala (Allan), Adil Asif (Allan), Aditya Vavre (Allan), Adriana Flores Miranda (Allan), Ahmad Bilal (Allan), Aileen Zaman (Allan), Ajay Hotchandani (Allan), Akanksha Shukla (Allan), Akhiad Bercovich (Allan), Aleksander Ficek (Allan), Alex Gronskiy (Allan), Alex Kondratenko (Allan), Alex Steiner (Allan), Alex Ye (Allan), Alexander Bukharin (Allan), Alexandre Milesi (Allan), Ali Taghibakhshi (Allan), Alice Gatti (Allan), Alisa Liu (Allan), Alok Kumar (Allan), Amar Phanishayee (Allan), Ameya Sunil Mahabaleshwarkar (Allan), Amir Klein (Allan), Amit Zuker (Allan), Amnon Geifman (Allan), Anahita Bhiwandiwalla (Allan), Ananth Subramaniam (Allan), Andrea Santilli (Allan), Andrew Fulks (Allan), Andrew McHarg (Allan), Andrew Tao (Allan), Andrii Skliar (Allan), Anjulie Agrusa (Allan), Ankur Srivastava (Allan), Ankur Verma (Allan), Anna Shors (Allan), Anna Warno (Allan), Antoni-Joan Solergibert I Llaquet (Allan), Arham Mehta (Allan), Arkadiusz Nowaczynski (Allan), Arti Jain (Allan), Ashwath Aithal (Allan), Ashwin Poojary (Allan), Asif Ahamed (Allan), Asit Mishra (Allan), Asma Kuriparambil Thekkumpate (Allan), Atefeh Sohrabizadeh (Allan), Avinash Kaur (Allan), Avinash Vem (Allan), Ayush Dattagupta (Allan), Barath Subramaniam Anandan (Allan), Bardiya Sadeghi (Allan), Ben Lanir (Allan), Benedikt Schifferer (Allan), Besmira Nushi (Allan), Bilal Kartal (Allan), Bill Thiede (Allan), Bita Darvish Rouhani (Allan), Bo Deng (Allan), Bob Schatz (Allan), Boris Ginsburg (Allan), Boxin Wang (Allan), Brad Nemire (Allan), Brandon Norick (Allan), Brian Dang (Allan), Brian Westphal (Allan), Brian Yu (Allan), Brucek Khailany (Allan), Bryan Catanzaro (Allan), Carlo del Mundo (Allan), Caryln Aarish (Allan), Chankyu Lee (Allan), Chantal Hwang (Allan), Charbel Sakr (Allan), Charles Wang (Allan), Charlie Truong (Allan), Chen Cui (Allan), Cheng Cheng (Allan), Cheng-Ping Hsieh (Allan), Chenghao Zhang (Allan), Chenhui Deng (Allan), Chintan Patel (Allan), Chris Alexiuk (Allan), Christian Cosgrove (Allan), Christian Munley (Allan), Christine Harvey (Allan), Christopher Parisien (Allan), Chunyang Shen (Allan), Coco Li (Allan), Collin Neale (Allan), Cynthia Gao (Allan), Cyril Meurillon (Allan), Dan Gil (Allan), Dan Su (Allan), Dan Zhao (Allan), Dane Corneil (Allan), Daniel Afrimi (Allan), Daniel Egert (Allan), Daniel Korzekwa (Allan), Daniel Lo (Allan), Daniel Machlab (Allan), Daniel Serebrenik (Allan), Daniil Sorokin (Allan), Daria Gitman (Allan), Daria Levy (Allan), Darko Stosic (Allan), David Mosallanezhad (Allan), David Yu (Allan), Davit Karamyan (Allan), Deena Donia (Allan), Deep Debroy (Allan), Deepak Narayanan (Allan), Devin O'Kelly (Allan), Dheeraj Peri (Allan), Dhruv Nathawani (Allan), Di (Allan), Wu, Dima Rekesh, Divyanshu Kakwani, Donald Plummer, Dong Anh, Dongfeng Yu, Dongfu Jiang, Donnie Kim, Dorrin Poorkay, Duncan Riach, Dusan Stosic, Dustin VanStee, Eavan Meng, Edgar Minasyan, Edward Lin, Eileen Margaret Peters Long, Elad Sarafin, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric Tramel, Eric Yang, Erick Galinkin, Erik Pounds, Erika Goncalves Goncalves, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Faisal Ladhak, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Frank Sun, Frankie Siino, Frida Hou, Gal Hubara Agam, Gal Kaplun, Gantavya Bhatt, Gargi Prasad, Garvit Kulshreshtha, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Greg Mason, Greg Pauloski, Grigor Nalbandyan, Grzegorz Chlebus, Grzegorz Karch, Guan-Ting Liu, Guoming Zhang, Guyue Huang, Haggai Maron, Haifeng Qian, Haim Elisha, Haoxing Ren, Haran Kumar Shiv Kumar, Haribhau Hud, Harris Nover, Harrison Saturley Hall, Hayate Iso, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hovhannes Tamoyan, Hua Li, Huanhuan Chen, Hui Li, Hui Wang, Huy Nguyen, Ian Chiles, Ido Galil, Ido Shahaf, Igor Gitman, Igor Shovkun, Ilya Loshchilov, Ingo Guehring, Itamar Schen, Itay Levy, Itay Neeman, Ivan Moshkov, Izik Golan, Izzy Putterman, Jaemin Choi, Jakub Slowikowski, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiantao Jiao, Jiaqi Zeng, Jie Lou, Jim King, Jimmy Zhang, Jingquan Wang, Jinhang Choi, Jinju Chu, Joey Conway, Joey Guman, Johan Jatko, Johannes Rausch, John Kamalu, John Roberts, Johnny Greco, Johnny Mensel, Jonah Alben, Jonas Yang, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joshua Mabry, Joshua Pierce, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kajal Jain, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Willowhawk, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirthi Shankar Sivamani, Konstantinos Krommydas, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Kyle Keprios, Kylie Day, Lawrence McAfee, Leo Du, Leon Derczynski, Li Ding, Linda Liu, Lingjie Wu, Lior Kadoch, Lizzie Wei, Luis Vega, Luke Robison, Lun Su, Maarten Van Segbroeck, Maciej Jakub Mikulski, Maer Rodrigues de Melo, Magda Sypula, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Tarun Chandran, Manoj Kilaru, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Marcin Chochowski, Mark Cai, Mark Mozolewski, Markus Kliegl, Marta Stepniewska-Dziubinska, Martyna Patelka, Mattei Machczynski, Matvei Novikov, Mauricio Ferrato, Maximilian Golub, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Mengxi Wu, Meredith Price, Meriem Boubdir, Micah Schaffer, Michael Andersch, Michael Boone, Michael Gschwind, Michael Lightstone, Michael Loh, Michal Bien, Michal Zawalski, Michelle Gill, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Houston, Mingyuan Ma, Minseok Lee, Mohamed Fawzy, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Namit Dhameja, Narimane Hennouni, Natalie Hereth, Nathaniel Pinckney, Nave Algarici, Nave Assaf, Netanel Haber, Nicholas Knight, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Desai, Nikolai Ludwig, Nima Tajbakhsh, Ning Xu, Nir Ailon, Nirmal Juluru, Nitin Nitin, Ofri Masad, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivia Viessmann, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Pablo Ribalta, Pallab Bhattacharya, Panos Lampropoulos, Parth Mannan, Pasha Shamis, Patrick Legresley, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pierre-Yves Aquilanti, Pinky Xu, Piotr Januszewski, Piotr Laskiewicz, Pooya Jannaty, Prakash Gurumurthy, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Puhui Meng, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Radha Sri-Tharan, Rahul Kandu, Rakshit Sanadhya, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Ray Macalisang, Rayen Tian, Reka Kovacs, Renjie Pi, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Rishi Puri, Rita Fernandes Neves, Ritchie Zhao, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Robert Kirby, Roger Waleffe, Rohit Watve, Roi Koren, Ron Banner, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Stewart, Ryota Egashira, Sadegh Mahdavi, Saee Paliwal, Sagar Singh, Sahil Modi, Salika Dave, Samantha Shinagawa, Samuel Kriman, Sandip Bhaskar, Sangkug Lym, Sanjay Kariyappa, Sanjeev Satheesh, Saran Vikas Murari, Satish Pasumarthi, Saurabh Mishra, Saurav Muralidharan, Scott Hara, Sean Narentharen, Selvaraj Anandaraj, Seonjin Na, Seonmeyong Bak, Seonmyeong Bak, Sepehr Sameni, Seph Mard, Serge Panev, Seth Henneman, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Mendelson, Shaun Kotek, Shawn Wang, Shay Aharon, Shaya Gharghabi, Sheng-Chieh Lin, Shi Chen, Shiqing Fan, Shirish Baskaran, Shreya Gopa, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Shwetha Krishnamurthy, Siddharth Singh, Simeng Sun, Sirshak Das, Sivakumar Arayandi Thottakara, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sridhar Bhuvanapalli, Srimukh Veccham, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Su Rong, Sugam Dipak Devare, Sukrit Rao, Sumeet Kumar Barua, Sungsoo Ha, Sunny Gai, Suriya Gunasekar, Suseella Panguluri, Suyog Gupta, Sviataslau Hinzburh, Sweta Priyadarshi, Syeda Nahida Akter, Talor Abramovich, Tan Bui, Tanay Varshney, Tatevik Ter-Hovhannisyan, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tianhe Zhang, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Tiyasa Mitra, Tom Balough, Tomasz Grzegorzek, Tomasz Hliwiak, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Tony Salim, Tony Wang, Traian Rebedea, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Venkat Srinivasan, Venmugil Elango, Vibhor Agrawal, Victor Cui, Vijay Korthikanti, Vikas Mehta, Vinay Rao, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Vu Pham, Wanli Jiang, Wasi Uddin Ahmad, Wataru Ishihara, Wei Du, Wei Ping, Weiheng Chai, Wenliang Dai, Wesley Helmholz, Will Jennings, Will Zhu, Wojciech Prazuch, Xiaowei Ren, Xiwen Yu, Yan Breek, Yang Chen, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Youngeun Kwon, Yu Yao, Yugi Guvvla, Yuki Huang, Yunsheng Liu, Zach Moshe, Zachary Newell, Zhilin Wang, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijie Yan, Zsolt-Alon Wertheimer
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
全体像:物事を「実行する」ためのスーパーブレイン
想像してみてください。あなたは非常に優秀なアシスタントを雇いました。現在のほとんどのAIアシスタントは、チャットをしたり短いメールを書いたりすることには長けています。しかし、Nemotron 3 Ultraは、**「長期プロジェクトのマネージャー」**として設計されています。これは、数時間にわたって起きてい続け、複数のウィンドウを開き、ウェブを検索し、コードを書き、エラーを修正し、あなたがつきっきりで指示を出さなくても、自律的に複雑なタスクを完了するために作られています。
論文では、このモデルがNVIDIAの中で最も有能なモデルであり、膨大な量の情報(一度に最大100万語)を扱いながら、高速かつ効率的であるように最適化されていると主張しています。
1. エンジン:AIのためのハイブリッド車
ほとんどのAIモデルは、あらゆるタスクに対して同じ方法で動作する、単一の巨大なエンジンのようなものです。Nemotron 3 Ultraは異なります。これはハイブリッド車両です。
- 「Mamba」エンジン: これは高速列車だと考えてください。情報を非常に素早く通り抜けることができ、背後に重い荷物列車(メモリ)を運ぶ必要がありません。これにより、長い物語や文書を処理するのが驚異的に速くなります。
- 「Transformer」エンジン: これは、深い推論や複雑な関係性の理解に優れた、古典的で強力なエンジンです。
- ハイブリッド: このモデルは、タスクに応じてこれら2つのエンジンの間を切り替えます。長い文書をスキャンする際には高速な列車を使い、深い思考が必要な際には強力なエンジンを使用します。この組み合わせにより、知能を失うことなく、競合他社よりもはるかに高速に動作することができます。
2. チーム構成:「混合エキスパート(Mixture of Experts)」
巨大な図書館を想像してください。一人の司書がすべての本についてすべてを知ろうとするのではなく(それは遅くて疲れる作業です)、図書館には512人の専門家がいます。
- 法律についての質問をすれば、法務の専門家だけが目覚めます。
- コーディングについて聞けば、コーディングの専門家だけが目覚めます。
- 数学について聞けば、数学の専門家だけが目覚めます。
これは**混合エキスパート(Mixture-of-Experts: MoE)**モデルと呼ばれます。Nemotron 3 Ultraには合計5500億の「エキスパート(パラメータ)」がありますが、単一の文章に対しては、そのうちの550億個しか「目覚め」させません。これは、膨大な数のスペシャリストが待機している状態ですが、今まさに必要な仕事に必要な分だけを呼び出すようなものです。これにより、膨大なエネルギーと時間を節約できます。
3. トレーニング:学生からマスターへ
論文では、このモデルをエキスパート・エージェントへと変貌させるための、3段階のトレーニングプロセスについて説明しています。
- ステップ1:事前学習(百科事典を読む): モデルは20兆のテキストトークン(単語やコード)を読み込みました。これは、巨大な図書館にあるすべての本を読んだようなものです。彼らはこれを効率的に行うために、特別な「低精度(low-precision)」フォーマット(NVFP4)を使用しました。これは、意味を損なうことなく、より多くの情報をページに詰め込むために、少し小さなフォントで本を読むようなものです。
- ステップ2:教師あり微調整(インターンシップ): モデルには、指示に従う方法、ツール(検索エンジンやコード・ターミナルなど)を使う方法、そして安全性を保つ方法を教えました。彼らは、問題をステップ・バイ・ステップで解決する方法の例を提示しました。
- ステップ3:強化学習と蒸留(マスタークラス): これが秘伝のソースです。
- まず、モデルはさまざまな「シミュレーション」(コーディング、数学、事務作業などのためのビデオゲームのようなもの)の中で、試行錯誤を通じて学習しました。
- 次に、彼らは10以上の特化した「教師」モデル(コーディング用、数学用、事務作業用など)を訓練しました。
- 最後に、**MOPD(Multi-teacher On-Policy Distillation)**という手法を用いました。メインのモデル(生徒)が問題を解こうとしているときに、専門の教師たちが、まさにどのようにすべきかについてアドバイスをささやく様子を想像してください。生徒は、教師たちのベストな動きを模倣することで学び、すべての知恵を一つのスーパーモデルへと統合していきます。
4. スーパーパワー
論文では、Nemotron 3 Ultraが持つ3つの主なスーパーパワーを強調しています。
- 100万語の記憶力: ほとんどのAIモデルは、数章分を超える長い本を与えられると混乱してしまいます。しかし、Nemotronは100万トークンのコンテキスト(およそ小説10冊分に相当)を読み取ることができ、最後のページを書いている間も、最初のページの細部を記憶しておくことができます。
- 「推論予算(Reasoning Budget)」の制御: ユーザーはモデルに対して、「素早く解いて、いくつかのステップは飛ばしてもいいよ」とか、「時間をかけて深く考えて」といった指示を出すことができます。これにより、タスクに応じてスピードと正確性のバランスを選択できます。
- スピード: ハイブリッドエンジンとエキスパート・システムのおかげで、他のトップクラスの公開モデルと比較して、最大6倍速く情報を処理できます。
5. 「脳」の安定性
論文では、これほど大きなモデルを訓練することは、綱渡りのようなものであることを認めています。トレーニング中に「発散(divergence)」(モデルがランダムで質の低い推測を始める現象)に2回遭遇しました。
- 修正1: 特定の数学的プロセス(勾配累積)で精度が失われていることに気づき、その部分については高精度モードに戻しました。
- 修正2: チーム内の「エキスパート」のバランスが崩れていること(一部のエキスパートがすべての仕事をし、他のエキスパートが眠っている状態)に気づきました。負荷が公平に共有されるようにシステムを調整し、モデルのクラッシュを防ぎました。
6. 結果:すべての人にオープンに
最もエキサイティングな部分は、NVIDIAがすべてをオープンソース化していることです。
- ベースモデル(生の脳)。
- ポストトレーニング済みモデル(エキスパート・エージェント)。
- 量子化バージョン(特定のNVIDIAチップ上でさらに高速に動作する圧縮版)。
- データとレシピ(彼らが読んだ本の正確なリストや、従った指示の内容)。
要約すると: Nemotron 3 Ultraは、長期的な自律的作業を行うために設計された、巨大なハイブリッドエンジンを持つAIです。専門化されたエキスパートのチームを利用して、深く考えながらも素早く動き、図書館全体のテキストを記憶することができ、誰もがこれを使って独自のAIエージェントを構築できるように公開されています。
テクニカルサマリー: Nemotron 3 Ultra
問題提起
大規模言語モデル(LLM)アプリケーションが、単純なチャットボットから、コーディング、リサーチ、複雑なタスク完了をこなす長時間稼働の自律型エージェントへと進化するにつれ、業界は重大なボトルネックに直面している。それは、高い精度だけでなく、スケールした際の高速かつ効率的な推論能力を必要としていることである。従来の密な(dense)モデルは、長いコンテキストや高スループットの要求に対して計算コストの面で苦戦することが多く、既存の混合エキスパート(MoE)モデルは、エージェント的な推能や長期間のタスクに不可欠なアーキテクチャの最適化が不足している場合がある。課題は、SOTA(最先端)の精度を達成しつつ、過度な計算オーバーヘッドなしに、推論スループットを大幅に向上させ、最大100万トークンという膨大なコンテキスト長をサポートすることである。
メソドロジー
モデルアーキテクチャ
Nemotron 3 Ultraは、総パラメータ数5500億、トークンあたりのアクティブパラメータ数550億のモデルである。これはハイブリッドMamba-Attention Mixture-of-Experts (MoE) アーキテクチャを採用している。
- ハイブリッド・バックボーン: 本モデルは、Mamba-2状態空間レイヤーと疎なグローバルAttentionアンカーを統合している。この設計により、AttentionのコストとKVキャッシュのフットプリントを削減し、プリフィル時のサブ二次的なシーケンス長のスケーリングと、デコード時の限定的なメモリ使用量を実現している。
- LatentMoE: モデルはエキスパートレイヤーにLatentMoEを利用しており、標準的なGranular MoEと比較して、アクティブパラメータあたりの精度を向上させている。
- マルチトークン予測 (MTP): アーキテクチャには、推論を大幅に加速させるための投機的デコーディングを可能にする、学習中に訓練されたネイティブなMTPヘッド(パラメータを共有する2つのヘッド)が含まれている。
事前学習
ベースモデルは、Warmup-Stable-Decay (WSD) 学習率スケジュールを用いて、20兆個のテキストトークンで事前学習された。
- 精度: 学習は、Transformer EngineのcuBLAS NVFP4 GEMMカーネルを活用し、ネットワークの大部分においてNVFP4 (NVIDIA FP4) 精度で行われた。安定性を確保するため、特定のレイヤー(最終15%、エンベディング、プロジェクション)のみが高精度に維持された。
- データ戦略: 事前学習コーパスは2つのフェーズに分けられた:
- フェーズ1 (15Tトークン): 多様性と幅広いドメインのカバレッジに焦点を当てた。
- フェーズ2 (5Tトークン): 精度を洗練させるための高品質なデータに焦点を当てた。
- 新しいデータソース: データセットには、更新されたコードデータ(GitHubからの173Bトークン)、法的・道徳的シナリオおよび事実探索のための合成データセット、および専門的な多言語データが含まれている。
- ロングコンテキスト拡張: 専用のロングコンテキスト(LC)フェーズにより、32ウェイのコンテキスト並列を用いた継続的事前学習(CPT)を通じて、モデルのコンテキストウィンドウを100万トークンまで拡張した。
ポストトレーニング・パイプライン
ポストトレーニング・パイプラインは、エージェント的な推論とツール利用に焦ellするように再設計され、斬新なマルチティーチャー・オンポリシー蒸留 (MOPD) アプローチを採用している。
- 教師あり微調整 (SFT): モデルは、ターミナル利用、検索、ソフトウェアエンジニアリング、安全性などのドメインをカバーする、最大512Kトークンのパッキングされたシーケンスを用いた2段階のSFTを経た。
- 統合されたRLVR: 多様な環境(コーディング、数学、安全性、チャットなど)に対して、検証可能な報酬を用いた強化学習(RLVR)ステージが適用され、能力を研ぎ澄ませた。
- マルチティーチャー・オンポリシー蒸留 (MOPD): 混合環境におけるRLでの学習信号の希釈を克服するため、チームは10以上のドメイン特化型ティーチャーモデル(例:SWE、検索、STEM、オフィス業務)を訓練した。その後、学生モデル(Nemotron 3 Ultra)は非同期のオンポリシー蒸留を受け、専門化されたこれらのティーチャーからロールアウトを生成し、高密度なトークンレベルのガイダンスを受けた。このプロセスは、ティーチャーが学生の進捗に基づいて更新される形で、2回繰り返された。
- MTPブースティング: 最終ステージでは、推論時のノイズ条件下での投機的デコーディングの受理率を向上させるため、バックボーンの分布にMTPヘッドを適合させる最適化が行われた。
量子化と推論
- 量子化: モデルは、NVIDIA Blackwell GPU上での推論用にNVFP4に量子化された。ルーティングされたエキスパートにはNVFP4、共有エキスパート/MambaにはFP8、AttentionにはBF16を使用する混合精度レシピを採用し、5.03 bits-per-element (BPE) の動作ポイントを実現した。
- インフラストラクチャ: 学習および推論インフラはGB200クラスター向けに最適化されており、550Bパラメータの規模を扱うために、トポロジーを意識したNVLink配置、NUMAバインディング、および非同期チェックポインティングを備えている。
主な貢献
- Nemotron 3 Ultra モデル: エージェント的な推論に最適化された550BパラメータのMoEハイブリッドMamba-Attentionモデルのリリース。
- オープンソース公開: Base、Post-Trained、およびNVFP4量子化されたチェックポイントに加え、学習データ(法的、コード、および専門的な合成データセットを含む)と学習レシピをHuggingFaceでフルオープンソースとして公開。
- MOPDフレームワーク: 標準的なRLVRと比較して、エージェント的および推論タスクにおいて優れた性能を実現するための、複数の専門化されたティーチャーモデルと非同期オンポリシー蒸留を用いた新しいポストトレーニング手法。
- NVFP4 スケール: 550Bパラメータのモデルにおける、大規模なNVFP4事前学習(20Tトークン)の安定性を実証し、低精度学習の安定性における新たなベンチマークを確立。
- 1Mトークン コンテキスト: 高い精度を維持しながら、モデルのコンテキストウィンドウを100万トークンに拡張することに成功。
結果
Nemotron 3 Ultraは、競争力のある精度を維持しながら、大幅な推論スループットの向上を実現している:
- スループット: 8K入力 / 64K出力の設定において(GB200上のNVFP4精度)、GLM-5.1-754B-A40Bと比較して5.9倍、Kimi-K2.6-1T-A32Bと比較して4.8倍、Qwen-3.5-397B-17Bと比較して1.6倍高い推論スループットを達成している。
- 精度: 以下の広範なベンチマークにおいて、同等または優れた精度を達成している:
- エージェントタスク: Terminal Bench 2.1 (56.4)、GDPVal (46.7)、SWE-Bench Verified (70.7)、TauBench V3 (平均70.9)。
- 推論: GPQA (87.0)、MMLU-Pro (86.8)、IOI 2025 (570.0、トップ3の人間のレベルのパフォーマンスに位置する)。
- ロングコンテキスト: 1MトークンにおけるRULER (94.7)。
- テスト時スケーリング: オリンピアードレベルの数学に対する検索ベースのテスト時スケーリング戦略を使用した場合、USAMO 2026で97.6%、Putnam 2025で96.7%の精度を達成した。
意義
本論文は、Nemotron 3 Ultraが、大規模で高精度なモデルを自律的なエージェントタスクに実用化するための重要な一歩であることを主張している。ハイブリッドMamba-Attentionアーキテクチャと高度な蒸留技術(MOPD)、および低精度学習(NVFP4)を組み合わせることで、本モデルは推論速度と精度の間の伝統的なトレードオフを打破している。著者らは、100万トークンのコンテキストを処理できる能力と高いスループットにより、本モデルが長時間稼働する複雑なエージェントのワークフローに理想的であることを強調している。専門的な学習データとレシピを含むオープンソースとしてのリリースは、より広いコミュニティにおけるエージェント型AIシステムの開発を加速させることを目的としている。保持されたエージェントベンチマーク(PinchBench, ProfBench)におけるモデルの性能は、その改善が標準的な開発指標を超えて、未知の実世界のシナリオにも汎用することを示唆している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。