Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
Nemotron 3 Super は、NVFP4 での前学習、LatentMoE 構造、MTP レイヤー、および 100 万トークンのコンテキスト長に対応する 1200 億パラメータ(アクティブ 120 億)のハイブリッド Mamba-Transformer モデルであり、推論スループットの大幅な向上とオープンソース化を実現したものです。
原著者: NVIDIA, :, Aakshita Chandiramani, Aaron Blakeman, Abdullahi Olaoye, Abhibha Gupta, Abhilash Somasamudramath, Abhinav Khattar, Adeola Adesoba, Adi Renduchintala, Adil Asif, Aditya Agrawal, Aditya Vavre, Ahmad Kiswani, Aishwarya Padmakumar, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Gronskiy, Alex Kondratenko, Alex Neefus, Alex Steiner, Alex Yang, Alexander Bukharin, Alexander Young, Ali Hatamizadeh, Ali Taghibakhshi, Alina Galiautdinova, Alisa Liu, Alok Kumar, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrew Tao, Anjaney Shrivastava, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Ann Guan, Anna Shors, Annamalai Chockalingam, Anubhav Mandarwal, Aparnaa Ramani, Arham Mehta, Arti Jain, Arun Venkatesan, Asha Anoosheh, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asli Sabanci Demiroz, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Benjamin Chislett, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bobby Chen, Boris Ginsburg, Brandon Norick, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Buvaneswari Mani, Carlo del Mundo, Chankyu Lee, Chanran Kim, Chantal Hwang, Chao Ni, Charles Wang, Charlie Truong, Cheng-Ping Hsieh, Chenhan Yu, Chenjie Luo, Cherie Wang, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Chris Holguin, Chris Wing, Christian Munley, Christopher Parisien, Chuck Desai, Chunyang Sheng, Collin Neale, Cyril Meurillon, Dakshi Kumar, Dan Gil, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Burkhardt Eliuth Triana, Daniel Egert, Daniel Fatade, Daniel Lo, Daniel Rohrer, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Edelsohn, David Messina, David Mosallanezhad, David Tamok, Deena Donia, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di Wu, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dmitry Konyagin Brandon Tuttle, Dong Ahn, Dongfu Jiang, Dorrin Poorkay, Douglas O'Flaherty, Duncan Riach, Dusan Stosic, Dustin Van Stee, Edgar Minasyan, Edward Lin, Eileen Peters Long, Elad Segal, Elena Lantz, Elena Lewis, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric W. Tramel, Erick Galinkin, Erik Pounds, Esti Etrog, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Farshad Saberi Movahed, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Fortuna Zhang, Frankie Siino, Frida Hou, Gantavya Bhatt, Gargi Prasad, Geethapriya Venkataramani, Geetika Gupta, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Grace Wu, Greg Pauloski, Greyson Davis, Grigor Nalbandyan, Guoming Zhang, Guy Farber, Guyue Huang, Haifeng Qian, Haran Kumar Shiv Kumar, Harry Kim, Harsh Sharma, Hayate Iso, Hayley Ross, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huy Nguyen, Iain Cunningham, Ido Galil, Ido Shahaf, Igino Padovani, Igor Gitman, Igor Shovkun, Ikroop Dhillon, Ilya Loshchilov, Ingrid Kelly, Itamar Schen, Itay Levy, Ivan Moshkov, Izik Golan, Izzy Putterman, Jain Tu, Jan Baczek, Jan Kautz, Jane Polak Scowcroft, Janica Rosenberg, Jared Casper, Jarrod Pflum, Jason Grant, Jason Sewall, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiaqi Zeng, Jie Lou, Jill Milton, Jim Chow, Jimmy Zhang, Jinhang Choi, Jining Huang, Jocelyn Huang, Joel Caruso, Joey Conway, Joey Guman, Johan Jatko, John Kamalu, Johnny Greco, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joyjit Daw, Juan Yu, Julio Tapia, Junkeun Yi, Jupinder Parmar, Jyothi Achar, Kari Briski, Kartik Mattoo, Katherine Cheung, Katherine Luna, Keith Wyss, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirill Buryak, Kirthi Shankar Sivamani, Konstantinos Krommydas, Kris Murphy, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Laikh Tewari, Laya Sleiman, Leo Du, Leon Derczynski, Li Ding, Lilach Ilan, Lingjie Wu, Lizzie Wei, Luis Vega, Lun Su, Maarten Van Segbroeck, Maer Rodrigues de Melo, Magaret Zhang, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Sreedhar, Makesh Tarun Chandran, Manuel Reyes Gomez, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Margaret Zhang, Mark Cai, Mark Gabel, Markus Kliegl, Martyna Patelka, Maryam Moosaei, Matthew Varacalli, Matvei Novikov, Mauricio Ferrato, Mehrzad Samadi, Melissa Corpuz, Meng Xin, Mengdi Wang, Mengru Wang, Meredith Price, Micah Schaffer, Michael Andersch, Michael Boone, Michael Evans, Michael Z Wang, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Hollinger, Mingyuan Ma, Minseok Lee, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Nader Khalil, Najeeb Nabwani, Nancy Agarwal, Nanthini Balasubramaniam, Narimane Hennouni, Narsi Kodukula, Natalie Hereth, Nathaniel Pinckney, Nave Assaf, Negar Habibi, Nestor Qin, Neta Zmora, Netanel Haber, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nir Ailon, Nirmal Juluru, Nirmalya De, Nowel Pitt, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Almog, Omri Puny, Oren Tropp, Otavio Padovani, Ouye Xie, Parth Chadha, Pasha Shamis, Paul Gibbons, Pavlo Molchanov, Peter Belcak, Peter Jin, Pinky Xu, Piotr Januszewski, Pooya Jannaty, Prachi Shevate, Pradeep Thalasta, Pranav Prashant Thombre, Prasoon Varshney, Prerana Gambhir, Pritam Gundecha, Przemek Tredak, Qing Miao, Qiyu Wan, Quan Tran Minh, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Rahul Kandu, Raina Zhong, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Renee Yao, Renjie Pi, Richard Mazzarese, Richard Wang, Rick Izzo, Ridhima Singla, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Roger Waleffe, Rohit Varma Kalidindi, Rohit Watve, Roi Koren, Ron Fan, Ruchika Kharwar, Ruisi Cai, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Ryota Egashira, Sadegh Mahdavi, Sagar Singh Ashutosh Joshi, Sahil Modi, Samuel Kriman, Sandeep Pombra, Sanjay Kariyappa, Sanjeev Satheesh, Santiago Pombo, Saori Kaji, Satish Pasumarthi, Saurav Mishra, Saurav Muralidharan, Scott Hara, Sean Narenthiran, Sebastian Rogawski, Seonjin Na, Seonmyeong Bak, Sepehr Sameni, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh Adam Lord, Sharath Turuvekere Sreenivas, Shaun Kotek, Shaya Gharghabi, Shelby Thomas, Sheng-Chieh Lin, Shibani Likhite, Shiqing Fan, Shiyang Chen, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuo Zhang, Shuoyang Ding, Shyam Renjith, Shyamala Prayaga, Siddhartha Jain, Simeng Sun, Sirisha Rella, Sirshak Das, Smita Ithape, Sneha Harishchandra S, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sriharsha Niverty, Stas Sergienko, Stefana Gloginic, Stefania Alborghetti, Stephen Ge, Stephen McCullough, Sugam Dipak Devare, Suguna Varshini Velury, Sukrit Rao, Sumeet Kumar Barua, Sunny Gai, Suseella Panguluri, Sushil Koundinyan, Swathi Patnam, Sweta Priyadarshi, Swetha Bhendigeri, Syeda Nahida Akter, Sylendran Arunagiri, Tailling Yuan, Talor Abramovich, Tan Bui, Tan Yu, Terry Kong, Thanh Do, Thomas Gburek, Thorgane Marques, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Timothy Ma, Tiyasa Mitra, Tomasz Grzegorzek, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Traian Rebedea, Trenton Starkey, Tugrul Konuk, Twinkle Vashishth, Tyler Condensa, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Vanshil Atul Shah, Veena Vaidyanathan, Venkat Srinivasan, Venmugil Elango, Victor Cui, Vijay Korthikanti, Vikas Mehta, Virginia Adams, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Wan Seo, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wei-Ming Chen, Wendy Quan, Wenliang Dai, Wenwen Gao, Will Jennings, William Zhang, Xiaowei Ren, Xiaowen Xin, Xin Li, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Suhara, Youngeun Kwon, Yuan Zhang, Yuki Huang, Zach Moshe, Zhilin Wang, Zhiyu Cheng, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijia Chen, Zijie Yan, Zuhair Ahmed
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ネマトロン 3 スーパー:AI の「超能力」を解き放つ新技術
2026 年 4 月、NVIDIA は「Nemotron 3 Super(ネマトロン 3 スーパー)」という新しい AI モデルを発表しました。これは単なる「賢い AI」ではなく、**「効率よく考え、素早く行動し、長文も完璧に理解する」**次世代の AI アシスタントです。
この論文を、難しい専門用語を使わず、日常の例え話で解説します。
1. この AI はどんな「スーパーヒーロー」?
この AI は、「1200 億個の部品」を持っていますが、実際に作業するときは「120 億個」だけを使います。
- 従来の AI(密集型): 巨大な図書館の全職員が、どんな小さな質問にも全員で答えるために集まってくるようなもの。とても正確ですが、時間とコストがかかります。
- ネマトロン 3 スーパー(MoE:混合専門家): 巨大な図書館には 1200 億人の専門家がいますが、質問が「数学」なら数人の数学者だけが飛び出し、「料理」ならシェフたちだけが出てきます。**「必要な人だけが出る」**ので、驚くほど速く、かつ正確に答えられます。
さらに、この AI は**「Mamba(マンバ)」という新しい脳の仕組みと「アテンション(注目)」**という仕組みを混ぜ合わせています。
- Mamba: 長い物語を忘れない「超記憶力」。
- アテンション: 重要な部分にピンポイントで注目する「集中力」。
この 2 つを組み合わせることで、**「100 万文字(1M コンテキスト)」**もの長い文章や本を一度に読んでも、内容を完璧に理解できます。
2. 3 つの「超能力」で、なぜこれほどすごいのか?
このモデルには、3 つの特別な技術が搭載されています。
① 「LatentMoE(ラテン MoE)」:賢さを圧縮する魔法の箱
- 昔の技術: 専門家に相談する際、全員に「巨大なファイル」を渡して相談していました。
- ネマトロンの技術: 相談する前に、内容を**「コンパクトなメモ(潜在空間)」**にまとめてから専門家に渡します。
- 効果: 専門家の数は増やせるのに、メモのサイズは小さく済むため、**「より多くの専門家(知識)」を「より少ないエネルギー」**で動かせます。まるで、100 人分の料理を、小さなキッチンで 10 人分と同じ時間で作れる魔法のコンロのようなものです。
② 「MTP(マルチトークン予測)」:先読みする天才
- 普通の AI: 「りんご」→「は」→「赤い」と、1 文字ずつ順番に考えて出力します。
- ネマトロン: 「りんごは赤い」まで一度に 3 つ先を予測して、同時に出力します。
- 効果: 思考のスピードが劇的に向上します。まるで、文章を書く際、1 文字ずつ書くのではなく、「単語単位」や「フレーズ単位」で一気に書き上げられるようなものです。これにより、回答速度が最大で7.5 倍に速くなりました。
③ 「NVFP4」:低精度でも高品質な「デジタル料理」
- 通常: 料理(計算)をする際、高価で重い道具(高精度な数値)を使います。
- ネマトロン: 軽量で安価な道具(低精度な数値:NVFP4)を使っても、味(精度)が落ちないように工夫しました。
- 効果: 道具が軽くなるので、**「より多くの食材(データ)」を「より少ない燃料(電力)」**で調理できます。25 兆語もの膨大なデータで学習しましたが、計算コストは大幅に抑えられています。
3. どのように「育てられた」のか?(学習プロセス)
この AI は、3 つの段階で育てられました。
基礎学習(プレトレーニング):
- 25 兆語のデータ(インターネット上の本、記事、コードなど)を読み込みました。
- 特徴: 最初は「広範囲な知識」を詰め込み、後半は「高品質なデータ」で仕上げました。まるで、小学生から大学生まで、幅広い本を読み、最後に専門書で深掘りするような学習です。
実戦訓練(ポストトレーニング):
- ここが最大の特徴です。AI に**「エージェント(自律行動)」**の能力を教えました。
- 何をしたか?
- プログラミング: 実際の GitHub の課題を解決する練習。
- ターミナル操作: コマンドラインを使って PC を操作する練習。
- ツール使用: 検索エンジンや計算ツールを使って、複雑なタスクをこなす練習。
- 結果: 単に「話す」だけでなく、**「実際に手を動かして問題を解決する」**能力が飛躍的に向上しました。
人間との調和(RLHF):
- 人間のフィードバックを元に、より自然で安全な回答ができるように調整しました。
4. 実際の性能は?(ベンチマーク結果)
この AI は、既存のトップクラスの AI(GPT-OSS や Qwen など)と比べても、「速さ」で圧倒的な差をつけています。
- 速度: 従来の AI より2.2 倍〜7.5 倍速く回答できます。
- 精度: 数学、プログラミング、論理パズルなどのテストでは、トップモデルと同等かそれ以上のスコアを叩き出しています。
- 長文理解: 100 万文字の文書を読んでも、必要な情報を正確に引き出せます。
5. まとめ:なぜこれが重要なのか?
NVIDIA はこのモデルの**「設計図(学習データや重み)」をすべて公開**しました。
- これまでは: 巨大な AI は「高価で、遅く、閉ざされた箱」でした。
- これから: 「安価で、超高速で、誰でも使える」AI が登場します。
「ネマトロン 3 スーパー」は、AI が「頭が良い」だけでなく、「手際よく、速く、現実世界で役立つ仕事」ができるようになったことを示す、大きな一歩です。
まるで、**「天才的な頭脳を持ちながら、自転車のように軽く、ロケットのように速く走る」**新しいタイプの AI アシスタントが、ついにあなたの手の届くところに来たようなものです。
Nemotron 3 Super: 技術的サマリー
本論文は、NVIDIA が開発した大規模言語モデル(LLM)「Nemotron 3 Super」のアーキテクチャ、前学習、後学習、量子化、および評価結果について詳述しています。このモデルは、1200 億パラメータ(アクティブ 120 億パラメータ)のハイブリッド Mixture-of-Experts (MoE) モデルであり、Mamba-2 と Attention の組み合わせ、新しい MoE 構造「LatentMoE」、および推論加速のための「Multi-Token Prediction (MTP)」を採用しています。特に、エージェントとしての推論能力(Agentic Reasoning)に重点を置いています。
以下に、問題定義、手法、主要な貢献、結果、および意義について詳細をまとめます。
1. 問題定義と背景
近年の LLM 開発において、以下の課題が浮き彫りになっています。
- 推論コストと精度のトレードオフ: 高密度なモデルは精度が高いが推論コストが高く、MoE モデルは効率的だが、メモリ帯域幅や通信オーバーヘッドにより実際の推論スループットが制限されることがある。
- 長文脈と推論速度の両立: 長文脈(Long Context)処理において、Self-Attention の KV キャッシュの二次成長がボトルネックとなり、推論遅延が増大する。
- エージェントタスクへの対応: 複雑なツール使用、コード生成、ターミナル操作など、多段階の推論を必要とするエージェントタスクにおいて、既存モデルは頑健性や効率性に課題を抱えている。
- 低精度学習の安定性: 推論効率を高めるための低精度(NVFP4 など)での大規模前学習において、勾配のゼロ化や精度劣化を防ぐことが難しい。
Nemotron 3 Super は、これらの課題を解決し、高精度かつ高スループットなエージェント指向モデルを実現することを目的としています。
2. 手法とアーキテクチャ
2.1. ハイブリッド Mamba-Attention MoE アーキテクチャ
- LatentMoE の採用: 従来の MoE 構造を改良した「LatentMoE」を初めて採用しました。
- 仕組み: 入力トークンを隠れ次元 d からより小さな潜在次元 ℓ へ射影し、エキスパート計算とルーティングをこの低次元空間で行います。その後、元の次元に戻します。
- 効果: 転送されるパラメータ量と All-to-All 通信量を d/ℓ 倍削減します。この節約分を用いて、エキスパート数 N とアクティブなエキスパート数 K を同倍率で増加させることで、推論コストを維持しつつモデルの精度を向上させます。
- Mamba-2 と Attention のハイブリッド:
- 88 層のスタックにおいて、Mamba-2 ブロック(線形時間計算量、定数状態サイズ)を主に使用し、KV キャッシュのメモリオーバーヘッドを削減。
- 戦略的に Attention レイヤー(Global Anchors)を配置し、長距離依存関係のモデル化を維持します。
- 最大 100 万トークンのコンテキスト長をサポート。
2.2. Multi-Token Prediction (MTP) と推論加速
- MTP の実装: 従来の「次のトークン予測」に加え、複数の未来トークンを同時に予測するタスクを学習させます。
- ネイティブ推測的デコーディング: MTP ヘッドを内部のドラフトモデルとして機能させ、推論時に複数の候補トークンを生成し、メインモデルで検証します。
- 共有重み設計: 複数のオフセットに対して重みを共有することで、自己生成状態における分布シフトを軽減し、長いドラフト長でも安定した受諾率を維持します。これにより、外部ドラフトモデルなしで Blackwell GPU 上で高いスループットを実現します。
2.3. 学習プロセス
- 前学習 (Pre-training):
- データ: 25 兆トークン(2 段階のキュリキュラム:多様性重視→高品質データ重視)。
- NVFP4 前学習: 世界で初めて NVFP4 精度で前学習を行いました。特定の層(最終 15%、MTP 層など)を BF16 に保つことで安定性を確保しつつ、全体的な計算効率を最大化しました。
- 課題解決: NVFP4 学習における勾配のゼロ化(Underflow)を特定し、Mamba 出力層などを MXFP8 に保つなどの対策を講じました。
- 後学習 (Post-training):
- SFT: 700 万サンプル以上で、特にエージェントタスク(ソフトウェア工学、ターミナル使用、検索、ツール使用など)に特化したデータで微調整。
- RL (Reinforcement Learning):
- RLVR: 21 種類の環境(数学、コード、STEM、安全、長文脈など)で検証可能な報酬を用いた強化学習。
- SWE-RL: ソフトウェア工学タスク(GitHub 課題の解決)に特化したエンドツーエンドの RL。
- PivotRL: 長期的なエージェントタスクにおいて、SFT 軌跡内の重要なターン(Pivot)に焦点を当てた効率的な RL 手法を採用。
- RLHF: 人間のフィードバックに基づく調整。
- MTP Healing: 後学習の最終段階で MTP ヘッドを再学習し、推論時の受諾率を向上させました。
2.4. 量子化 (Quantization)
- FP8 および NVFP4 量子化: 推論用チェックポイントとして FP8 と NVFP4 を提供。
- AutoQuantize: 層ごとの感度に基づき、NVFP4、FP8、BF16 を最適に混合する混合精度量子化手法を採用。
- Mamba 状態キャッシュの量子化: 再帰的な Mamba 構造における誤差蓄積を防ぐため、FP16 へのキャスト時に確率的丸め (Stochastic Rounding) を適用し、精度と verbosity(冗長性)のバランスを最適化しました。
3. 主要な貢献
- LatentMoE の実用化: 推論コストを一定に保ちながら、パラメータ数と FLOPs 当たりの精度を向上させる新しい MoE 構造を初めて大規模モデルに適用。
- NVFP4 での大規模前学習: 25 兆トークンの前学習を NVFP4 精度で安定して完了させ、低精度学習の技術的ハードルを克服。
- MTP によるネイティブ推測的デコーディング: 外部ドラフトモデルなしで、Blackwell GPU 上で最大 7.5 倍の推論スループット向上を実現。
- エージェント指向の強化学習: 21 種類の環境と PivotRL を活用し、ソフトウェア工学、ターミナル操作、ツール使用など、複雑な長期的タスクにおける能力を大幅に強化。
- オープンソース化: ベースモデル、後学習済みモデル、量子化モデル、およびトレーニングデータ(合成データ含む)を HuggingFace で公開。
4. 結果
- 精度: 一般的なベンチマーク(MMLU-Pro, HMMT, SWE-Bench など)において、GPT-OSS-120B や Qwen3.5-122B と同等かそれ以上の精度を達成。
- 特に SWE-Bench (OpenHands) では 60.47%、Terminal Bench Hard では 25.78% を記録。
- 長文脈(RULER 1M)では 91.64% の精度を維持。
- 推論スループット:
- 8k 入力 / 64k 出力の設定において、GPT-OSS-120B に対して2.2 倍、Qwen3.5-122B に対して7.5 倍の推論スループットを達成。
- MTP 有効化により、レイテンシを維持しつつスループットを大幅に向上。
- 量子化性能: NVFP4 量子化モデルは、BF16 ベースラインに対して 99.8% の精度を維持しつつ、Blackwell GPU 上で極めて高い効率性を示しました。
5. 意義
Nemotron 3 Super は、「高精度」と「高効率」を両立させたエージェント指向 LLMの新たな基準を示しました。
- アーキテクチャの進化: Mamba と MoE のハイブリッド化、および LatentMoE の導入は、メモリ帯域幅と計算コストの制約下でのモデルスケーリングの新しい道筋を開きました。
- 推論効率の革新: MTP と推測的デコーディングの組み合わせは、生成 AI の実運用におけるコスト削減と応答速度向上に大きく寄与します。
- エージェント能力の飛躍: 複雑なツール使用や長期的なタスク遂行において、強化学習と合成データを活用したアプローチが、実世界での適用可能性を高めています。
- オープンエコシステム: 大規模モデルのトレーニングレシピ、データ、チェックポイントを公開することで、研究コミュニティや産業応用におけるイノベーションを加速させることが期待されます。
本モデルは、特にリソース制約のある環境や、高速な推論が求められるエージェントアプリケーションにおいて、強力な基盤技術となります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。