Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
Nemotron 3 Super 是 NVIDIA 开源的首款采用 NVFP4 预训练、LatentMoE 架构及 MTP 层加速的 1200 亿参数(激活 120 亿)混合 Mamba-Transformer 专家模型,支持 100 万上下文长度,在保持基准精度的同时实现了远超同类模型的推理吞吐量。
原作者: NVIDIA, :, Aakshita Chandiramani, Aaron Blakeman, Abdullahi Olaoye, Abhibha Gupta, Abhilash Somasamudramath, Abhinav Khattar, Adeola Adesoba, Adi Renduchintala, Adil Asif, Aditya Agrawal, Aditya Vavre, Ahmad Kiswani, Aishwarya Padmakumar, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Gronskiy, Alex Kondratenko, Alex Neefus, Alex Steiner, Alex Yang, Alexander Bukharin, Alexander Young, Ali Hatamizadeh, Ali Taghibakhshi, Alina Galiautdinova, Alisa Liu, Alok Kumar, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrew Tao, Anjaney Shrivastava, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Ann Guan, Anna Shors, Annamalai Chockalingam, Anubhav Mandarwal, Aparnaa Ramani, Arham Mehta, Arti Jain, Arun Venkatesan, Asha Anoosheh, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asli Sabanci Demiroz, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Benjamin Chislett, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bobby Chen, Boris Ginsburg, Brandon Norick, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Buvaneswari Mani, Carlo del Mundo, Chankyu Lee, Chanran Kim, Chantal Hwang, Chao Ni, Charles Wang, Charlie Truong, Cheng-Ping Hsieh, Chenhan Yu, Chenjie Luo, Cherie Wang, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Chris Holguin, Chris Wing, Christian Munley, Christopher Parisien, Chuck Desai, Chunyang Sheng, Collin Neale, Cyril Meurillon, Dakshi Kumar, Dan Gil, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Burkhardt Eliuth Triana, Daniel Egert, Daniel Fatade, Daniel Lo, Daniel Rohrer, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Edelsohn, David Messina, David Mosallanezhad, David Tamok, Deena Donia, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di Wu, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dmitry Konyagin Brandon Tuttle, Dong Ahn, Dongfu Jiang, Dorrin Poorkay, Douglas O'Flaherty, Duncan Riach, Dusan Stosic, Dustin Van Stee, Edgar Minasyan, Edward Lin, Eileen Peters Long, Elad Segal, Elena Lantz, Elena Lewis, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric W. Tramel, Erick Galinkin, Erik Pounds, Esti Etrog, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Farshad Saberi Movahed, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Fortuna Zhang, Frankie Siino, Frida Hou, Gantavya Bhatt, Gargi Prasad, Geethapriya Venkataramani, Geetika Gupta, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Grace Wu, Greg Pauloski, Greyson Davis, Grigor Nalbandyan, Guoming Zhang, Guy Farber, Guyue Huang, Haifeng Qian, Haran Kumar Shiv Kumar, Harry Kim, Harsh Sharma, Hayate Iso, Hayley Ross, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huy Nguyen, Iain Cunningham, Ido Galil, Ido Shahaf, Igino Padovani, Igor Gitman, Igor Shovkun, Ikroop Dhillon, Ilya Loshchilov, Ingrid Kelly, Itamar Schen, Itay Levy, Ivan Moshkov, Izik Golan, Izzy Putterman, Jain Tu, Jan Baczek, Jan Kautz, Jane Polak Scowcroft, Janica Rosenberg, Jared Casper, Jarrod Pflum, Jason Grant, Jason Sewall, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiaqi Zeng, Jie Lou, Jill Milton, Jim Chow, Jimmy Zhang, Jinhang Choi, Jining Huang, Jocelyn Huang, Joel Caruso, Joey Conway, Joey Guman, Johan Jatko, John Kamalu, Johnny Greco, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joyjit Daw, Juan Yu, Julio Tapia, Junkeun Yi, Jupinder Parmar, Jyothi Achar, Kari Briski, Kartik Mattoo, Katherine Cheung, Katherine Luna, Keith Wyss, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirill Buryak, Kirthi Shankar Sivamani, Konstantinos Krommydas, Kris Murphy, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Laikh Tewari, Laya Sleiman, Leo Du, Leon Derczynski, Li Ding, Lilach Ilan, Lingjie Wu, Lizzie Wei, Luis Vega, Lun Su, Maarten Van Segbroeck, Maer Rodrigues de Melo, Magaret Zhang, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Sreedhar, Makesh Tarun Chandran, Manuel Reyes Gomez, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Margaret Zhang, Mark Cai, Mark Gabel, Markus Kliegl, Martyna Patelka, Maryam Moosaei, Matthew Varacalli, Matvei Novikov, Mauricio Ferrato, Mehrzad Samadi, Melissa Corpuz, Meng Xin, Mengdi Wang, Mengru Wang, Meredith Price, Micah Schaffer, Michael Andersch, Michael Boone, Michael Evans, Michael Z Wang, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Hollinger, Mingyuan Ma, Minseok Lee, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Nader Khalil, Najeeb Nabwani, Nancy Agarwal, Nanthini Balasubramaniam, Narimane Hennouni, Narsi Kodukula, Natalie Hereth, Nathaniel Pinckney, Nave Assaf, Negar Habibi, Nestor Qin, Neta Zmora, Netanel Haber, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nir Ailon, Nirmal Juluru, Nirmalya De, Nowel Pitt, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Almog, Omri Puny, Oren Tropp, Otavio Padovani, Ouye Xie, Parth Chadha, Pasha Shamis, Paul Gibbons, Pavlo Molchanov, Peter Belcak, Peter Jin, Pinky Xu, Piotr Januszewski, Pooya Jannaty, Prachi Shevate, Pradeep Thalasta, Pranav Prashant Thombre, Prasoon Varshney, Prerana Gambhir, Pritam Gundecha, Przemek Tredak, Qing Miao, Qiyu Wan, Quan Tran Minh, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Rahul Kandu, Raina Zhong, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Renee Yao, Renjie Pi, Richard Mazzarese, Richard Wang, Rick Izzo, Ridhima Singla, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Roger Waleffe, Rohit Varma Kalidindi, Rohit Watve, Roi Koren, Ron Fan, Ruchika Kharwar, Ruisi Cai, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Ryota Egashira, Sadegh Mahdavi, Sagar Singh Ashutosh Joshi, Sahil Modi, Samuel Kriman, Sandeep Pombra, Sanjay Kariyappa, Sanjeev Satheesh, Santiago Pombo, Saori Kaji, Satish Pasumarthi, Saurav Mishra, Saurav Muralidharan, Scott Hara, Sean Narenthiran, Sebastian Rogawski, Seonjin Na, Seonmyeong Bak, Sepehr Sameni, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh Adam Lord, Sharath Turuvekere Sreenivas, Shaun Kotek, Shaya Gharghabi, Shelby Thomas, Sheng-Chieh Lin, Shibani Likhite, Shiqing Fan, Shiyang Chen, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuo Zhang, Shuoyang Ding, Shyam Renjith, Shyamala Prayaga, Siddhartha Jain, Simeng Sun, Sirisha Rella, Sirshak Das, Smita Ithape, Sneha Harishchandra S, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sriharsha Niverty, Stas Sergienko, Stefana Gloginic, Stefania Alborghetti, Stephen Ge, Stephen McCullough, Sugam Dipak Devare, Suguna Varshini Velury, Sukrit Rao, Sumeet Kumar Barua, Sunny Gai, Suseella Panguluri, Sushil Koundinyan, Swathi Patnam, Sweta Priyadarshi, Swetha Bhendigeri, Syeda Nahida Akter, Sylendran Arunagiri, Tailling Yuan, Talor Abramovich, Tan Bui, Tan Yu, Terry Kong, Thanh Do, Thomas Gburek, Thorgane Marques, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Timothy Ma, Tiyasa Mitra, Tomasz Grzegorzek, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Traian Rebedea, Trenton Starkey, Tugrul Konuk, Twinkle Vashishth, Tyler Condensa, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Vanshil Atul Shah, Veena Vaidyanathan, Venkat Srinivasan, Venmugil Elango, Victor Cui, Vijay Korthikanti, Vikas Mehta, Virginia Adams, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Wan Seo, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wei-Ming Chen, Wendy Quan, Wenliang Dai, Wenwen Gao, Will Jennings, William Zhang, Xiaowei Ren, Xiaowen Xin, Xin Li, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Suhara, Youngeun Kwon, Yuan Zhang, Yuki Huang, Zach Moshe, Zhilin Wang, Zhiyu Cheng, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijia Chen, Zijie Yan, Zuhair Ahmed
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这是一篇关于 NVIDIA 最新发布的超级大模型 Nemotron 3 Super 的技术报告。为了让你轻松理解,我们可以把构建和使用这个 AI 模型想象成打造并训练一位“超级全能管家”。
以下是用通俗易懂的语言和生动的比喻对这篇论文的解读:
1. 这位“管家”是谁?(模型架构)
想象一下,你以前请的管家(普通大模型)是一个全能但反应慢的人,他脑子里有 120 亿个知识点,但每次回答问题都要把这 120 亿个知识点全部过一遍,所以很慢。
Nemotron 3 Super 则不同,它采用了**“专家小组” + “快速通道”**的混合模式:
- 120 亿总参数,但只激活 12 亿:它像一个拥有 120 亿个专家的大公司,但每次处理任务时,它只唤醒最合适的 12 亿个专家来工作。这就像你家里有个巨大的图书馆,但每次你问问题,它只派最懂那个领域的几个图书管理员出来,既快又准。
- LatentMoE(潜空间专家)技术:这是它的独门秘籍。以前的“专家小组”在传递信息时,就像要把一吨重的货物(高维数据)搬来搬去,很费力气。Nemotron 3 Super 发明了一种“压缩快递”技术,先把货物打包成小包裹(低维空间)再搬运,到了目的地再 unpack。这样既省了力气(显存带宽),又让专家数量可以翻倍,让管家变得更聪明。
- Mamba + Transformer 混合:它把两种技术结合了。
- Transformer 像是一个记忆力超群的侦探,擅长处理复杂的逻辑推理(比如做数学题)。
- Mamba 像是一个反应极快的快递员,擅长处理长文档和快速流式数据,而且不占地方。
- 两者结合,让管家既能读得懂几百万字的长篇小说(支持 100 万上下文),又能秒回你的消息。
2. 它是怎么“上学”的?(预训练与数据)
- 吃得少,学得多(NVFP4 训练):
通常训练大模型需要吃“满汉全席”(高精度数据),但这很费电。Nemotron 3 Super 尝试了一种**“压缩食谱”**(NVFP4 精度)。就像给管家吃了一种特制的“营养浓缩丸”,虽然体积小(数据精度低),但营养密度极高。结果证明,吃这种“浓缩丸”不仅没饿坏,反而让管家在 25 万亿个单词的“阅读量”下,依然学得稳稳当当,而且速度快了一倍多。 - 两阶段学习法:
- 第一阶段(广撒网):先让它读遍互联网、书籍、代码,像个博学的通才,什么都知道一点。
- 第二阶段(精修):最后 20% 的时间,专门给它喂高质量的“精英教材”(如高难度数学题、专业代码),把它从“通才”培养成“专家”。
3. 它是怎么学会“干活”的?(后训练与代理能力)
这是这篇论文最酷的地方。以前的 AI 像个只会背书的秀才,你问它问题它才答。Nemotron 3 Super 被训练成了一个**“行动派管家”**(Agentic Reasoning)。
- 学会“动手” (Agentic Capabilities):
它不再只是说话,而是学会了操作工具。比如,你让它“帮我修好这个网站的 Bug",它不会只给你一段代码,而是会:- 打开终端(Terminal)。
- 运行命令去检查错误。
- 修改代码文件。
- 再次运行测试。
- 直到问题解决。
这就像你教它不仅要懂理论,还要会修水管、写代码、查资料。
- 多步推理与自我修正:
在训练过程中,它经历了一个**“试错 - 奖励”的过程(强化学习 RL)。如果它做对了(比如代码跑通了),就给它奖励;做错了,就让它重来。它甚至学会了“低能耗模式”**(Low-effort mode),对于简单问题,它不啰嗦,直接给答案;对于复杂问题,它才开启“深度思考模式”。
4. 它有多快?(推理加速与量化)
- 猜谜游戏 (MTP):
普通 AI 说话是一个字一个字蹦的(像打字机)。Nemotron 3 Super 学会了**“预判”**。它不仅能预测下一个字,还能一次性预测后面好几个字(Multi-Token Prediction)。这就像它不仅能猜到你下一句要说什么,还能直接把整段话的草稿都写好了,然后只让你确认一下。这让它的说话速度(吞吐量)比竞争对手快了 2.2 倍到 7.5 倍! - 瘦身计划 (量化):
为了让大家都能用得起,它把自己“瘦身”了。- FP8 版:像把衣服从棉袄换成了夹克,轻便但保暖。
- NVFP4 版:这是更激进的“真空压缩袋”版本,体积更小,速度更快,专门针对 NVIDIA 最新的 Blackwell 芯片优化。虽然压缩得很厉害,但它的“智商”几乎没有下降。
5. 总结:它厉害在哪里?
简单来说,Nemotron 3 Super 是一个:
- 聪明:在数学、代码、科学推理上能和目前最顶尖的模型(如 Qwen3.5, GPT-OSS)掰手腕。
- 能干:不仅能聊天,还能像真人一样操作电脑、写代码、查资料,是个真正的“数字员工”。
- 快速:得益于特殊的架构和“猜谜”技术,它说话的速度极快。
- 便宜:通过“压缩食谱”和“真空压缩”技术,它能在更便宜的硬件上高效运行。
NVIDIA 的野心:
他们不仅把这个模型做出来了,还把“食谱”(训练数据)、“教材”(后训练数据)和“成品”(模型权重)全部开源了。这意味着全球的开发者都可以免费使用这位“超级管家”的配方,去构建属于他们自己的 AI 应用。
一句话总结:
Nemotron 3 Super 就像是一个经过特训、懂得压缩时间、能同时操作多个工具、且速度极快的超级数字员工,现在,NVIDIA 把它的“入职培训手册”免费发给了全世界。
Nemotron 3 Super 技术总结报告
Nemotron 3 Super 是 NVIDIA 推出的一款面向**智能体推理(Agentic Reasoning)**的开源、高效混合架构大语言模型。该模型总参数量为 1200 亿(120B),但在前向传播时仅激活 120 亿(12B)参数。它结合了混合 Mamba-Attention 架构与混合专家(MoE)技术,并首次引入了 LatentMoE 和 NVFP4 预训练等创新,旨在在保持高准确率的同时显著提升推理吞吐量。
以下是该论文的详细技术总结:
1. 核心问题与挑战 (Problem)
当前大语言模型(LLM)在扩展至代理(Agent)任务时面临以下主要挑战:
- 推理效率与延迟的矛盾:传统的稠密模型(Dense)推理成本高,而现有的混合专家(MoE)模型虽然降低了活跃参数量,但在实际部署中常受限于显存带宽和通信开销,导致推理吞吐量不足。
- 长上下文与代理任务的复杂性:智能体任务(如代码生成、终端操作、多步工具调用)需要处理超长上下文(高达 1M tokens)和复杂的长程推理,传统 Transformer 的 KV Cache 二次方增长成为瓶颈。
- 低精度训练的稳定性:为了降低显存占用和提升推理速度,模型需要向低精度(如 FP4/FP8)迁移,但在大规模预训练中,低精度往往导致梯度消失或训练不稳定。
- 智能体能力的构建:现有的模型在复杂的多步工具使用、终端交互和软件工程中表现不足,缺乏专门的强化学习(RL)训练框架来支持长程任务。
2. 方法论 (Methodology)
Nemotron 3 Super 采用了一套从架构设计、预训练、后训练到量化部署的全流程优化方案:
2.1 模型架构创新
- LatentMoE (潜在混合专家):
- 这是该模型的核心创新。不同于标准 MoE,LatentMoE 将输入 Token 先投影到更低维的潜在空间(Latent Space),在该空间内进行路由和专家计算,最后再投影回原始维度。
- 优势:通过减少路由和通信时的维度(d→ℓ),显著降低了显存带宽压力和 All-to-All 通信开销。利用节省下来的资源,模型可以大幅增加专家总数(512 个)和每个 Token 激活的专家数(Top-22),从而在保持计算成本不变的情况下提升模型容量和准确率。
- 混合 Mamba-Attention 架构:
- 采用周期性交织设计:大部分层使用 Mamba-2 块(线性时间复杂度,恒定状态大小),仅在关键位置插入少量的 Attention 层作为“全局锚点”,以保留长程依赖建模能力。
- 支持高达 100 万 (1M) 的上下文长度。
- 多 Token 预测 (MTP):
- 引入共享权重的 MTP 头,允许模型在一次前向传播中预测多个未来 Token。
- 支持原生推测解码 (Speculative Decoding),无需外部草稿模型即可加速推理,显著提升吞吐量。
2.2 预训练策略 (Pre-training)
- NVFP4 全精度预训练:
- 这是 Nemotron 3 系列首次尝试在 NVFP4 (NVIDIA FP4) 格式下进行 25 万亿 Token 的大规模预训练。
- 混合精度方案:大部分线性层使用 NVFP4,但关键层(如 Attention 投影、MTP 层、Embedding)保留 BF16 或 MXFP8 以维持稳定性。
- 零梯度问题处理:研究发现 NVFP4 会导致部分专家层出现零梯度,通过调整量化策略和混合精度,成功在 25T Token 规模下实现了稳定训练。
- 数据混合:
- 分为两个阶段:第一阶段(80%)注重多样性,第二阶段(20%)注重高质量数据(如合成代码、逻辑、经济学数据)。
- 引入了大量合成数据,包括 Python 编程概念、形式逻辑、经济学多选题等,以增强推理能力。
2.3 后训练与智能体对齐 (Post-training & Agentic Alignment)
- 两阶段 SFT (监督微调):
- Stage 1:基于 Token 级别的损失,强化推理行为。
- Stage 2:基于样本级别的归一化损失,防止长输出主导 Loss,恢复“长输入短输出”场景的性能。
- 数据涵盖软件工程(SWE)、终端使用、搜索代理、多语言等。
- 强化学习 (RL) 基础设施:
- 多环境 RLVR:在 21 种不同环境(数学、代码、STEM、安全、工具使用等)中联合训练,防止单一任务过拟合。
- SWE-RL:专门针对软件工程任务,使用 OpenHands 等框架进行端到端的代码修复和生成训练。
- PivotRL:一种针对长程代理任务的 RL 算法,利用 SFT 轨迹中的“关键转折点”进行高效训练,平衡了效率与准确性。
- 基础设施:基于 NeMo Gym 和 Ray 构建的异步 RL 系统,支持在数千张 GPU 上并行训练,解决了大规模 RL 的稳定性问题。
2.4 量化与推理优化
- FP8 与 NVFP4 量化:
- 提供了 BF16、FP8 和 NVFP4 三种版本的检查点。
- NVFP4 量化:针对 Blackwell 架构优化,采用混合精度策略(AutoQuantize),对敏感层(如 Attention 投影)保留 FP8/BF16,其余层使用 NVFP4。
- Mamba 状态缓存优化:针对 Mamba 的 SSM 缓存,采用 FP16 + 随机舍入 (Stochastic Rounding) 策略,解决了量化误差累积导致的“冗长输出 (Verbosity)"问题,同时保持推理速度。
3. 关键贡献 (Key Contributions)
- LatentMoE 架构:首次将 LatentMoE 应用于 120B 参数规模的模型,证明了在降低显存带宽和通信开销的同时,通过增加专家数量可以显著提升“每 FLOP 准确率”和“每参数准确率”。
- NVFP4 大规模预训练:成功验证了在 25T Token 规模下使用 NVFP4 进行预训练的可行性,为未来超低精度大模型训练提供了重要参考。
- 原生推测解码 (Native Speculative Decoding):通过 MTP 层实现无需外部草稿模型的推测解码,显著提升了推理吞吐量。
- 强大的智能体能力:通过大规模 RL 和 PivotRL 算法,在软件工程(SWE-Bench)、终端操作(Terminal Bench)和工具使用(TauBench)等基准测试中达到了 SOTA 水平。
- 开源生态:开源了基座模型、后训练模型、量化模型(FP8/NVFP4)以及训练数据(合成代码、逻辑、经济学等),推动了社区发展。
4. 实验结果 (Results)
- 推理吞吐量:
- 在 8k 输入/64k 输出设置下,Nemotron 3 Super 的推理吞吐量比 GPT-OSS-120B 高 2.2 倍,比 Qwen3.5-122B 高 7.5 倍。
- 在 Blackwell (B200) GPU 上,NVFP4 量化版本实现了极高的吞吐效率。
- 基准测试准确率:
- 通用知识:在 MMLU-Pro 上达到 83.73%,与 Qwen3.5-122B (86.70%) 和 GPT-OSS-120B (81.00%) 相当或略优。
- 推理能力:在 HMMT Feb25 (数学) 上达到 94.73% (带工具),在 GPQA 上达到 82.70%。
- 智能体任务:
- SWE-Bench (OpenHands): 60.47% (优于 GPT-OSS-120B 的 41.9%)。
- Terminal Bench (Hard): 25.78%。
- TauBench V2: 平均 61.15%。
- 长上下文:在 RULER 1M 长度测试中达到 91.64% 的准确率,远超 GPT-OSS-120B (22.3%)。
- 量化效果:
- NVFP4 量化模型在保持 99.8% 相对 BF16 基准准确率的同时,实现了极低的显存占用和极高的推理速度。
5. 意义与影响 (Significance)
- 架构范式转移:Nemotron 3 Super 证明了 Mamba-Attention 混合架构 结合 LatentMoE 是解决长上下文和推理效率瓶颈的有效路径,为未来模型设计提供了新方向。
- 低精度训练里程碑:NVFP4 预训练的成功表明,通过精心设计的量化策略,可以在极低精度下训练超大规模模型,这将大幅降低训练和推理成本。
- 智能体时代的基石:该模型在复杂的代理任务(代码、终端、工具链)上表现卓越,且支持 1M 上下文,使其成为构建下一代自主智能体(Agentic AI)的理想基座。
- 开源与可复现性:NVIDIA 开源了完整的训练配方、数据和模型权重,极大地降低了社区构建高效、高性能代理模型的技术门槛。
总结:Nemotron 3 Super 是一款在架构效率、训练精度和智能体能力上均取得突破的模型。它通过 LatentMoE 和 MTP 技术解决了“大模型”与“高效率”之间的矛盾,并通过 NVFP4 预训练和强化学习,为构建低成本、高性能的下一代 AI 智能体奠定了坚实基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。