← 最新论文
🤖 machine learning

Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Super 是 NVIDIA 开源的首款采用 NVFP4 预训练、LatentMoE 架构及 MTP 层加速的 1200 亿参数(激活 120 亿)混合 Mamba-Transformer 专家模型,支持 100 万上下文长度,在保持基准精度的同时实现了远超同类模型的推理吞吐量。

原作者: NVIDIA, :, Aakshita Chandiramani, Aaron Blakeman, Abdullahi Olaoye, Abhibha Gupta, Abhilash Somasamudramath, Abhinav Khattar, Adeola Adesoba, Adi Renduchintala, Adil Asif, Aditya Agrawal, Aditya Vavr
发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: NVIDIA, :, Aakshita Chandiramani, Aaron Blakeman, Abdullahi Olaoye, Abhibha Gupta, Abhilash Somasamudramath, Abhinav Khattar, Adeola Adesoba, Adi Renduchintala, Adil Asif, Aditya Agrawal, Aditya Vavre, Ahmad Kiswani, Aishwarya Padmakumar, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Gronskiy, Alex Kondratenko, Alex Neefus, Alex Steiner, Alex Yang, Alexander Bukharin, Alexander Young, Ali Hatamizadeh, Ali Taghibakhshi, Alina Galiautdinova, Alisa Liu, Alok Kumar, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrew Tao, Anjaney Shrivastava, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Ann Guan, Anna Shors, Annamalai Chockalingam, Anubhav Mandarwal, Aparnaa Ramani, Arham Mehta, Arti Jain, Arun Venkatesan, Asha Anoosheh, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asli Sabanci Demiroz, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Benjamin Chislett, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bobby Chen, Boris Ginsburg, Brandon Norick, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Buvaneswari Mani, Carlo del Mundo, Chankyu Lee, Chanran Kim, Chantal Hwang, Chao Ni, Charles Wang, Charlie Truong, Cheng-Ping Hsieh, Chenhan Yu, Chenjie Luo, Cherie Wang, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Chris Holguin, Chris Wing, Christian Munley, Christopher Parisien, Chuck Desai, Chunyang Sheng, Collin Neale, Cyril Meurillon, Dakshi Kumar, Dan Gil, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Burkhardt Eliuth Triana, Daniel Egert, Daniel Fatade, Daniel Lo, Daniel Rohrer, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Edelsohn, David Messina, David Mosallanezhad, David Tamok, Deena Donia, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di Wu, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dmitry Konyagin Brandon Tuttle, Dong Ahn, Dongfu Jiang, Dorrin Poorkay, Douglas O'Flaherty, Duncan Riach, Dusan Stosic, Dustin Van Stee, Edgar Minasyan, Edward Lin, Eileen Peters Long, Elad Segal, Elena Lantz, Elena Lewis, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric W. Tramel, Erick Galinkin, Erik Pounds, Esti Etrog, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Farshad Saberi Movahed, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Fortuna Zhang, Frankie Siino, Frida Hou, Gantavya Bhatt, Gargi Prasad, Geethapriya Venkataramani, Geetika Gupta, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Grace Wu, Greg Pauloski, Greyson Davis, Grigor Nalbandyan, Guoming Zhang, Guy Farber, Guyue Huang, Haifeng Qian, Haran Kumar Shiv Kumar, Harry Kim, Harsh Sharma, Hayate Iso, Hayley Ross, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huy Nguyen, Iain Cunningham, Ido Galil, Ido Shahaf, Igino Padovani, Igor Gitman, Igor Shovkun, Ikroop Dhillon, Ilya Loshchilov, Ingrid Kelly, Itamar Schen, Itay Levy, Ivan Moshkov, Izik Golan, Izzy Putterman, Jain Tu, Jan Baczek, Jan Kautz, Jane Polak Scowcroft, Janica Rosenberg, Jared Casper, Jarrod Pflum, Jason Grant, Jason Sewall, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiaqi Zeng, Jie Lou, Jill Milton, Jim Chow, Jimmy Zhang, Jinhang Choi, Jining Huang, Jocelyn Huang, Joel Caruso, Joey Conway, Joey Guman, Johan Jatko, John Kamalu, Johnny Greco, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joyjit Daw, Juan Yu, Julio Tapia, Junkeun Yi, Jupinder Parmar, Jyothi Achar, Kari Briski, Kartik Mattoo, Katherine Cheung, Katherine Luna, Keith Wyss, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirill Buryak, Kirthi Shankar Sivamani, Konstantinos Krommydas, Kris Murphy, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Laikh Tewari, Laya Sleiman, Leo Du, Leon Derczynski, Li Ding, Lilach Ilan, Lingjie Wu, Lizzie Wei, Luis Vega, Lun Su, Maarten Van Segbroeck, Maer Rodrigues de Melo, Magaret Zhang, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Sreedhar, Makesh Tarun Chandran, Manuel Reyes Gomez, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Margaret Zhang, Mark Cai, Mark Gabel, Markus Kliegl, Martyna Patelka, Maryam Moosaei, Matthew Varacalli, Matvei Novikov, Mauricio Ferrato, Mehrzad Samadi, Melissa Corpuz, Meng Xin, Mengdi Wang, Mengru Wang, Meredith Price, Micah Schaffer, Michael Andersch, Michael Boone, Michael Evans, Michael Z Wang, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Hollinger, Mingyuan Ma, Minseok Lee, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Nader Khalil, Najeeb Nabwani, Nancy Agarwal, Nanthini Balasubramaniam, Narimane Hennouni, Narsi Kodukula, Natalie Hereth, Nathaniel Pinckney, Nave Assaf, Negar Habibi, Nestor Qin, Neta Zmora, Netanel Haber, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nir Ailon, Nirmal Juluru, Nirmalya De, Nowel Pitt, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Almog, Omri Puny, Oren Tropp, Otavio Padovani, Ouye Xie, Parth Chadha, Pasha Shamis, Paul Gibbons, Pavlo Molchanov, Peter Belcak, Peter Jin, Pinky Xu, Piotr Januszewski, Pooya Jannaty, Prachi Shevate, Pradeep Thalasta, Pranav Prashant Thombre, Prasoon Varshney, Prerana Gambhir, Pritam Gundecha, Przemek Tredak, Qing Miao, Qiyu Wan, Quan Tran Minh, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Rahul Kandu, Raina Zhong, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Renee Yao, Renjie Pi, Richard Mazzarese, Richard Wang, Rick Izzo, Ridhima Singla, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Roger Waleffe, Rohit Varma Kalidindi, Rohit Watve, Roi Koren, Ron Fan, Ruchika Kharwar, Ruisi Cai, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Ryota Egashira, Sadegh Mahdavi, Sagar Singh Ashutosh Joshi, Sahil Modi, Samuel Kriman, Sandeep Pombra, Sanjay Kariyappa, Sanjeev Satheesh, Santiago Pombo, Saori Kaji, Satish Pasumarthi, Saurav Mishra, Saurav Muralidharan, Scott Hara, Sean Narenthiran, Sebastian Rogawski, Seonjin Na, Seonmyeong Bak, Sepehr Sameni, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh Adam Lord, Sharath Turuvekere Sreenivas, Shaun Kotek, Shaya Gharghabi, Shelby Thomas, Sheng-Chieh Lin, Shibani Likhite, Shiqing Fan, Shiyang Chen, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuo Zhang, Shuoyang Ding, Shyam Renjith, Shyamala Prayaga, Siddhartha Jain, Simeng Sun, Sirisha Rella, Sirshak Das, Smita Ithape, Sneha Harishchandra S, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sriharsha Niverty, Stas Sergienko, Stefana Gloginic, Stefania Alborghetti, Stephen Ge, Stephen McCullough, Sugam Dipak Devare, Suguna Varshini Velury, Sukrit Rao, Sumeet Kumar Barua, Sunny Gai, Suseella Panguluri, Sushil Koundinyan, Swathi Patnam, Sweta Priyadarshi, Swetha Bhendigeri, Syeda Nahida Akter, Sylendran Arunagiri, Tailling Yuan, Talor Abramovich, Tan Bui, Tan Yu, Terry Kong, Thanh Do, Thomas Gburek, Thorgane Marques, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Timothy Ma, Tiyasa Mitra, Tomasz Grzegorzek, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Traian Rebedea, Trenton Starkey, Tugrul Konuk, Twinkle Vashishth, Tyler Condensa, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Vanshil Atul Shah, Veena Vaidyanathan, Venkat Srinivasan, Venmugil Elango, Victor Cui, Vijay Korthikanti, Vikas Mehta, Virginia Adams, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Wan Seo, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wei-Ming Chen, Wendy Quan, Wenliang Dai, Wenwen Gao, Will Jennings, William Zhang, Xiaowei Ren, Xiaowen Xin, Xin Li, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Suhara, Youngeun Kwon, Yuan Zhang, Yuki Huang, Zach Moshe, Zhilin Wang, Zhiyu Cheng, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijia Chen, Zijie Yan, Zuhair Ahmed

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于 NVIDIA 最新发布的超级大模型 Nemotron 3 Super 的技术报告。为了让你轻松理解,我们可以把构建和使用这个 AI 模型想象成打造并训练一位“超级全能管家”

以下是用通俗易懂的语言和生动的比喻对这篇论文的解读:

1. 这位“管家”是谁?(模型架构)

想象一下,你以前请的管家(普通大模型)是一个全能但反应慢的人,他脑子里有 120 亿个知识点,但每次回答问题都要把这 120 亿个知识点全部过一遍,所以很慢。

Nemotron 3 Super 则不同,它采用了**“专家小组” + “快速通道”**的混合模式:

  • 120 亿总参数,但只激活 12 亿:它像一个拥有 120 亿个专家的大公司,但每次处理任务时,它只唤醒最合适的 12 亿个专家来工作。这就像你家里有个巨大的图书馆,但每次你问问题,它只派最懂那个领域的几个图书管理员出来,既快又准。
  • LatentMoE(潜空间专家)技术:这是它的独门秘籍。以前的“专家小组”在传递信息时,就像要把一吨重的货物(高维数据)搬来搬去,很费力气。Nemotron 3 Super 发明了一种“压缩快递”技术,先把货物打包成小包裹(低维空间)再搬运,到了目的地再 unpack。这样既省了力气(显存带宽),又让专家数量可以翻倍,让管家变得更聪明。
  • Mamba + Transformer 混合:它把两种技术结合了。
    • Transformer 像是一个记忆力超群的侦探,擅长处理复杂的逻辑推理(比如做数学题)。
    • Mamba 像是一个反应极快的快递员,擅长处理长文档和快速流式数据,而且不占地方。
    • 两者结合,让管家既能读得懂几百万字的长篇小说(支持 100 万上下文),又能秒回你的消息。

2. 它是怎么“上学”的?(预训练与数据)

  • 吃得少,学得多(NVFP4 训练)
    通常训练大模型需要吃“满汉全席”(高精度数据),但这很费电。Nemotron 3 Super 尝试了一种**“压缩食谱”**(NVFP4 精度)。就像给管家吃了一种特制的“营养浓缩丸”,虽然体积小(数据精度低),但营养密度极高。结果证明,吃这种“浓缩丸”不仅没饿坏,反而让管家在 25 万亿个单词的“阅读量”下,依然学得稳稳当当,而且速度快了一倍多。
  • 两阶段学习法
    • 第一阶段(广撒网):先让它读遍互联网、书籍、代码,像个博学的通才,什么都知道一点。
    • 第二阶段(精修):最后 20% 的时间,专门给它喂高质量的“精英教材”(如高难度数学题、专业代码),把它从“通才”培养成“专家”。

3. 它是怎么学会“干活”的?(后训练与代理能力)

这是这篇论文最酷的地方。以前的 AI 像个只会背书的秀才,你问它问题它才答。Nemotron 3 Super 被训练成了一个**“行动派管家”**(Agentic Reasoning)。

  • 学会“动手” (Agentic Capabilities)
    它不再只是说话,而是学会了操作工具。比如,你让它“帮我修好这个网站的 Bug",它不会只给你一段代码,而是会:
    1. 打开终端(Terminal)。
    2. 运行命令去检查错误。
    3. 修改代码文件。
    4. 再次运行测试。
    5. 直到问题解决。
      这就像你教它不仅要懂理论,还要会修水管、写代码、查资料。
  • 多步推理与自我修正
    在训练过程中,它经历了一个**“试错 - 奖励”的过程(强化学习 RL)。如果它做对了(比如代码跑通了),就给它奖励;做错了,就让它重来。它甚至学会了“低能耗模式”**(Low-effort mode),对于简单问题,它不啰嗦,直接给答案;对于复杂问题,它才开启“深度思考模式”。

4. 它有多快?(推理加速与量化)

  • 猜谜游戏 (MTP)
    普通 AI 说话是一个字一个字蹦的(像打字机)。Nemotron 3 Super 学会了**“预判”**。它不仅能预测下一个字,还能一次性预测后面好几个字(Multi-Token Prediction)。这就像它不仅能猜到你下一句要说什么,还能直接把整段话的草稿都写好了,然后只让你确认一下。这让它的说话速度(吞吐量)比竞争对手快了 2.2 倍到 7.5 倍
  • 瘦身计划 (量化)
    为了让大家都能用得起,它把自己“瘦身”了。
    • FP8 版:像把衣服从棉袄换成了夹克,轻便但保暖。
    • NVFP4 版:这是更激进的“真空压缩袋”版本,体积更小,速度更快,专门针对 NVIDIA 最新的 Blackwell 芯片优化。虽然压缩得很厉害,但它的“智商”几乎没有下降。

5. 总结:它厉害在哪里?

简单来说,Nemotron 3 Super 是一个:

  1. 聪明:在数学、代码、科学推理上能和目前最顶尖的模型(如 Qwen3.5, GPT-OSS)掰手腕。
  2. 能干:不仅能聊天,还能像真人一样操作电脑、写代码、查资料,是个真正的“数字员工”。
  3. 快速:得益于特殊的架构和“猜谜”技术,它说话的速度极快。
  4. 便宜:通过“压缩食谱”和“真空压缩”技术,它能在更便宜的硬件上高效运行。

NVIDIA 的野心
他们不仅把这个模型做出来了,还把“食谱”(训练数据)、“教材”(后训练数据)和“成品”(模型权重)全部开源了。这意味着全球的开发者都可以免费使用这位“超级管家”的配方,去构建属于他们自己的 AI 应用。

一句话总结
Nemotron 3 Super 就像是一个经过特训、懂得压缩时间、能同时操作多个工具、且速度极快的超级数字员工,现在,NVIDIA 把它的“入职培训手册”免费发给了全世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →