Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
Nemotron 3 Ultra 是一个开源的、拥有 5500 亿参数的 Mamba-Transformer 混合模型,具备 100 万 token 的上下文长度和先进的训练技术,能够提供最先进的准确度以及高达 6 倍的推理吞吐量,使其成为处理复杂智能体推理任务的理想选择。
原作者: NVIDIA (Allan), : (Allan), Aaron Blakeman (Allan), Aaron Thomas (Allan), Aastha Jhunjhunwala (Allan), Abhibha Gupta (Allan), Abhinav Khattar (Allan), Adam Rajfer (Allan), Adi Renduchintala (Allan), Adil Asif (Allan), Aditya Vavre (Allan), Adriana Flores Miranda (Allan), Ahmad Bilal (Allan), Aileen Zaman (Allan), Ajay Hotchandani (Allan), Akanksha Shukla (Allan), Akhiad Bercovich (Allan), Aleksander Ficek (Allan), Alex Gronskiy (Allan), Alex Kondratenko (Allan), Alex Steiner (Allan), Alex Ye (Allan), Alexander Bukharin (Allan), Alexandre Milesi (Allan), Ali Taghibakhshi (Allan), Alice Gatti (Allan), Alisa Liu (Allan), Alok Kumar (Allan), Amar Phanishayee (Allan), Ameya Sunil Mahabaleshwarkar (Allan), Amir Klein (Allan), Amit Zuker (Allan), Amnon Geifman (Allan), Anahita Bhiwandiwalla (Allan), Ananth Subramaniam (Allan), Andrea Santilli (Allan), Andrew Fulks (Allan), Andrew McHarg (Allan), Andrew Tao (Allan), Andrii Skliar (Allan), Anjulie Agrusa (Allan), Ankur Srivastava (Allan), Ankur Verma (Allan), Anna Shors (Allan), Anna Warno (Allan), Antoni-Joan Solergibert I Llaquet (Allan), Arham Mehta (Allan), Arkadiusz Nowaczynski (Allan), Arti Jain (Allan), Ashwath Aithal (Allan), Ashwin Poojary (Allan), Asif Ahamed (Allan), Asit Mishra (Allan), Asma Kuriparambil Thekkumpate (Allan), Atefeh Sohrabizadeh (Allan), Avinash Kaur (Allan), Avinash Vem (Allan), Ayush Dattagupta (Allan), Barath Subramaniam Anandan (Allan), Bardiya Sadeghi (Allan), Ben Lanir (Allan), Benedikt Schifferer (Allan), Besmira Nushi (Allan), Bilal Kartal (Allan), Bill Thiede (Allan), Bita Darvish Rouhani (Allan), Bo Deng (Allan), Bob Schatz (Allan), Boris Ginsburg (Allan), Boxin Wang (Allan), Brad Nemire (Allan), Brandon Norick (Allan), Brian Dang (Allan), Brian Westphal (Allan), Brian Yu (Allan), Brucek Khailany (Allan), Bryan Catanzaro (Allan), Carlo del Mundo (Allan), Caryln Aarish (Allan), Chankyu Lee (Allan), Chantal Hwang (Allan), Charbel Sakr (Allan), Charles Wang (Allan), Charlie Truong (Allan), Chen Cui (Allan), Cheng Cheng (Allan), Cheng-Ping Hsieh (Allan), Chenghao Zhang (Allan), Chenhui Deng (Allan), Chintan Patel (Allan), Chris Alexiuk (Allan), Christian Cosgrove (Allan), Christian Munley (Allan), Christine Harvey (Allan), Christopher Parisien (Allan), Chunyang Shen (Allan), Coco Li (Allan), Collin Neale (Allan), Cynthia Gao (Allan), Cyril Meurillon (Allan), Dan Gil (Allan), Dan Su (Allan), Dan Zhao (Allan), Dane Corneil (Allan), Daniel Afrimi (Allan), Daniel Egert (Allan), Daniel Korzekwa (Allan), Daniel Lo (Allan), Daniel Machlab (Allan), Daniel Serebrenik (Allan), Daniil Sorokin (Allan), Daria Gitman (Allan), Daria Levy (Allan), Darko Stosic (Allan), David Mosallanezhad (Allan), David Yu (Allan), Davit Karamyan (Allan), Deena Donia (Allan), Deep Debroy (Allan), Deepak Narayanan (Allan), Devin O'Kelly (Allan), Dheeraj Peri (Allan), Dhruv Nathawani (Allan), Di (Allan), Wu, Dima Rekesh, Divyanshu Kakwani, Donald Plummer, Dong Anh, Dongfeng Yu, Dongfu Jiang, Donnie Kim, Dorrin Poorkay, Duncan Riach, Dusan Stosic, Dustin VanStee, Eavan Meng, Edgar Minasyan, Edward Lin, Eileen Margaret Peters Long, Elad Sarafin, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric Tramel, Eric Yang, Erick Galinkin, Erik Pounds, Erika Goncalves Goncalves, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Faisal Ladhak, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Frank Sun, Frankie Siino, Frida Hou, Gal Hubara Agam, Gal Kaplun, Gantavya Bhatt, Gargi Prasad, Garvit Kulshreshtha, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Greg Mason, Greg Pauloski, Grigor Nalbandyan, Grzegorz Chlebus, Grzegorz Karch, Guan-Ting Liu, Guoming Zhang, Guyue Huang, Haggai Maron, Haifeng Qian, Haim Elisha, Haoxing Ren, Haran Kumar Shiv Kumar, Haribhau Hud, Harris Nover, Harrison Saturley Hall, Hayate Iso, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hovhannes Tamoyan, Hua Li, Huanhuan Chen, Hui Li, Hui Wang, Huy Nguyen, Ian Chiles, Ido Galil, Ido Shahaf, Igor Gitman, Igor Shovkun, Ilya Loshchilov, Ingo Guehring, Itamar Schen, Itay Levy, Itay Neeman, Ivan Moshkov, Izik Golan, Izzy Putterman, Jaemin Choi, Jakub Slowikowski, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiantao Jiao, Jiaqi Zeng, Jie Lou, Jim King, Jimmy Zhang, Jingquan Wang, Jinhang Choi, Jinju Chu, Joey Conway, Joey Guman, Johan Jatko, Johannes Rausch, John Kamalu, John Roberts, Johnny Greco, Johnny Mensel, Jonah Alben, Jonas Yang, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joshua Mabry, Joshua Pierce, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kajal Jain, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Willowhawk, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirthi Shankar Sivamani, Konstantinos Krommydas, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Kyle Keprios, Kylie Day, Lawrence McAfee, Leo Du, Leon Derczynski, Li Ding, Linda Liu, Lingjie Wu, Lior Kadoch, Lizzie Wei, Luis Vega, Luke Robison, Lun Su, Maarten Van Segbroeck, Maciej Jakub Mikulski, Maer Rodrigues de Melo, Magda Sypula, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Tarun Chandran, Manoj Kilaru, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Marcin Chochowski, Mark Cai, Mark Mozolewski, Markus Kliegl, Marta Stepniewska-Dziubinska, Martyna Patelka, Mattei Machczynski, Matvei Novikov, Mauricio Ferrato, Maximilian Golub, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Mengxi Wu, Meredith Price, Meriem Boubdir, Micah Schaffer, Michael Andersch, Michael Boone, Michael Gschwind, Michael Lightstone, Michael Loh, Michal Bien, Michal Zawalski, Michelle Gill, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Houston, Mingyuan Ma, Minseok Lee, Mohamed Fawzy, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Namit Dhameja, Narimane Hennouni, Natalie Hereth, Nathaniel Pinckney, Nave Algarici, Nave Assaf, Netanel Haber, Nicholas Knight, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Desai, Nikolai Ludwig, Nima Tajbakhsh, Ning Xu, Nir Ailon, Nirmal Juluru, Nitin Nitin, Ofri Masad, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivia Viessmann, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Pablo Ribalta, Pallab Bhattacharya, Panos Lampropoulos, Parth Mannan, Pasha Shamis, Patrick Legresley, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pierre-Yves Aquilanti, Pinky Xu, Piotr Januszewski, Piotr Laskiewicz, Pooya Jannaty, Prakash Gurumurthy, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Puhui Meng, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Radha Sri-Tharan, Rahul Kandu, Rakshit Sanadhya, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Ray Macalisang, Rayen Tian, Reka Kovacs, Renjie Pi, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Rishi Puri, Rita Fernandes Neves, Ritchie Zhao, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Robert Kirby, Roger Waleffe, Rohit Watve, Roi Koren, Ron Banner, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Stewart, Ryota Egashira, Sadegh Mahdavi, Saee Paliwal, Sagar Singh, Sahil Modi, Salika Dave, Samantha Shinagawa, Samuel Kriman, Sandip Bhaskar, Sangkug Lym, Sanjay Kariyappa, Sanjeev Satheesh, Saran Vikas Murari, Satish Pasumarthi, Saurabh Mishra, Saurav Muralidharan, Scott Hara, Sean Narentharen, Selvaraj Anandaraj, Seonjin Na, Seonmeyong Bak, Seonmyeong Bak, Sepehr Sameni, Seph Mard, Serge Panev, Seth Henneman, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Mendelson, Shaun Kotek, Shawn Wang, Shay Aharon, Shaya Gharghabi, Sheng-Chieh Lin, Shi Chen, Shiqing Fan, Shirish Baskaran, Shreya Gopa, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Shwetha Krishnamurthy, Siddharth Singh, Simeng Sun, Sirshak Das, Sivakumar Arayandi Thottakara, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sridhar Bhuvanapalli, Srimukh Veccham, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Su Rong, Sugam Dipak Devare, Sukrit Rao, Sumeet Kumar Barua, Sungsoo Ha, Sunny Gai, Suriya Gunasekar, Suseella Panguluri, Suyog Gupta, Sviataslau Hinzburh, Sweta Priyadarshi, Syeda Nahida Akter, Talor Abramovich, Tan Bui, Tanay Varshney, Tatevik Ter-Hovhannisyan, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tianhe Zhang, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Tiyasa Mitra, Tom Balough, Tomasz Grzegorzek, Tomasz Hliwiak, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Tony Salim, Tony Wang, Traian Rebedea, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Venkat Srinivasan, Venmugil Elango, Vibhor Agrawal, Victor Cui, Vijay Korthikanti, Vikas Mehta, Vinay Rao, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Vu Pham, Wanli Jiang, Wasi Uddin Ahmad, Wataru Ishihara, Wei Du, Wei Ping, Weiheng Chai, Wenliang Dai, Wesley Helmholz, Will Jennings, Will Zhu, Wojciech Prazuch, Xiaowei Ren, Xiwen Yu, Yan Breek, Yang Chen, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Youngeun Kwon, Yu Yao, Yugi Guvvla, Yuki Huang, Yunsheng Liu, Zach Moshe, Zachary Newell, Zhilin Wang, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijie Yan, Zsolt-Alon Wertheimer
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是对 Nemotron 3 Ultra 论文的解析,通过简单的概念和富有创意的类比进行了拆解。
大局观:一个擅长“做事”的超级大脑
想象你有一个才华横溢的助手。如今大多数 AI 助手擅长聊天或写一封简短的邮件。Nemotron 3 Ultra 的设计目标是一个长程项目经理。它被构建为能够连续工作数小时,打开多个窗口,搜索网络,编写代码,修复错误,并在不需要你全程手把手指导的情况下,自主完成复杂的任务。
论文声称该模型是 NVIDIA 迄今为止“能力最强”的模型,专门针对快速和高效进行了优化,同时能够处理海量信息(一次性处理高达 100 万个单词)。
1. 引擎:AI 的混合动力车
大多数 AI 模型就像是一个单一的、庞大的引擎,对所有任务都以同样的方式运行。Nemotron 3 Ultra 则不同,它是一辆混合动力汽车。
- “Mamba”引擎: 可以把它想象成一列高速列车。它处理信息的速度极快,且不需要拖着沉重的行李车厢(内存)。这使得它在处理长篇故事或文档时速度惊人。
- “Transformer”引擎: 这是经典的、强大的引擎,擅长深度推理和理解复杂的逻辑关系。
- 混合体: 该模型会根据任务在两种引擎之间进行切换。它利用高速列车来扫描长文档,利用强大的引擎来进行深度思考。这种组合使其在不损失智能的前提下,比竞争对手快得多。
2. 团队结构:“专家混合”模式
想象一个巨大的图书馆。与其让一个图书管理员试图了解每一本书(这既慢又累),不如让图书馆拥有 512 位专业专家。
- 当你询问关于法律的问题时,只有法律专家会被唤醒。
- 当你询问关于编程的问题时,只有编程专家会被唤醒。
- 当你询问关于数学的问题时,只有数学专家会被唤醒。
这被称为**专家混合(Mixture-of-Experts, MoE)**模型。Nemotron 3 Ultra 总共有 5500 亿个“专家”(参数),但对于任何单个句子,它只会“唤醒”其中的 550 亿个。这就像拥有一支庞大的专家团队随时待命,但每次只调用当前任务所需的特定专家。这节省了大量的能量和时间。
3. 训练:从学生到大师
论文描述了一个将该模型转化为专家级智能体的三步训练过程:
- 第一步:预训练(阅读百科全书): 模型阅读了 20 万亿个文本 Token(单词和代码)。这就像读完了大型图书馆里的每一本书。他们使用了特殊的“低精度”格式(NVFP4)来高效地完成这一过程,就像用略小的字体印刷书籍,以便在不丢失意义的前提下,在每一页容纳更多内容。
- 第二步:监督微调(实习期): 模型被教会如何遵循指令、使用工具(如搜索引擎或代码终端)以及保持安全。他们提供了如何循序渐进解决问题的示例。
- 第三步:强化学习与蒸馏(大师课): 这是核心秘诀。
- 首先,模型在许多不同的“模拟环境”中进行练习(例如针对编程、数学和办公工作的视频游戏),通过试错来学习。
- 然后,他们训练了 10 多个专门的“教师”模型(一个负责编程,一个负责数学,一个负责办公等)。
- 最后,他们使用了一种名为 MOPD(多教师在策略蒸馏) 的技术。想象一下,主模型(学生)正在尝试解决一个问题,而专门的教师们会在旁边低声指导,告诉它确切的操作方法。学生通过模仿教师的最佳动作来学习,将所有的智慧融合成一个超级模型。
4. 超能力
论文强调了 Nemotron 3 Ultra 的三个主要超能力:
- 100 万字的记忆力: 大多数 AI 模型如果给它们超过几章长度的书就会感到困惑。Nemotron 可以阅读 100 万个 Token 的上下文(大约相当于 10 本完整的小说),并且在写到最后一页时,依然能记住第一页的细节。
- “推理预算”控制: 你可以告诉模型:“快速解决这个问题,但可以跳过一些步骤”或者“慢慢来,深入思考”。这让用户可以根据任务在速度和准确度之间进行选择。
- 速度: 得益于其混合引擎和专家系统,它的处理速度可以比其他顶尖公开模型快达 6 倍,同时获得相同(或更好)的答案。
5. “大脑”的稳定性
论文承认,训练这样一个规模的模型就像是在走钢丝。在训练过程中,他们遇到了两次“发散”(即模型开始做出随机、错误的判断)的情况。
- 修复方案 1: 他们意识到数学运算中的一个特定部分(梯度累积)正在丢失精度,因此他们将该部分切换回了更高精度的模式。
- 修复方案 2: 他们注意到团队中的“专家”出现了不平衡(有些专家在做所有的工作,而有些则在睡觉)。他们调整了系统,以确保工作量得到公平分配,防止模型崩溃。
6. 结果:面向所有人
这篇论文最令人兴奋的部分是 NVIDIA 正在开源一切。
- 他们发布了 基础模型(Base model)(原始的大脑)。
- 他们发布了 后训练模型(Post-trained model)(专家级智能体)。
- 他们发布了 量化版本(Quantized version)(一种可以在特定 NVIDIA 芯片上运行得更快的压缩版本)。
- 他们发布了 数据和配方(Data and Recipes)(他们阅读的图书清单以及他们遵循的指令细节)。
总结: Nemotron 3 Ultra 是一个巨大的、采用混合引擎的 AI,旨在成为一个长时运行的自主工作者。它利用专门的专家团队进行深度思考并快速行动,可以记住一整个图书馆的文本,并且正在向公众开放,以便任何人都能利用它构建自己的 AI 智能体。
技术摘要:Nemotron 3 Ultra
问题陈述
随着大语言模型(LLM)应用从简单的聊天机器人演变为能够进行编程、研究和完成复杂任务的长程自主智能体,业界面临着一个关键瓶颈:需要既具备高准确性,又能实现大规模快速、高效推理的模型。传统的稠密模型在处理长上下文和高吞吐量需求时往往面临计算成本过高的难题,而现有的混合专家(MoE)模型可能缺乏实现高效智能体推理和长程任务所需的架构优化。挑战在于如何在实现最先进(SOTA)准确性的同时,显著提高推理吞吞吐量,并支持高达 100 万 token 的海量上下文长度,且不产生过高的计算开销。
方法论
模型架构
Nemotron 3 Ultra 是一个总参数量为 5500 亿、每 token 激活参数为 550 亿的参数模型。它采用了 混合 Mamba-Attention 混合专家(MoE) 架构。
- 混合骨干网络: 该模型集成了 Mamba-2 状态空间层与稀疏全局 Attention 锚点。这种设计降低了 Attention 的计算成本和 KV 缓存占用,使得在预填充(prefill)阶段实现亚二次方序列长度缩放,并在解码阶段实现受限的内存使用。
- LatentMoE: 模型在其专家层中使用了 LatentMoE,与标准的细粒度 MoE 相比,它提高了单位激活参数的准确性。
- 多 Token 预测(MTP): 该架构包含原生的 MTP 头(两个共享参数的头),这些头在预训练期间进行训练,以实现投机采样(speculative decoding),从而显著加速推理。
预训练
基础模型使用 温和-稳定-衰减(WSD) 学习率调度方案,在 20 万亿个文本 token 上进行了预训练。
- 精度: 训练过程在网络的大部分区域使用了 NVFP4(NVIDIA FP4)精度,利用 Transformer Engine 的 cuBLAS NVFP4 GEMM 内核。仅有特定层(最后 15%、嵌入层、投影层)保持较高精度以确保稳定性。
- 数据策略: 预训练语料库分为两个阶段:
- 第一阶段(15 万亿 token): 侧重于多样性和广泛的领域覆盖。
- 第二阶段(5 万亿 token): 侧重于高质量数据以精炼准确性。
- 新数据源: 数据集包括更新后的代码数据(来自 GitHub 的 1730 亿 token)、用于法律、道德场景和事实寻求的合成数据集,以及专门的多语言数据。
- 长上下文扩展: 通过使用 32 路上下文并行(context parallelism)的持续预训练(CPT),专门的长上下文(LC)阶段将模型的上下文窗口扩展到了 100 万 token。
后训练流水线
后训练流水线经过重新设计,专注于智能体推理和工具使用,其特点是采用了创新的 多教师在策略蒸馏(MOPD) 方法。
- 监督微调(SFT): 模型经历了两个阶段的 SFT,采用高达 512K token 的打包序列(packed sequences),涵盖终端使用、搜索、软件工程和安全性等领域。
- 统一 RLVR: 在多种环境(编程、数学、安全、对话等)中应用了可验证奖励强化学习(RLVR)阶段,以强化各项能力。
- 多教师在策略蒸馏(MOPD): 为了克服混合环境下学习信号稀释的问题,团队训练了超过十个领域专门化的 教师模型(例如:SWE、搜索、STEM、办公任务)。随后,学生模型(Nemotron 3 Ultra)进行异步在策略蒸馏,生成展开(rollouts)并接收来自这些专门化教师的密集、token 级的指导。该过程进行了两次迭代,教师模型会根据学生模型的进展进行更新。
- MTP 增强: 最后一个阶段优化了 MTP 头,使其在推理时的噪声条件下能够匹配骨干网络的分布,从而提高投机采样的接受率。
量化与推理
- 量化: 模型被量化为 NVFP4 用于在 NVIDIA Blackwell GPU 上进行推理,采用混合精度配方(对路由专家使用 NVFP4,对共享专家/Mamba 使用 FP8,对 Attention 使用 BF16),以达到 5.03 bits-per-element (BPE) 的运行点。
- 基础设施: 训练和推理基础设施针对 GB200 集群进行了优化,具有拓扑感知型 NVLink 放置、NUMA 绑定以及异步检查点功能,以处理 550B 参数的规模。
核心贡献
- Nemotron 3 Ultra 模型: 发布了一个 550B 参数的 MoE 混合 Mamba-Attention 模型,专为智能体推理优化。
- 开源发布: 在 HuggingFace 上完整开源了基础模型、后训练模型及 NVFP4 量化版本的权重,以及训练数据(包括法律、代码和专门的合成数据集)和训练配方。
- MOPD 框架: 一种新型后训练方法,通过多个专门化教师模型和异步在策略蒸馏,实现了比标准 RLVR 更优越的智能体和推理任务性能。
- NVFP4 规模化: 展示了在 550B 参数模型上进行大规模 NVFP4 预训练(20T tokens)的稳定性,为低精度训练稳定性树立了新基准。
- 100 万 Token 上下文: 成功将模型的上下文窗口扩展至 100 万 token,同时保持了长上下文基准测试中的高准确性。
结果
Nemotron 3 Ultra 在保持竞争性准确性的同时,显著提高了推理吞效:
- 吞吐量: 在 8K 输入 / 64K 输出设置下(GB200 上的 NVFP4 精度),该模型的推理吞吐量分别是 GLM-5.1-754B-A40B 的 5.9 倍、Kimi-K2.6-1T-A32B 的 4.8 倍 以及 Qwen-3.5-397B-17B 的 1.6 倍。
- 准确性: 它在广泛的基准测试中达到了持平或超越的准确性,包括:
- 智能体任务: Terminal Bench 2.1 (56.4), GDPVal (46.7), SWE-Bench Verified (70.7), 以及 TauBench V3 (平均 70.9)。
- 推理: GPQA (87.0), MMLU-Pro (86.8), 以及 IOI 2025 (570.0,位列人类水平前三)。
- 长上下文: 100 万 token 下的 RULER (94.7)。
- 测试时缩放(Test-Time Scaling): 当结合基于搜索的测试时缩放策略处理奥林匹克级数学问题时,该模型在 USAMO 2026 上达到了 97.6% 的准确率,在 Putnam 2025 上达到了 96.7%。
意义
论文声称,Nemotron 3 Ultra 代表了使大规模、高准确性模型在 自主智能体任务 中变得实用的重要一步。通过将混合 Mamba-Attention 架构与先进的蒸馏技术(MOPD)以及低精度训练(NVFP4)相结合,该模型打破了推理速度与准确性之间的传统权衡。作者强调,该模型处理 100 万 token 上下文的能力及其高吞吐量,使其成为长程、复杂智能体工作流的理想选择。其开源性质(包括专门的训练数据和配方)旨在加速整个社区开发智能体 AI 系统。该模型在留存智能体基准测试(PinchBench, ProfBench)上的表现表明,其改进已超越标准的开发指标,泛化到了未见的现实世界场景中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 NLP 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。