Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
Nemotron 3 Ultra는 100만 토큰의 컨텍스트와 고급 학습 기술을 특징으로 하는 5,500억 파라미터 규모의 오픈 소스 하이브리드 Mamba-Transformer 모델로, 최대 6배 높은 추론 처리량을 통해 최첨단 정확도를 제공하며 복잡한 에이전트 추론 작업에 이상적입니다.
원저자: NVIDIA (Allan), : (Allan), Aaron Blakeman (Allan), Aaron Thomas (Allan), Aastha Jhunjhunwala (Allan), Abhibha Gupta (Allan), Abhinav Khattar (Allan), Adam Rajfer (Allan), Adi Renduchintala (Allan), Adil Asif (Allan), Aditya Vavre (Allan), Adriana Flores Miranda (Allan), Ahmad Bilal (Allan), Aileen Zaman (Allan), Ajay Hotchandani (Allan), Akanksha Shukla (Allan), Akhiad Bercovich (Allan), Aleksander Ficek (Allan), Alex Gronskiy (Allan), Alex Kondratenko (Allan), Alex Steiner (Allan), Alex Ye (Allan), Alexander Bukharin (Allan), Alexandre Milesi (Allan), Ali Taghibakhshi (Allan), Alice Gatti (Allan), Alisa Liu (Allan), Alok Kumar (Allan), Amar Phanishayee (Allan), Ameya Sunil Mahabaleshwarkar (Allan), Amir Klein (Allan), Amit Zuker (Allan), Amnon Geifman (Allan), Anahita Bhiwandiwalla (Allan), Ananth Subramaniam (Allan), Andrea Santilli (Allan), Andrew Fulks (Allan), Andrew McHarg (Allan), Andrew Tao (Allan), Andrii Skliar (Allan), Anjulie Agrusa (Allan), Ankur Srivastava (Allan), Ankur Verma (Allan), Anna Shors (Allan), Anna Warno (Allan), Antoni-Joan Solergibert I Llaquet (Allan), Arham Mehta (Allan), Arkadiusz Nowaczynski (Allan), Arti Jain (Allan), Ashwath Aithal (Allan), Ashwin Poojary (Allan), Asif Ahamed (Allan), Asit Mishra (Allan), Asma Kuriparambil Thekkumpate (Allan), Atefeh Sohrabizadeh (Allan), Avinash Kaur (Allan), Avinash Vem (Allan), Ayush Dattagupta (Allan), Barath Subramaniam Anandan (Allan), Bardiya Sadeghi (Allan), Ben Lanir (Allan), Benedikt Schifferer (Allan), Besmira Nushi (Allan), Bilal Kartal (Allan), Bill Thiede (Allan), Bita Darvish Rouhani (Allan), Bo Deng (Allan), Bob Schatz (Allan), Boris Ginsburg (Allan), Boxin Wang (Allan), Brad Nemire (Allan), Brandon Norick (Allan), Brian Dang (Allan), Brian Westphal (Allan), Brian Yu (Allan), Brucek Khailany (Allan), Bryan Catanzaro (Allan), Carlo del Mundo (Allan), Caryln Aarish (Allan), Chankyu Lee (Allan), Chantal Hwang (Allan), Charbel Sakr (Allan), Charles Wang (Allan), Charlie Truong (Allan), Chen Cui (Allan), Cheng Cheng (Allan), Cheng-Ping Hsieh (Allan), Chenghao Zhang (Allan), Chenhui Deng (Allan), Chintan Patel (Allan), Chris Alexiuk (Allan), Christian Cosgrove (Allan), Christian Munley (Allan), Christine Harvey (Allan), Christopher Parisien (Allan), Chunyang Shen (Allan), Coco Li (Allan), Collin Neale (Allan), Cynthia Gao (Allan), Cyril Meurillon (Allan), Dan Gil (Allan), Dan Su (Allan), Dan Zhao (Allan), Dane Corneil (Allan), Daniel Afrimi (Allan), Daniel Egert (Allan), Daniel Korzekwa (Allan), Daniel Lo (Allan), Daniel Machlab (Allan), Daniel Serebrenik (Allan), Daniil Sorokin (Allan), Daria Gitman (Allan), Daria Levy (Allan), Darko Stosic (Allan), David Mosallanezhad (Allan), David Yu (Allan), Davit Karamyan (Allan), Deena Donia (Allan), Deep Debroy (Allan), Deepak Narayanan (Allan), Devin O'Kelly (Allan), Dheeraj Peri (Allan), Dhruv Nathawani (Allan), Di (Allan), Wu, Dima Rekesh, Divyanshu Kakwani, Donald Plummer, Dong Anh, Dongfeng Yu, Dongfu Jiang, Donnie Kim, Dorrin Poorkay, Duncan Riach, Dusan Stosic, Dustin VanStee, Eavan Meng, Edgar Minasyan, Edward Lin, Eileen Margaret Peters Long, Elad Sarafin, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric Tramel, Eric Yang, Erick Galinkin, Erik Pounds, Erika Goncalves Goncalves, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Faisal Ladhak, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Frank Sun, Frankie Siino, Frida Hou, Gal Hubara Agam, Gal Kaplun, Gantavya Bhatt, Gargi Prasad, Garvit Kulshreshtha, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Greg Mason, Greg Pauloski, Grigor Nalbandyan, Grzegorz Chlebus, Grzegorz Karch, Guan-Ting Liu, Guoming Zhang, Guyue Huang, Haggai Maron, Haifeng Qian, Haim Elisha, Haoxing Ren, Haran Kumar Shiv Kumar, Haribhau Hud, Harris Nover, Harrison Saturley Hall, Hayate Iso, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hovhannes Tamoyan, Hua Li, Huanhuan Chen, Hui Li, Hui Wang, Huy Nguyen, Ian Chiles, Ido Galil, Ido Shahaf, Igor Gitman, Igor Shovkun, Ilya Loshchilov, Ingo Guehring, Itamar Schen, Itay Levy, Itay Neeman, Ivan Moshkov, Izik Golan, Izzy Putterman, Jaemin Choi, Jakub Slowikowski, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiantao Jiao, Jiaqi Zeng, Jie Lou, Jim King, Jimmy Zhang, Jingquan Wang, Jinhang Choi, Jinju Chu, Joey Conway, Joey Guman, Johan Jatko, Johannes Rausch, John Kamalu, John Roberts, Johnny Greco, Johnny Mensel, Jonah Alben, Jonas Yang, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joshua Mabry, Joshua Pierce, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kajal Jain, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Willowhawk, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirthi Shankar Sivamani, Konstantinos Krommydas, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Kyle Keprios, Kylie Day, Lawrence McAfee, Leo Du, Leon Derczynski, Li Ding, Linda Liu, Lingjie Wu, Lior Kadoch, Lizzie Wei, Luis Vega, Luke Robison, Lun Su, Maarten Van Segbroeck, Maciej Jakub Mikulski, Maer Rodrigues de Melo, Magda Sypula, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Tarun Chandran, Manoj Kilaru, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Marcin Chochowski, Mark Cai, Mark Mozolewski, Markus Kliegl, Marta Stepniewska-Dziubinska, Martyna Patelka, Mattei Machczynski, Matvei Novikov, Mauricio Ferrato, Maximilian Golub, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Mengxi Wu, Meredith Price, Meriem Boubdir, Micah Schaffer, Michael Andersch, Michael Boone, Michael Gschwind, Michael Lightstone, Michael Loh, Michal Bien, Michal Zawalski, Michelle Gill, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Houston, Mingyuan Ma, Minseok Lee, Mohamed Fawzy, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Namit Dhameja, Narimane Hennouni, Natalie Hereth, Nathaniel Pinckney, Nave Algarici, Nave Assaf, Netanel Haber, Nicholas Knight, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Desai, Nikolai Ludwig, Nima Tajbakhsh, Ning Xu, Nir Ailon, Nirmal Juluru, Nitin Nitin, Ofri Masad, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivia Viessmann, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Pablo Ribalta, Pallab Bhattacharya, Panos Lampropoulos, Parth Mannan, Pasha Shamis, Patrick Legresley, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pierre-Yves Aquilanti, Pinky Xu, Piotr Januszewski, Piotr Laskiewicz, Pooya Jannaty, Prakash Gurumurthy, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Puhui Meng, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Radha Sri-Tharan, Rahul Kandu, Rakshit Sanadhya, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Ray Macalisang, Rayen Tian, Reka Kovacs, Renjie Pi, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Rishi Puri, Rita Fernandes Neves, Ritchie Zhao, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Robert Kirby, Roger Waleffe, Rohit Watve, Roi Koren, Ron Banner, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Stewart, Ryota Egashira, Sadegh Mahdavi, Saee Paliwal, Sagar Singh, Sahil Modi, Salika Dave, Samantha Shinagawa, Samuel Kriman, Sandip Bhaskar, Sangkug Lym, Sanjay Kariyappa, Sanjeev Satheesh, Saran Vikas Murari, Satish Pasumarthi, Saurabh Mishra, Saurav Muralidharan, Scott Hara, Sean Narentharen, Selvaraj Anandaraj, Seonjin Na, Seonmeyong Bak, Seonmyeong Bak, Sepehr Sameni, Seph Mard, Serge Panev, Seth Henneman, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Mendelson, Shaun Kotek, Shawn Wang, Shay Aharon, Shaya Gharghabi, Sheng-Chieh Lin, Shi Chen, Shiqing Fan, Shirish Baskaran, Shreya Gopa, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Shwetha Krishnamurthy, Siddharth Singh, Simeng Sun, Sirshak Das, Sivakumar Arayandi Thottakara, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sridhar Bhuvanapalli, Srimukh Veccham, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Su Rong, Sugam Dipak Devare, Sukrit Rao, Sumeet Kumar Barua, Sungsoo Ha, Sunny Gai, Suriya Gunasekar, Suseella Panguluri, Suyog Gupta, Sviataslau Hinzburh, Sweta Priyadarshi, Syeda Nahida Akter, Talor Abramovich, Tan Bui, Tanay Varshney, Tatevik Ter-Hovhannisyan, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tianhe Zhang, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Tiyasa Mitra, Tom Balough, Tomasz Grzegorzek, Tomasz Hliwiak, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Tony Salim, Tony Wang, Traian Rebedea, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Venkat Srinivasan, Venmugil Elango, Vibhor Agrawal, Victor Cui, Vijay Korthikanti, Vikas Mehta, Vinay Rao, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Vu Pham, Wanli Jiang, Wasi Uddin Ahmad, Wataru Ishihara, Wei Du, Wei Ping, Weiheng Chai, Wenliang Dai, Wesley Helmholz, Will Jennings, Will Zhu, Wojciech Prazuch, Xiaowei Ren, Xiwen Yu, Yan Breek, Yang Chen, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Youngeun Kwon, Yu Yao, Yugi Guvvla, Yuki Huang, Yunsheng Liu, Zach Moshe, Zachary Newell, Zhilin Wang, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijie Yan, Zsolt-Alon Wertheimer
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 Nemotron 3 Ultra 논문을 쉬운 개념과 창의적인 비유로 풀어낸 설명입니다.
핵심 요약: "실행"을 위한 슈퍼 브레인
당신에게 아주 유능한 비서가 있다고 상상해 보세요. 오늘날 대부분의 AI 비서들은 채팅을 하거나 짧은 이메일을 쓰는 데 능숙합니다. 하지만 Nemotron 3 Ultra는 장기 프로젝트 매니저가 되도록 설계되었습니다. 이 모델은 몇 시간 동안 깨어 있는 상태로 여러 개의 창을 열고, 웹을 검색하고, 코드를 작성하고, 오류를 수정하며, 당신이 일일이 손을 잡아주지 않아도 스스로 복잡한 과업을 완수할 수 있도록 구축되었습니다.
논문에 따르면 이 모델은 NVIDIA에서 만든 모델 중 가장 뛰어난 성능을 자랑하며, 방대한 양의 정보(최대 100만 단어)를 처리하면서도 빠르고 효율적이도록 최적화되었습니다.
1. 엔진: AI를 위한 하이브리드 자동차
대부분의 AI 모델은 모든 작업에 동일한 방식으로 작동하는 하나의 거대한 엔진과 같습니다. 하지만 Nemotron 3 Ultra는 다릅니다. 이 모델은 하이브리드 차량입니다.
- "Mamba" 엔진: 이것은 고속 열차와 같습니다. 정보를 매우 빠르게 통과하며, 뒤에 무거운 짐 가방(메모리)을 끌고 다닐 필요가 없습니다. 덕분에 긴 이야기나 문서를 처리할 때 믿기지 않을 정도로 빠릅니다.
- "Transformer" 엔진: 이것은 심층적인 추론과 복잡한 관계 이해에 탁월한 클래식하고 강력한 엔진입니다.
- 하이브리드: 이 모델은 작업에 따라 이 두 가지 엔진 사이를 전환합니다. 긴 문서를 스캔할 때는 빠른 열차를 사용하고, 깊은 사고가 필요할 때는 강력한 엔진을 사용합니다. 이 조합 덕분에 지능을 잃지 않으면서도 경쟁 모델들보다 훨씬 더 빠르게 작동할 수 있습니다.
2. 팀 구조: "전문가 혼합(Mixture of Experts)"
거대한 도서관을 상상해 보세요. 한 명의 사서가 모든 책에 대해 다 알려고 하면 느리고 지치겠지만, 이 도서관에는 512명의 전문 사서가 있습니다.
- 만약 당신이 법률에 대해 질문하면, 법률 전문가들만 깨어납니다.
- 만약 코딩에 대해 질문하면, 코딩 전문가들만 깨어납니다.
- 만약 수학에 대해 질문하면, 수학 전문가들만 깨어납니다.
이것을 전문가 혼합(Mixture-of-Experts, MoE) 모델이라고 부릅니다. Nemotron 3 Ultra는 총 5,500억 개의 "전문가"(파라미터)를 가지고 있지만, 단 하나의 문장을 처리할 때도 오직 550억 개의 전문가만을 "깨웁니다". 이는 대기 중인 거대한 전문가 팀을 보유하되, 현재 작업에 필요한 특정 전문가만 호출하는 것과 같습니다. 이는 엄청난 양의 에너지와 시간을 절약해 줍니다.
3. 학습 과정: 학생에서 마스터로
논문은 이 모델을 전문적인 에이전트로 만들기 위한 3단계 학습 과정을 설명합니다.
- 1단계: 사전 학습 (백과사전 읽기): 모델은 20조 개의 텍스트 토큰(단어 및 코드)을 읽었습니다. 이는 거대한 도서관의 모든 책을 읽는 것과 같습니다. 그들은 이를 효율적으로 수행하기 위해 특수한 "저정밀도(low-precision)" 형식(NVFP4)을 사용했는데, 이는 의미를 잃지 않으면서도 페이지에 더 많은 내용을 담기 위해 약간 작은 글씨체로 책을 읽는 것과 같습니다.
- 2단계: 지도 미세 조정 (인턴십): 모델은 지시 사항을 따르고, 도구(검색 엔진이나 코드 터미널 등)를 사용하며, 안전을 유지하는 법을 배웠습니다. 연구진은 문제를 단계별로 해결하는 예시들을 제공했습니다.
- 3단계: 강화 학습 및 지식 증류 (마스터 클래스): 이것이 바로 핵심 비법(secret sauce)입니다.
- 먼저, 모델은 시행착오를 통해 배우기 위해 다양한 "시뮬레이션"(코딩, 수학, 사무 업무를 위한 비디오 게임 같은 환경) 속에서 연습했습니다.
- 그다음, 10개 이상의 특화된 "교사(Teacher)" 모델(코딩용, 수학용, 사무 업무용 등)을 훈련시켰습니다.
- 마지막으로, **MOPD(Multi-teacher On-Policy Distillation)**라는 기술을 사용했습니다. 메인 모델(학생)이 문제를 풀려고 노력할 때, 특화된 교사들이 정확히 어떻게 해야 하는지 조언을 속삭여 주는 것을 상상해 보세요. 학생은 교사들의 최고의 움직임을 모방함으로써 학습하며, 모든 지혜를 하나의 슈퍼 모델으로 결합합니다.
4. 초능력
논문은 Nemotron 3 Ultra가 가진 세 가지 주요 초능력을 강조합니다.
- 100만 단어의 기억력: 대부분의 AI 모델은 몇 장의 챕터보다 긴 책을 주면 혼란을 겪습니다. 하지만 Nemotron은 100만 토큰(대략 소설 10권 분량)의 컨텍스트를 읽을 수 있으며, 마지막 페이지를 쓰는 동안에도 첫 페이지의 세부 사항을 기억할 수 있습니다.
- "추론 예산(Reasoning Budget)" 제어: 당신은 모델에게 "빠르게 해결하되 몇 단계는 건너뛰어도 좋아" 또는 "시간을 갖고 깊이 생각하라"고 말할 수 있습니다. 이를 통해 사용자는 작업에 따라 속도와 정확도 사이의 균형을 선택할 수 있습니다.
- 속도: 하이브리드 엔진과 전문가 시스템 덕분에, 이 모델은 다른 최고 수준의 공개 모델들보다 최대 6배 빠르게 정보를 처리하면서도 동일하거나 더 나은 답변을 내놓을 수 있습니다.
5. "두뇌"의 안정성
논문은 이 정도로 큰 모델을 훈련하는 것이 마치 외줄 타기를 하는 것과 같다고 인정합니다. 훈련 중에 모델이 무작위로 잘못된 예측을 하기 시작하는 "발산(divergence)" 현상을 두 번 겪었습니다.
- 해결책 1: 특정 수학적 부분(그래디언트 누적)에서 정밀도가 손실된다는 것을 깨닫고, 해당 부분에 대해 다시 높은 정밀도 모드로 전환했습니다.
- 해결책 2: 팀 내의 "전문가"들이 불균형해지고 있다는 것(어떤 전문가는 모든 일을 하고, 어떤 전문가는 잠만 자는 현상)을 발견했습니다. 이를 방지하기 위해 업무량이 공평하게 공유되도록 시스템을 조정하여 모델이 붕괴되는 것을 막았습니다.
6. 결과: 모두를 향해 열려 있음
이 논문의 가장 흥미로운 점은 NVIDIA가 모든 것을 오픈 소스로 공개한다는 것입니다.
- 베이스 모델(가공되지 않은 원천 두뇌)을 공개합니다.
- 사후 학습된 모델(전문가 에이전트)을 공개합니다.
- 양자화 버전(특정 NVIDIA 칩에서 더 빠르게 실행되도록 압축된 버전)을 공개합니다.
- 데이터와 레시피(그들이 읽은 책의 목록과 따라간 지침)를 공개합니다.
요약하자면: Nemotron 3 Ultra는 장기간 자율적으로 작동하도록 설계된 거대한 하이브리드 엔진 AI입니다. 이 모델은 깊이 생각하면서도 빠르게 움직이기 위해 특화된 전문가 팀을 사용하며, 도서관 전체의 텍스트를 기억할 수 있고, 누구나 이 모델을 사용하여 자신만의 AI 에이전트를 구축할 수 있도록 대중에게 공개됩니다.
기술 요약: Nemotron 3 Ultra
문제 정의
대규모 언어 모델(LLM) 애플리케이션이 단순한 챗봇에서 코딩, 연구 및 복잡한 작업 완수가 가능한 장기 실행 자율 에이전트로 진화함에 따라, 업계는 중요한 병목 현상에 직면해 있습니다. 즉, 매우 높은 정확도를 갖추면서도 대규모 환경에서 빠르고 효율적인 추론이 가능한 모델에 대한 필요성입니다. 기존의 밀집(dense) 모델은 긴 컨텍스트의 계산 비용과 높은 처리량 요구 사항을 충족하는 데 어려움을 겪는 경우가 많으며, 기존의 전문가 혼합(Mixture-of-Experts, MoE) 모델은 에이전트 기반 추론 및 장기 과제 수행에 필요한 아키텍처 최적화가 부족할 수 있습니다. 과제는 과도한 계산 오버헤드 없이 상태 최첨단(SOTA) 정확도를 달면서도 추론 처리량을 크게 개선하고 최대 100만 토큰에 달하는 방대한 컨텍스트 길이를 지원하는 것입니다.
방법론
모델 아키텍처
Nemotron 3 Ultra는 총 파라미터 5,500억 개 중 토큰당 550억 개의 활성 파라미터를 사용하는 5,500억 파라미터 모델입니다. 이 모델은 하이브리드 Mamba-Attention Mixture-of-Experts (MoE) 아키텍처를 채택했습니다.
- 하이브리드 백본(Hybrid Backbone): 모델은 Mamba-2 상태 공간(state-space) 레이어와 희소 전역 어텐션(sparse global Attention) 앵커를 통합합니다. 이 설계는 어텐션 비용과 KV 캐시 점유율을 줄여, 프리필(prefill) 단계에서는 하위 이차(sub-quadratic) 시퀀스 길이 스케일링을 가능하게 하고 디코드(decode) 단계에서는 제한된 메모리 사용량을 보장합니다.
- LatentMoE: 모델은 전문가 레이어에 LatentMoE를 사용하여 표준 그래뉼러(Granular) MoE 대비 활성 파라미터당 정확도를 향상시킵니다.
- 다중 토큰 예측 (Multi-Token Prediction, MTP): 아키텍처에는 추론을 가속화하기 위해 사전 학습 중에 훈련된 두 개의 공유 파라미터 헤드를 가진 네이티브 MTP 헤드가 포함되어 있어 투기적 디코딩(speculative decoding)을 가능하게 합니다.
사전 학습 (Pre-training)
베이스 모델은 Warmup-Stable-Decay (WSD) 학습률 스케줄을 사용하여 20조 개의 텍스트 토큰으로 사전 학습되었습니다.
- 정밀도(Precision): 네트워크의 대부분은 Transformer Engine의 cuBLAS NVFP4 GEMM 커널을 활용하여 NVFP4 (NVIDIA FP4) 정밀도로 학습되었습니다. 안정성을 보장하기 위해 특정 레이어(최종 15%, 임베딩, 프로젝션)만 더 높은 정밀도를 유지했습니다.
- 데이터 전략: 사전 학습 코퍼스는 두 단계로 나뉩로 구성되었습니다:
- 1단계 (15조 토큰): 다양성과 광범위한 도메인 커버리지에 집중했습니다.
- 2단계 (5조 토큰): 정확도를 정교화하기 위한 고품질 데이터에 집중했습니다.
- 새로운 데이터 소스: 데이터셋에는 갱신된 코드 데이터(GitHub에서 추출한 1,730억 토큰), 법률, 도덕적 시나리오 및 사실 탐색을 위한 합성 데이터셋, 그리고 특화된 다국어 데이터가 포함되었습니다.
- 롱 컨텍스트 확장: 별도의 롱 컨텍스트(Long-Context, LC) 단계를 통해 32-way 컨텍스트 병렬성을 사용한 연속 사전 학습(CPT)으로 모델의 컨텍스트 창을 100만 토큰까지 확장했습니다.
사후 학습 파이프라인 (Post-training Pipeline)
사후 학습 파이프라인은 에이전트 추론과 도구 사용에 초점을 맞도록 재설계되었으며, 혁신적인 다중 교사 온-폴리시 증류 (Multi-teacher On-Policy Distillation, MOPD) 접근 방식을 특징으로 합니다.
- 지도 미세 조정 (Supervised Fine-Tuning, SFT): 모델은 터미널 사용, 검색, 소프트웨어 엔지니어링, 안전 등의 도메인을 다루는 최대 512K 토큰의 패킹된 시퀀스를 사용하여 두 단계의 SFT를 거쳤습니다.
- 통합 RLVR: 다양한 환경(코딩, 수학, 안전, 채팅 등)에 걸쳐 검증 가능한 보상을 통한 강화 학습(Reinforcement Learning with Verifiable Reward, RLVR) 단계를 적용하여 능력을 날카롭게 다듬었습니다.
- 다중 교사 온-폴리시 증류 (MOPD): 혼합된 환경의 RL에서 발생하는 학습 신호의 희석 문제를 해결하기 위해, 팀은 10개 이상의 도메인 특화 교사 모델(예: SWE, Search, STEM, Office tasks)을 훈련시켰습니다. 이후 학생 모델(Nemotron 3 Ultra)은 비동기 온-폴리시 증류를 거치며, 전문화된 교사들로부터 롤아웃(rollout)을 생성하고 조밀한 토큰 수준의 가이드를 받았습니다. 이 과정은 교사가 학생의 진전에 따라 업데이트되는 방식으로 두 차례 반복되었습니다.
- MTP 부스팅 (MTP Boosting): 마지막 단계에서는 추론 시 노이즈 조건 하에서의 투기적 디코딩 수락률을 높이기 위해 MTP 헤드를 백본의 분포와 일치하도록 최적화했습니다.
양자화 및 추론
- 양자화: 모델은 NVIDIA Blackwell GPU에서의 추론을 위해 NVFP4로 양자화되었으며, 5.03 bits-per-element (BPE) 동작 지점을 달성하기 위해 혼합 정밀도 레시피(라우팅된 전문가에는 NVFP4, 공유 전문가/Mamba에는 FP8, 어텐션에는 BF16 적용)를 사용했습니다.
- 인프라: 5,500억 개의 파라미터 규모를 처리하기 위해 토폴로지 인식 NVLink 배치, NUMA 바인딩, 비동기 체크포인팅을 특징으로 하는 GB200 클러스터에 최적화된 훈련 및 추론 인프라를 갖추었습니다.
주요 기여
- Nemotron 3 Ultra 모델: 에이전트 추론에 최적화된 5,500억 파라미터 MoE 하이브리드 Mamba-Attention 모델을 출시했습니다.
- 오픈 소스 공개: Base, Post-Trained, NVFP4 양자화 체크포인트와 함께 훈련 데이터(법률, 코드 및 특화된 합성 데이터셋 포함) 및 훈련 레시피를 HuggingFace에 완전히 공개했습니다.
- MOPD 프레임워크: 표준 RLVR보다 에이전트 및 추론 작업에서 우수한 성능을 달성하기 위해 다수의 특화된 교사 모델과 비동기 온-폴리시 증류를 사용하는 새로운 사후 학습 방법론을 제시했습니다.
- NVFP4 규모: 5,500억 파라미터 모델에 대해 20조 개의 토큰을 활용한 안정적인 대규모 NVFP4 사전 학습을 입증하여 저정밀도 훈련 안정성의 새로운 벤치마크를 세웠습니다.
- 100만 토큰 컨텍스트: 롱 컨텍스트 벤치마크에서 높은 정확도를 유지하면서 모델의 컨텍스트 창을 100만 토큰까지 성공적으로 확장했습니다.
결과
Nemotron 3 Ultra는 경쟁력 있는 정확도를 유지하면서 추론 처리량을 크게 개선했습니다:
- 처리량: 8K 입력 / 64K 출력 설정(GB200 상의 NVFP4 정밀도)에서 GLM-5.1-754B-A40B 대비 최대 5.9배, Kimi-K2.6-1T-A32B 대비 4.8배, Qwen-3.5-397B-17B 대비 1.6배 높은 추론 처리량을 달성했습니다.
- 정확도: 다음을 포함한 광범한 벤치마크에서 대등하거나 우수한 정확도를 달성했습니다:
- 에이전트 작업: Terminal Bench 2.1 (56.4), GDPVal (46.7), SWE-Bench Verified (70.7), TauBench V3 (평균 70.9).
- 추론: GPQA (87.0), MMLU-Pro (86.8), IOI 2025 (570.0으로 인간 수준의 상위 3위 기록).
- 롱 컨텍스트: 100만 토큰에서의 RULER (94.7).
- 테스트 시간 스케일링 (Test-Time Scaling): 올림피아드 수준의 수학을 위한 검색 기반 테스트 시간 스케일링 전략을 사용할 때, USAMO 2026에서 97.6%, Putnam 2025에서 96.7%의 정확도를 달성했습니다.
의의
본 논문은 Nemotron 3 Ultra가 대규모 고정밀 모델을 자율 에이전트 작업에 실용적으로 만드는 데 있어 중요한 진전임을 주장합니다. 하이브리드 Mamba-Attention 아키텍처와 고급 증류 기술(MOPD), 그리고 저정밀도 훈련(NVFP4)을 결합함으로써, 이 모델은 추론 속도와 정확도 사이의 전통적인 트레이드오프를 깨뜨립니다. 저자들은 100만 토큰 컨텍스트를 처리할 수 있는 능력과 높은 처리량이 장기 실행되는 복잡한 에이전트 워크플로우에 이상적이라는 점을 강조합니다. 특화된 훈련 데이터와 레시피를 포함한 오픈 소스 공개는 더 넓은 커뮤니티 내에서 에이전트형 AI 시스템의 발전을 가속화하기 위함입니다. 홀드아웃(held-out) 에이전트 벤치마크(PinchBench, ProfBench)에서 보여준 모델의 성능은 이러한 개선이 표준 개발 메트릭을 넘어 미지의 실제 시나리오로 일반화됨을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.
매주 최고의 NLP 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.