Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
이 논문은 25 조 개의 토큰으로 사전 학습되고 NVFP4, LatentMoE, MTP 레이어 등 혁신적인 기술을 적용하여 100 만 토큰의 컨텍스트를 지원하면서도 GPT-OSS-120B 및 Qwen3.5-122B 대비 최대 7.5 배 높은 추론 처리량을 달성한 오픈 소스 하이브리드 Mamba-Transformer MoE 모델인 'Nemotron 3 Super'의 개발 과정과 성능을 설명합니다.
원저자: NVIDIA, :, Aakshita Chandiramani, Aaron Blakeman, Abdullahi Olaoye, Abhibha Gupta, Abhilash Somasamudramath, Abhinav Khattar, Adeola Adesoba, Adi Renduchintala, Adil Asif, Aditya Agrawal, Aditya Vavre, Ahmad Kiswani, Aishwarya Padmakumar, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Gronskiy, Alex Kondratenko, Alex Neefus, Alex Steiner, Alex Yang, Alexander Bukharin, Alexander Young, Ali Hatamizadeh, Ali Taghibakhshi, Alina Galiautdinova, Alisa Liu, Alok Kumar, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrew Tao, Anjaney Shrivastava, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Ann Guan, Anna Shors, Annamalai Chockalingam, Anubhav Mandarwal, Aparnaa Ramani, Arham Mehta, Arti Jain, Arun Venkatesan, Asha Anoosheh, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asli Sabanci Demiroz, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Benjamin Chislett, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bobby Chen, Boris Ginsburg, Brandon Norick, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Buvaneswari Mani, Carlo del Mundo, Chankyu Lee, Chanran Kim, Chantal Hwang, Chao Ni, Charles Wang, Charlie Truong, Cheng-Ping Hsieh, Chenhan Yu, Chenjie Luo, Cherie Wang, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Chris Holguin, Chris Wing, Christian Munley, Christopher Parisien, Chuck Desai, Chunyang Sheng, Collin Neale, Cyril Meurillon, Dakshi Kumar, Dan Gil, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Burkhardt Eliuth Triana, Daniel Egert, Daniel Fatade, Daniel Lo, Daniel Rohrer, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Edelsohn, David Messina, David Mosallanezhad, David Tamok, Deena Donia, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di Wu, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dmitry Konyagin Brandon Tuttle, Dong Ahn, Dongfu Jiang, Dorrin Poorkay, Douglas O'Flaherty, Duncan Riach, Dusan Stosic, Dustin Van Stee, Edgar Minasyan, Edward Lin, Eileen Peters Long, Elad Segal, Elena Lantz, Elena Lewis, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric W. Tramel, Erick Galinkin, Erik Pounds, Esti Etrog, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Farshad Saberi Movahed, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Fortuna Zhang, Frankie Siino, Frida Hou, Gantavya Bhatt, Gargi Prasad, Geethapriya Venkataramani, Geetika Gupta, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Grace Wu, Greg Pauloski, Greyson Davis, Grigor Nalbandyan, Guoming Zhang, Guy Farber, Guyue Huang, Haifeng Qian, Haran Kumar Shiv Kumar, Harry Kim, Harsh Sharma, Hayate Iso, Hayley Ross, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huy Nguyen, Iain Cunningham, Ido Galil, Ido Shahaf, Igino Padovani, Igor Gitman, Igor Shovkun, Ikroop Dhillon, Ilya Loshchilov, Ingrid Kelly, Itamar Schen, Itay Levy, Ivan Moshkov, Izik Golan, Izzy Putterman, Jain Tu, Jan Baczek, Jan Kautz, Jane Polak Scowcroft, Janica Rosenberg, Jared Casper, Jarrod Pflum, Jason Grant, Jason Sewall, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiaqi Zeng, Jie Lou, Jill Milton, Jim Chow, Jimmy Zhang, Jinhang Choi, Jining Huang, Jocelyn Huang, Joel Caruso, Joey Conway, Joey Guman, Johan Jatko, John Kamalu, Johnny Greco, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joyjit Daw, Juan Yu, Julio Tapia, Junkeun Yi, Jupinder Parmar, Jyothi Achar, Kari Briski, Kartik Mattoo, Katherine Cheung, Katherine Luna, Keith Wyss, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirill Buryak, Kirthi Shankar Sivamani, Konstantinos Krommydas, Kris Murphy, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Laikh Tewari, Laya Sleiman, Leo Du, Leon Derczynski, Li Ding, Lilach Ilan, Lingjie Wu, Lizzie Wei, Luis Vega, Lun Su, Maarten Van Segbroeck, Maer Rodrigues de Melo, Magaret Zhang, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Sreedhar, Makesh Tarun Chandran, Manuel Reyes Gomez, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Margaret Zhang, Mark Cai, Mark Gabel, Markus Kliegl, Martyna Patelka, Maryam Moosaei, Matthew Varacalli, Matvei Novikov, Mauricio Ferrato, Mehrzad Samadi, Melissa Corpuz, Meng Xin, Mengdi Wang, Mengru Wang, Meredith Price, Micah Schaffer, Michael Andersch, Michael Boone, Michael Evans, Michael Z Wang, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Hollinger, Mingyuan Ma, Minseok Lee, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Nader Khalil, Najeeb Nabwani, Nancy Agarwal, Nanthini Balasubramaniam, Narimane Hennouni, Narsi Kodukula, Natalie Hereth, Nathaniel Pinckney, Nave Assaf, Negar Habibi, Nestor Qin, Neta Zmora, Netanel Haber, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nir Ailon, Nirmal Juluru, Nirmalya De, Nowel Pitt, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Almog, Omri Puny, Oren Tropp, Otavio Padovani, Ouye Xie, Parth Chadha, Pasha Shamis, Paul Gibbons, Pavlo Molchanov, Peter Belcak, Peter Jin, Pinky Xu, Piotr Januszewski, Pooya Jannaty, Prachi Shevate, Pradeep Thalasta, Pranav Prashant Thombre, Prasoon Varshney, Prerana Gambhir, Pritam Gundecha, Przemek Tredak, Qing Miao, Qiyu Wan, Quan Tran Minh, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Rahul Kandu, Raina Zhong, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Renee Yao, Renjie Pi, Richard Mazzarese, Richard Wang, Rick Izzo, Ridhima Singla, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Roger Waleffe, Rohit Varma Kalidindi, Rohit Watve, Roi Koren, Ron Fan, Ruchika Kharwar, Ruisi Cai, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Ryota Egashira, Sadegh Mahdavi, Sagar Singh Ashutosh Joshi, Sahil Modi, Samuel Kriman, Sandeep Pombra, Sanjay Kariyappa, Sanjeev Satheesh, Santiago Pombo, Saori Kaji, Satish Pasumarthi, Saurav Mishra, Saurav Muralidharan, Scott Hara, Sean Narenthiran, Sebastian Rogawski, Seonjin Na, Seonmyeong Bak, Sepehr Sameni, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh Adam Lord, Sharath Turuvekere Sreenivas, Shaun Kotek, Shaya Gharghabi, Shelby Thomas, Sheng-Chieh Lin, Shibani Likhite, Shiqing Fan, Shiyang Chen, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuo Zhang, Shuoyang Ding, Shyam Renjith, Shyamala Prayaga, Siddhartha Jain, Simeng Sun, Sirisha Rella, Sirshak Das, Smita Ithape, Sneha Harishchandra S, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sriharsha Niverty, Stas Sergienko, Stefana Gloginic, Stefania Alborghetti, Stephen Ge, Stephen McCullough, Sugam Dipak Devare, Suguna Varshini Velury, Sukrit Rao, Sumeet Kumar Barua, Sunny Gai, Suseella Panguluri, Sushil Koundinyan, Swathi Patnam, Sweta Priyadarshi, Swetha Bhendigeri, Syeda Nahida Akter, Sylendran Arunagiri, Tailling Yuan, Talor Abramovich, Tan Bui, Tan Yu, Terry Kong, Thanh Do, Thomas Gburek, Thorgane Marques, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Timothy Ma, Tiyasa Mitra, Tomasz Grzegorzek, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Traian Rebedea, Trenton Starkey, Tugrul Konuk, Twinkle Vashishth, Tyler Condensa, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Vanshil Atul Shah, Veena Vaidyanathan, Venkat Srinivasan, Venmugil Elango, Victor Cui, Vijay Korthikanti, Vikas Mehta, Virginia Adams, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Wan Seo, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wei-Ming Chen, Wendy Quan, Wenliang Dai, Wenwen Gao, Will Jennings, William Zhang, Xiaowei Ren, Xiaowen Xin, Xin Li, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Suhara, Youngeun Kwon, Yuan Zhang, Yuki Huang, Zach Moshe, Zhilin Wang, Zhiyu Cheng, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijia Chen, Zijie Yan, Zuhair Ahmed
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
NVIDIA 의 'Nemotron 3 Super': 지능형 에이전트를 위한 초고속, 초효율 AI
이 논문은 NVIDIA 가 공개한 새로운 인공지능 모델, **'Nemotron 3 Super(네모트론 3 슈퍼)'**에 대한 기술 보고서입니다. 이 모델은 단순히 글을 쓰는 것을 넘어, 스스로 문제를 해결하고 도구를 사용하는 **'지능형 에이전트 (Agentic Reasoning)'**에 특화되어 있습니다.
복잡한 기술 용어 대신, 일상적인 비유를 통해 이 모델이 무엇이 어떻게 특별한지 쉽게 설명해 드리겠습니다.
1. 이 모델은 어떤 존재일까요? (기본 개념)
비유: "120 명 팀원 중 12 명만 일하는 효율적인 사무실"
일반적인 AI 모델은 모든 작업을 할 때 팀원 전원이 함께 일합니다 (Dense 모델). 하지만 Nemotron 3 Super 는 **120 억 명의 거대한 팀 (전체 파라미터)**을 가지고 있으면서도, 실제로 한 번에 일을 처리할 때는 **가장 적합한 12 억 명의 전문가 (활성화 파라미터)**만 골라서 일하게 합니다.
- 모두 (MoE, Mixture-of-Experts): 각자 다른 분야 (수학, 코딩, 언어 등) 에 특화된 전문가들이 모여 있습니다.
- 하이브리드 (Mamba-Transformer): 두 가지 방식의 장점을 섞었습니다.
- Mamba: 긴 문서를 읽을 때 메모리를 거의 쓰지 않는 '초고속 스캐너' 역할.
- Transformer: 복잡한 관계를 파악할 때 정교한 '논리 분석가' 역할.
- 이 두 가지를 섞어서 **긴 문맥 (최대 100 만 단어)**도 빠르고 정확하게 처리합니다.
2. 무엇이 특별하게 개선되었나요? (핵심 기술)
① 'LatentMoE': 더 작은 공간에 더 많은 전문가를 배치
비유: "좁은 사무실 (메모리) 에 더 많은 전문가를 배치하는 clever한 방법"
기존 방식은 전문가를 불러올 때마다 무거운 서류 (데이터) 를 옮기느라 시간이 걸렸습니다. Nemotron 3 Super 는 **'LatentMoE'**라는 기술을 써서, 전문가들이 일하는 공간을 먼저 줄이고 (압축), 그 안에서 더 많은 전문가를 고용했습니다.
- 결과: 같은 양의 연산으로 더 똑똑한 일을 해냅니다. 메모리 사용량은 줄이고 지능은 높인 셈입니다.
② MTP (Multi-Token Prediction): "예측해서 미리 답을 준비하기"
비유: "말을 할 때 다음 단어를 미리 입에 담고 있는 사람"
보통 AI 는 한 글자씩 순서대로 답을 만듭니다. 하지만 이 모델은 한 번에 여러 개의 다음 단어를 미리 예측합니다.
- 효과: 마치 마술처럼, 실제로 검증만 하면 되므로 답을 내는 속도가 훨씬 빨라집니다. (최대 7.5 배 빠른 처리 속도)
③ NVFP4 학습: "저전력 모드에서도 똑똑하게 공부하기"
비유: "고급 카메라를 저해상도 모드에서도 찍어도 선명한 사진을 얻는 기술"
보통 AI 는 고해상도 (고정밀도) 데이터로만 학습합니다. 하지만 이 모델은 NVFP4라는 매우 낮은 정밀도 (데이터를 압축한 상태) 로 25 조 개의 텍스트를 학습했습니다.
- 의미: 하드웨어 부담을 크게 줄이면서도, 성능은 떨어지지 않게 학습하는 기술을 성공적으로 적용한 첫 사례입니다.
3. 무엇을 잘하나요? (성능과 특징)
이 모델은 **'에이전트 (Agent)'**에 집중했습니다. 즉, 단순히 질문에 답하는 것을 넘어 스스로 도구를 쓰고 문제를 해결합니다.
- 코드 작성 및 수정: GitHub 의 버그를 찾아서 고치는 일을 스스로 합니다.
- 터미널 조작: 컴퓨터 명령어를 직접 입력하고 실행 결과를 확인합니다.
- 검색 및 도구 사용: 인터넷을 검색하거나 계산기를 쓰는 등 복잡한 작업을 여러 단계로 나누어 수행합니다.
성능 비교:
- 속도: 같은 작업을 할 때, 경쟁 모델 (GPT-OSS, Qwen3.5) 보다 최대 7.5 배까지 더 빠릅니다.
- 정확도: 속도가 빠르다고 해서 똑똑하지 않은 것이 아닙니다. 수학, 과학, 코딩 등 주요 테스트에서 경쟁 모델들과 비슷하거나 더 좋은 점수를 받았습니다.
- 긴 문맥: 책 한 권 분량 (100 만 단어) 을 한 번에 읽어도 핵심을 놓치지 않습니다.
4. 왜 이 모델이 중요한가요? (실생활 적용)
이 모델은 **NVIDIA 가 모든 것을 공개 (Open Source)**했습니다.
- 누구나 사용 가능: 연구자나 기업이라면 누구나 이 모델을 가져와서 자신만의 AI 에이전트를 만들 수 있습니다.
- 효율적인 운영: 낮은 전력으로 더 많은 일을 처리할 수 있어, 데이터센터 비용을 크게 아낄 수 있습니다.
- 미래의 비서: 이 모델은 단순히 "날씨 알려줘"라고 대답하는 것을 넘어, "내 여행 일정을 짜주고 항공권 예매하고, 호텔 예약까지 해줘"라는 복잡한 지시도 스스로 실행할 수 있는 능력을 갖췄습니다.
요약
Nemotron 3 Super는 **"120 억 개의 두뇌를 가진 거인"**이지만, 실제로는 12 억 개의 두뇌만 효율적으로 움직여 최고의 속도와 정확도를 자랑하는 AI 입니다. 특히 **컴퓨터를 직접 조작하고 문제를 해결하는 '지능형 비서'**로서, 기존 모델들보다 훨씬 빠르고 똑똑하게 작동하며, NVIDIA 는 이 기술을 누구나 쓸 수 있도록 공개했습니다.
이 모델은 AI 가 단순히 '지식'을 가진 것을 넘어, '행동'을 할 수 있는 시대의 문을 여는 중요한 기술입니다.
Nemotron 3 Super 기술 요약
1. 문제 정의 (Problem)
최근 대규모 언어 모델 (LLM) 은 추론 능력과 에이전트 (Agent) 기능의 중요성이 부각되면서 더욱 복잡하고 긴 작업 (Long-horizon tasks) 을 수행해야 하는 요구를 받고 있습니다. 기존 모델들은 다음과 같은 한계를 가지고 있습니다:
- 추론 효율성: 긴 컨텍스트와 복잡한 에이전트 작업을 처리할 때 추론 속도가 느리고 계산 비용이 높음.
- 아키텍처 효율성: 기존 MoE(Mixture-of-Experts) 모델은 파라미터 수는 많지만 실제 활성화되는 파라미터 (Active parameters) 대비 정확도 효율이 낮거나, 메모리 대역폭 및 통신 오버헤드가 큼.
- 정밀도 vs 효율성 트레이드오프: 저정밀도 (Low-precision) 학습을 통해 효율성을 높이는 것은 안정성과 정확도 유지가 어려움.
- 에이전트 훈련의 어려움: 소프트웨어 엔지니어링 (SWE), 터미널 사용, 도구 활용 등 다단계 에이전트 작업을 위한 RL(강화학습) 인프라의 확장성과 견고성 부족.
2. 방법론 (Methodology)
Nemotron 3 Super 는 1200 억 (총) / 120 억 (활성화) 파라미터의 하이브리드 아키텍처를 기반으로 하며, 다음과 같은 핵심 기술들을 도입했습니다.
가. 하이브리드 아키텍처 및 LatentMoE
- Mamba-Attention Hybrid: Transformer 의 Attention 레이어와 Mamba-2(선형 시간 복잡도) 를 결합하여 긴 컨텍스트 처리 시 메모리 오버헤드를 줄이고 추론 속도를 향상시킴.
- LatentMoE (핵심 혁신): 기존 MoE 의 병목 현상 (메모리 대역폭, 통신 오버헤드) 을 해결하기 위해 제안된 새로운 MoE 아키텍처.
- 입력 토큰을 숨겨진 차원 (d) 에서 더 작은 잠재 차원 (ℓ) 으로 투영하여 라우팅 및 전문가 계산을 수행.
- 이를 통해 라우팅된 파라미터 로드와 All-to-All 트래픽을 d/ℓ배 감소시킴.
- 절감된 자원을 활용하여 총 전문가 수 (N) 와 토큰당 활성화 전문가 수 (K) 를 동적으로 증가시켜, 동일한 추론 비용으로 더 높은 정확도를 달성.
- MTP (Multi-Token Prediction): 추론 시 스펙큘레이티브 디코딩 (Speculative Decoding) 을 통해 여러 토큰을 동시에 예측하여 지연 시간을 줄이고 처리량 (Throughput) 을 향상시킴.
나. 학습 전략 (Training Strategy)
- NVFP4 프리트레이닝: 25 조 (25T) 토큰으로 학습하며, NVIDIA 의 NVFP4 포맷을 사용하여 저정밀도 학습의 안정성을 입증. (일부 레이어는 BF16/MXFP8 로 유지하여 안정성 확보).
- 데이터 구성:
- Synthetic Data: 코드 개념, 알고리즘, 경제학, 형식 논리, 객관식 문제 등을 위한 고품질 합성 데이터 생성.
- 에이전트 데이터: 소프트웨어 엔지니어링 (GitHub 이슈 해결), 터미널 사용, 검색 에이전트, 대화형 도구 사용 등 다양한 에이전트 시나리오를 위한 대규모 SFT 데이터.
- 후학습 (Post-training):
- SFT: 2 단계 학습 (토큰 수준 평균 -> 대화 단위 정규화) 을 통해 긴 입력/짧은 출력 시나리오에서의 성능 저하를 방지.
- RL (강화학습):
- Multi-environment RLVR: 21 개 이상의 다양한 환경 (수학, 코드, 과학, 안전 등) 에서 동시에 학습하여 일반화 능력 향상.
- SWE-RL: OpenHands, OpenCode 등 다양한 에이전트 하네스를 사용하여 소프트웨어 엔지니어링 작업에 특화된 RL 수행.
- PivotRL: SFT 전문가 궤적 내의 '중요한 턴 (Pivots)'에 집중하여 RL 효율성을 극대화하고 OOD(Out-of-Distribution) 성능 저하를 방지.
- RLHF: 인간 선호도 데이터를 기반으로 한 GenRM 을 사용하여 안전성과 지시 따르기 능력 강화.
다. 양자화 (Quantization)
- FP8 및 NVFP4 양자화: Blackwell GPU 에 최적화된 NVFP4(W4A4) 와 Hopper GPU 용 FP8(W8A8) 체크포인트 제공.
- AutoQuantize: 레이어별 민감도를 분석하여 최적의 혼합 정밀도 (Mixed-precision) 할당을 자동화하는 NAS 기반 방법론 적용.
- Mamba State Cache 최적화: Mamba 의 재귀적 상태 캐시 (SSM Cache) 양자화 시 발생하는 오차 누적 문제를 해결하기 위해 확률적 반올림 (Stochastic Rounding) 을 적용하여 정확도 유지.
3. 주요 기여 (Key Contributions)
- LatentMoE 아키텍처 도입: 하드웨어 제약 (메모리 대역폭, 통신) 을 고려하여 설계된 새로운 MoE 방식으로, 파라미터당 및 FLOP 당 정확도를 기존 MoE 보다 향상시킴.
- NVFP4 대규모 학습: 25 조 토큰 규모에서 NVFP4 정밀도로 안정적인 학습을 성공적으로 수행한 최초의 모델 중 하나.
- 에이전트 특화 강화학습: 21 개 환경, 37 개 RL 데이터셋을 활용한 대규모 비동기 RL 인프라 구축 및 PivotRL 등을 통한 에이전트 능력 (SWE, 터미널, 도구 사용) 의 획기적 개선.
- 오픈 소스 및 재현성: 베이스 모델, 후학습 모델, 양자화 모델 (BF16, FP8, NVFP4) 과 함께 학습 데이터셋, RL 환경, 학습 레시피를 HuggingFace 와 GitHub 를 통해 공개.
4. 결과 (Results)
- 정확도 (Accuracy):
- MMLU-Pro, HMMT, SWE-Bench, RULER(1M 컨텍스트) 등 다양한 벤치마크에서 GPT-OSS-120B 및 Qwen3.5-122B 와 유사하거나 더 높은 성능을 기록.
- 특히 SWE-Bench (OpenHands) 에서 60.47% 의 높은 점수를 기록하며 에이전트 코딩 능력을 입증.
- RULER 1M에서 91.64% 의 정확도로 100 만 토큰 컨텍스트 처리 능력을 입증.
- 추론 성능 (Inference Throughput):
- 처리량: 8k 입력 / 64k 출력 설정에서 GPT-OSS-120B 대비 2.2 배, Qwen3.5-122B 대비 7.5 배 높은 추론 처리량 (Throughput) 을 달성.
- MTP 효과: 스펙큘레이티브 디코딩을 통해 지연 시간을 줄이고 Blackwell GPU 에서 높은 TPS(초당 토큰 생성 수) 를 제공.
- 양자화 성능:
- NVFP4 양자화 모델은 BF16 기준 모델 대비 정확도 손실 없이 (99.8% 유지) 최대의 효율성을 제공.
5. 의의 (Significance)
Nemotron 3 Super 는 에이전트 AI 시대를 대비하여 효율성 (Efficiency) 과 정확도 (Accuracy) 를 동시에 달성한 새로운 패러다임을 제시합니다.
- 하드웨어-소프트웨어 공동 설계: LatentMoE 와 같은 아키텍처 혁신을 통해 하드웨어의 물리적 제약 (메모리 대역폭 등) 을 우회하여 성능을 극대화했습니다.
- 실용적 배포: NVFP4 및 FP8 양자화를 통해 최신 GPU 아키텍처 (Blackwell, Hopper) 에서 상용 수준의 높은 처리량을 제공하며, 오픈 소스로 공개되어 연구 및 산업계 전반의 발전에 기여할 것으로 기대됩니다.
- 에이전트 능력의 표준: 복잡한 소프트웨어 엔지니어링 및 도구 활용 작업을 수행할 수 있는 강력한 오픈 소스 모델의 기준을 제시했습니다.
이 모델은 NVIDIA 가 제시한 차세대 오픈 모델의 방향성을 보여주며, 특히 긴 컨텍스트와 복잡한 에이전트 작업이 필요한 환경에서 기존 밀집형 (Dense) 모델이나 다른 MoE 모델보다 우월한 효율성을 입증했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.
매주 최고의 machine learning 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.