← Neueste Arbeiten
💬 NLP

Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Ultra ist ein Open-Source-Hybrid-Mamba-Transformer-Modell mit 550 Milliarden Parametern, das über einen Kontext von 1 Mio. Token und fortschrittliche Trainingstechniken verfügt, die eine erstklassige Genauigkeit bei einer bis zu 6-mal höheren Inferenz-Durchsatzrate liefern und es somit ideal für komplexe agentische Denkaufgaben macht.

Ursprüngliche Autoren: NVIDIA (Allan), : (Allan), Aaron Blakeman (Allan), Aaron Thomas (Allan), Aastha Jhunjhunwala (Allan), Abhibha Gupta (Allan), Abhinav Khattar (Allan), Adam Rajfer (Allan), Adi Renduchintala (Allan), A
Veröffentlicht 2026-06-16
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: NVIDIA (Allan), : (Allan), Aaron Blakeman (Allan), Aaron Thomas (Allan), Aastha Jhunjhunwala (Allan), Abhibha Gupta (Allan), Abhinav Khattar (Allan), Adam Rajfer (Allan), Adi Renduchintala (Allan), Adil Asif (Allan), Aditya Vavre (Allan), Adriana Flores Miranda (Allan), Ahmad Bilal (Allan), Aileen Zaman (Allan), Ajay Hotchandani (Allan), Akanksha Shukla (Allan), Akhiad Bercovich (Allan), Aleksander Ficek (Allan), Alex Gronskiy (Allan), Alex Kondratenko (Allan), Alex Steiner (Allan), Alex Ye (Allan), Alexander Bukharin (Allan), Alexandre Milesi (Allan), Ali Taghibakhshi (Allan), Alice Gatti (Allan), Alisa Liu (Allan), Alok Kumar (Allan), Amar Phanishayee (Allan), Ameya Sunil Mahabaleshwarkar (Allan), Amir Klein (Allan), Amit Zuker (Allan), Amnon Geifman (Allan), Anahita Bhiwandiwalla (Allan), Ananth Subramaniam (Allan), Andrea Santilli (Allan), Andrew Fulks (Allan), Andrew McHarg (Allan), Andrew Tao (Allan), Andrii Skliar (Allan), Anjulie Agrusa (Allan), Ankur Srivastava (Allan), Ankur Verma (Allan), Anna Shors (Allan), Anna Warno (Allan), Antoni-Joan Solergibert I Llaquet (Allan), Arham Mehta (Allan), Arkadiusz Nowaczynski (Allan), Arti Jain (Allan), Ashwath Aithal (Allan), Ashwin Poojary (Allan), Asif Ahamed (Allan), Asit Mishra (Allan), Asma Kuriparambil Thekkumpate (Allan), Atefeh Sohrabizadeh (Allan), Avinash Kaur (Allan), Avinash Vem (Allan), Ayush Dattagupta (Allan), Barath Subramaniam Anandan (Allan), Bardiya Sadeghi (Allan), Ben Lanir (Allan), Benedikt Schifferer (Allan), Besmira Nushi (Allan), Bilal Kartal (Allan), Bill Thiede (Allan), Bita Darvish Rouhani (Allan), Bo Deng (Allan), Bob Schatz (Allan), Boris Ginsburg (Allan), Boxin Wang (Allan), Brad Nemire (Allan), Brandon Norick (Allan), Brian Dang (Allan), Brian Westphal (Allan), Brian Yu (Allan), Brucek Khailany (Allan), Bryan Catanzaro (Allan), Carlo del Mundo (Allan), Caryln Aarish (Allan), Chankyu Lee (Allan), Chantal Hwang (Allan), Charbel Sakr (Allan), Charles Wang (Allan), Charlie Truong (Allan), Chen Cui (Allan), Cheng Cheng (Allan), Cheng-Ping Hsieh (Allan), Chenghao Zhang (Allan), Chenhui Deng (Allan), Chintan Patel (Allan), Chris Alexiuk (Allan), Christian Cosgrove (Allan), Christian Munley (Allan), Christine Harvey (Allan), Christopher Parisien (Allan), Chunyang Shen (Allan), Coco Li (Allan), Collin Neale (Allan), Cynthia Gao (Allan), Cyril Meurillon (Allan), Dan Gil (Allan), Dan Su (Allan), Dan Zhao (Allan), Dane Corneil (Allan), Daniel Afrimi (Allan), Daniel Egert (Allan), Daniel Korzekwa (Allan), Daniel Lo (Allan), Daniel Machlab (Allan), Daniel Serebrenik (Allan), Daniil Sorokin (Allan), Daria Gitman (Allan), Daria Levy (Allan), Darko Stosic (Allan), David Mosallanezhad (Allan), David Yu (Allan), Davit Karamyan (Allan), Deena Donia (Allan), Deep Debroy (Allan), Deepak Narayanan (Allan), Devin O'Kelly (Allan), Dheeraj Peri (Allan), Dhruv Nathawani (Allan), Di (Allan), Wu, Dima Rekesh, Divyanshu Kakwani, Donald Plummer, Dong Anh, Dongfeng Yu, Dongfu Jiang, Donnie Kim, Dorrin Poorkay, Duncan Riach, Dusan Stosic, Dustin VanStee, Eavan Meng, Edgar Minasyan, Edward Lin, Eileen Margaret Peters Long, Elad Sarafin, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric Tramel, Eric Yang, Erick Galinkin, Erik Pounds, Erika Goncalves Goncalves, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Faisal Ladhak, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Frank Sun, Frankie Siino, Frida Hou, Gal Hubara Agam, Gal Kaplun, Gantavya Bhatt, Gargi Prasad, Garvit Kulshreshtha, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Greg Mason, Greg Pauloski, Grigor Nalbandyan, Grzegorz Chlebus, Grzegorz Karch, Guan-Ting Liu, Guoming Zhang, Guyue Huang, Haggai Maron, Haifeng Qian, Haim Elisha, Haoxing Ren, Haran Kumar Shiv Kumar, Haribhau Hud, Harris Nover, Harrison Saturley Hall, Hayate Iso, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hovhannes Tamoyan, Hua Li, Huanhuan Chen, Hui Li, Hui Wang, Huy Nguyen, Ian Chiles, Ido Galil, Ido Shahaf, Igor Gitman, Igor Shovkun, Ilya Loshchilov, Ingo Guehring, Itamar Schen, Itay Levy, Itay Neeman, Ivan Moshkov, Izik Golan, Izzy Putterman, Jaemin Choi, Jakub Slowikowski, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiantao Jiao, Jiaqi Zeng, Jie Lou, Jim King, Jimmy Zhang, Jingquan Wang, Jinhang Choi, Jinju Chu, Joey Conway, Joey Guman, Johan Jatko, Johannes Rausch, John Kamalu, John Roberts, Johnny Greco, Johnny Mensel, Jonah Alben, Jonas Yang, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joshua Mabry, Joshua Pierce, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kajal Jain, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Willowhawk, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirthi Shankar Sivamani, Konstantinos Krommydas, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Kyle Keprios, Kylie Day, Lawrence McAfee, Leo Du, Leon Derczynski, Li Ding, Linda Liu, Lingjie Wu, Lior Kadoch, Lizzie Wei, Luis Vega, Luke Robison, Lun Su, Maarten Van Segbroeck, Maciej Jakub Mikulski, Maer Rodrigues de Melo, Magda Sypula, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Tarun Chandran, Manoj Kilaru, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Marcin Chochowski, Mark Cai, Mark Mozolewski, Markus Kliegl, Marta Stepniewska-Dziubinska, Martyna Patelka, Mattei Machczynski, Matvei Novikov, Mauricio Ferrato, Maximilian Golub, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Mengxi Wu, Meredith Price, Meriem Boubdir, Micah Schaffer, Michael Andersch, Michael Boone, Michael Gschwind, Michael Lightstone, Michael Loh, Michal Bien, Michal Zawalski, Michelle Gill, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Houston, Mingyuan Ma, Minseok Lee, Mohamed Fawzy, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Namit Dhameja, Narimane Hennouni, Natalie Hereth, Nathaniel Pinckney, Nave Algarici, Nave Assaf, Netanel Haber, Nicholas Knight, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Desai, Nikolai Ludwig, Nima Tajbakhsh, Ning Xu, Nir Ailon, Nirmal Juluru, Nitin Nitin, Ofri Masad, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivia Viessmann, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Pablo Ribalta, Pallab Bhattacharya, Panos Lampropoulos, Parth Mannan, Pasha Shamis, Patrick Legresley, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pierre-Yves Aquilanti, Pinky Xu, Piotr Januszewski, Piotr Laskiewicz, Pooya Jannaty, Prakash Gurumurthy, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Puhui Meng, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Radha Sri-Tharan, Rahul Kandu, Rakshit Sanadhya, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Ray Macalisang, Rayen Tian, Reka Kovacs, Renjie Pi, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Rishi Puri, Rita Fernandes Neves, Ritchie Zhao, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Robert Kirby, Roger Waleffe, Rohit Watve, Roi Koren, Ron Banner, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Stewart, Ryota Egashira, Sadegh Mahdavi, Saee Paliwal, Sagar Singh, Sahil Modi, Salika Dave, Samantha Shinagawa, Samuel Kriman, Sandip Bhaskar, Sangkug Lym, Sanjay Kariyappa, Sanjeev Satheesh, Saran Vikas Murari, Satish Pasumarthi, Saurabh Mishra, Saurav Muralidharan, Scott Hara, Sean Narentharen, Selvaraj Anandaraj, Seonjin Na, Seonmeyong Bak, Seonmyeong Bak, Sepehr Sameni, Seph Mard, Serge Panev, Seth Henneman, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Mendelson, Shaun Kotek, Shawn Wang, Shay Aharon, Shaya Gharghabi, Sheng-Chieh Lin, Shi Chen, Shiqing Fan, Shirish Baskaran, Shreya Gopa, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Shwetha Krishnamurthy, Siddharth Singh, Simeng Sun, Sirshak Das, Sivakumar Arayandi Thottakara, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sridhar Bhuvanapalli, Srimukh Veccham, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Su Rong, Sugam Dipak Devare, Sukrit Rao, Sumeet Kumar Barua, Sungsoo Ha, Sunny Gai, Suriya Gunasekar, Suseella Panguluri, Suyog Gupta, Sviataslau Hinzburh, Sweta Priyadarshi, Syeda Nahida Akter, Talor Abramovich, Tan Bui, Tanay Varshney, Tatevik Ter-Hovhannisyan, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tianhe Zhang, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Tiyasa Mitra, Tom Balough, Tomasz Grzegorzek, Tomasz Hliwiak, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Tony Salim, Tony Wang, Traian Rebedea, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Venkat Srinivasan, Venmugil Elango, Vibhor Agrawal, Victor Cui, Vijay Korthikanti, Vikas Mehta, Vinay Rao, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Vu Pham, Wanli Jiang, Wasi Uddin Ahmad, Wataru Ishihara, Wei Du, Wei Ping, Weiheng Chai, Wenliang Dai, Wesley Helmholz, Will Jennings, Will Zhu, Wojciech Prazuch, Xiaowei Ren, Xiwen Yu, Yan Breek, Yang Chen, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Youngeun Kwon, Yu Yao, Yugi Guvvla, Yuki Huang, Yunsheng Liu, Zach Moshe, Zachary Newell, Zhilin Wang, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijie Yan, Zsolt-Alon Wertheimer

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Ein Super-Gehirn zum „Tun“

Stellen Sie sich vor, Sie hätten einen brillanten Assistenten. Die meisten heutigen KI-Assistenten sind großartig darin, zu chatten oder eine schnelle E-Mail zu schreiben. Nemotron 3 Ultra ist darauf ausgelegt, ein Langzeit-Projektmanager zu sein. Es ist darauf gebaut, stundenlang wach zu bleiben, mehrere Fenster zu öffnen, das Web zu durchsuchen, Code zu schreiben, Fehler zu beheben und komplexe Aufgaben eigenständig zu erledigen, ohne dass Sie es bei jedem Schritt an der Hand halten müssen.

Das Paper behauptet, dass dieses Modell das bisher „fähigste“ von NVIDIA ist, speziell optimiert, um schnell und effizient zu sein, während es massive Mengen an Informationen (bis zu 1 Million Wörter auf einmal) verarbeitet.


1. Der Motor: Ein Hybridauto für KI

Die meisten KI-Modelle sind wie ein einzelner, massiver Motor, der für jede Aufgabe auf die gleiche Weise läuft. Nemotron 3 Ultra ist anders; es ist ein Hybridfahrzeug.

  • Der „Mamba“-Motor: Betrachten Sie dies als einen Hochgeschwindigkeitszug. Er bewegt sich sehr schnell durch Informationen und muss keinen schweren Gepäckzug (Speicher) hinter sich herziehen. Dies macht ihn unglaublich schnell beim Verarbeiten langer Geschichten oder Dokumente.
  • Der „Transformer“-Motor: Dies ist der klassische, leistungsstarke Motor, der großartig im tiefen logischen Denken und im Verständnis komplexer Beziehungen ist.
  • Der Hybrid: Das Modell wechselt zwischen diesen beiden Motoren, je nach Aufgabe. Es nutzt den schnellen Zug für das Scannen langer Dokumente und den leistungsstarken Motor für tiefes Nachdenken. Diese Kombination ermöglicht es dem Modell, viel schneller als seine Konkurrenten zu sein, ohne an Intelligenz zu verlieren.

2. Die Teamstruktur: Die „Mixture of Experts“

Stellen Sie sich eine riesige Bibliothek vor. Anstatt eines einzelnen Bibliothekars, der versuchen muss, alles über jedes Buch zu wissen (was langsam und ermüdend wäre), verfügt die Bibliothek über 512 spezialisierte Experten.

  • Wenn Sie eine Frage zum Thema Recht stellen, wachen nur die Rechtsexperten auf.
  • Wenn Sie nach Programmierung fragen, wachen nur die Programmier-Experten auf.
  • Wenn Sie nach Mathematik fragen, wachen nur die Mathe-Experten auf.

Dies wird als Mixture-of-Experts (MoE)-Modell bezeichnet. Nemotron 3 Ultra hat insgesamt 550 Milliarden „Experten“ (Parameter), aber für jeden einzelnen Satz werden nur 55 Milliarden davon „wach“. Das ist wie ein riesiges Team von Spezialisten, die bereitstehen, aber man ruft immer nur die spezifischen Experten, die man gerade für den Job benötigt. Dies spart massive Mengen an Energie und Zeit.

3. Das Training: Vom Schüler zum Meister

Das Paper beschreibt einen dreistufigen Trainingsprozess, um dieses Modell in einen Experten-Agenten zu verwandeln:

  • Schritt 1: Pre-training (Das Lexikon lesen): Das Modell las 20 Billionen Text-Token (Wörter und Code). Es ist, als würde man jedes Buch in einer riesigen Bibliothek lesen. Sie verwendeten ein spezielles „Low-Precision“-Format (NVFP4), um dies effizient zu gestalten – wie das Lesen eines Buches mit etwas kleinerer Schriftart, um mehr auf die Seite zu bekommen, ohne die Bedeutung zu verlieren.
  • Schritt 2: Supervised Fine-Tuning (Das Praktikum): Dem Modell wurde beigebracht, Anweisungen zu befolgen, Werkzeuge zu benutzen (wie Suchmaschinen oder Code-Terminals) und sicher zu agieren. Man gab ihm Beispiele dafür, wie man Probleme Schritt für Schritt löst.
  • Schritt 3: Reinforcement Learning & Distillation (Die Masterclass): Dies ist das Geheimrezept.
    • Zuerst übte das Modell in vielen verschiedenen „Simulationen“ (wie ein Videospiel für Programmierung, Mathematik und Büroarbeit), um durch Versuch und Irrtum zu lernen.
    • Dann trainierten sie über 10 spezialisierte „Lehrer“-Modelle (eines für Programmierung, eines für Mathematik, eines für Büroarbeit usw.).
    • Schließlich verwendeten sie eine Technik namens MOPD (Multi-teacher On-Policy Distillation). Stellen Sie sich vor, das Hauptmodell (der Schüler) versucht, ein Problem zu lösen, und die spezialisierten Lehrer flüstern ihm Ratschläge zu, wie genau er es tun soll. Der Schüler lernt, indem er die besten Züge der Lehrer nachahmt und deren gesamte Weisheit in einem Super-Modell kombiniert.

4. Die Superkräfte

Das Paper hebt drei Haupt-Superkräfte hervor, die Nemotron 3 Ultra besitzt:

  • Das 1-Million-Wörter-Gedächtnis: Die meisten KI-Modelle werden verwirrt, wenn man ihnen ein Buch gibt, das länger als ein paar Kapitel ist. Nemotron kann ein 1-Million-Token-Kontext (etwa die Größe von 10 ganzen Romanen) lesen und Details von der allerersten Seite behalten, während es die letzte Seite schreibt.
  • Die Kontrolle über das „Reasoning Budget“: Sie können dem Modell sagen: „Löse dies schnell, aber überspringe vielleicht ein paar Schritte“ oder „Nimm dir Zeit und denke tief nach“. Dies ermöglicht es den Nutzern, zwischen Geschwindigkeit und Genauigkeit zu wählen, je nach Aufgabe.
  • Geschwindigkeit: Durch seinen Hybrid-Motor und das Expertensystem kann das Modell Informationen bis zu 6-mal schneller verarbeiten als andere Top-Modelle im öffentlichen Bereich, während es dieselben (oder bessere) Antworten liefert.

5. Die Stabilität des „Gehirns“

Das Paper gibt zu, dass das Training eines Modells dieser Größe wie ein Seiltanz ist. Sie stießen während des Trainings zweimal auf „Divergenz“ (wo das Modell beginnt, zufällige, schlechte Vermutungen anzustellen).

  • Fix 1: Sie erkannten, dass ein spezifischer Teil der Mathematik (Gradient Accumulation) an Präzision verlor, also wechselten sie für diesen Teil zurück zu einem Modus mit höherer Präzision.
  • Fix 2: Sie bemerkten, dass die „Experten“ im Team ungleichmäßig verteilt waren (einige machten die ganze Arbeit, andere schliefen). Sie passten das System an, um sicherzustellen, dass die Arbeitslast fair verteilt wird, was einen Absturz des Modells verhinderte.

6. Das Ergebnis: Offen für alle

Der spannendste Teil des Papers ist, dass NVIDIA alles Open Source zur Verfügung stellt.

  • Sie veröffentlichen das Base-Modell (das rohe Gehirn).
  • Das Post-trained Modell (den Experten-Agenten).
  • Eine quantisierte Version (eine komprimierte Version, die auf spezifischen NVIDIA-Chips sogar noch schneller läuft).
  • Die Daten und Rezepte (die exakte Liste der Bücher, die sie gelesen haben, und die Anweisungen, denen sie gefolgt sind).

Zusammenfassend: Nemotron 3 Ultra ist ein massives, Hybrid-Motor-gesteuertes KI-Modell, das als langlebiger, autonomer Arbeiter konzipiert ist. Es nutzt ein Team spezialisierter Experten, um tief nachzudenken, aber schnell zu agieren, kann eine ganze Bibliothek an Text im Gedächtnis behalten und wird der Öffentlichkeit zur Verfügung gestellt, damit jeder mit ihm eigene KI-Agenten bauen kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →