← Neueste Arbeiten
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni ist ein neues Open-Source-multimodales Modell, das Audio-, Text-, Bild- und Videoeingaben nativ unterstützt und durch eine 30B-A3B-Architektur sowie Token-Reduktionsverfahren verbesserte Genauigkeit, agentische Fähigkeiten und effiziente Inferenz bietet, wobei veröffentlichte Checkpoints und Code zur Unterstützung weiterer Forschung bereitgestellt werden.

Ursprüngliche Autoren: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
Veröffentlicht 2026-04-29
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich einen superklugen Assistenten vor, der sein ganzes Leben damit verbracht hat, Bücher zu lesen und Bilder anzusehen. Er ist brillant im Umgang mit Text und Bildern, doch wenn Sie versuchen, mit ihm zu sprechen oder ihm ein Video mit Ton zu zeigen, wäre er verwirrt.

Nemotron 3 Nano Omni ist die neue Version dieses Assistenten von NVIDIA. Es ist, als würde man diesem Assistenten ein Paar Ohren und eine Videokamera geben und ihm gleichzeitig beibringen, Informationen viel schneller und effizienter zu verarbeiten.

Hier ist eine einfache Aufschlüsselung dessen, was dieses neue Modell besonders macht, unter Verwendung alltäglicher Analogien:

1. Das „All-in-One"-Upgrade

Bevor dies eingeführt wurde, konnte der Assistent (Nemotron Nano V2) nur Text lesen und statische Bilder betrachten. Der neue Nemotron 3 Nano Omni ist „omnimodal", was eine ausgefallene Art zu sagen ist, dass er alles gleichzeitig bewältigen kann: Text, Bilder, Videos und Audio.

  • Die Analogie: Denken Sie an das alte Modell als an einen Bibliothekar, der nur Bücher lesen kann. Das neue Modell ist ein Bibliothekar, der Bücher lesen, Filme schauen, Podcasts hören und Ihnen dann erklären kann, wie all diese Dinge miteinander verbunden sind.

2. Das „Gehirn" und die „Sinne"

Das Modell basiert auf einem sehr effizienten Gehirn namens Nemotron 3 Nano 30B-A3B. Dieses Gehirn ist ein „Mixture of Experts" (MoE), was wie ein Team von Spezialisten funktioniert, bei dem nur die richtigen Experten aufwachen, um ein spezifisches Problem zu lösen, was Energie spart.

  • Die Sinne: Um die neuen Eingaben zu bewältigen, wurden zwei neue „Sensoren" angebracht:
    • Sehen: Ein High-Tech-Kamerasystem (C-RADIOv4-H), das Bilder und Videos betrachtet.
    • Hören: Ein hochentwickeltes Ohr (Parakeet-TDT), das Sprache, Musik und Umgebungsgeräusche versteht.

3. Intelligente Wege zu sehen und zu hören

Das Papier hebt drei clevere Tricks hervor, die das Modell verwendet, um von zu vielen Daten nicht überwältigt zu werden:

  • Dynamische Auflösung (Die flexible Linse): Anstatt jedes Foto in ein winziges, festes Quadrat zu quetschen (was Details verliert), passt das Modell seinen Blick wie eine Kamera an, die herein- oder herauszoomt, um die natürliche Form des Bildes zu bewahren.
  • Videokomprimierung (Die Zeitraffer): Beim Betrachten eines Videos betrachtet das Modell nicht jeden einzelnen Frame, wenn diese identisch sind. Es verwendet einen Trick namens „3D-Convolution", um Paare von Frames zu verschmelzen, wodurch die Anzahl der zu verarbeitenden „Frames" effektiv halbiert wird.
  • Audio-Chunks (Die Soundbite): Anstatt einen 2-stündigen Podcast als einen riesigen Block aus Lärm zu hören, zerlegt es den Audioinhalt in 30-Sekunden-Clips, was es einfacher macht, den Fluss des Gesprächs zu verstehen.

4. Das „Trainingslager" (Wie es gelernt hat)

Man kann nicht einfach eine Kamera anschließen und erwarten, dass das Modell Filme sofort versteht. Das Team verwendete ein gestuftes Trainingsrezept, wie ein Schüler, der die Schule durchläuft:

  • Stufe 0-1: Zuerst lehrten sie das Modell, Bilder und Text gemeinsam zu verstehen.
  • Stufe 2-3: Als Nächstes lehrten sie ihm, Audio zu hören und zu sprechen.
  • Stufe 4-6: Schließlich fügten sie alles zusammen. Sie fütterten es mit riesigen Datenmengen (über 466 Milliarden „Tokens" oder Wörter), die lange Dokumente, Stunden an Videos und komplexe Gespräche enthielten.
  • Die Phase des „Reinforcement Learning": Nach dem initialen Training spielten sie ein Spiel von „Versuchen, Scheitern, Gelingen". Sie gaben dem Modell Probleme, prüften, ob es die Antwort richtig hatte, und belohnten es für logisches Denken. Dies ist ähnlich wie ein Trainer, der mit einem Athleten Spielaufnahmen durchgeht, um dessen Strategie zu verbessern.

5. Geschwindigkeit und Effizienz

Eine der größten Behauptungen im Papier ist, dass dieses Modell unglaublich schnell ist.

  • Die Analogie: Wenn andere Modelle ähnlicher Größe wie ein Sportwagen sind, der im Stau stecken bleibt, ist Nemotron 3 Nano Omni ein Hochgeschwindigkeitszug. Es verwendet spezielle Techniken, um unnötige Schritte zu überspringen, was es ermöglicht, lange Videos und riesige Dokumente viel schneller als seine Konkurrenten zu verarbeiten.
  • Das Ergebnis: Auf den neuesten Chips von NVIDIA (B200) kann es Textausgaben 3- bis 9-mal schneller produzieren als ähnliche Modelle, während es weniger Speicher verbraucht.

6. Was es tatsächlich kann (Basierend auf dem Papier)

Das Papier testete dieses Modell an spezifischen Herausforderungen, und es schnitt in folgenden Bereichen sehr gut ab:

  • Dokumente lesen: Es kann komplexe Diagramme, Tabellen und lange Berichte (wie Finanzberichte) besser verstehen als frühere Versionen.
  • Videos verstehen: Es kann ein langes Video mit Ton ansehen und Fragen beantworten, was passiert ist, warum es passiert ist und in welcher Reihenfolge die Ereignisse abliefen.
  • Computersteuerung: Es kann auf einen Computerbildschirm (GUI) schauen und herausfinden, welche Buttons geklickt werden müssen, um eine Aufgabe abzuschließen (wie das Buchen eines Fluges oder das Ausfüllen eines Formulars).
  • Sprachinteraktion: Es kann ein Gespräch führen, Akzente verstehen und Fragen beantworten, basierend auf dem, was es hört.

7. Offen für alle

Schließlich gibt das Papier bekannt, dass NVIDIA die „Baupläne" und das „Trainingsmaterial" teilt. Sie veröffentlichen das Modell in verschiedenen Größen (Standard, komprimiert und ultra-komprimiert) und teilen sogar einige der Daten und den Code, die sie zum Bau verwendet haben. Dies ist, als würde man das Rezept und die Zutaten der ganzen Welt geben, damit andere Wissenschaftler ihre eigenen Versionen bauen oder diese verbessern können.

Zusammenfassend: Nemotron 3 Nano Omni ist ein schnellerer, intelligenterer, multisensorischer Assistent, der gleichzeitig lesen, schauen und hören kann und so konzipiert ist, dass er lange und komplexe Aufgaben bewältigt, ohne ins Stocken zu geraten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →