← Nieuwste papers
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni is een nieuw open-source multimodaal model dat native audio, tekst, afbeeldingen en video ondersteunt als invoer, en dat verbeterde nauwkeurigheid, agentische capaciteiten en efficiënte inferentie biedt dankzij een 30B-A3B-ruggengraat en token-reductietechnieken, met vrijgegeven checkpoints en code ter ondersteuning van verder onderzoek.

Oorspronkelijke auteurs: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
Gepubliceerd 2026-04-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een superintelligente assistent voor die zijn hele leven boeken heeft gelezen en naar afbeeldingen heeft gekeken. Ze is briljant in tekst en afbeeldingen, maar als je probeerde met hen te praten of hen een video met geluid liet zien, zouden ze in de war raken.

Nemotron 3 Nano Omni is NVIDIA's nieuwe versie van deze assistent. Het is alsof je die assistent een paar oren en een videocamera geeft, terwijl je hen tegelijkertijd leert informatie veel sneller en efficiënter te verwerken.

Hier is een eenvoudige uiteenzetting van wat dit nieuwe model speciaal maakt, met behulp van alledaagse analogieën:

1. De "Alles-in-één"-upgrade

Voorheen kon de assistent (Nemotron Nano V2) alleen tekst lezen en naar statische afbeeldingen kijken. De nieuwe Nemotron 3 Nano Omni is "omni-modaal", wat een ingewikkelde manier is om te zeggen dat het alles tegelijk aankan: tekst, afbeeldingen, video en audio.

  • De analogie: Denk aan het oude model als een bibliothecaris die alleen boeken kan lezen. Het nieuwe model is een bibliothecaris die boeken kan lezen, films kan kijken, naar podcasts kan luisteren en je vervolgens kan vertellen hoe al die dingen met elkaar verbonden zijn.

2. Het "Brein" en de "Zintuigen"

Het model is gebouwd op een zeer efficiënt brein genaamd Nemotron 3 Nano 30B-A3B. Dit brein is een "Mixture of Experts" (MoE), wat lijkt op een team van specialisten waarbij alleen de juiste experts wakker worden om een specifiek probleem op te lossen, waardoor energie wordt bespaard.

  • De zintuigen: Om de nieuwe invoer te verwerken, hebben ze twee nieuwe "sensoren" toegevoegd:
    • Visie: Een high-tech camerasysteem (C-RADIOv4-H) dat kijkt naar afbeeldingen en video's.
    • Horen: Een verfijnd oor (Parakeet-TDT) dat spraak, muziek en omgevingsgeluiden begrijpt.

3. Slimmere manieren om te kijken en te luisteren

Het artikel benadrukt drie slimme trucs die het model gebruikt om niet overweldigd te raken door te veel data:

  • Dynamische resolutie (De flexibele lens): In plaats van elke foto in een klein, vast vierkant te persen (wat details kost), past het model zijn kijkhoek aan als een camera die in- of uitzoomt om de natuurlijke vorm van de afbeelding te behouden.
  • Videocompressie (De timelapse): Bij het bekijken van een video kijkt het model niet naar elk enkel frame als deze identiek zijn. Het gebruikt een "3D Convolutie"-truc om paren frames samen te voegen, waardoor het aantal "frames" dat het moet verwerken effectief met de helft wordt verminderd.
  • Audiofragmenten (De geluidsfragmenten): In plaats van een 2 uur durende podcast als één groot blok ruis te beluisteren, breekt het de audio op in 30-seconden clips, waardoor het gemakkelijker wordt om de flow van het gesprek te begrijpen.

4. Het "Opleidingskamp" (Hoe het leerde)

Je kunt niet zomaar een camera aansluiten en verwachten dat het model direct films begrijpt. Het team gebruikte een gestructureerd trainingsrecept, zoals een student die door school stapt:

  • Fase 0-1: Eerst leerden ze het model om afbeeldingen en tekst samen te begrijpen.
  • Fase 2-3: Vervolgens leerden ze het om naar audio te luisteren en te spreken.
  • Fase 4-6: Tot slot brachten ze alles samen. Ze voerden enorme hoeveelheden data aan (meer dan 466 miljard "tokens" of woorden) die lange documenten, uren aan video en complexe gesprekken bevatten.
  • De "Versterkende Leer"-fase: Na de initiële training speelden ze een spel van "Probeer, Faal, Slag". Ze gaven het model problemen, controleerden of het het juiste antwoord gaf, en beloonden het voor logisch denken. Dit is vergelijkbaar met een coach die wedstrijdfilmpjes bekijkt met een atleet om hun strategie te verbeteren.

5. Snelheid en efficiëntie

Een van de grootste claims in het artikel is dat dit model ongelooflijk snel is.

  • De analogie: Als andere modellen van vergelijkbare grootte lijken op een sportauto die vastzit in het verkeer, dan is Nemotron 3 Nano Omni een hogesnelheidstrein. Het gebruikt speciale technieken om onnodige stappen over te slaan, waardoor het lange video's en enorme documenten veel sneller kan verwerken dan zijn concurrenten.
  • Het resultaat: Op NVIDIA's nieuwste chips (B200) kan het 3 tot 9 keer sneller tekstoutput produceren dan vergelijkbare modellen, terwijl het minder geheugen gebruikt.

6. Wat het daadwerkelijk kan (Gebaseerd op het artikel)

Het artikel testte dit model op specifieke uitdagingen, en het presteerde zeer goed in:

  • Documenten lezen: Het kan complexe grafieken, tabellen en lange rapporten (zoals financiële documenten) beter begrijpen dan vorige versies.
  • Video's begrijpen: Het kan een lange video met geluid bekijken en vragen beantwoorden over wat er gebeurde, waarom het gebeurde en de volgorde van gebeurtenissen.
  • Computerbesturing: Het kan naar een computerscherm (GUI) kijken en uitzoeken welke knoppen er moeten worden geklikt om een taak te voltooien (zoals het boeken van een vlucht of het invullen van een formulier).
  • Spraakinteractie: Het kan een gesprek voeren, accenten begrijpen en vragen beantwoorden op basis van wat het hoort.

7. Open voor iedereen

Tot slot kondigt het artikel aan dat NVIDIA de "blauwdrukken" en het "opleidingsmateriaal" deelt. Ze brengen het model in verschillende maten uit (standaard, gecomprimeerd en ultra-gecomprimeerd) en delen zelfs een deel van de data en de code die ze gebruikten om het te bouwen. Dit is alsof je het recept en de ingrediënten aan de hele wereld geeft, zodat andere wetenschappers hun eigen versies kunnen bouwen of deze kunnen verbeteren.

Samenvattend: Nemotron 3 Nano Omni is een snellere, slimmere, multi-sensorische assistent die tegelijkertijd kan lezen, kijken en luisteren, ontworpen om lange en complexe taken aan te kunnen zonder vast te lopen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →