← Ultimi articoli
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni è un nuovo modello multimodale open-source che supporta nativamente input audio, testo, immagine e video, offrendo maggiore accuratezza, capacità agentiche e inferenza efficiente grazie a un backbone 30B-A3B e tecniche di riduzione dei token, con checkpoint e codice rilasciati per supportare ulteriori ricerche.

Autori originali: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
Pubblicato 2026-04-29
📖 5 min di lettura🧠 Approfondimento

Autori originali: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina un assistente super-intelligente che ha passato tutta la vita a leggere libri e guardare immagini. È brillante con il testo e le immagini, ma se provassi a parlargli o mostrargli un video con audio, rimarrebbe confuso.

Nemotron 3 Nano Omni è la nuova versione di questo assistente da parte di NVIDIA. È come dare a quell'assistente un paio di orecchie e una videocamera, insegnandogli allo stesso tempo a elaborare le informazioni molto più velocemente ed efficientemente.

Ecco una semplice spiegazione di ciò che rende speciale questo nuovo modello, utilizzando analogie di tutti i giorni:

1. L'aggiornamento "Tutto-in-Uno"

Prima di questo, l'assistente (Nemotron Nano V2) poteva solo leggere testo e guardare immagini statiche. Il nuovo Nemotron 3 Nano Omni è "omni-modale", che è un modo elegante per dire che può gestire tutto contemporaneamente: testo, immagini, video e audio.

  • L'Analogia: Pensa al vecchio modello come a un bibliotecario che può solo leggere libri. Il nuovo modello è un bibliotecario che può leggere libri, guardare film, ascoltare podcast e poi dirti come tutte quelle cose sono collegate.

2. Il "Cervello" e i "Sensi"

Il modello è costruito su un cervello molto efficiente chiamato Nemotron 3 Nano 30B-A3B. Questo cervello è un "Mixture of Experts" (MoE), che è come un team di specialisti dove solo gli esperti giusti si svegliano per risolvere un problema specifico, risparmiando energia.

  • I Sensi: Per gestire i nuovi input, hanno attaccato due nuovi "sensori":
    • Vista: Un sistema di fotocamere high-tech (C-RADIOv4-H) che guarda immagini e video.
    • Udito: Un orecchio sofisticato (Parakeet-TDT) che comprende la parola, la musica e i suoni ambientali.

3. Modi più intelligenti di guardare e ascoltare

Il documento evidenzia tre trucchi intelligenti che il modello utilizza per non essere sopraffatto da troppi dati:

  • Risoluzione Dinamica (La Lente Flessibile): Invece di schiacciare ogni foto in un quadrato fisso e minuscolo (il che fa perdere dettagli), il modello adatta la sua vista come una telecamera che fa lo zoom in o out per mantenere la forma naturale dell'immagine.
  • Compressione Video (Il Time-Lapse): Quando guarda un video, il modello non esamina ogni singolo fotogramma se sono identici. Usa un trucco di "Convoluzione 3D" per unire coppie di fotogrammi, riducendo efficacemente della metà il numero di "fotogrammi" che deve elaborare.
  • Frammenti Audio (Il Sound Bite): Invece di ascoltare un podcast di 2 ore come un unico blocco enorme di rumore, suddivide l'audio in clip di 30 secondi, rendendo più facile comprendere il flusso della conversazione.

4. Il "Campo di Addestramento" (Come ha imparato)

Non puoi semplicemente collegare una videocamera e aspettarti che il modello capisca i film immediatamente. Il team ha utilizzato una ricetta di addestramento a fasi, come uno studente che progredisce attraverso la scuola:

  • Fase 0-1: Prima, hanno insegnato al modello a comprendere immagini e testo insieme.
  • Fase 2-3: Successivamente, gli hanno insegnato ad ascoltare l'audio e a parlare.
  • Fase 4-6: Infine, hanno messo tutto insieme. Gli hanno fornito enormi quantità di dati (oltre 466 miliardi di "token" o parole) che includevano documenti lunghi, ore di video e conversazioni complesse.
  • Fase di "Apprendimento per Rinforzo": Dopo l'addestramento iniziale, hanno giocato a un gioco di "Prova, Fallisci, Riuscisci". Hanno dato al modello problemi, verificato se aveva la risposta giusta e lo hanno premiato per aver pensato logicamente. Questo è simile a un allenatore che rivede le registrazioni delle partite con un atleta per migliorare la sua strategia.

5. Velocità ed Efficienza

Una delle affermazioni più importanti nel documento è che questo modello è incredibilmente veloce.

  • L'Analogia: Se altri modelli di dimensioni simili sono come un'auto sportiva che rimane bloccata nel traffico, Nemotron 3 Nano Omni è un treno ad alta velocità. Utilizza tecniche speciali per saltare passaggi non necessari, consentendogli di elaborare video lunghi e documenti enormi molto più velocemente dei suoi concorrenti.
  • Il Risultato: Sui chip più recenti di NVIDIA (B200), può produrre output testuali da 3 a 9 volte più velocemente rispetto a modelli simili utilizzando meno memoria.

6. Cosa può effettivamente fare (Basato sul documento)

Il documento ha testato questo modello su sfide specifiche, e si è comportato molto bene in:

  • Lettura di Documenti: Può comprendere grafici complessi, tabelle e rapporti lunghi (come documenti finanziari) meglio delle versioni precedenti.
  • Comprensione dei Video: Può guardare un video lungo con audio e rispondere a domande su cosa è successo, perché è successo e l'ordine degli eventi.
  • Controllo del Computer: Può guardare uno schermo del computer (GUI) e capire quali pulsanti cliccare per completare un compito (come prenotare un volo o compilare un modulo).
  • Interazione Vocale: Può tenere una conversazione, comprendere gli accenti e rispondere a domande basandosi su ciò che sente.

7. Aperto a Tutti

Infine, il documento annuncia che NVIDIA sta condividendo le "prospettive" e i "materiali di addestramento". Stanno rilasciando il modello in diverse dimensioni (standard, compresso e ultra-compresso) e condividendo anche parte dei dati e del codice utilizzati per costruirlo. È come dare la ricetta e gli ingredienti a tutto il mondo in modo che altri scienziati possano costruire le proprie versioni o migliorarle.

In sintesi: Nemotron 3 Nano Omni è un assistente multi-sensoriale più veloce e intelligente che può leggere, guardare e ascoltare simultaneamente, progettato per gestire compiti lunghi e complessi senza rimanere intralciato.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →