← Derniers articles
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni est un nouveau modèle multimodal open source qui prend en charge nativement les entrées audio, textuelles, image et vidéo, offrant une précision améliorée, des capacités d'agent et une inférence efficace grâce à un backbone 30B-A3B et des techniques de réduction de tokens, avec des checkpoints et du code publiés pour soutenir la recherche ultérieure.

Auteurs originaux : NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
Publié 2026-04-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un assistant ultra-intelligent qui a passé toute sa vie à lire des livres et à regarder des images. Il est brillant avec le texte et les images, mais si vous essayiez de lui parler ou de lui montrer une vidéo avec du son, il serait perdu.

Nemotron 3 Nano Omni est la nouvelle version de cet assistant par NVIDIA. C'est comme donner à cet assistant une paire d'oreilles et une caméra vidéo, tout en lui apprenant à traiter l'information beaucoup plus rapidement et efficacement.

Voici une explication simple de ce qui rend ce nouveau modèle spécial, en utilisant des analogies du quotidien :

1. La mise à niveau « Tout-en-un »

Avant cela, l'assistant (Nemotron Nano V2) ne pouvait que lire du texte et regarder des images statiques. Le nouveau Nemotron 3 Nano Omni est « omni-modal », ce qui est une façon élégante de dire qu'il peut gérer tout en même temps : texte, images, vidéo et audio.

  • L'analogie : Imaginez l'ancien modèle comme un bibliothécaire qui ne peut lire que des livres. Le nouveau modèle est un bibliothécaire qui peut lire des livres, regarder des films, écouter des podcasts, puis vous expliquer comment tous ces éléments sont liés.

2. Le « Cerveau » et les « Sens »

Le modèle repose sur un cerveau très efficace appelé Nemotron 3 Nano 30B-A3B. Ce cerveau est un « Mixture of Experts » (MoE), comparable à une équipe de spécialistes où seuls les experts appropriés se réveillent pour résoudre un problème spécifique, économisant ainsi de l'énergie.

  • Les Sens : Pour gérer les nouvelles entrées, ils ont attaché deux nouveaux « capteurs » :
    • Vision : Un système de caméra haute technologie (C-RADIOv4-H) qui observe les images et les vidéos.
    • Ouïe : Une oreille sophistiquée (Parakeet-TDT) qui comprend la parole, la musique et les sons ambiants.

3. Des façons plus intelligentes de regarder et d'écouter

Le document met en évidence trois astuces ingénieuses que le modèle utilise pour ne pas être submergé par trop de données :

  • Résolution dynamique (La lentille flexible) : Au lieu d'écraser chaque photo dans un petit carré fixe (ce qui fait perdre des détails), le modèle ajuste sa vue comme un appareil photo qui zoome ou dézoome pour conserver la forme naturelle de l'image.
  • Compression vidéo (Le laps de temps) : Lorsqu'il regarde une vidéo, le modèle ne regarde pas chaque image individuelle si elles sont identiques. Il utilise une astuce de « convolution 3D » pour fusionner des paires d'images, réduisant ainsi de moitié le nombre d'« images » qu'il doit traiter.
  • Segments audio (Le morceau sonore) : Au lieu d'écouter un podcast de deux heures comme un seul bloc de bruit immense, il découpe l'audio en clips de 30 secondes, facilitant la compréhension du flux de conversation.

4. Le « Camp d'entraînement » (Comment il a appris)

On ne peut pas simplement brancher une caméra et s'attendre à ce que le modèle comprenne immédiatement les films. L'équipe a utilisé une recette d'entraînement par étapes, comme un élève progressant à l'école :

  • Étape 0-1 : D'abord, ils ont appris au modèle à comprendre les images et le texte ensemble.
  • Étape 2-3 : Ensuite, ils lui ont appris à écouter l'audio et à parler.
  • Étape 4-6 : Enfin, ils ont tout assemblé. Ils lui ont fourni d'énormes quantités de données (plus de 466 milliards de « tokens » ou mots) incluant de longs documents, des heures de vidéo et des conversations complexes.
  • La phase d'« Apprentissage par renforcement » : Après l'entraînement initial, ils ont joué à un jeu de « Essayer, Échouer, Réussir ». Ils ont donné des problèmes au modèle, vérifié s'il trouvait la bonne réponse, et l'ont récompensé pour sa pensée logique. Cela ressemble à un entraîneur qui révise les bandes vidéo d'un match avec un athlète pour améliorer sa stratégie.

5. Vitesse et efficacité

L'une des affirmations majeures du document est que ce modèle est incroyablement rapide.

  • L'analogie : Si d'autres modèles de taille similaire sont comme une voiture de sport bloquée dans les embouteillages, Nemotron 3 Nano Omni est un train à grande vitesse. Il utilise des techniques spéciales pour sauter les étapes inutiles, lui permettant de traiter des vidéos longues et d'énormes documents beaucoup plus rapidement que ses concurrents.
  • Le résultat : Sur les puces les plus récentes de NVIDIA (B200), il peut produire des sorties textuelles 3 à 9 fois plus rapidement que des modèles similaires tout en utilisant moins de mémoire.

6. Ce qu'il peut réellement faire (Selon le document)

Le document a testé ce modèle sur des défis spécifiques, et il s'est très bien comporté dans :

  • La lecture de documents : Il peut comprendre des graphiques complexes, des tableaux et de longs rapports (comme des documents financiers) mieux que les versions précédentes.
  • La compréhension de vidéos : Il peut regarder une longue vidéo avec du son et répondre à des questions sur ce qui s'est passé, pourquoi cela s'est produit et l'ordre des événements.
  • Le contrôle informatique : Il peut regarder un écran d'ordinateur (GUI) et déterminer quels boutons cliquer pour accomplir une tâche (comme réserver un vol ou remplir un formulaire).
  • L'interaction vocale : Il peut tenir une conversation, comprendre les accents et répondre à des questions basées sur ce qu'il entend.

7. Ouvert à tous

Enfin, le document annonce que NVIDIA partage les « plans » et les « matériaux d'entraînement ». Ils publient le modèle dans différentes tailles (standard, compressé et ultra-compressé) et partagent même certaines des données et du code utilisés pour le construire. C'est comme donner la recette et les ingrédients au monde entier afin que d'autres scientifiques puissent construire leurs propres versions ou les améliorer.

En résumé : Nemotron 3 Nano Omni est un assistant multi-sensoriel, plus rapide et plus intelligent, capable de lire, regarder et écouter simultanément, conçu pour gérer des tâches longues et complexes sans s'enliser.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →