← Últimos artículos
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni es un nuevo modelo multimodal de código abierto que admite de forma nativa entradas de audio, texto, imagen y vídeo, ofreciendo mayor precisión, capacidades de agente e inferencia eficiente mediante una arquitectura base de 30B-A3B y técnicas de reducción de tokens, con puntos de control y código publicados para apoyar la investigación futura.

Autores originales: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
Publicado 2026-04-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un asistente superinteligente que ha pasado toda su vida leyendo libros y viendo imágenes. Es brillante con el texto y las imágenes, pero si intentas hablarle o mostrarle un video con sonido, se quedaría confundido.

Nemotron 3 Nano Omni es la nueva versión de este asistente de NVIDIA. Es como darle a ese asistente un par de oídos y una cámara de video, mientras también le enseñas a procesar información mucho más rápido y de manera más eficiente.

Aquí tienes un desglose sencillo de lo que hace especial a este nuevo modelo, usando analogías cotidianas:

1. La actualización "Todo en Uno"

Antes de esto, el asistente (Nemotron Nano V2) solo podía leer texto y mirar imágenes estáticas. El nuevo Nemotron 3 Nano Omni es "omnimodal", que es una forma elegante de decir que puede manejar todo a la vez: texto, imágenes, video y audio.

  • La analogía: Piensa en el modelo antiguo como un bibliotecario que solo puede leer libros. El nuevo modelo es un bibliotecario que puede leer libros, ver películas, escuchar podcasts y luego decirte cómo se conectan todas esas cosas.

2. El "cerebro" y los "sentidos"

El modelo se basa en un cerebro muy eficiente llamado Nemotron 3 Nano 30B-A3B. Este cerebro es una "Mezcla de Expertos" (MoE), que es como un equipo de especialistas donde solo los expertos correctos se despiertan para resolver un problema específico, ahorrando energía.

  • Los sentidos: Para manejar las nuevas entradas, adjuntaron dos nuevos "sensores":
    • Visión: Un sistema de cámara de alta tecnología (C-RADIOv4-H) que mira imágenes y videos.
    • Oído: Un oído sofisticado (Parakeet-TDT) que entiende el habla, la música y los sonidos ambientales.

3. Formas más inteligentes de mirar y escuchar

El artículo destaca tres trucos inteligentes que usa el modelo para no abrumarse con demasiados datos:

  • Resolución dinámica (La lente flexible): En lugar de aplastar cada foto en un cuadrado fijo y diminuto (lo que pierde detalle), el modelo ajusta su vista como una cámara haciendo zoom hacia adentro o hacia afuera para mantener la forma natural de la imagen.
  • Compresión de video (El lapso de tiempo): Al ver un video, el modelo no mira cada fotograma individual si son idénticos. Usa un truco de "Convolución 3D" para fusionar pares de fotogramas, reduciendo efectivamente a la mitad el número de "fotogramas" que necesita procesar.
  • Fragmentos de audio (El fragmento de sonido): En lugar de escuchar un podcast de 2 horas como un solo bloque gigante de ruido, divide el audio en clips de 30 segundos, lo que facilita entender el flujo de la conversación.

4. El "campamento de entrenamiento" (Cómo aprendió)

No puedes simplemente conectar una cámara y esperar que el modelo entienda las películas de inmediato. El equipo utilizó una receta de entrenamiento por etapas, como un estudiante avanzando a través de la escuela:

  • Etapa 0-1: Primero, enseñaron al modelo a entender imágenes y texto juntos.
  • Etapa 2-3: Luego, le enseñaron a escuchar audio y hablar.
  • Etapa 4-6: Finalmente, lo unieron todo. Le alimentaron cantidades masivas de datos (más de 466 mil millones de "tokens" o palabras) que incluían documentos largos, horas de video y conversaciones complejas.
  • La fase de "Aprendizaje por Reforzamiento": Después del entrenamiento inicial, jugaron un juego de "Intentar, Fallar, Triunfar". Le dieron problemas al modelo, verificaron si obtuvo la respuesta correcta y lo recompensaron por pensar lógicamente. Esto es similar a un entrenador revisando grabaciones de partidos con un atleta para mejorar su estrategia.

5. Velocidad y eficiencia

Una de las mayores afirmaciones en el artículo es que este modelo es increíblemente rápido.

  • La analogía: Si otros modelos de tamaño similar son como un auto deportivo que se atasca en el tráfico, Nemotron 3 Nano Omni es un tren de alta velocidad. Utiliza técnicas especiales para saltarse pasos innecesarios, permitiéndole procesar videos largos y documentos enormes mucho más rápido que sus competidores.
  • El resultado: En los chips más recientes de NVIDIA (B200), puede producir salida de texto de 3 a 9 veces más rápido que modelos similares mientras usa menos memoria.

6. Lo que realmente puede hacer (Basado en el artículo)

El artículo probó este modelo en desafíos específicos, y se desempeñó muy bien en:

  • Leer documentos: Puede entender gráficos complejos, tablas y informes largos (como documentos financieros) mejor que las versiones anteriores.
  • Entender videos: Puede ver un video largo con sonido y responder preguntas sobre qué sucedió, por qué sucedió y el orden de los eventos.
  • Control de computadora: Puede mirar una pantalla de computadora (GUI) y averiguar qué botones hacer clic para completar una tarea (como reservar un vuelo o llenar un formulario).
  • Interacción por voz: Puede mantener una conversación, entender acentos y responder preguntas basadas en lo que escucha.

7. Abierto para todos

Finalmente, el artículo anuncia que NVIDIA está compartiendo los "planos" y los "materiales de entrenamiento". Están lanzando el modelo en diferentes tamaños (estándar, comprimido y ultra comprimido) e incluso compartiendo algunos de los datos y el código que usaron para construirlo. Esto es como darle la receta y los ingredientes a todo el mundo para que otros científicos puedan construir sus propias versiones o mejorarlas.

En resumen: Nemotron 3 Nano Omni es un asistente más rápido, más inteligente y multisensorial que puede leer, ver y escuchar simultáneamente, diseñado para manejar tareas largas y complejas sin quedarse atascado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →