← Últimos artículos
💬 NLP

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

El artículo presenta Nemotron-Labs-Diffusion, un modelo de lenguaje trimodal que unifica la decodificación autorregresiva, de difusión y de autoespeculación dentro de una única arquitectura para lograr un rendimiento y una precisión superiores mediante el aprovechamiento de las fortalezas complementarias de estos métodos en diversas escalas de modelos y configuraciones de despliegue.

Autores originales: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Nor
Publicado 2026-07-08
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando escribir una historia, pero tienes dos formas diferentes de hacerlo.

La Forma Antigua (Autorregresiva): Esto es como escribir una oración palabra por palabra, estrictamente de izquierda a derecha. Escribes "El", luego piensas: "¿Qué viene después?" y escribes "gato". Luego piensas: "¿Qué viene después?" y escribes "sentó". Es muy preciso y sigue las reglas de la gramática perfectamente, pero es lento porque no puedes escribir la siguiente palabra hasta que termines la actual. Es como una sola persona tecleando en un teclado, esperando a que cada pulsación se registre antes de seguir escribiendo.

La Nueva Forma (Difusión): Esto es como tener un borrador desordenado donde escribes todo el párrafo a la vez, pero faltan algunas palabras o están desordenadas. Luego vas corrigiendo las palabras faltantes todas al mismo tiempo. Esto es mucho más rápido porque estás trabajando en muchas palabras simultáneamente. Sin embargo, como no sigues las reglas estrictas de izquierda a derecha, la historia a veces tiene menos sentido o suena un poco extraña.

La Gran Idea del Artículo:
Los investigadores de NVIDIA crearon un "supermodelo" llamado Nemotron-Labs-Diffusion. Piensa en este modelo como una Navaja Suiza que puede cambiar entre tres modos diferentes dependiendo de la situación, todo dentro del mismo cerebro.

Los Tres Modos

  1. El Modo "Escritor Estricto" (Modo AR):

    • Cómo funciona: Actúa exactamente como la forma antigua y lenta. Escribe una palabra tras otra.
    • Cuándo usarlo: Cuando tienes una gran multitud de personas pidiendo historias al mismo tiempo (alta concurrencia). Es fiable y mantiene la gramática perfecta.
    • La afirmación del artículo: Este modelo es tan bueno como los mejores modelos existentes para escribir oraciones perfectas, a pesar de que también sabe hacer los otros modos.
  2. El Modo "Corrector Rápido" (Modo de Difusión):

    • Cómo funciona: Adivina muchas palabras a la vez y las corrige en paralelo.
    • Cuándo usarlo: Cuando necesitas velocidad y el modelo está trabajando solo o con muy pocas personas.
    • La afirmación del artículo: Este modo es increíblemente rápido, pero usualmente no es tan preciso como el "Escritor Estricto". Sin embargo, este nuevo modelo es lo suficientemente inteligente como para mantener la precisión alta incluso siendo rápido.
  3. El Modo "Borrador y Verificación" (Auto-especulación):

    • Cómo funciona: Este es el ingrediente secreto del artículo. Imagina que el modelo tiene un "cerebro rápido" y un "cerebro cuidadoso" trabajando juntos.
      • El Cerebro Rápido (Difusión) redacta rápidamente un borrador completo de suposiciones de una oración.
      • El Cerebro Cuidadoso (AR) revisa instantáneamente esas suposiciones. Si el Cerebro Cuidadoso está de acuerdo, el modelo acepta todas esas palabras a la vez. Si no está de acuerdo, corrige el error y continúa.
    • La afirmación del artículo: Este es el ganador para uso personal (como en tu portátil). Es mucho más rápido que el antiguo método de "una palabra a la vez" e incluso más rápido que otros métodos de "adivinación" utilizados por la competencia. Es como tener un lector veloz que también puede editar su propio trabajo instantáneamente.

Por qué esto es importante (Los momentos de "¡Ajá!")

  • No luchan, se ayudan: El artículo descubrió que el "Escritor Estricto" y el "Corrector Rápido" no son enemigos. De hecho, enseñar al modelo a ser un escritor estricto primero ayuda a que se convierta en un mejor corrector rápido. Es como aprender a caminar antes de aprender a correr; el entrenamiento de caminar le da al modelo un sentido de la dirección (gramática) que le ayuda a correr sin estrellarse.
  • Mejor que la competencia: Cuando probaron este nuevo modelo contra los mejores modelos actuales (como Qwen), el nuevo modelo fue 6 veces más rápido generando tokens (palabras) en un solo paso manteniendo el mismo nivel de inteligencia. En chips informáticos potentes, fue 4 veces más rápido gestionando tareas del mundo real.
  • Aún queda más velocidad por recorrer: Los investigadores realizaron un análisis de "Velocidad de la Luz". Preguntaron: "¿Qué tan rápido podría ir este modelo si tuviéramos un sistema perfecto?". Descubrieron que el método actual de "Borrador y Verificación" ya es genial, pero todavía hay una brecha del 76.5% respecto a la velocidad máxima teórica. Esto significa que la tecnología tiene mucho margen para volverse aún más rápida en el futuro sin necesidad de un invento completamente nuevo.

La Conclusión

Este artículo presenta un único modelo de IA que puede ser un escritor lento y perfecto, un adivinador rápido y paralelo, o un híbrido que redacta y verifica su propio trabajo instantáneamente. Demuestra que no tienes que elegir entre velocidad y precisión; puedes tener un modelo que cambie entre ambas para obtener lo mejor de los dos mundos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →