← Últimos artigos
💬 NLP

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

O artigo apresenta o Nemotron-Labs-Diffusion, um modelo de linguagem trimodal que unifica a decodificação autorregressiva, de difusão e de autoespeculação dentro de uma única arquitetura para alcançar throughput e precisão superiores ao aproveitar as forças complementares desses métodos através de várias escalas de modelo e configurações de implantação.

Autores originais: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Nor
Publicado 2026-07-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever uma história, mas tem duas maneiras diferentes de fazê-lo.

O Jeito Antigo (Autoregressivo): Isso é como escrever uma frase palavra por palavra, estritamente da esquerda para a direita. Você escreve "O", depois pensa: "O que vem a seguir?" e escreve "gato". Depois pensa: "O que vem a seguir?" e escreve "sentou". É muito preciso e segue as regras de gramática perfeitamente, mas é lento porque você não pode escrever a próxima palavra até terminar a atual. É como uma única pessoa digitando em um teclado, esperando cada tecla ser registrada antes de digitar a próxima.

O Jeito Novo (Difusão): Isso é como ter um rascunho bagunçado onde você escreve o parágrafo inteiro de uma vez, mas algumas palavras estão faltando ou embaralhadas. Então, você passa a corrigir as palavras que faltam, todas ao mesmo tempo. Isso é muito mais rápido porque você está trabalhando em muitas palavras simultaneamente. No entanto, como você não está seguindo as regras estritas da esquerda para a direita, a história às vezes faz menos sentido ou soa um pouco estranha.

A Grande Ideia do Artigo:
Os pesquisadores da NVIDIA criaram um "super-modelo" chamado Nemotron-Labs-Diffusion. Pense neste modelo como um Canivete Suíço que pode alternar entre três modos diferentes dependendo da situação, tudo dentro do mesmo cérebro.

Os Três Modos

  1. O Modo "Escritor Rigoroso" (Modo AR):

    • Como funciona: Ele age exatamente como o jeito antigo e lento. Escreve uma palavra após a outra.
    • Quando usar: Quando você tem uma multidão de pessoas pedindo histórias ao mesmo tempo (alta concorrência). É confiável e mantém a gramática perfeita.
    • A Alegação do Artigo: Este modelo é tão bom quanto os melhores modelos existentes em escrever frases perfeitas, mesmo sabendo fazer os outros modos.
  2. O Modo "Corretor Rápido" (Modo de Difusão):

    • Como funciona: Ele adivinha muitas palavras de uma vez e as corrige em paralelo.
    • Quando usar: Quando você precisa de velocidade e o modelo está trabalhando sozinho ou com pouquíssimas pessoas.
    • A Alegação do Artigo: Este modo é incrivelmente rápido, mas geralmente não é tão preciso quanto o "Escritor Rigoroso". No entanto, este novo modelo é inteligente o suficiente para manter a precisão alta mesmo sendo rápido.
  3. O Modo "Rascunhar e Conferir" (Auto-especulação):

    • Como funciona: Este é o ingrediente secreto do artigo. Imagine que o modelo tem um "cérebro rápido" e um "cérebro cuidadoso" trabalhando juntos.
      • O Cérebro Rápido (Difusão) rascunha rapidamente uma frase inteira de palpites.
      • O Cérebro Cuidadoso (AR) verifica instantaneamente esses palpites. Se o Cérebro Cuidadoso concordar, o modelo aceita todas essas palavras de uma vez. Se ele discordar, o modelo corrige o erro e segue em frente.
    • A Alegação do Artigo: Este é o vencedor para uso pessoal (como no seu laptop). É muito mais rápido do que o método antigo de "uma palavra por vez" e até mais rápido do que outros métodos de "adivinhação" usados pelos concorrentes. É como ter um leitor veloz que também consegue editar seu próprio trabalho instantaneamente.

Por Que Isso Importa (Os Momentos "Aha!")

  • Eles Não Lutam, Eles Ajudam: O artigo descobriu que o "Escritor Rigoroso" e o "Corretor Rápido" não são inimigos. Na verdade, ensinar o modelo a ser um escritor rigoroso primeiro ajuda a torná-lo um corretor rápido melhor. É como aprender a andar antes de aprender a correr; o treinamento de caminhada dá ao modelo um senso de direção (gramática) que o ajuda a correr sem bater.
  • Melhor que a Concorrência: Quando testaram este novo modelo contra os melhores modelos atuais (como o Qwen), o novo modelo foi 6 vezes mais rápido na geração de tokens (palavras) em um único passo, mantendo o mesmo nível de inteligência. Em chips de computador poderosos, foi 4 vezes mais rápido ao lidar com tarefas do mundo real.
  • Ainda Há Mais Velocidade para Alcançar: Os pesquisadores fizeram uma análise de "Velocidade da Luz". Eles perguntaram: "Qual é a velocidade máxima que este modelo poderia atingir se tivéssemos um sistema perfeito?". Eles descobriram que o método atual de "Rascunhar e Conferir" já é ótimo, mas ainda existe uma lacuna de 76,5% para a velocidade máxima teórica. Isso significa que a tecnologia tem muito espaço para ficar ainda mais rápida no futuro sem precisar de uma invenção completamente nova.

A Conclusão

Este artigo apresenta um único modelo de IA que pode ser um escritor lento e perfeito, um adivinhador rápido e paralelo, ou um híbrido que rascunha e confere a si mesmo instantaneamente. Ele prova que você não precisa escolher entre velocidade e precisão; você pode ter um modelo que alterna entre elas para obter o melhor dos dois mundos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →