← Últimos artigos
💬 NLP

Nemotron-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context

O Nemotron-TwoTower introduz uma nova arquitetura de difusão autorregressiva por blocos que desacopla o processamento de contexto e a denoização em duas torres especializadas, alcançando um throughput de geração 2,42x mais rápido enquanto retém 98,7% da qualidade de sua linha de base autorregressiva.

Autores originais: Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

Publicado 2026-06-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Fitsum Reda, John Kamalu, Roger Waleffe, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever uma história longa, mas tem uma regra estrita: você só pode escrever uma palavra de cada vez, e deve esperar que a palavra anterior esteja totalmente finalizada antes de começar a próxima. É assim que a maioria dos modelos de linguagem de IA atuais funciona (chamado de modelo "Autorregressivo"). É como um digitador muito cuidadoso, lento, que nunca comete erros, mas leva uma eternidade para terminar uma frase.

Agora, imagine um novo método onde você pode digitar uma frase inteira de uma vez, olhar para ela e, então, corrigir os erros em todas as palavras simultaneamente. Isso é mais rápido, mas geralmente a qualidade da história sofre porque a IA se confunde ao tentar consertar tudo ao mesmo tempo.

Nemotron-TwoTower é uma nova invenção que tenta obter o melhor dos dois mundos: a velocidade de digitar tudo de uma vez, com a alta qualidade do digitador cuidadoso, uma palavra por vez.

Aqui está como isso funciona, usando uma analogia simples:

As Duas Torres: O Bibliotecário e o Editor

Os pesquisadores construíram um sistema com duas "torres" distintas (partes da IA) que trabalham juntas, como uma equipe de duas pessoas:

  1. A Torre de Contexto Congelada (O Bibliotecário):

    • Papel: Este é o "especialista" que conhece a história até agora. É uma IA pré-treinada que está congelada (travada no lugar). Ela atua como um bibliotecário rigoroso que lê a história palavra por palavra, do início ao fim.
    • Trabalho: Ela não muda. Ela apenas mantém um registro perfeito e organizado de tudo o que foi escrito até o momento. Ela diz à outra torre: "Aqui está o contexto da história até este ponto".
    • Por que importa: Porque está congelada, ela mantém toda a inteligência e o conhecimento original do modelo massivo de 30 bilhões de parâmetros do qual foi construída. Ela nunca esquece ou se confunde.
  2. A Torre de Denoising de Difusão Treinável (O Editor):

    • Papel: Este é o "trabalhador rápido". É uma IA treinável que tem permissão para mudar e aprender.
    • Trabalho: Em vez de escrever uma palavra de cada vez, ela pega um bloco de 16 palavras (ou tokens) que estão atualmente em branco (mascaradas). Ela olha para as notas do "Bibliotecário" e tenta preencher todas as 16 lacunas de uma só vez.
    • O Processo: Ela não acerta perfeitamente de imediato. Ela faz um palpite, olha para o seu próprio palpite e para as notas do Bibliotecário, e refina as palavras. Ela faz isso repetidamente (iterativamente) até que o bloco de palavras esteja limpo e faça sentido.
    • A Magia: Como ela pode olhar para as 16 palavras ao mesmo tempo e corrigi-las juntas, ela é muito mais rápida do que escrever uma por uma.

Como Eles Trabalham Juntos (A Linha de Montagem)

Imagine uma linha de montagem de uma fábrica:

  1. O Bibliotecário lê o comando (prompt) e as palavras já escritas, mantendo um mapa mental perfeito da história.
  2. O Editor pega um pedaço de papel em branco (com 16 palavras de comprimento).
  3. O Editor pergunta ao Bibliotecário: "O que vem a seguir?" e o Bibliotecário fornece o contexto.
  4. O Editor preenche as 16 lacunas, verifica seu trabalho e corrige quaisquer erros.
  5. Assim que o Editor está confiante de que as 16 palavras estão boas, elas são "comprometidas" (finalizadas).
  6. O Bibliotecário atualiza seu mapa mental para incluir essas novas 16 palavras.
  7. O Editor pega o próximo pedaço de 16 palavras em branco, e o ciclo se repete.

Os Resultados: Velocidade vs. Qualidade

O artigo afirma que este sistema alcança um "ponto ideal":

  • Velocidade: É 2,42 vezes mais rápido do que o método tradicional de uma palavra por vez. É como mudar de um caracol para um velocista.
  • Qualidade: Ele retém 98,7% da qualidade do modelo original. Não perdeu muita inteligência para ganhar essa velocidade.
  • Eficiência: Eles treinaram esta nova torre "Editor" com cerca de 2,1 trilhões de palavras, uma fração minúscula das 25 trilhões de palavras usadas para treinar o "Bibliotecário" original. Isso significa que eles não tiveram que ensinar toda a IA do zero; eles apenas ensinaram o Editor a usar as notas do Bibliotecário.

Por que Isso é Diferente de Tentativas Anteriores

Tentativas anteriores tentaram usar um único cérebro para fazer ambos os trabalhos: lembrar a história e corrigir as palavras ao mesmo tempo. O artigo argumenta que isso é como pedir a uma pessoa para ser um guardião de memória perfeito e um editor rápido simultaneamente — é trabalho demais, e eles acabam não fazendo nenhum dos dois trabalhos perfeitamente.

Ao dividir os papéis em duas torres (uma congelada e uma treinável), eles permitem que cada parte faça aquilo para o que é melhor. O Bibliotecário permanece perfeito, e o Editor torna-se rápido.

O Truque da "Confiança"

O sistema também possui um recurso inteligente de "desmascaramento de confiança" (confidence unmasking).

  • Se o Editor estiver muito confiante sobre uma palavra, ele a trava imediatamente.
  • Se estiver incerto, ele deixa essa palavra em branco (mascarada) e tenta corrigi-la na próxima rodada de edição.
  • Isso significa que ele não perde tempo rechecando palavras que já sabe que estão certas, mas dedica um tempo extra para polir as partes difíceis.

Resumo

Nemotron-TwoTower é uma forma de tornar a geração de texto por IA muito mais rápida sem torná-la "mais burra". Ele faz isso separando o trabalho de "lembrar a história" (que permanece lento e perfeito) do trabalho de "escrever o próximo bloco" (que se torna rápido e iterativo). O resultado é um sistema que escreve histórias quase tão bem quanto o antigo método lento, mas duas vezes mais rápido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →