← Últimos artigos
🤖 machine learning

UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective

O artigo propõe o UNIFUSION, um framework unificado que estabelece conexões entre vários objetivos de difusão discreta para permitir a adaptação direta de modelos autorregressivos pré-treinados para difusão de ruído uniforme, alcançando o estado da arte tanto em qualidade generativa quanto em precisão de tarefas de jusante.

Autores originais: Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

Publicado 2026-07-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xiaoyi Jiang, Jingyuan Li, Yixuan Jiang, Wei Liu, Yi Zhu, Zuoqiang Shi, Pipi Hu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a escrever histórias. Por muito tempo, a melhor maneira de fazer isso era ensinar o robô a escrever uma palavra de cada vez, da esquerda para a direita, como um humano digitando uma frase. Esse método, chamado de aprendizado "autorregressivo", é ótimo porque é rápido e o robô aprende muitas regras de linguagem. Mas tem um grande defeio: uma vez que o robô escreve uma palavra, ele nunca pode voltar atrás para mudá-la. Se ele cometer um erro na primeira frase, toda a história pode ser arruinada porque ele não consegue editar seu passado.

Recentemente, cientistas tentaram uma abordagem diferente chamada "difusão discreta". Em vez de escrever palavra por palavra, esse método começa com uma frase completa que foi embaralhada ou "corrompida" com ruído, e o robô aprende a limpá-la, consertando uma palavra de cada vez até que a frase fique perfeita. Isso é como pegar um quarto bagunçado e organizá-lo lentamente. O problema é que a maioria desses novos robôs de "limpeza" é treinada do zero, desperdiçando todo o conhecimento de linguagem que os antigos robôs "palavra por palavra" já possuíam. Além disso, muitos desses novos robôs usam um tipo específico de ruído onde escondem palavras atrás de uma "máscara" (como uma caixa preta). Isso significa que o robô só pode consertar as partes escondidas, não as palavras que já estão visíveis. A grande questão era: Podemos pegar um robô "palavra por palavra" inteligente e pré-treinado e transformá-lo instantaneamente em um poderoso robô de "limpeza" que possa consertar qualquer palavra em uma frase, mesmo aquelas que não estão escondidas?

Este artigo, intitulado "Unifusion", diz que sim, e mostra como fazer isso. Os pesquisadores descobriram que, apesar das diferentes fórmulas matemáticas usadas por vários robôs de "limpeza", todos estão secretamente tentando resolver o mesmo problema subjacente: prever a rapidez com que uma palavra deve saltar de um estado para outro. Eles chamam isso de "taxa reversa" (reverse rate). Ao perceberem que todos esses diferentes métodos são apenas falando dialetos diferentes da mesma língua, eles criaram um tradutor universal. Este tradutor permite que eles peguem o conhecimento de um modelo "palavra por palavra" padrão (como o GPT-2) e o adaptem diretamente para um modelo de difusão de "ruído uniforme" (uniform-noise).

A inovação principal é que este novo modelo, o Unifusion, não precisa esconder palavras atrás de máscaras. Em vez disso, ele trata cada palavra da frase como editável, exatamente como você pode editar qualquer palavra em um Google Docs. Os pesquisadores testaram isso pegando duas versões de um modelo pré-treinado (um com 124 milhões de parâmetros e outro com 355 milhões) e treinando-os para serem artistas da "limpeza". Eles descobriram que, conforme davam ao modelo mais tempo para pensar (aumentando o número de etapas de 16 para 256), a qualidade do texto melhorava constantemente.

No máximo de 256 etapas, o modelo menor (Unifusion-S) alcançou uma "perplexidade generativa" (uma medida de quão confuso o modelo fica pelo texto que ele cria) de 97,783, enquanto o modelo maior (Unifusion-M) atingiu 71,516. Mais importante ainda, esses modelos não apenas escreveram textos fluentes; eles também mantiveram uma alta "entropia unigrama", que é uma forma sofisticada de dizer que o texto era diverso e não ficava preso repetindo as mesmas frases ou padrões. De fato, nas 256 etapas, nenhum outro modelo testado do mesmo tamanho foi capaz de superar o Unifusion tanto em fluência quanto em diversidade ao mesmo tempo.

O artigo também mostrou que essa conversão direta funciona melhor do que a antiga maneira de tentar ir de "palavra por palavra" para "difusão mascarada" e depois para "difusão uniforme". Ao pular o intermediário, o Unifusion alcançou a mesma alta qualidade de forma muito mais eficiente. Quando testado em quebra-cabeças de lógica do mundo real e questões de senso comum (como WinoGrande e SIQA), esses novos modelos de difusão superaram todos os outros modelos de difusão de seu tamanho, provando que eles não apenas aprenderam a limpar o ruído, mas também retiveram as habilidades de raciocínio inteligente de seu treinamento original "palavra por palavra".

Em resumo, o Unifusion é como pegar um mestre cuca que está acostumado a cozinhar uma refeição um ingrediente de cada vez e ensiná-lo uma nova técnica onde ele pode provar e ajustar toda a panela de sopa de uma só vez, sem ter que jogar fora seus anos de experiência culinária. O resultado é um modelo que pode gerar um texto que é ao mesmo tempo fluente e criativamente diverso, simplesmente aprendendo a editar a frase inteira de uma vez.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →