DiffusionGemma Technical Report
O DiffusionGemma é um modelo de linguagem de pesos abertos que alcança velocidades excepcionais de geração de texto de aproximadamente 1.500 tokens por segundo ao ajustar uma arquitetura Gemma 4 com um pipeline de dois estágios computacionalmente eficiente para permitir a difusão discreta paralela por blocos, estabelecendo assim uma nova fronteira de Pareto para o equilíbrio entre velocidade de inferência e capacidade do modelo.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você esteja tentando escrever uma história, mas é forçado a escrevê-la uma letra de cada vez, da esquerda para a direita, sem nunca poder olhar para trás ou mudar de ideia. Se você cometer um erro na primeira frase, terá que continuar escrevendo o resto do livro com esse erro, esperando consertá-lo mais tarde adicionando mais palavras. É assim que a maioria dos programas de computador "inteligentes" modernos, chamados Modelos de Linguagem de Grande Escala, funcionam atualmente. Eles são como um digitador muito rápido que não consegue apertar a tecla de apagar. Embora sejam brilhantes, essa regra de "mão única" cria um congestionamento em seus cérebios. Cada vez que eles querem escrever a próxima palavra, precisam parar, lembrar de tudo o que acabaram de escrever e calcular o próximo passo. Isso os torna lentos, especialmente quando você é o único usando-os, porque o computador passa mais tempo lembrando o passado do que pensando no futuro.
Cientistas têm procurado uma maneira de permitir que esses computadores escrevam em "blocos" em vez de letras, permitindo que olhem para frente e corrijam erros conforme avançam, muito parecido com um humano editando um rascunho. Essa ideia é chamada de "difusão". Pense nisso como um escultor começando com um bloco de pedra coberto por uma névoa. Em vez de esculpir uma peça minúscula de cada vez, o escultor olha para o bloco inteiro, adivinha onde a estátua deve estar e limpa a névoa de toda a forma de uma só vez. Eles repetem isso, tornando tudo cada vez mais claro, até que a estátua esteja perfeita. Este artigo apresenta um novo modelo chamado DiffusionGemma, que tenta usar este método de "limpar a névoa" para escrever texto incrivelmente rápido, mantendo-se inteligente o suficiente para resolver problemas matemáticos difíceis e escrever código.
O Novo Escritor de "Limpeza de Névoa"
Os pesquisadores da Google DeepMind construíram o DiffusionGemma, um modelo de computador experimental que quebra a antiga regra de "uma palavra por vez". Em vez de escrever uma frase letra por letra, o DiffusionGemma escreve em grandes blocos de 256 palavras de uma só vez. Imagine tentar preencher uma página de um caderno. O modo antigo é como mergulhar sua caneta na tinta, escrever uma palavra, levantar a caneta, pensar, mergulhar novamente e escrever a próxima. O DiffusionGemma é como ter um carimbo que imprime um parágrafo inteiro instantaneamente. Se o carimbo comete um erro, ele não apenas continua; ele borra o parágrafo inteiro e tenta carimbá-lo novamente, mas desta vez com uma imagem mais clara do que deveria ser. Ele faz isso repetidamente, refinando todo o bloco de texto em paralelo, até que as palavras se encaixem no lugar.
A equipe não construiu este modelo do zero. Eles começaram com um modelo existente muito inteligente chamado Gemma 4 (que possui cerca de 25,2 bilhões de partes totais, com 3,8 bilhões ativas em qualquer momento) e ensinaram a ele um novo truque. Eles usaram um processo de treinamento de duas etapas. Primeiro, mostraram ao modelo como "denoizar" (remover o ruído de) um texto, ensinando-o a olhar para um bloco de palavras bagunçado e confuso e descobrir qual deve ser a frase limpa. Segundo, usaram um tipo especial de "aprendizado por reforço" combinado com "destilação de amostra". Pense nisso como um treinador que não apenas diz ao modelo "bom trabalho", mas também o ensina a terminar o trabalho mais rápido. O treinador pressiona o modelo para ser mais inteligente enquanto também o ensina a parar de refinar o texto assim que estiver confiante o suficiente, economizando tempo.
Velocidade que Deixa as Portas Escancaradas
Os resultados são impressionantes. Em um único chip de computador poderoso chamado NVIDIA H100 GPU, o DiffusionGemma pode gerar cerca de 1.500 palavras por segundo. Para colocar em perspectiva, os melhores modelos da "velha escola", mesmo com seus truques mais rápidos, geralmente conseguem cerca de 300 palavras por segundo. O DiffusionGemma é aproximadamente 5 vezes mais rápido que a versão padrão e cerca de 2,5 vezes mais rápido que outros modelos rápidos que estão atualmente escondidos atrás de paywalls privados.
O artigo mostra que isso não é apenas um truque de velocidade que torna o modelo burro. Embora seja ligeiramente menos perfeito em algumas tarefas de raciocínio muito difíceis em comparação ao modelo Gemma 4 original, ele ainda é incrivelmente capaz. Ele pode resolver problemas matemáticos complexos, escrever código e até entender imagens. Os pesquisadores descobriram que, ao escrever em blocos de 256, o modelo pode produzir cerca de 20 palavras para cada única "etapa de pensamento" que realiza, enquanto os modelos antigos geralmente produzem apenas 1 palavra por etapa. Essa eficiência massiva permite que ele contorne os gargalos de memória que normalmente atrasam os computadores.
Por Que Isso Importa (E o Que Ele Ainda Não Consegue Fazer)
O artigo sugere que esta abordagem abre uma nova porta para como usamos a IA. Como o modelo pode gerar texto tão rapidamente, ele poderia ser usado para coisas que exigem respostas instantâneas, como conversação em tempo real ou ajudar médicos a redigir relatórios em uma fração de segundo. Os pesquisadores também mostraram que o modelo é flexível: ele ainda pode escrever no estilo antigo de "uma palavra por vez", se necessário, e pode até alternar entre o modo de "pensamento" (onde planeja sua resposta) e o modo "rápido".
No entanto, os autores são cuidadosos ao apontar que esta é uma versão experimental. Não é um substituto perfeito para os modelos antigos ainda. Eles admitem que o modelo às vezes fica preso em loops repetitivos (como dizer "o o o" repetidamente) ou produz respostas ligeiramente mais curtas e concisas do que o original. Eles também observam que, embora seja super rápido para uma pessoa usando, se você tentar atender centenas de pessoas ao mesmo tempo, os modelos antigos de "uma palavra" podem eventualmente alcançá-lo em velocidade. Mas, por enquanto, o DiffusionGemma estabeleceu uma nova "fronteira", provando que você pode ter tanto velocidade extrema quanto alta inteligência, quebrando a regra antiga de que você tinha que escolher entre as duas.
Em resumo, o DiffusionGemma sugere que o futuro de escrever com computadores pode não ser uma marcha lenta e cuidadosa, mas um refinamento rápido e simultâneo de ideias, limpando a névoa de toda a imagem de uma só vez.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.