← Últimos artigos
💬 NLP

Mask-Aware Policy Gradients for Diffusion Language Models

Este artigo apresenta o Mask-Aware Policy Gradients, um framework de aprendizado por reforço que formaliza a geração de Modelos de Linguagem de Difusão com Máscara como um processo de decisão de dois estágios para otimizar conjuntamente a seleção de tokens e o mascaramento de posições, superando assim a intratabilidade da verossimilhança de log e alcançando desempenho de estado da arte em benchmarks de raciocínio matemático e codificação.

Autores originais: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

Publicado 2026-07-17
📖 3 min de leitura☕ Leitura rápida

Autores originais: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a escrever uma história ou resolver um problema de matemática. Por muito tempo, a melhor maneira de fazer isso era fazer o robô escrever uma palavra por vez, como um humano digitando em um teclado. Isso é chamado de geração "autoregressiva". É confiável, mas também é lento, como um caracol atravessando uma rodovia. Recentemente, cientistas descobriram uma maneira mais rápida chamada "Difusão". Em vez de escrever do zero, o robô começa com uma página cheia de máscaras em branco (como [MASK]) e gradualmente as preenche, revelando as palavras uma a uma até que a frase esteja completa. É como um quebra-cabeça onde você começa com uma imagem coberta e lentamente levanta as coberturas para ver a imagem.

No entanto, ensinar esses robôs de "difusão" rápidos a ficarem mais espertos usando recompensas (uma técnica chamada Aprendizado por Reforço) tem sido um pesadelo. No antigo método "palavra por palavra", é fácil calcular exatamente quão provável era o robô fazer uma escolha específica. Mas no método de "difusão", o robô faz duas escolhas em cada etapa: ele decide qual palavra colocar em um espaço em branco e também decide qual espaço em branco revelar a seguir. Métodos anteriores tentaram ensinar o robô olhando apenas para a primeira escolha (a palavra) e ignorando a segunda escolha (a ordem de revelação). É como tentar ensinar um chef a cozinhar uma refeição perfeita criticando apenas os ingredientes que ele escolheu, enquanto ignora completamente a ordem em que ele picou e mexeu.

Este artigo, apresentado na conferência COLM 2026, sugere que estivemos perdendo uma grande parte do quebra-cabeça. Os autores, Haran Raajesh, Kulin Shah e sua equipe da Universidade do Texas em Austin, argumentam que, para realmente dominar a arte da difusão, você precisa recompensar o robô tanto por escolher as palavras certas quanto por escolher a ordem certa para revelá-las. Eles desenvolveram um novo método chamado "Gradientes de Política Cientes de Máscara" (Mask-Aware Policy Gradients). Em vez de apenas adivinhar a próxima palavra, o sistema deles trata a decisão de "qual máscara levantar a seguir" como uma parte crucial da estratégia do robô. Ao decompor matematicamente o processo de aprendizado nessas duas partes distintas, eles descobriram que o robô aprende muito mais rápido e comete menos erros.

Os resultados são bastante impressionantes. Quando testaram esse novo método em problemas matemáticos difíceis e desafios de programação, o robô tornou-se significativamente melhor em resolvê-los. Em um teste de matemática famoso chamado GSM8K, o método deles alcançou uma precisão de 87,1%, e em um teste de programação chamado MBPP, atingiu 53,4%. Esses números são superiores a qualquer método anterior que tentou ensinar modelos de difusão usando recompensas. O artigo mostra que, ao prestar atenção às decisões de "mascaramento" — a ordem em que o robô revela seus pensamentos — podemos desbloquear um novo nível de inteligência nesses modelos de IA rápidos e flexíveis, tornando-os não apenas mais rápidos, mas também mais espertos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →