← Últimos artigos
💻 computer science

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

Este artigo introduz o Reward-based Velocity Matching (RVM), uma estrutura simples e computacionalmente eficiente que não utiliza trajetórias e que otimiza diretamente o campo de velocidade de modelos de difusão para o ajuste fino baseado em recompensa, superando os métodos existentes de gradiente de política baseados em verossimilhança ao mesmo tempo em que oferece uma perspectiva unificada sobre abordagens recentes e possibilita recompensas dinâmicas aprimoradas para a geração de vídeo.

Autores originais: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

Publicado 2026-08-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo em rápida evolução da inteligência artificial, uma classe específica de programas de computador surgiu, capaz de criar imagens deslumbrantes e vídeos realistas a partir de simples descrições de texto. Esses sistemas, conhecidos como modelos de difusão, funcionam aprendendo a reverter um processo de corrupção gradual. Imagine pegar uma fotografia nítida e adicionar lentamente ruído estático até que ela se torne irreconhecível; esses modelos aprendem o caminho matemático para fazer o caminho inverso, começando a partir de ruído puro e removendo-o cuidadosamente, passo a passo, para revelar uma imagem coerente. Embora essas ferramentas tenham se tornado incrivelmente poderosas, ensinar aos modelos a seguir as preferências humanas — como fazer um vídeo se mover de forma mais natural ou uma imagem parecer mais bela — tem se mostrado difícil. Tradicionalmente, pesquisadores tentaram adaptar métodos usados para modelos de linguagem, que dependem do cálculo da probabilidade de cada próximo passo possível em uma sequência. No entanto, como a geração de imagens e vídeos envolve milhões de pixels mudando simultaneamente, calcular essas probabilidades é computacionalmente caro e muitas vezes impossível de realizar com precisão perfeita.

Uma equipe de pesquisadores da Georgia Tech e da NVIDIA encontrou uma maneira mais simples e direta de ensinar esses modelos o que os humanos preferem. Em vez de tentar calcular probabilidades complexas para cada minúsculo passo do processo de geração, eles propuseram um método que foca diretamente na "velocidade" da imagem enquanto ela se forma. Na linguagem desses modelos, o sistema prevê como a imagem deve mudar de um momento para o outro para alcançar o resultado final. Os pesquisadores descobriram que poderiam simplesmente direcionar essa previsão para direções que levam a resultados de alta qualidade e afastá-la de direções que levam a resultados ruins, usando um sinal de recompensa como guia. Essa abordagem, que eles chamam de correspondência de velocidade baseada em recompensa (reward-based velocity matching), evita a necessidade dos complicados cálculos de probabilidade que atrasaram tentativas anteriores.

Os pesquisadores testaram essa ideia em modelos de geração de vídeo de grande escala, que são particularmente caros de treinar porque a criação de um único vídeo exige um poder computacional significativo. Eles compararam seu novo método com técnicas existentes que dependem do rastreamento de todo o caminho da criação do vídeo. Os resultados foram impressionantes: seu método mais simples produziu vídeos que não apenas tinham melhor qualidade, mas também exigiram uma fração do tempo de computação. Em um teste específico usando um modelo chamado Wan2.1, sua abordagem alcançou as pontuações de qualidade geral mais altas, utilizando apenas cerca de um doze avos do tempo de treinamento exigido pelos métodos anteriores mais eficazes. Isso sugere que a complexidade dos métodos antigos era desnecessária; a chave para a melhoria não estava em refinar a maquinaria matemática da probabilidade, mas em como os sinais de recompensa eram desenhados e aplicados.

Uma parte crítica de sua descoberta envolveu a compreensão do que os modelos estavam realmente otimizando. Os pesquisadores descobriram que as recompensas padrão, que frequentemente focam na clareza visual ou em quão bem o vídeo corresponde a uma descrição de texto, poderiam inadvertidamente encorajar o modelo a produzir imagens estáticas e sem movimento, que pareciam limpas, mas eram entediantes. Para corrigir isso, eles introduziram um novo tipo de recompensa que rastreia especificamente o movimento, garantindo que o vídeo contenha movimentos significativos. Quando adicionaram essa recompensa focada em movimento ao seu sistema, os vídeos tornaram-se significativamente mais dinâmicos sem perder sua qualidade visual. Essa descoberta destaca que, para esses modelos poderosos, o fator mais importante não é a complexidade do algoritmo de treinamento, mas a clareza e a especificidade dos objetivos estabelecidos para a máquina.

O estudo também revelou que a fórmula matemática específica usada para atualizar o modelo importa menos do que se pensava anteriormente. Os pesquisadores mostraram que seu novo método é matematicamente equivalente a vários outros métodos recentes, o que significa que as diferenças de desempenho entre esses métodos provavelmente se devem à forma como configuraram suas recompensas, e não ao núcleo do algoritmo em si. Ao remover as camadas desnecessárias de estimativa de probabilidade, eles demonstraram que uma atualização direta, baseada em velocidade, é suficiente para guiar o modelo em direção a melhores resultados. Essa simplificação abre as portas para um treinamento mais eficiente, permitindo que pesquisadores iterem mais rapidamente e potencialmente escalem essas tecnologias para tarefas ainda mais complexas sem serem limitados pelos custos computacionais.

Em última análise, este trabalho sugere uma mudança na forma como pensamos sobre o treinamento de IA generativa. Em vez de tratar o problema como um quebra-cabeça complexo de estimativa de probabilidade, os pesquisadores mostraram que é melhor vê-lo como um alinhamento direto da direção interna do modelo com as preferências humanas. O sucesso de seu método, que alcançou resultados superiores com recursos drasticamente reduzidos, indica que o futuro do treinamento eficiente de IA pode residir em ciclos de feedback mais simples e diretos. À medida que esses modelos continuam a crescer em tamanho e capacidade, a habilidade de ajustá-los de forma rápida e eficaz será essencial, e essa nova abordagem oferece um caminho claro e prático para tornar a inteligência artificial mais responsiva às necessidades humanas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →