← Últimos artigos
🤖 machine learning

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

Este artigo apresenta o Reinforce Adjoint Matching (RAM), um método escalável de pós-treinamento por RL para modelos de difusão e correspondência de fluxo que alcança alinhamento superior com recompensas ao derivar uma função de perda de consistência simples que corrige os objetivos de pré-treinamento sem exigir simulações de EDE custosas, varreduras adjuntas reversas ou gradientes de recompensa.

Autores originais: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

Publicado 2026-05-12
📖 4 min de leitura☕ Leitura rápida

Autores originais: Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um artista mestre que passou anos aprendendo a pintar copiando milhares de fotos. Este artista é incrivelmente bom em recriar o que vê, mas não necessariamente sabe como seguir instruções específicas e complicadas, como "pinte uma zebra vermelha ao lado de um caminhão azul" ou "escreva a palavra 'OLÁ' claramente em um escudo".

Para ensinar a esse artista essas novas habilidades, geralmente usamos um método chamado Aprendizado por Reforço (RL). Pense nisso como um crítico de arte rigoroso que examina a pintura, atribui uma nota e diz ao artista: "Faça melhor da próxima vez".

O Jeito Antigo: O Crítico Caro e Lento

Anteriormente, treinar esses artistas de IA com um crítico era como tentar ensinar alguém a nadar jogando-o no oceano e observando-o se debater.

  • O Processo: A IA gerava uma imagem completa (o "nadar"), o crítico atribuía uma nota e, em seguida, o sistema tentava descobrir exatamente qual pincelada causou a nota boa ou ruim.
  • O Problema: Para fazer isso, a IA tinha que simular todo o processo de pintura do início ao fim, repetidamente, apenas para obter uma única peça de feedback. Era lento, computacionalmente caro e frequentemente instável (como tentar calcular a velocidade do vento enquanto o barco está afundando).

O Jeito Novo: RAM (Reinforce Adjoint Matching)

Os autores deste artigo, Andreas Bergmeister e sua equipe, perceberam que existe uma maneira muito mais inteligente de fazer isso. Eles encontraram um "atalho" que mantém o treinamento rápido e simples, como a fase original de pré-treinamento.

Veja como o RAM funciona, usando uma analogia simples:

1. O Truque do "Ponto Final Limpo"
Imagine que o processo de pintura é como um filme passando ao contrário. O filme começa com uma tela em branco (ruído) e termina com uma pintura concluída.

  • Método Antigo: A IA tinha que assistir a todo o filme, avaliar o final e, em seguida, rebobinar o filme quadro a quadro para ver onde errou.
  • Método RAM: Os autores perceberam que, se você conhece a pintura final (o "ponto final limpo"), não precisa assistir a todo o filme para entender o processo. Você pode simplesmente pegar essa pintura concluída e, matematicamente, "adicionar ruído" a ela instantaneamente para criar uma versão bagunçada, exatamente como o treinamento original fazia.

2. O Feedback "Uma Vez e Pronto"
Em vez de simular todo o processo de pintura para obter feedback, o RAM faz o seguinte:

  1. Gerar: A IA pinta uma imagem concluída (o ponto final).
  2. Avaliar: O crítico atribui uma nota (por exemplo, "Ótimo trabalho no texto!").
  3. Rebobinar Instantaneamente: Em vez de simular o rebobinar, a matemática cria instantaneamente uma versão "ruidosa" dessa imagem.
  4. Aprender: A IA aprende a transformar essa versão ruidosa específica de volta na imagem de alta nota.

A Insight Mágica:
O artigo prova que as regras sobre como "adicionar ruído" a uma imagem não mudam, mesmo quando você está tentando melhorar a imagem. A única coisa que muda é quais imagens a IA decide pintar em primeiro lugar. Como as "regras do ruído" permanecem as mesmas, a IA pode usar a mesma matemática simples que usou durante seu treinamento original, apenas com um novo alvo.

Por Que Isso é Importante

  • Velocidade: O artigo afirma que o RAM é 34 a 50 vezes mais rápido que os métodos anteriores. Ele atinge o mesmo nível de habilidade em uma fração do tempo.
  • Simplicidade: Não requer cálculos complexos e instáveis (como "rollouts de EDE" ou "varreduras adjuntas reversas"). É apenas uma tarefa de regressão simples, semelhante ao treinamento original.
  • Qualidade: Quando testado no Stable Diffusion 3.5M, a IA ficou muito melhor em:
    • Composabilidade: Colocar objetos nos lugares certos (por exemplo, um caminhão à esquerda de uma geladeira).
    • Renderização de Texto: Escrever palavras claramente em imagens.
    • Preferência Humana: Criar imagens que os humanos realmente gostam de olhar.

A Conclusão

Pense no RAM como dar ao artista uma "borracha mágica" e um "placar mágico". Em vez de forçar o artista a repintar toda a tela para ver o que deu errado, a borracha mágica mostra instantaneamente uma versão bagunçada de seu melhor trabalho, e o placar diz exatamente como consertar essa bagunça específica. Isso permite que a IA aprenda novas habilidades complexas sem o alto custo computacional dos métodos anteriores.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →