← Últimos artigos
🤖 machine learning

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

Este artigo apresenta o TraFL, um método de pós-treinamento baseado em equilíbrio de trajetória para modelos de linguagem difusivos que supera o modo de falha de "bloqueio de trajetória" das abordagens de maximização de recompensa ao alinhar a política com uma distribuição-alvo inclinada pela recompensa, alcançando assim ganhos consistentes de desempenho em benchmarks de raciocínio matemático e geração de código.

Autores originais: Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

Publicado 2026-05-15
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Uma Nova Maneira de Ensinar IA

Imagine que você tem um artista muito talentoso (o modelo de IA) que pode pintar quadros começando com uma tela cheia de ruído e estática e limpando-a lentamente até que uma imagem clara apareça. É assim que os Modelos de Linguagem de Difusão funcionam: eles não escrevem palavras uma por uma como uma máquina de escrever (que é como os modelos de IA mais antigos funcionam); em vez disso, eles começam com um emaranhado de letras e gradualmente "removem o ruído" delas até formar uma frase coerente.

O artigo argumenta que a maneira atual como ensinamos esses artistas a ficarem melhores em resolver problemas difíceis (como matemática ou programação) está quebrada. Os autores propõem um novo método chamado TraFL (Trajectory Flow baLancing) que corrige uma falha específica chamada "Bloqueio de Trajetória".


O Problema: A Armadilha do "Caminho Único" (Bloqueio de Trajetória)

Para entender o problema, imagine um labirinto.

  • O Objetivo: O labirinto tem muitas saídas corretas diferentes (diferentes soluções válidas para um problema de matemática).
  • O Método Antigo (RL de Maximização de Recompensa): Imagine que você está treinando um cachorro para encontrar a saída. Toda vez que o cachorro encontra uma saída, você lhe dá um petisco.
    • A Falha: O cachorro não se importa qual caminho ele percorreu para obter o petisco, apenas que ele conseguiu um.
    • O Resultado: Se o cachorro, por acaso, tropeçar em um caminho específico que leva a um petisco cedo, ele recebe um petisco. Ele lembra desse caminho. Na próxima vez, ele tenta aquele caminho novamente. Ele recebe outro petisco. Ele fica mais confiante naquele único caminho.
    • Bloqueio de Trajetória: Eventualmente, o cachorro para de explorar o labirinto completamente. Ele só corre naquele caminho estreito, mesmo que existam 50 outras saídas válidas que ele poderia ter encontrado. Ele "travou" em uma única solução e esqueceu como encontrar as outras.

No artigo, os autores chamam isso de Bloqueio de Trajetória. Como a IA só recebe uma "recompensa" (uma pontuação) pela resposta final, ela ignora o fato de que havia muitas maneiras diferentes (caminhos) para chegar lá. Ela colapsa toda a sua criatividade em uma única rota estreita, tornando-se ruim em encontrar alternativas corretas quando você pede para tentar novamente.

A Solução: A Abordagem do "Guia" (TraFL)

Os autores propõem o TraFL, que muda as regras de treinamento. Em vez de apenas dar um petisco para qualquer saída, eles dão à IA um Guia (um modelo de referência congelado) e um Mapa.

  1. O Guia (Modelo de Referência): Esta é uma versão da IA que ainda não foi treinada nas recompensas específicas. Ela representa uma maneira "saudável" e diversificada de pensar. Ela sabe que há muitas maneiras de resolver um problema.
  2. O Mapa (Alvo Ponderado pela Recompensa): Dizemos à IA: "Você quer encontrar as saídas que dão a recompensa (as respostas corretas), MAS você deve manter seus padrões de movimento semelhantes ao Guia."

A Analogia:
Imagine que você está ensinando um aluno a resolver um problema de matemática.

  • Maneira Antiga: Você diz: "Chegue à resposta certa, de qualquer jeito!" O aluno descobre um truque que funciona, memoriza-o e se recusa a aprender qualquer outro método.
  • Maneira TraFL: Você diz: "Encontre a resposta certa, mas mantenha seu processo de pensamento diversificado e flexível, como um aluno de topo que conhece muitas estratégias diferentes."

O TraFL força a IA a equilibrar duas coisas:

  1. Obter a Recompensa: Encontrar a resposta correta.
  2. Mantener-se Diverso: Não colapsar em um único caminho repetitivo. Ele mantém a "massa de probabilidade" (a probabilidade de escolher um caminho) distribuída por muitas soluções válidas diferentes, ancorada pelo Guia.

Como Eles Fizeram Funcionar

O artigo observa que os modelos de difusão são complicados porque não mostram seu "processo de pensamento" passo a passo como os modelos mais antigos fazem. Para corrigir isso, os autores inventaram duas ferramentas:

  1. Uma Pontuação Surrogada: Como eles não podem ver a matemática exata de cada passo, eles criaram uma pontuação "proxy" que estima o quão boa é uma resposta completa, permitindo treinar o modelo sem precisar de visibilidade perfeita em cada pequeno passo.
  2. Um Normalizador Aprendido: Eles ensinaram à IA uma "calculadora" especial que ajusta a dificuldade da tarefa com base na pergunta específica (o prompt), garantindo que o treinamento permaneça justo e equilibrado.

Os Resultados: Isso Realmente Ajuda?

Os autores testaram esse novo método em Matemática (resolvendo problemas de texto) e Código (escrevendo programas de computador).

  • A Armadilha do "Caminho Único" foi quebrada: Ao contrário de outros métodos que às vezes pioravam na busca por diferentes soluções enquanto melhoravam na busca por uma solução, o TraFL melhorou em cada teste único.
  • Mais Amostras = Melhores Resultados: Quando pediram à IA para gerar 16 respostas diferentes em vez de apenas 1, o TraFL ficou significativamente melhor. Isso prova que ele realmente encontrou mais soluções corretas diferentes, não apenas um palpite sortudo.
  • Funciona em Coisas Novas: A IA não apenas memorizou as perguntas de treinamento. Quando testada em problemas de matemática totalmente novos (Minerva Math) e novos desafios de programação (LiveCodeBench) que ela nunca tinha visto antes, o TraFL foi o melhor desempenho.
  • Verificação de Diversidade: Eles usaram um "Juiz" (outra IA) para analisar as respostas. O Juiz confirmou que o TraFL não estava apenas dando a mesma resposta com palavras diferentes; ele estava realmente usando estratégias de raciocínio diferentes e algoritmos diferentes para resolver os mesmos problemas.

Resumo

O artigo identifica uma falha onde os modelos de IA ficam "presos" em uma maneira de resolver um problema, ignorando outras soluções válidas. Eles corrigiram isso com o TraFL, um método que ensina a IA a buscar respostas corretas enquanto mantém uma "exploração" diversificada de diferentes caminhos, guiada por um modelo de referência. O resultado é uma IA que não é apenas mais inteligente, mas também mais criativa e confiável quando solicitada a gerar múltiplas soluções.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →