← Últimos artigos
🤖 machine learning

ff-Trajectory Balance: A Loss Family for Tuning GFlowNets, Generative Models, and LLMs with Off- and On-Policy Data

Este artigo introduz o Equilíbrio de Trajetória ff, uma família de funções de perda que estende a abordagem do erro quadrático médio para todas as ff-divergências, permitindo o treinamento de modelos generativos e LLMs com dados off-policy enquanto preserva as propriedades específicas de otimização (como a cobertura de modos) de seus gradientes de ff-divergência on-policy correspondentes.

Autores originais: Jake Fawkes, Jason Hartford

Publicado 2026-05-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jake Fawkes, Jason Hartford

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a explorar um vasto sistema de cavernas escuras. A caverna possui muitas câmaras ocultas (chamadas de "modos"), algumas das quais contêm ouro (recompensas altas), e outras são apenas vazias ou perigosas. Seu objetivo é ensinar o robô a encontrar o maior número possível de câmaras de ouro diferentes, em vez de apenas encontrar uma grande mina de ouro e ignorar tudo o mais.

Este artigo apresenta um novo conjunto de "ferramentas de ensino" (funções de perda) para ajudar a treinar esses robôs, seja eles gerando moléculas para novos medicamentos, criando arte ou escrevendo código.

Aqui está a explicação das ideias do artigo usando analogias simples:

1. O Problema: A "Corrida do Ouro" vs. O "Explorador"

No passado, a maneira padrão de ensinar esses robôs era como uma Corrida do Ouro. O robô encontraria um local com um pouco de ouro, ficaria animado e, em seguida, gastaria todo o seu tempo cavando ali. Ele ignoraria todas as outras minas de ouro na caverna.

  • Em termos técnicos: Isso é chamado de "busca por modo". O modelo colapsa em algumas respostas de alta probabilidade e ignora o restante da diversidade.
  • O objetivo do artigo: Queremos "cobertura de modos". Queremos que o robô se espalhe e explore todas as minas de ouro, mesmo as menores, para obter um mapa completo da caverna.

2. A Ferramenta Antiga: A Perda "KL ao Quadrado"

Recentemente, pesquisadores descobriram um truque inteligente para ensinar robôs usando um método de "erro quadrático" (medindo a distância entre o que o robô pensa e o que ele deveria pensar).

  • A Analogia: Imagine um professor corrigindo um aluno. Se o aluno errar a resposta, o professor não diz apenas "Errado". Ele calcula o quadrado do erro.
  • O Benefício: Este método é muito estável. Funciona mesmo se o aluno estiver aprendendo com anotações antigas (dados off-policy) em vez de aulas ao vivo.
  • A Falha: Embora seja estável, este método específico "quadrado" ainda age como uma Corrida do Ouro. Ele naturalmente empurra o robô a focar em apenas algumas respostas, perdendo a diversidade da caverna.

3. A Nova Solução: A Família "f-Trajectory Balance"

Os autores perceberam que o método "quadrado" era apenas um sabor específico de uma família muito maior de ferramentas de ensino. Eles chamam essa família de f-Trajectory Balance.

Pense nesta família como um seletor ou um botão de volume em um rádio.

  • Girando o seletor para um lado (Números baixos): Você obtém ferramentas que agem como um Super Explorador. Essas ferramentas forçam o robô a se espalhar e encontrar todas as minas de ouro possíveis, mesmo as de difícil acesso. Isso é ótimo para a descoberta de medicamentos, onde você quer encontrar qualquer molécula que possa funcionar, não apenas a mais óbvia.
  • Girando o seletor para o outro lado (Números altos): Você obtém ferramentas que agem como um Garimpeiro. Essas ferramentas dizem ao robô para ignorar as minas pequenas e focar intensamente na maior e mais óbvia pilha de ouro. Isso é útil se você quiser apenas a melhor resposta única.
  • O Meio-Termo: Você pode ajustar o seletor em qualquer lugar entre os dois para obter uma mistura de exploração e foco.

4. Por Que Isso é Importante

O artigo prova duas coisas principais:

  1. O "Interruptor Mágico": Eles mostraram que você pode trocar a ferramenta "quadrada" padrão por qualquer uma dessas novas ferramentas de "seletor", e a matemática ainda funciona perfeitamente. O robô aprende tão bem quanto, mas com uma personalidade diferente (mais exploratória ou mais focada).
  2. Estabilidade: Assim como a ferramenta antiga, essas novas ferramentas funcionam mesmo se o robô estiver aprendendo com dados antigos (off-policy). Isso é crucial para aplicações do mundo real como Modelos de Linguagem de Grande Escala (LLMs), onde o treinamento frequentemente ocorre de forma assíncrona (o robô aprende com dados gerados há algum tempo).

5. Testes do Mundo Real (Os Mapas da Caverna)

Os autores testaram essas ferramentas em três "cavernas" diferentes:

  • O Jogo da Grade: Um labirinto de computador simples com quatro cantos cheios de ouro. A ferramenta padrão encontrou apenas um canto. As novas ferramentas de "Explorador" encontraram todos os quatro cantos rapidamente.
  • Descoberta de Moléculas (SynFlowNet): Eles tentaram gerar novas moléculas químicas. Ao ajustar o seletor para "Explorador", eles geraram uma variedade muito maior de moléculas únicas que poderiam potencialmente ser medicamentos, em vez de apenas variações das mesmas poucas substâncias químicas.
  • Modelos de Linguagem (LLMs): Eles ajustaram modelos de IA para resolver problemas de matemática. As novas ferramentas permitiram que a IA explorasse diferentes maneiras de resolver problemas sem ficar presa em um loop de repetindo a mesma resposta, mesmo quando os dados de treinamento estavam atrasados (assíncronos).

Resumo

Este artigo não inventa um novo tipo de robô. Em vez disso, ele inventa um novo conjunto de instruções sobre como treiná-los.

  • Antigo jeito: "Encontre a maior mina de ouro e cave lá." (Estável, mas chato).
  • Novo jeito: "Aqui está um seletor. Você pode escolher ser um Garimpeiro, um Super Explorador ou qualquer coisa entre os dois. E não importa qual você escolha, o treinamento será estável e funcionará com dados antigos."

Isso dá aos engenheiros um botão simples para controlar o quão criativos ou focados seus modelos de IA devem ser, sem quebrar o processo de treinamento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →