Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
O Agentic-DPO é um método de otimização de política offline e leve que transforma trajetórias de especialistas em preferências de ação condicionadas ao estado para permitir que agentes de LLM aprendam a tomada de decisão ideal além da simples imitação, alcançando um desempenho comparável ao aprendizado por reforço online sem exigir rollouts de ambiente ou modelos de recompensa.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está ensinando um robô mordomo a limpar um quarto bagunçado. O método antigo, chamado Ajuste Fino Supervisionado (SFT), é como entregar ao robô um vídeo de um humano limpando e dizer: "Copie exatamente o que você vê". O robô aprende a imitar a sequência de movimentos: pegar a meia, colocá-la no cesto de roupa suja, pegar a pá de poeira. Mas aqui está o problema: o robô não aprende realmente por que esses movimentos foram escolhidos. Se a meia fosse, na verdade, um pedaço de lixo, o robô ainda assim a pegaria porque está apenas copiando o vídeo, não pensando no erro que poderia ter cometido.
O artigo apresenta um novo método mais leve chamado Agentic-DPO para corrigir isso. Em vez de apenas copiar, ele transforma os dados de treinamento em um jogo de "Escolha sua Própria Aventura", onde o robô aprende a detectar seus próprios erros potenciais.
A Ideia Central: "Não Apenas Copie, Compare"
Os autores sugerem que, em vez de tratar o caminho de um especialista como uma única linha de texto para memorizar, devemos olhar para cada passo como um ponto de decisão. Em qualquer momento, o robô poderia escolher o movimento correto do especialista ou poderia escolher um "erro plausível".
O Agentic-DPO funciona assim:
- A Configuração: Você mostra ao robô um momento específico do histórico do especialista (o "estado").
- O Teste: Você pergunta ao robô: "O que você faria agora?".
- A Comparação: Se o robô sugerir uma ação diferente da do especialista, você cria um par: "Movimento do Especialista (Bom)" vs. "Palpite do Robô (Ruim)".
- A Lição: Você ensina o robô a preferir o movimento do especialista sobre o seu próprio erro provável.
Esta é uma mudança enorme. O artigo argumenta que os métodos anteriores ou apenas copiavam (SFT) ou tentavam aprender jogando o jogo repetidamente em um ambiente real (Aprendizado por Reforço), o que é lento, caro e exige sistemas de pontuação complexos. O Agentic-DPO sugere que você pode obter os benefícios de aprender com os erros sem precisar realmente jogar o jogo ou contratar um humano para julgar cada movimento.
O "Truque de Mágica": Mantendo as Regras Claras
Existe um problema delicado ao ensinar robôs: eles podem se confundir com o modo como algo é escrito, em vez do que aquilo signia. Por exemplo, pedir ao robô para "Chamar a ferramenta" pode ser escrito como call_tool() ou {"tool": "call"}. Se o robô apenas aprender a preferir o formato de texto do especialista, ele falhará quando o formato mudar.
Para corrigir isso, os autores introduzem uma técnica inteligente chamada Aumentação de Preservação de Política (PPA). Imagine que você está ensinando um aluno a resolver um problema matemático. Você mostra o mesmo problema escrito em inglês, depois em espanhol, depois em estilo de história em quadrinhos, mas a solução (a matemática) permanece exatamente a mesma. A PPA faz isso pelo robô: ela reescreve a ação do especialista em muitos "dialetos" ou formatos diferentes, mantendo a decisão central idêntica. Isso força o robô a aprender a lógica da escolha, não apenas as palavras específicas usadas.
O Que os Números Dizem
Os autores testaram essa ideia em três diferentes "parquinhos" onde robôs precisam interagir com ferramentas, usuários e sites:
- StableToolBench: Um lugar para testar o uso de ferramentas.
- τ-bench (tau-bench): Uma simulação de varejo onde o robô conversa com um cliente.
- Mind2Web: Uma tarefa onde o robô navega em sites reais.
Os resultados sugerem que o Agentic-DPO supera consistentemente o método padrão de "cópia" (SFT) em diferentes tamanhos de robôs:
- Na tarefa de varejo do τ-bench, um modelo de 9 bilhões de parâmetros saltou de 21,7% de sucesso com a cópia padrão para 41,4% com o Agentic-DPO.
- No StableToolBench, um modelo menor de 2 bilhões de parâmetros foi de 57,1% para 90,9%.
- No Mind2Web, a taxa média de sucesso por etapa foi de 45,6% para 64,4%.
Interessantemente, o artigo observa que o Agentic-DPO teve um desempenho tão bom quanto um método muito mais caro chamado GRPO (que exige que o robô jogue o jogo milhares de vezes para aprender), mas o Agentic-DPO o fez sem nunca interagir com o ambiente real durante as etapas de treinamento.
O Que Este Método Não Faz
É importante saber o que este método não afirma resolver. O artigo descarta explicitamente a ideia de que este método possa descobrir novas situações que o especialista não viu. Como ele só aprende a partir dos estados presentes nos vídeos existentes do especialista, ele não consegue explorar um quarto que o especialista nunca entrou. Isso sugere que há uma troca: você obtém um método de treinamento mais barato e rápido que funciona muito bem em pontos de decisão conhecidos, mas perde a capacidade de encontrar soluções inéditas que exijam desviar do caminho traçado.
O Veredito Final
Os autores sugerem que, ao transformar demonstrações de especialistas em uma série de escolhas de "Certo vs. Errado" em cada passo, e ao usar o truque de "embaralhamento de formato" (PPA) para manter o robô focado na lógica, podemos treinar agentes mais inteligentes de forma muito mais barata do que antes. É como atualizar um robô de um papagaio sem mente para um estudante que realmente pensa sobre por que poderia estar errado, tudo isso sem precisar de um milhão de dólares em poder computacional para rodar simulações intermináveis.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.