← Últimos artigos
🤖 machine learning

Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

Este artigo apresenta a Otimização de Política com Prompt Reflexivo (R2PO), um framework de dois estágios para LLMs que aprimora a busca por políticas ao aproveitar evidências detalhadas em nível de trajetória, em vez de recompensas escalares, para diagnosticar falhas e orientar revisões, abordando especificamente o modo de falha de "viés de saliência" para alcançar desempenho mais rápido, estável e próximo do ótimo em ambientes diversos.

Autores originais: Rahaf Abu Hara, Vaibbhav Murarri, Claudio Zito

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Rahaf Abu Hara, Vaibbhav Murarri, Claudio Zito

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A "Planilha de Pontuação" vs. A "História"

Imagine que você está ensinando um robô a jogar um videogame. Nos métodos tradicionais, você só recebe uma planilha de pontuação no final do jogo.

  • A Planilha diz: "Você fez 45 pontos."
  • O Robô pensa: "Certo, preciso fazer algo diferente para conseguir 46."

Mas a planilha não diz por que você perdeu. Você caiu em um buraco no passo 3? Ficou preso em um loop? Jogou perfeitamente por 19 rodadas, mas colapsou espetacularmente na 20ª? Sem a história, o robô tem que adivinhar, levando a muita tentativa e erro.

Métodos recentes de IA tentaram corrigir isso usando um "Treinador Inteligente" (um Modelo de Linguagem de Grande Escala) para analisar a pontuação e sugerir mudanças. Mas mesmo esse treinador só olhava para a planilha. Ele sabia que a pontuação era baixa, mas não sabia o que o robô realmente fez de errado.

A Solução: R2PO (O Sistema de Dois Treinadores)

Os autores propõem o R2PO, um novo sistema que usa dois treinadores de IA trabalhando juntos para ensinar o robô. Eles tratam o vídeo real do jogo do robô (a "trajetória") como a evidência mais importante, não apenas a pontuação final.

Treinador 1: O Escoteiro (Search-LLM)

  • Função: O Escoteiro analisa o histórico de pontuações de tentativas anteriores.
  • Ação: Ele diz: "Certo, com base nas pontuações, vamos tentar alterar as configurações do robô ligeiramente nesta direção." Ele propõe um novo conjunto de instruções para o robô.
  • Analogia: Pense no Escoteiro como um caminhante olhando para um mapa. Ele adivinha qual direção pode levar ao cume com base em onde esteve antes.

O Ambiente: A Prova de Fogo

O robô testa as novas instruções do Escoteiro. Ele joga o jogo 20 vezes (chamadas de "rollouts"). Isso gera muitos dados: para onde foi, o que fez e como falhou.

Treinador 2: O Crítico (Critic-LLM)

  • Função: O Crítico é o detetive. Ele não olha apenas para a pontuação; ele assiste ao vídeo das 20 tentativas do robô.
  • Ação: Ele analisa o vídeo para encontrar o erro específico. "Ah, entendi! Em 19 dessas tentativas, o robô foi ótimo. Mas em uma tentativa, ele caiu em um buraco porque virou para a esquerda muito cedo."
  • O Ajuste: Em vez de adivinhar, o Crítico sugere um pequeno ajuste direcionado às instruções do robô para corrigir aquele problema específico.

A Rede de Segurança: A Etapa de Seleção

Antes que as novas instruções do Crítico sejam salvas, um "Árbitro" as verifica.

  • Se as novas instruções funcionarem melhor, elas são mantidas.
  • Se as novas instruções piorarem as coisas (mesmo que o Crítico achasse que eram uma boa ideia), as instruções antigas são mantidas.
  • Analogia: Isso é como um chef provando uma nova sopa. Se a nova especiaria fizer o sabor pior, ele joga a nova especiaria fora e fica com a receita original.

A Armadilha Oculta: "Viés de Salência"

Os pesquisadores descobriram um hábito engraçado, mas perigoso, no Treinador Crítico. Eles chamam isso de Viés de Salência.

Imagine que o robô joga 20 partidas.

  • 19 partidas: Ele vence facilmente.
  • 1 partida: Ele colide com uma parede de uma maneira muito dramática e bagunçada.

Se você mostrar ao Treinador Crítico todos os 20 vídeos, o Treinador fica obcecado com aquela única colisão dramática. Ele pensa: "Oh não! O robô é terrível em evitar paredes!" e altera o cérebro do robô para corrigir a colisão.

O Resultado: O robô estava realmente indo muito bem nas outras 19 partidas. Ao tentar corrigir aquela colisão estranha, o Crítico acidentalmente quebra a capacidade do robô de jogar as outras 19 partidas. O robô piora.

Como o R2PO Corrige Isso:
O sistema R2PO é inteligente sobre qual vídeo ele mostra ao Crítico.

  1. O Vídeo Mediano: Em vez de mostrar a pior colisão ou a melhor vitória, ele mostra o vídeo "do meio"—aquele que representa o que o robô geralmente faz.
  2. A Planilha de Estatísticas: Ele dá ao Crítico um resumo: "95% das vezes, o robô vence. A colisão foi uma anomalia de 5%."
  3. A Regra "Não Toque": Se o robô já estiver indo muito bem (pontuação alta), o Crítico recebe a ordem: "Não mude nada a menos que tenha uma razão muito, muito boa."

Isso impede que o Crítico entre em pânico por causa de um único dia ruim e estrague uma boa estratégia.

Os Resultados: Mais Rápido, Mais Inteligente e Mais Estável

O artigo testou esse sistema em 10 ambientes diferentes (como equilibrar um poste, jogar Pong ou navegar em um labirinto).

  • Velocidade: O R2PO aprendeu muito mais rápido. Por exemplo, no jogo "CartPole" (equilibrar um bastão), ele atingiu pontuações quase perfeitas em cerca de 500 tentativas, enquanto outros métodos precisaram de 4.000 tentativas.
  • Estabilidade: Outros métodos encontrariam uma ótima solução, mas acidentalmente a quebrariam no próximo passo. O R2PO encontrou a solução e permaneceu lá.
  • Eficiência: Eles usaram um modelo de IA relativamente pequeno e de código aberto (20 bilhões de parâmetros) para superar métodos que usavam modelos muito maiores, caros ou proprietários.

Resumo

O artigo argumenta que, para ensinar IA efetivamente, você não deve apenas dar a ela uma pontuação. Você deve mostrar a ela a história do que aconteceu. No entanto, você deve ter cuidado para não deixar a IA se obcecar com a única vez que falhou (Viés de Salência). Ao mostrar à IA a história "média" e fornecer uma rede de segurança, você pode ensiná-la a aprender mais rápido, corrigir problemas específicos e evitar quebrar o que já funciona.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →