EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
Autores originais: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
Autores originais: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: ENVRL - Aprender com a Dinâmica do Ambiente no Aprendizado por Reforço Agêntico
1. Declaração do Problema
O Aprendizado por Reforço (RL) tornou-se um paradigma padrão para o treinamento de Grandes Modelos de Linguagem (LLMs) como agentes autônomos capazes de lidar com tarefas complexas de longo horizonte (ex: navegação na web, interação com software). No entanto, os algoritmos de RL agêntico predominantes (como GRPO e RLOO) dependem predominantemente de recompensas baseadas em resultados, onde o ambiente fornece feedback binário apenas após a conclusão de um episódio.
Em contextos de longo horizonte e múltiplos turnos, esse feedback esparso impõe um desafio severo de aprendizado. Os autores argumentam que essa abordagem negligencia as ricas informações de dinâmica do ambiente contidas nas trajetórias de interação de rollout. Enquanto o agente interage com o ambiente, ele gera experiência que carrega implicitamente sinais densos descrevendo como o ambiente evolui em resposta a ações e revelando mecanismos de transição subjacentes. Os métodos existentes falham em aproveitar essa supervisão implícita, limitando a capacidade do agente de construir um modelo interno preciso do ambiente e tomar decisões robustas.
2. Metodologia: O Framework ENVRL
O artigo propõe o ENVRL, um framework projetado para incorporar o aprendizado de dinâmica de ambiente no RL agêntico. A ideia central é transformar experiências de interação em sinais de auto-supervisão que complementam o objetivo primário de RL. O ENVRL introduz dois objetivos auxiliares:
A. Predição de Estado (SP - State Prediction)
Este objetivo modela a dinâmica de ambiente direta (forward). Dada a situação atual st e a ação escolhida at, o agente é treinado para prever o próximo estado do ambiente st+1.
- Mecanismo: Em ambientes textuais, st+1 é a observação textual do próximo passo. O objetivo minimiza a perda de entropia cruzada entre o estado previsto e o real:
LSP(θ)=−E(st,at,st+1)∼Dπθ[logpθ(st+1∣st,at)] - Objetivo: Incentiva o agente a internalizar como suas ações moldam as observações subsequentes.
B. Dinâmica Inversa (ID - Inverse Dynamics)
Este objetivo modela a causalidade reversa (backward). Dados dois estados consecutivos (st,st+1), o agente é treinado para inferir a ação at que causou a transição.
- Mecanismo: O objetivo minimiza a perda de entropia cruzada para recuperar a ação:
LID(θ)=−E(st,at,st+1)∼Dπθ[logpθ(at∣st,st+1)] - Objetivo: Fortalece a compreensão do agente sobre o elo causal entre seu comportamento e as mudanças ambientais, ajudando-o a filtrar detalhes irrelevantes da observação.
C. Otimização Online Conjunta com Decaimento
O objetivo de aprendizado total combina a perda primária de RL (LRL) com as perdas auxiliares (LSP e LID):
L(θ;t)=LRL(θ)+λSP(t)LSP(θ)+λID(t)LID(θ)
Para equilibrar a necessidade de aprendizado de dinâmica precoce com a maximização de recompensa em estágio tardio, os autores utilizam um mecanismo de decaimento de coeficiente. Os pesos λSP(t) e λID(t) seguem um esquema de decaimento de cosseno, começando em um valor alto e reduzindo gradualmente para zero conforme o treinamento progride. Isso garante que o agente receba supervisão densa sobre a dinâmica no início e, então, mude suavemente o foco para a recompensa da tarefa principal.
Eficiência Computacional: O ENVRL reutiliza os dados de rollout gerados durante o processo de RL padrão. Ele requer apenas uma passagem adicional de forward por atualização para calcular as perdas auxiliares, introduzindo um overhead computacional desprezível.
3. Principais Contribuições
- Proposta de Framework: Introdução do ENVRL, um framework leve que integra predição de estado e dinâmica inversa como objetivos auxiliares no RL agêntico.
- Utilização de Supervisão Implícita: Uma abordagem inovadora para tratar a experiência de interação como uma fonte independente de sinais de supervisão densos, abordando a esparsidade das recompensas de resultado em tarefas de longo horizonte.
- Mecanismo de Decaimento: Um esquema de coeficiente dependente do tempo que equilibra dinamicamente o aprendizado de dinâmica de ambiente contra a otimização de recompensas de tarefa.
- Eficiência: Demonstração de que essas melhorias são alcançadas sem amostragem adicional ou treinamento de modelos separados, reutilizando as trajetórias de rollout existentes.
4. Resultados Experimentais
Os autores avaliaram o ENVRL em dois benchmarks de agentes de longo horizonte: ALFWorld (tarefas domésticas baseadas em texto) e WebShop (busca de produtos de e-commerce). Os experimentos foram conduzidos usando modelos Qwen2.5 (1.5B e 7B) com baselines GRPO e GiGPO.
- Ganhos de Desempenho:
- ALFWorld (1.5B, GRPO): A taxa de sucesso aumentou de 72,8% para 77,4% (+4,6 pontos).
- WebShop (1.5B, GRPO): A taxa de sucesso aumentou de 56,8% para 67,0% (+10,2 pontos).
- Modelos 7B: Melhorias consistentes foram observadas tanto com GRPO quanto com o baseline mais forte GiGPO (ex: GiGPO + ENVRL atingiu 94,5% no ALFWorld).
- Eficiência de Amostragem: O ENVRL atingiu o nível de desempenho final do baseline de RL usando aproximadamente 68,5% dos passos totais de treinamento em média, indicando convergência mais rápida.
- Melhorias Comportamentais: Episódios bem-sucedidos exigiram menos turnos de interação e comprimentos de resposta menores, sugerindo tomada de decisão mais precisa e redução de exploração redundante.
- Generalização: Modelos ENVRL treinados em tarefas padrão mostraram melhor robustez em conjuntos de teste Out-of-Distribution (OOD) com configurações de quartos inéditas e tipos de objetos não vistos.
- Estudos de Ablação:
- Remover o SP ou o ID degradou o desempenho, confirmando a natureza complementar da modelagem de dinâmica direta e inversa.
- Remover o mecanismo de decaimento levou a quedas de desempenho, destacando a necessidade de mudar o foco de dinâmica para recompensas ao longo do tempo.
- O desempenho escalou positivamente com a fração de dados de experiência usados para o treinamento auxiliar.
5. Significância e Alegações
O artigo afirma que o ENVRL oferece uma abordagem geral e leve para LLMs aprenderem com a dinâmica do ambiente. Ao internalizar os mecanismos de transição do ambiente através de objetivos de auto-supervisão, os agentes podem tomar decisões mais eficazes em tarefas de longo horizonte onde as recompensas de resultado são esparsas.
Os autores posicionam seu trabalho como ortogonal aos métodos existentes que focam em atribuição de crédito refinada ou modelagem de recompensa intermediária. Em vez disso, o ENVRL trata a experiência de interação como uma fonte de informação rica e independente. O framework é apresentado como uma estratégia complementar que pode ser integrada a vários algoritmos de otimização de política (como GRPO ou GiGPO) para aumentar a eficiência de amostragem e a generalização sem custo computacional significativo. O trabalho visa fornecer uma nova perspectiva sobre a mecânica do RL agêntico, contribuindo para o desenvolvimento de agentes mais robustos e autônomos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.
Receba os melhores artigos de machine learning toda semana.
Confiado por pesquisadores de Stanford, Cambridge e da Academia Francesa de Ciências.
Verifique sua caixa de entrada para confirmar sua inscrição.
Algo deu errado. Tentar novamente?
Sem spam, cancele quando quiser.