EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
Autores originales: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
Autores originales: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: ENVRL - Aprender de la Dinámica del Entorno en el Aprendizaje por Refuerzo Agéntico
1. Planteamiento del Problema
El Aprendizaje por Refuerzo (RL) se ha convertido en un paradigma estándar para entrenar Modelos de Lenguaje Extensos (LLMs) como agentes autónomos capaces de manejar tareas complejas de largo horizonte (por ejemplo, navegación web, interacción con software). Sin embargo, los algoritmos de RL agéntico predominantes (como GRPO y RLOO) dependen predominantemente de recompensas basadas en resultados, donde el entorno proporciona retroalimentación binaria solo al completar un episodio.
En contextos de largo horizonte y múltiples turnos, esta retroalimentación dispersa plantea un desafío de aprendizaje severo. Los autores argumentan que este enfoque pasa por alto la rica información de la dinámica del entorno contenida en las trayectorias de interacción de los rollouts. Mientras el agente interactúa con el entorno, genera experiencia que porta implícitamente señales densas que describen cómo evoluciona el entorno y revelan los mecanismos de transición subyacentes. Los métodos existentes no logran aprovechar esta supervisión implícita, lo que limita la capacidad del agente para construir un modelo interno preciso del entorno y tomar decisiones robustas.
2. Metodología: El Marco de Trabajo ENVRL
El artículo propone ENVRL, un marco diseñado para incorporar el aprendizaje de la dinámica del entorno en el RL agéntico. La idea central es transformar las experiencias de interacción en señales de auto-supervisión que complementen el objetivo principal de RL. ENVRL introduce dos objetivos auxiliares:
A. Predicción de Estado (SP - State Prediction)
Este objetivo modela la dinámica de avance del entorno. Dado el estado actual st y la acción elegida at, el agente es entrenado para predecir el siguiente estado del entorno st+1.
- Mecanismo: En entornos textuales, st+1 es la observación textual del siguiente paso. El objetivo minimiza la pérdida de entropía cruzada entre el estado predicho y el real:
LSP(θ)=−E(st,at,st+1)∼Dπθ[logpθ(st+1∣st,at)] - Objetivo: Incentiva al agente a interiorizar cómo sus acciones moldean las observaciones subsecuentes.
B. Dinámica Inversa (ID - Inverse Dynamics)
Este objetivo modela la causalidad hacia atrás. Dados dos estados consecutivos (st,st+1), el agente es entrenado para inferir la acción at que causó la transición.
- Mecanismo: El objetivo minimiza la pérdida de entropía cruzada para recuperar la acción:
LID(θ)=−E(st,at,st+1)∼Dπθ[logpθ(at∣st,st+1)] - Objetivo: Fortalece la comprensión del agente sobre el vínculo causal entre su comportamiento y los cambios ambientales, ayudándole a filtrar detalles de observación irrelevantes.
C. Optimización Conjunta en Línea con Decaimiento
El objetivo de aprendizaje total combina la pérdida principal de RL (LRL) con las pérdidas auxiliares (LSP y LID):
L(θ;t)=LRL(θ)+λSP(t)LSP(θ)+λID(t)LID(θ)
Para equilibrar la necesidad de un aprendizaje temprano de la dinámica con la maximización de la recompensa en la etapa final, los autores emplean un mecanismo de decaimiento de coeficientes. Los pesos λSP(t) y λID(t) siguen un esquema de decaimiento de coseno, comenzando con un valor alto y reduciéndose gradualmente a cero a medida que avanza el entrenamiento. Esto asegura que el agente reciba una supervisión densa sobre la dinámica al principio, y luego cambie suavemente su enfoque hacia la recompensa de la tarea principal.
Eficiencia Computacional: ENVRL reutiliza los datos de los rollouts generados durante el proceso de RL estándar. Requiere solo una pasada hacia adelante adicional por cada actualización para calcular las pérdidas auxiliares, lo que introduce un costo computacional insignificante.
3. Contribuciones Clave
- Propuesta de Marco de Trabajo: Introducción de ENVRL, un marco ligero que integra la predicción de estado y la dinámica inversa como objetivos auxiliares en el RL agéntico.
- Utilización de Supervisión Implícita: Un enfoque novedoso para tratar la experiencia de interacción como una fuente independiente de señales de supervisión densas, abordando la dispersión de las recompensas de resultado en tareas de largo horizonte.
- Mecanismo de Decaimiento: Un esquema de coeficientes dependiente del tiempo que equilibra dinámicamente el aprendizaje de la dinámica del entorno frente a la optimización de las recompensas de la tarea.
- Eficiencia: Demostración de que estas mejoras se logran sin muestreo adicional o entrenamiento de modelos separados, reutilizando las trayectorias de los rollouts existentes.
4. Resultados Experimentales
Los autores evaluaron ENVRL en dos benchmarks agénticos de largo horizonte: ALFWorld (tareas domésticas basadas en texto) y WebShop (búsqueda de productos de comercio electrónico). Los experimentos se realizaron utilizando modelos Qwen2.5 (1.5B y 7B) con baselines de GRPO y GiGPO.
- Ganancias de Rendimiento:
- ALFWorld (1.5B, GRPO): La tasa de éxito aumentó de 72.8% a 77.4% (+4.6 puntos).
- WebShop (1.5B, GRPO): La tasa de éxito aumentó de 56.8% a 67.0% (+10.2 puntos).
- Modelos de 7B: Se observaron mejoras consistentes tanto con GRPO como con el baseline más fuerte, GiGPO (por ejemplo, GiGPO + ENVRL alcanzó un 94.5% en ALFWorld).
- Eficiencia de Muestreo: ENVRL alcanzó el nivel de rendimiento final del baseline de RL utilizando aproximadamente el 68.5% de los pasos totales de entrenamiento en promedio, lo que indica una convergencia más rápida.
- Mejoras de Comportamiento: Los episodios exitosos requirieron menos turnos de interacción y longitudes de respuesta más cortas, lo que sugiere una toma de decisiones más precisa y una reducción de la exploración redundante.
- Generalización: Los modelos ENVRL entrenados en tareas estándar mostraron una mayor robustez en conjuntos de prueba fuera de la distribución (OOD) con configuraciones de habitaciones novedosas y tipos de objetos no vistos.
- Estudios de Ablación:
- Eliminar ya sea SP o ID degradó el rendimiento, confirmando la naturaleza complementaria del modelado de la dinámica hacia adelante y hacia atrás.
- Eliminar el mecanismo de decaimiento provocó caídas en el rendimiento, resaltando la necesidad de cambiar el enfoque de la dinámica a las recompensas a lo largo del tiempo.
- El rendimiento escaló positivamente con la fracción de datos de experiencia utilizados para el entrenamiento auxiliar.
5. Significado y Reivindicaciones
El artículo afirma que ENVRL ofrece un enfoque general y ligero para que los agentes de LLM aprendan de la dinámica del entorno. Al interiorizar los mecanismos de transición del entorno a través de objetivos de auto-supervisión, los agentes pueden tomar decisiones más efectivas en tareas de largo horizonte donde las recompensas de resultado son dispersas.
Los autores posicionan su trabajo como ortogonal a los métodos existentes que se centran en la asignación de crédito fina o en el modelado de recompensas intermedias. En cambio, ENVRL trata la experiencia de interacción como una fuente de información rica e independiente. El marco se presenta como una estrategia complementaria que puede integrarse con varios algoritmos de optimización de políticas (como GRPO o GiGPO) para mejorar la eficiencia de muestreo y la generalización sin un costo computacional significativo. El trabajo pretende proporcionar una nueva perspectiva sobre la mecánica del RL agéntico, contribuyendo al desarrollo de agentes más robustos y autónomos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de machine learning cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.