EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
Auteurs originaux : Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
Auteurs originaux : Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : ENVRL - Apprendre de la Dynamique de l'Environnement dans l'Apprentissage par Renforcement Agentique
1. Énoncé du Problème
L'apprentissage par renforcement (RL) est devenu un paradigme standard pour l'entraînement de modèles de langage de grande taille (LLM) en tant qu'agents autonomes capables de gérer des tâches complexes à long horizon (par exemple, la navigation web, l'interaction avec des logiciels). Cependant, les algorithmes de RL agentique prédominants (tels que GRPO et RLOO) reposent principalement sur des récompenses basées sur le résultat, où l'environnement fournit un retour binaire uniquement à la fin d'un épisode.
Dans des contextes multi-tours à long horizon, ce retour clairsemé pose un défi d'apprentissage majeur. Les auteurs soutiennent que cette approche néglige les riches informations de dynamique de l'environnement contenues dans les trajectoires d'interaction de déploiement (rollout). Pendant que l'agent interagit avec l'environnement, il génère une expérience qui porte implicitement des signaux denses décrivant comment l'environnement évolue en réponse aux actions et révélant les mécanismes de transition sous-jacents. Les méthodes existantes ne parviennent pas à exploiter cette supervision implicite, limitant la capacité de l'agent à construire un modèle interne précis de l'environnement et à prendre des décisions robustes.
2. Méthodologie : Le Cadre ENVRL
Le papier propose ENVRL, un cadre conçu pour intégrer l'apprentissage de la dynamique de l'environnement dans le RL agentique. L'idée centrale est de transformer les expériences d'interaction en signaux auto-supervisés qui complètent l'objectif principal de RL. ENVRL introduit deux objectifs auxiliaires :
A. Prédiction d'État (State Prediction - SP)
Cet objectif modélise la dynamique de l'environnement vers l'avant. Étant donné l'état actuel st et l'action choisie at, l'agent est entraîné à prédire l'état suivant de l'environnement st+1.
- Mécanisme : Dans les environnements textuels, st+1 est l'observation textuelle de l'étape suivante. L'objectif minimise la perte d'entropie croisée entre l'état prédit et l'état réel :
LSP(θ)=−E(st,at,st+1)∼Dπθ[logpθ(st+1∣st,at)] - But : Encourage l'agent à intérioriser la manière dont ses actions façonnent les observations subséquentes.
B. Dynamique Inverse (Inverse Dynamics - ID)
Cet objectif modélise la causalité vers l'arrière. Étant donné deux états consécutifs (st,st+1), l'agent est entraîné à inférer l'action at qui a causé la transition.
- Mécanisme : L'objectif minimise la perte d'entropie croisée pour la récupération de l'action :
LID(θ)=−E(st,at,st+1)∼Dπθ[logpθ(at∣st,st+1)] - But : Renforce la compréhension de l'agent du lien causal entre son comportement et les changements environnementaux, l'aidant à filtrer les détails d'observation superflus.
C. Optimisation Conjointe en Ligne avec Décroissance
L'objectif d'apprentissage total combine la perte de RL primaire (LRL) avec les pertes auxiliaires (LSP et LID) :
L(θ;t)=LRL(θ)+λSP(t)LSP(θ)+λID(t)LID(θ)
Pour équilibrer le besoin d'un apprentissage précoce de la dynamique et la maximisation de la récompense en fin de parcours, les auteurs utilisent un mécanisme de décroissance de coefficient. Les poids λSP(t) et λID(t) suivent un schéma de décroissance cosinus, commençant par une valeur élevée et diminuant progressivement vers zéro à mesure que l'entraînement progresse. Cela garantit que l'agent reçoit une supervision dense sur la dynamique au début, puis bascule progressivement son attention vers la récompense de la tâche principale.
Efficacité Computationnelle : ENVRL réutilise les données de déploiement générées lors du processus de RL standard. Il ne nécessite qu'un seul passage direct supplémentaire par mise à jour pour calculer les pertes auxiliaires, introduisant un surcoût computationnel négligeable.
3. Contributions Clés
- Proposition de Cadre : Introduction de ENVRL, un cadre léger qui intègre la prédiction d'état et la dynamique inverse comme objectifs auxiliaires dans le RL agentique.
- Utilisation de la Supervision Implicite : Une approche novatrice consistant à traiter l'expérience d'interaction comme une source indépendante de signaux de supervision denses, répondant à la rareté des récompenses de résultat dans les tâches à long horizon.
- Mécanisme de Décroissance : Un schéma de coefficient dépendant du temps qui équilibre dynamiquement l'apprentissage de la dynamique de l'environnement par rapport à l'optimisation des récompenses de la tâche.
- Efficacité : Démonstration que ces améliorations sont obtenues sans échantillonnage supplémentaire ou entraînement de modèle séparé, en réutilisant les trajectoires de déploiement existantes.
4. Résultats Expérimentaux
Les auteurs ont évalué ENVRL sur deux benchmarks agentiques à long horizon : ALFWorld (tâches domestiques textuelles) et WebShop (recherche de produits e-commerce). Les expériences ont été menées en utilisant des modèles Qwen2.5 (1.5B et 7B) avec les bases GRPO et GiGPO.
- Gains de Performance :
- ALFWorld (1.5B, GRPO) : Le taux de réussite est passé de 72,8 % à 77,4 % (+4,6 points).
- WebShop (1.5B, GRPO) : Le taux de réussite est passé de 56,8 % à 67,0 % (+10,2 points).
- Modèles 7B : Des améliorations constantes ont été observées avec GRPO et la base plus forte GiGPO (par exemple, GiGPO + ENVRL atteint 94,5 % sur ALFWorld).
- Efficacité d'Échantillonnage : ENVRL a atteint le niveau de performance final du baseline RL en utilisant environ 68,5 % du total des étapes d'entraînement en moyenne, indiquant une convergence plus rapide.
- Améliorations Comportementales : Les épisodes réussis nécessitaient moins de tours d'interaction et des longueurs de réponse plus courtes, suggérant une prise de décision plus précise et une réduction de l'exploration redondante.
- Généralisation : Les modèles ENVRL entraînés sur des tâches standards ont montré une meilleure robustesse sur les ensembles de test hors distribution (OOD) avec de nouvelles configurations de pièces et des types d'objets inédits.
- Études d'Ablation :
- Le retrait de SP ou de ID a dégradé les performances, confirmant la nature complémentaire de la modélisation de la dynamique vers l'avant et vers l'arrière.
- Le retrait du mécanisme de décroissance a entraîné des baisses de performance, soulignant la nécessité de déplacer l'attention de la dynamique vers les récompenses au fil du temps.
- La performance a augmenté proportionnellement à la fraction de données d'expérience utilisée pour l'entraînement auxiliaire.
5. Signification et Revendications
Le papier affirme que ENVRL offre une approche générale et légère pour que les agents LLM apprennent de la dynamique de l'environnement. En intériorisant les mécanismes de transition de l'environnement via des objectifs auto-supervisés, les agents peuvent prendre des décisions plus efficaces dans des tâches à long horizon où les récompenses de résultat sont rares.
Les auteurs positionnent leur travail comme étant orthogonal aux méthodes existantes qui se concentrent sur l'attribution de crédit fine ou le façonnage de récompenses intermédiaires. Au lieu de cela, ENVRL traite l'expérience d'interaction comme une source d'information riche et indépendante. Le cadre est présenté comme une stratégie complémentaire qui peut être intégrée à diverses algorithmes d'optimisation de politique (comme GRPO ou GiGPO) pour améliorer l'efficacité d'échantillonnage et la généralisation sans coût computationnel significatif. Le travail vise à fournir une nouvelle perspective sur la mécanique du RL agentique, contribuant au développement d'agents plus robustes et autonomes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles machine learning chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.