EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
Oorspronkelijke auteurs: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
Oorspronkelijke auteurs: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: ENVRL - Leren van Omgevingsdynamiek in Agentic Reinforcement Learning
1. Probleemstelling
Reinforcement Learning (RL) is een standaardparadigma geworden voor het trainen van Large Language Models (LLMs) als autonome agenten die in staat zijn complexe, langdurige taken aan te kunnen (bijv. websnavigatie, software-interactie). De huidige agentic RL-algoritmen (zoals GRPO en RLOO) vertrouwen echter voornamelijk op outcome-gebaseerde beloningen, waarbij de omgeving pas binaire feedback geeft bij de voltooiing van een episode.
In contexten met een lange horizon en meerdere beurten vormt deze schaarse feedback een ernstige leeruitdaging. De auteurs stellen dat deze aanpak de rijke informatie over de omgevingsdynamiek die besloten ligt in de trajecten van interactie tijdens rollouts, over het hoofd ziet. Terwijl de agent met de omgeving interacteert, genereert deze ervaring die impliciet dichte signalen bevat die beschrijven hoe de omgeving evolueert in reactie op acties en de onderliggende transitiemechanismen onthullen. Bestaande methoden slagen er niet in om deze impliciete supervisie te benutten, wat het vermogen van de agent beperkt om een accuraat intern model van de omgeving op te bouwen en robuuste beslissingen te nemen.
2. Methodologie: Het ENVRL-framework
Het artikel stelt ENVRL voor, een framework ontworpen om het leren van omgevingsdynamiek te integreren in agentic RL. Het kernidee is om interactie-ervaringen te transformeren naar zelfgesuperviseerde signalen die het primaire RL-doel aanvullen. ENVRL introduceert twee hulpdoelen:
A. Toestandsvoorspelling (State Prediction - SP)
Dit doel modelleert de voorwaartse omgevingsdynamiek. Gegeven de huidige toestand st en de gekozen actie at, wordt de agent getraind om de volgende omgevingstoestand st+1 te voorspellen.
- Mechanisme: In tekstuele omgevingen is st+1 de observatie van de volgende stap. Het doel is om de cross-entropy loss te minimaliseren tussen de voorspelde en de werkelijke volgende toestand:
LSP(θ)=−E(st,at,st+1)∼Dπθ[logpθ(st+1∣st,at)] - Doel: Moedigt de agent aan om te internaliseren hoe zijn acties de daaropvolgende observaties vormgeven.
B. Inverse Dynamiek (Inverse Dynamics - ID)
Dit doel modelleert achterwaartse causaliteit. Gegeven twee opeenvolgende toestanden (st,st+1), wordt de agent getraind om de actie at af te leiden die de transitie veroorzaakte.
- Mechanisme: Het doel is om de cross-entropy loss te minimaliseren voor het herstellen van de actie:
LID(θ)=−E(st,at,st+1)∼Dπθ[logpθ(at∣st,st+1)] - Doel: Versterkt het begrip van de agent over de causale link tussen zijn gedrag en de veranderingen in de omgeving, wat helpt bij het filteren van irrelevante observatiedetails.
C. Gezamenlijke Online Optimalisatie met Decay
Het totale leerdoel combineert de primaire RL-loss (LRL) met de hulp-losses (LSP en LID):
L(θ;t)=LRL(θ)+λSP(t)LSP(θ)+λID(t)LID(θ)
Om de behoefte aan vroege dynamiek-leren te balanceren met beloningsmaximalisatie in een latere fase, maken de auteurs gebruik van een coefficient decay mechanisme. De gewichten λSP(t) en λID(t) volgen een cosine decay schema, waarbij ze beginnen met een hogere waarde en geleidelijk afnemen tot nul naarmate de training vordert. Dit zorgt ervoor dat de agent in een vroeg stadium dichte supervisie krijgt op de dynamiek, om vervolgens soepel de focus te verleggen naar de primaire taakbeloning.
Computationele Efficiëntie: ENVRL hergebruikt de rollout-data die gegenereerd worden tijdens het standaard RL-proces. Het vereist slechts één extra forward pass per update om de hulp-losses te berekenen, wat een verwaarloosbare computationele overhead introduceert.
3. Belangrijkste Bijdragen
- Framework Voorstel: Introductie van ENVRL, een lichtgewicht framework dat state prediction en inverse dynamics integreert als hulpdoelen in agentic RL.
- Benutting van Impliciete Supervisie: Een nieuwe aanpak om interactie-ervaring te behandelen als een onafhankelijke bron van dichte supervisiesignalen, waarmee de schaarste van outcome-beloningen in langdurige taken wordt aangepakt.
- Decay Mechanisme: Een tijdafhankelijk coefficient schema dat de leerprocessen van omgevingsdynamiek en de optimalisatie van taakbeloningen dynamisch in evenwicht brengt.
- Efficiëntie: Demonstratie dat deze verbeteringen worden bereikt zonder extra sampling of aparte modeltraining, door gebruik te maken van bestaande rollout-trajecten.
4. Experimentele Resultaten
De auteurs evalueerden ENVRL op twee langdurige agentic benchmarks: ALFWorld (tekstgebaseerde huishoudelijke taken) en WebShop (e-commerce productzoekopdrachten). Experimenten werden uitgevoerd met Qwen2.5 modellen (1.5B en 7B) met GRPO en GiGPO baselines.
- Prestatiewinst:
- ALFWorld (1.5B, GRPO): Succespercentage steeg van 72,8% naar 77,4% (+4,6 punten).
- WebShop (1.5B, GRPO): Succespercentage steeg van 56,8% naar 67,0% (+10,2 punten).
- 7B Modellen: Consistente verbeteringen werden waargenomen met zowel GRPO als de sterkere GiGPO baseline (bijv. GiGPO + ENVRL bereikte 94,5% op ALFWorld).
- Sample Efficiëntie: ENVRL bereikte het uiteindelijke prestatieniveau van de RL-baseline met gemiddeld ongeveer 68,5% van de totale trainingsstappen, wat wijst op snellere convergentie.
- Gedragsverbeteringen: Succesvolle episodes vereisten minder interactiebeurten en kortere responslengtes, wat duidt op nauwkeurigere besluitvorming en minder redundante exploratie.
- Generalisatie: ENVRL-modellen getraind op standaardtaken vertoonden verbeterde robuustheid op Out-of-Distribution (OOD) testsets met nieuwe kamerconfiguraties en ongeziene objecttypen.
- Ablatie-studies:
- Het verwijderen van ofwel SP of ID leidde tot een verslechtering van de prestaties, wat de complementaire aard van voorwaartse en achterwaartse dynamiekmodellering bevestigt.
- Het verwijderen van het decay mechanisme leidde tot prestatieverlies, wat het belang benadrukt van het verschuiven van de focus van dynamiek naar beloningen in de loop van de tijd.
- De prestaties schaalden positief met het deel van de ervaring-data dat gebruikt werd voor de hulp-training.
5. Betekenis en Claims
Het artikel claimt dat ENVRL een generaal en lichtgewicht aanpak biedt voor LLM-agenten om te leren van omgevingsdynamiek. Door de transitiemechanismen van de omgeving te internaliseren via zelfgesuperviseerde doelen, kunnen agenten effectievere beslissingen nemen in langdurige taken waar outcome-beloningen schaars zijn.
De auteurs positioneren hun werk als orthogonaal aan bestaande methoden die zich richten op fijnmazige credit assignment of tussenliggende reward shaping. In plaats daarvan behandelt ENVRL interactie-ervaring als een rijke, onafhankelijke informatiebron. Het framework wordt gepresenteerd als een complementaire strategie die kan worden geïntegreerd met diverse policy optimalisatie-algoritmen (zoals GRPO of GiGPO) om de sample efficiëntie en generalisatie te verbeteren zonder significante computationele kosten. Het werk beoogt een nieuw perspectief te bieden op de mechanica van agentic RL, en draagt bij aan de ontwikkeling van robuustere en meer autonome agenten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste machine learning papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.