← Nieuwste papers
💬 NLP

Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective

Dit artikel identificeert "exploration collapse" als een cruciale foutmodus waarbij LLM-agenten het vermogen verliezen om nieuwe oplossingen te ontdekken in onbekende omgevingen tijdens reinforcement learning, en stelt SPA voor, een methode die de prestaties verbetert door de agent eerst te verankeren in staat- en transitievoorspelling via self-experience supervised finetuning voordat er wordt geoptimaliseerd voor beloning.

Oorspronkelijke auteurs: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Gepubliceerd 2026-09-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shiqi Chen, Tongyao Zhu, Zian Wang, Jinghan Zhang, Kangrui Wang, Ruochen Zhou, Siyang Gao, Teng Xiao, Yee Whye Teh, Junxian He, Manling Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een computerprogramma voor dat is ontworpen om te denken en te handelen als een mens, in staat om puzzels op te lossen, virtuele werelden te navigeren of zelfs een webbrowser te gebruiken om informatie te vinden. Deze programma's, bekend als grote taalmodellen, worden getraind op enorme hoeveelheden tekst van het internet, waarbij ze leren voorspellen welk woord volgt in een zin. Wanneer onderzoekers deze modellen vragen om als agenten op te treden—stappen ondernemen om een doel te bereiken—gebruiken ze vaak een methode genaamd reinforcement learning (versterkend leren). Dit is een proces waarbij het model verschillende acties probeert, feedback ontvangt over of het geslaagd of gefaald heeft, en geleidelijk leert om de acties te herhalen die tot succes leiden. Het is een krachtige manier om een machine te leren dingen te doen die niet expliciet zijn geprogrammeerd. Echter, er ontstaat een kritiek probleem wanneer deze agenten in nieuwe, onbekende situaties worden geplaatst. Hoewel ze misschien leren om een specifieke puzzel die ze eerder hebben gezien op te lossen, hebben ze vaak moeite met het uitzoeken hoe ze een compleet nieuwe omgeving moeten verkennen, waarbij ze vast komen te zitten in een nauwe manier van denken die hen verhindert de beste oplossing te vinden.

Een team van onderzoekers zette zich in om te begrijpen waarom deze intelligente agenten falen wanneer ze een het onbekende tegenkomen. Ze ontdekten een specifiek fenomeen dat ze "exploration collapse" (exploratie-instorting) noemen. In eenvoudige termen: wanneer een agent wordt getraind op een nieuwe taak, leert hij vaak slechts één specifiek pad naar succes te vinden en negeert hij vervolgens alle andere mogelijkheden. Hij wordt zo gefocust op dat enkele traject dat hij het vermogen verliest om verschillende benaderingen te proberen. De onderzoekers maten dit door naar twee verschillende scores te kijken: één die bijhoudt of de allerbeste gok van de agent werkt, en een andere die bijhoudt of een van zijn vele verschillende gommen werkt. In vertrouwde taken verbeteren beide scores naarmate de agent leert. Maar in nieuwe, moeilijke omgevingen, zoals een rastergebaseerde puzzel waarbij dozen naar specifieke doelen moeten worden geduwd, stijgt de score voor de enkele beste gok slechts licht, terwijl de score voor het proberen van vele verschillende paden daadwerkelijk daalt. De agent leert meer zelfverzekerd te zijn in een slechte gewoonte in plaats van te leren om flexibeler te zijn. Dit gebeurt omdat de agent de regels van de nieuwe wereld waarin hij zich bevindt niet echt begrijpt; hij gokt zonder een solide fundament.

Om dit op te lossen, ontwikkelden de onderzoekers een nieuwe trainingsmethode genaamd SPA, wat staat voor Self-Experience Agent. In plaats van de agent onmiddellijk te leren hoe hij beloningen kan krijgen, leerden ze hem eerst hoe hij de wereld om zich heen moet begrijpen. Ze gaven de agent de kans om de omgeving op eigen houtje te verkennen, zonder de druk om punten te scoren. Tijdens deze fase werd de agent gevraagd te beschrijven wat hij zag en te voorspellen wat er zou gebeuren als hij een bepaalde actie ondernam. Bijvoorbeeld, als de agent een doos op een specifieke plek zag staan en besloot deze te duwen, moest hij eerst aangeven waar de doos stond en vervolgens voorspellen waar deze terecht zou komen. De onderzoekers gebruikten vervolgens de werkelijke, correcte uitkomsten uit de omgeving om de voorspellingen van de agent te corrigeren, wat de agent effectief leerde wat de natuurwetten waren voor dat specifieke spel. Dit proces creëerde een soort intern kaart of "wereldmodel" in de geest van de agent, waardoor zijn begrip werd verankerd in de realiteit in plaats van in vage gokken.

Zodra de agent dit interne begrip had opgebouwd van hoe de wereld werkt, begonnen de onderzoekers met het standaard trainingsproces om de agent te leren hoe hij moet winnen. De resultaten waren opmerkelijk. In tests op een puzzelspel genaamd Sokoban, waarbij de agent dozen naar doelpunten moest duwen, slaagde de agent met de standaard trainingsmethode slechts ongeveer 25 procent van de tijd. Met de nieuwe methode sprong het succespercentage naar bijna 60 procent. In een andere puzzel die te maken had met een bevroren meer, verbeterde het succespercentage van ongeveer 22 procent naar meer dan 70 procent. Misschien wel het meest verrassend was dat een zeer klein computermodel dat met deze methode was getraind, in staat was om een veel groter, krachtiger model te overtreffen dat met de oude, standaardmethoden was getraind. Het kleine model, dat eerst de regels van het spel had geleerd, was in staat om de complexe puzzels effectiever te navigeren dan het gigantische model dat er alleen maar op heeft geprobeerd te gokken naar een beloning.

De onderzoekers testten ook of deze aanpak werkte op andere soorten taken, zoals een logische puzzel genaamd Sudoku en een gesimuleerde omgeving voor huishoudelijke taken. In elk geval leidde de methode die de agent leerde de staat van de wereld te begrijpen voordat hij probeerde te winnen, tot betere resultaten. Ze ontdekten dat de sleutel tot succes niet alleen het hebben van meer data of een grotere computer was, maar eerder de volgorde waarin het leren plaatsvond. Door de agent te dwingen eerst de structuur van de omgeving te leren, voorkwam hij de valstrik van het instorten in een enkele, breekbare strategie. De agent leerde zijn opties open te houden en meerdere paden te verkennen, omdat hij de gevolgen van zijn acties begreep. Deze aanpak suggereert dat voor kunstmatige intelligentie om echt aan te kunnen passen aan nieuwe en complexe situaties, het eerst een betrouwbaar begrip van de realiteit moet opbouwen voordat het probeert te optimaliseren voor succes. De studie laat zien dat wanneer een agent verankerd is in de werkelijke mechanica van zijn omgeving, hij effectiever kan verkennen en problemen kan oplossen die voorheen buiten bereik lagen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →