← Nieuwste papers
🤖 machine learning

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

Het artikel introduceert GROW, een versterkt leerframework dat Groepsrelatieve Beleidsoptimalisatie (GRPO) aanpast voor agents van Vision-Language-modellen in een open wereld door volledige trajecten te ontleden in state-action-stalen om beperkingen in de contextlengte te overwinnen, en dat state-of-the-art prestaties behaalt op meer dan 800 Minecraft-taken.

Oorspronkelijke auteurs: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert een complex videospel spelen zoals Minecraft. De robot heeft een camera (zijn ogen) en kan typen op een toetsenbord en een muis bewegen (zijn handen). Zijn doel is om taken te voltooien zoals "bouw een huis", "goud delven" of "een monster verslaan".

Lange tijd was de beste manier om deze robots te leren Supervised Fine-Tuning (SFT). Denk hierbij aan het tonen van een video van een menselijk expert dat het spel perfect speelt, met de opdracht: "Kopieer precies wat ze deden." Het probleem? Het vinden van uren aan perfect menselijk gameplay is duur, en als de robot de video gewoon uit het hoofd leert, raakt hij in de war zodra het spel iets verandert.

Vervolgens probeerden onderzoekers Reinforcement Learning (RL), specifiek een algoritme genaamd GRPO. Dit is alsof je de robot het spel laat spelen, laten falen, laten slagen en laten leren uit de resultaten. Echter, standaard GRPO had een groot gebrek bij toepassing op open-world games: het behandelde de hele gamesessie als één enkele les.

Het Probleem: De "Te Lange" Les

Stel je voor dat je probeert te leren hoe je een taart bakt.

  • Standaard GRPO is alsof je een boek van 500 pagina's krijgt dat het verhaal van je kindertijd, het weerbericht van drie dagen geleden, het recept en het verhaal van de hond van je buurman bevat, allemaal door elkaar gemengd. Het vertelt je: "Je hebt aan het einde een goede taart gebakken, dus alles in dit boek van 500 pagina's was goed."
  • In het artikel wordt dit de "full trajectory" (volledige traject) genoemd. Naarmate de robot Minecraft speelt, wordt de geschiedenis van wat hij zag en deed langer en langer. Uiteindelijk wordt het "boek" zo enorm en vol met irrelevante ruis (zoals tien minuten rondlopen voordat je een blok vindt) dat de robot overweldigd raakt en niet meer kan uitzoeken welke specifieke zet daadwerkelijk tot succes leidde.

De Oplossing: GROW (De "Receptkaart"-Aanpak)

De auteurs stellen een nieuw kader voor genaamd GROW (Aligning GRPO with State-Action Modeling).

In plaats van de robot het hele boek van 500 pagina's te geven, snijdt GROW de gamesessie op in kleine, hapklare receptkaarten.

  • State-Action Decomposition: GROW breekt de lange gamesessie op in individuele momenten: "Kijk naar het blok" + "Klik met de muis" + "De pikhouweel raakt".
  • Slimme Feedback: Als de robot aan het einde slaagt, zegt GROW niet "Alles in het hele spel was geweldig". In plaats daarvan kijkt het naar de specifieke kaarten die leidden tot de winst. Het zegt: "De zet die je vijf seconden voordat je het goud vond, maakte was zeer goed. De zet die je twintig minuten geleden maakte toen je gewoon rondliep? Dat was gewoon oké."

Hoe Het Werkt (De Analogie)

Stel je een trainer voor die een voetballer traint.

  • Oude manier (Standaard GRPO): De trainer kijkt de hele 90 minuten durende wedstrijd, ziet de speler een doelpunt maken en schreeuwt toen: "Goed gedaan! Je hebt alles goed gedaan van de eerste minuut tot de laatste!" De speler is in de war omdat hij eigenlijk in de tiende minuut een vreselijke pass maakte die het spel bijna deed verliezen.
  • GROW-methode: De trainer breekt het spel op. "Die pass in de tiende minuut was slordig. Maar die loop die je in de 80e minuut maakte? Perfect. En die trap in de 89e minuut? Brillant." De speler leert precies welke specifieke acties hij moet herhalen.

De "Magische" Wiskunde

Het artikel bevat een wiskundig bewijs (Surrogate Analysis) om ons gerust te stellen dat deze aanpak van "les opknippen" nog steeds geldig is.

  • De Bezorgdheid: Standaard wiskunde voor dit type leren vereist meestal het vergelijken van verschillende pogingen op exact hetzelfde startpunt. GROW vergelijkt verschillende momenten in de tijd, die allemaal verschillend zijn.
  • Het Resultaat: De auteurs bewezen dat, zelfs al zijn de startpunten verschillend, de "score" die de robot krijgt nog steeds nauwkeurig weergeeft hoe goed zijn strategie is. Het is alsof je een student beoordeelt op een wiskundetoets: zelfs als de vragen verschillend zijn, vertelt de eindscore je nog steeds of ze beter worden in wiskunde.

De Resultaten: Het Spel Verslaan

Het team testte GROW op meer dan 800 verschillende Minecraft-taken, variërend van het navigeren door grotten tot het maken van voorwerpen en het vechten tegen monsters.

  • Succespercentage: GROW presteerde aanzienlijk beter dan eerdere methoden. Bijvoorbeeld, bij "GUI-taken" (het gebruik van de menu's van het spel om voorwerpen te maken), steeg het succes van ongeveer 39% naar 68%.
  • Efficiëntie: De robot won niet alleen vaker; hij won ook sneller. Het kostte minder stappen om taken te voltooien omdat hij leerde de "ruis" te negeren en zich te concentreren op de zetten die echt belangrijk waren.
  • Generalisatie: De robot memoriseerde niet alleen de specifieke spellen waar hij op oefende. Hij leerde algemene vaardigheden (zoals hoe je naar een doel zoekt of hoe je een menu gebruikt) die hem in staat stelden om te slagen in nieuwe, onbekende taken die hij nog nooit had gezien.

Samenvattend

GROW is een slimmere manier om AI-agenten open-world games te leren spelen. In plaats van hen te overweldigen met lange, rommelige geschiedenissen van hun volledige gamesessies, breekt het het spel op in kleine, duidelijke stappen. Dit helpt de AI om precies te begrijpen welke acties tot succes leiden, waardoor het sneller leert, beter speelt en nieuwe uitdagingen aankan zonder in de war te raken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →