← Nieuwste papers
💬 NLP

Environment-Grounded Automated Prompt Optimization for LLM Game Agents

Dit artikel introduceert een geautomatiseerd, omgevingsgebonden framework dat prompts voor LLM-gameagents iteratief optimaliseert via een multi-agent evolutionaire loop en gedragsanalyse, wat de taakprestaties aanzienlijk verbetert zonder dat model-fine-tuning vereist is.

Oorspronkelijke auteurs: Rean Clive Fernandes, Lukas Fehring, Theresa Eimer, Marius Lindauer, Matthias Feurer

Gepubliceerd 2026-06-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rean Clive Fernandes, Lukas Fehring, Theresa Eimer, Marius Lindauer, Matthias Feurer

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robot hebt (een Large Language Model, of LLM) die je wilt leren hoe hij een videogame moet spelen. De robot is ongelooflijk intelligent, maar het is alsof het een genie is dat nog nooit een gamecontroller heeft gezien. Als je het slechts een vage instructie geeft zoals "Ga naar de rode bal", kan de robot in de war raken, tegen muren aanlopen of de bal op de verkeerde plek laten vallen.

Normaal gesproken besteden mensen uren aan het handmatig schrijven en bijsturen van de instructies (de zogenaamde "prompts") om de robot goed te laten werken. Dit artikel introduceert een systeem genaamd RAPOA dat dit proces automatiseert. Het is alsof je de robot een coach geeft die hem ziet spelen, precies uitzoekt waar hij de fout in ging, en de instructiehandleiding onderweg herschrijft totdat hij een professional is.

Hier is hoe het systeem werkt, onderverdeeld in eenvoudige concepten:

1. Het splitsen van de hersenen (Het "Tweepersoonsteam")

In plaats van één robot alles tegelijk te laten doen (naar het scherm kijken, het plan bedenken en de knoppen indrukken), heeft de auteur de taak verdeeld in twee gespecialiseerde rollen:

  • De Beschrijver (De Ogen): Dit deel van de robot kijkt alleen naar het gamescherm en vat samen wat belangrijk is voor het doel. Het maakt zich geen zorgen over wat de volgende stap is; het zegt alleen: "Hé, er is een paarse deur twee stappen links van je, en deze is vergrendeld."
  • De Actor (De Handen): Dit deel neemt die samenvatting en beslist welke knop er ingedrukt moet worden. Het denkt: "Oké, ik moet naar links gaan, een sleutel vinden en dan de deur openen."

Dit is als het hebben van een navigator in een auto die alleen vertelt waar de bochten zijn, terwijl een aparte chauffeur zich volledig concentreert op het sturen en remmen. Door ze te scheiden, raakt het systeem minder in de war.

2. De Evolutionaire Coach (De "Trial and Error"-lus)

Het systeem raadt niet zomaar nieuwe instructies; het gebruikt een evolutionair proces, vergelijkbaar met hoe natuurlijke soorten evolueren over een lange tijd, maar dan veel sneller.

  • Spelen: De robot speelt het spel.
  • Kijken: Een "Behavior Analyzer" (de coach) bekijkt de beelden van het spel. Als de robot faalt, vraagt de coach: "Heeft de Beschrijver iets gemist? Maakte de Actor een slechte keuze?"
  • Herschrijven: Een "Mutator" (de editor) neemt de feedback van de coach en herschrijft de instructiehandleiding voor het specifieke deel dat faalde.
  • Testen: De robot probeert de nieuwe instructies. Als het beter gaat, worden de nieuwe instructies behouden. Als het slechter gaat, worden ze weggegooid.

3. Het "PutNext" Wonder

Het systeem werd getest op een spel genaamd BabyAI, dat vijf verschillende soorten levels heeft. Eén level, genaamd PutNext, is berucht moeilijk. Het vereist dat de robot een object oppakt, naar een specifieke plek loopt en het naast een ander object neerlegt zonder het om te stoten.

  • Vóór: De standaardrobot (zelfs met door mensen geschreven instructies) kreeg dit 0% van de tijd voor elkaar; het kon simpelweg de geometrie van het neerleggen van het object niet begrijpen.
  • Ná: Het geautomatiseerde systeem paste de instructies aan totdat de robot dit in 72,5% van de gevallen correct uitvoerde.

De belangrijkste ontdekking hier was dat het systeem een specifieke regel ontdekte die de mensen over het hoofd hadden gezien: Om een object naast iets te leggen, moet je er vlak naast staan maar er met je rug naartoe gericht zijn, zodat het object in de lege ruimte naast het doel terechtkomt en niet bovenop het doel. Het systeem ontdekte deze regel door de fouten te analyseren en de prompt te herschrijven om deze specifieke geometrische beperking op te nemen.

4. Waarom dit ertoe doet (Zonder de hersenen te veranderen)

Normaal gesproken, om een AI beter te maken in een specifieke taak, moet je de AI "fine-tunen", wat vergelijkbaar is met het volledig hertrainen van de hersenen van een student — een traag, duur en energieverslindend proces.
Dit artikel laat zien dat je de hersenen niet eens hoeft te hertrainen. Je moet alleen de juiste set instructies vinden. Door het zoeken naar die instructies te automatiseren, hebben ze een standaard AI-model aanzienlijk beter laten presteren zonder ook maar één getal binnen het model te veranderen.

Samenvattende Analogie

Beschouw het AI-model als een zeer getalenteerde maar onervaren acteur.

  • De Oude Manier: Een regisseur (mens) probeert het script te schrijven, maar het duurt eeuwen voordat de teksten kloppen.
  • De Nieuwe Manier (RAPOA): Je huurt een regisseur in die een filmploeg bij zich heeft. De crew filmt de acteur, een AI-editor bekijkt de beelden, ziet precies waar de acteur struikelde, en herschrijft direct het script voor de volgende opname. Na 20 pogingen levert de acteur een perfect optreden, niet omdat hij een nieuwe vaardigheid heeft geleerd, maar omdat het script hem eindelijk precies vertelde wat hij moest doen.

Het artikel bewijst dat voor complexe, interactieve taken, het automatisch optimaliseren van de instructies een krachtige manier is om betere resultaten te behalen zonder de onderliggende AI-modellen te hoeven veranderen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →