← Nieuwste papers
💻 computer science

Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks

Het paper introduceert COSPLAY, een co-evolutieframework waarin een LLM-beslissingsagent samenwerkt met een vaardigheidsbank-agent om herbruikbare vaardigheden te ontdekken en op te slaan, wat leidt tot aanzienlijk betere prestaties in langdurige interactieve omgevingen zoals games.

Oorspronkelijke auteurs: Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha

Gepubliceerd 2026-04-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een videospel speelt, zoals Super Mario of een strategisch bordspel als Diplomacy. Als je een nieuwe speler bent, maak je veel fouten. Je loopt tegen muren aan, valt in gaten of maakt slechte deals met andere spelers. Een slimme speler leert van deze fouten: "Ah, als ik hier spring, val ik. Volgende keer spring ik niet."

Dit is precies wat kunstmatige intelligentie (AI) ook doet, maar dan met een groot probleem: Hoe onthoudt een AI zijn lessen voor de lange termijn?

Deze paper introduceert COS-PLAY, een slimme manier om AI-agenten te laten groeien door niet alleen te spelen, maar ook een persoonlijk "vaardigheden-boekje" te schrijven en te verbeteren.

Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De Vergeten Leraar

Stel je een AI voor als een student die een examen moet doen. Normaal gesproken leert een AI door duizenden keren te oefenen. Maar bij complexe spellen met lange spelrondes (zoals Diplomacy, waar je 20 beurten lang moet plannen) is het lastig.

  • Het probleem: De AI vergeet snel wat ze eerder leerde. Ze heeft geen "boodschappenlijstje" met slimme trucs die ze kan opslaan en later weer gebruiken. Ze probeert elke stap opnieuw uit te vinden, alsof ze elke dag weer de weg naar school moet uitvinden.

2. De Oplossing: COS-PLAY (De Twee-Hoofdige AI)

COS-PLAY lost dit op door twee verschillende "AI-persona's" te laten samenwerken. Je kunt het zien als een Team van een Speler en een Trainer.

De Speler (De Beslissings-Agent)

Dit is de AI die daadwerkelijk het spel speelt.

  • Wat doet hij? Hij kijkt naar het spelbord en vraagt zich af: "Wat moet ik nu doen?"
  • De truc: In plaats van alles zelf te bedenken, kijkt hij in zijn Vaardigheden-Boekje (de Skill Bank). Hij zoekt daar een slimme truc op, zoals "Hoe ik een muur omver haal" of "Hoe ik een bondgenoot overtuig".
  • Het resultaat: Hij speelt slimmer omdat hij al bewezen strategieën gebruikt in plaats van blindelings te klikken.

De Trainer (De Vaardigheden-Agent)

Dit is de AI die niet speelt, maar kijkt naar hoe de speler speelt.

  • Wat doet hij? Hij analyseert de spelrondes van de speler. Als de speler een reeks goede zetten maakt (bijvoorbeeld: eerst verkennen, dan een basis bouwen, dan aanvallen), pakt de Trainer dit op.
  • De magie: Hij schrijft deze reeks zetten op in het Vaardigheden-Boekje als een officiële "truc" met een duidelijke titel en instructies.
    • Voorbeeld: Hij schrijft op: "Truc 'Basis Bouwen': Als je 3 punten hebt, bouw dan eerst een muur voordat je aanvalt."
  • De verbetering: Als de speler een fout maakt, corrigeert de Trainer het boekje. Hij zegt: "Die truc werkte niet altijd, laten we hem aanpassen."

3. De Co-Evolutie: Een Dans van Twee

Het mooiste aan COS-PLAY is dat deze twee elkaar voeden.

  1. De Speler wordt beter door het boekje te gebruiken.
  2. Omdat de Speler beter speelt, leert de Trainer betere patronen te herkennen.
  3. De Trainer maakt het boekje nog slimmer.
  4. De Speler gebruikt het nieuwe boekje en wordt nog slimmer.

Het is alsof je een sporter bent die elke dag traint, en een coach die elke avond de video's bekijkt, de beste bewegingen opschrijft in een trainingsplan, en de volgende dag een aangepast plan geeft. Samen worden ze onverslaanbaar.

4. Wat hebben ze ontdekt?

De onderzoekers hebben dit getest op zes verschillende spellen, van puzzels (2048, Tetris) tot complexe sociale spellen (Avalon, Diplomacy).

  • Resultaat: Zelfs met een relatief klein en goedkoop AI-model (een "8B" model, wat betekent dat het niet de grootste en duurste supercomputer is) haalde COS-PLAY betere resultaten dan de allerbeste, duurste AI's van de wereld (zoals de nieuwste versies van GPT of Gemini).
  • Waarom? Omdat de AI niet alleen "slimmer" is, maar georganiseerd is. Ze heeft een bibliotheek met bewezen strategieën.
  • Bijzonder: In sociale spellen waar je moet bluffen en onderhandelen, bleek COS-PLAY heel goed in het onthouden van wie wat beloofde en wanneer ze die belofte moesten nakomen.

Samenvatting in één zin

COS-PLAY is een systeem waarbij een AI-speler en een AI-trainer samenwerken: de speler gebruikt een groeiend boekje met slimme trucs om het spel te winnen, en de trainer schrijft die trucs continu bij, zodat de AI niet alleen leert, maar ook wijzer wordt naarmate ze meer speelt.

Het is de digitale versie van: "Niet alleen doen, maar ook onthouden hoe je het goed deed."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →