← Nieuwste papers
🤖 AI

Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

Dit artikel introduceert *alem*, een JAX-gebaseerde benchmark voor het evalueren van open einde multi-agent coördinatie in langdurige overlevingstaken, wat onthult dat hoewel grensverleggende LLM's uitblinken in individuele taken, ze aanzienlijk moeite hebben met coördinatie — een duidelijke flessenhals waarbij communicatie cruciaal blijkt en de prestaties sterk variëren tussen modellen.

Oorspronkelijke auteurs: Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Gouk, Elliot J. Crowley, Tim Rocktäschel, Amos Storkey

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Gouk, Elliot J. Crowley, Tim Rocktäschel, Amos Storkey

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een groep ontdekkingsreizigers voor die proberen te overleven in een uitgestrekte, voortdurend veranderende wildernis. Ze moeten hout hakken, steen mijnen, schuilplaatsen bouwen en monsters bevechten. Maar hier is de crux: ze kunnen dit niet zomaar alleen doen. Soms moeten ze een boom op exact hetzelfde moment omhakken om hem te laten vallen. Op andere momenten moet de één een gat beginnen te graven, en de ander moet het binnen enkele seconden voltooien, anders stort het gat in.

Dit paper introduceert een nieuwe "trainingsgrond" genaamd ALEM (wat "wereld" betekent in het Amhaars) om te testen hoe goed AI-agenten kunnen samenwerken in een dergelijk chaotisch, langetermijn-overlevingsspel.

Het Probleem: Solo Sterren vs. Teamspelers

Tot nu toe waren de meeste tests voor AI als solo videogames. Ze vragen: "Kan deze AI een puzzel oplossen?" of "Kan het een doolhof navigeren?". Maar in de echte wereld zal AI in teams moeten werken. De auteurs merkten op dat bestaande tests voor teamwork te simpel waren: ze waren kort, de regels waren vaststaand, of de teamleden hoefden niet veel met elkaar te communiceren.

Ze wilden zien of moderne AI (Large Language Models, of LLM's) om kan gaan met langetermijncoördinatie. Kunnen ze een plan onthouden dat 50 stappen geleden is gemaakt? Kunnen ze met een teamgenoot praten om te zeggen: "Ik ga links, jij gaat rechts"? Kunnen ze zich aanpassen wanneer de situatie verandert?

De Oplossing: ALEM (De Survival Simulator)

De auteurs hebben ALEM gebouwd, een digitale wereld gebaseerd op een spel genaamd Craftax. Denk aan een hoogtechnologische versie van Minecraft of Terraria, maar dan met een twist:

  • Procedurele Generatie: Elke keer dat het spel start, worden de kaart en de specifieke teamwork-uitdagingen willekeurig gegenereerd. Dit voorkomt dat de AI simpelweg de antwoorden "uit het hoofd leert".
  • Het "Coördinatiespectrum": Het spel heeft een draaiknop die bepaalt hoe moeilijk het teamwork is.
    • Makkelijk: Je kunt grotendeels alleen werken.
    • Gemiddeld: Je moet gereedschap aan elkaar doorgeven (zoals het doorgeven van een hamer aan iemand die een muur bouwt).
    • Moeilijk: Je moet in perfecte harmonie handelen, zoals een synchroonzwemteam, anders mislukt de taak.
  • Zachte Specialisatie: In deze wereld kan iedereen elk beroep uitvoeren, maar als je niet de "specialist" bent voor die taak, kun je falen. Dit dwingt het team om ter plekke te bepalen wie wat moet doen.

Het Experiment: 13 AI-agenten vs. De Wereld

De onderzoekers plaatsten 13 verschillende moderne AI-modellen in deze wereld. Ze hebben ze niet geleerd hoe ze moeten spelen; ze hebben ze er gewoon in gedropt (dit wordt "zero-shot" genoemd). Ze trainden ook enkele "robot"-agenten (met behulp van standaard reinforcement learning) om te dienen als een benchmark voor wat mogelijk is.

De resultaten waren verrassend:

  1. De AI worstelde: Gemiddeld behaalden de AI-agenten slechts ongeveer 6% van de mogkelijke score. Ze waren ver verwijderd van het oplossen van het spel.
  2. Slim zijn in je eentje betekent niet slim zijn in een team: Sommige AI-modellen waren erg goed in het uitvoeren van solo-taken (zoals hout verzamelen), maar waren verschrikkelijk in het coördineren. Eén model, GPT-5.4, was erg goed in basis-taken maar faalde jammerlijk wanneer het moest synchroniseren met teamgenoten. Een ander model, Gemini-3.1, was veel beter in teamwork en versloeg zelfs sommige getrainde robot-agenten in de moeilijkste scenario's.
  3. Grootte is niet alles: Grotere AI-modellen (met meer "hersencapaciteit") werkten niet noodzakelijkerwijs beter als team. Soms coördineerde een kleiner model beter dan een gigantisch model.

De "Waarom": Wat maakt teamwork moeilijk?

De onderzoekers hebben de AI-agenten ontleed om te zien wat de oorzaak van de mislukkingen was. Ze vonden drie hoofdingrediënten:

  • Communicatie is essentieel: Wanneer ze de mogelijkheid uitschakelden voor agenten om met elkaar te praten, stortte hun teamwork-score in. De AI-agenten gebruikten de chat om dingen te zeggen als: "Ik ga naar de boom, jij wacht hier," of "Geef me hout." Zonder dit waren ze slechts aan het gokken.
  • Geheugen is voor planning: De AI had een "kladblokje" (een privé notitieblok). De beste presteerders gebruikten dit kladblok om toekomstige plannen op te schrijven (bijv. "Stap 1: Steen mijnen. Stap 2: Oven bouwen"). De zwakkere modellen gebruikten het kladblok alleen om te herhalen wat ze op dat moment zagen, wat niet hielp bij het plannen vooruit.
  • Redeneren helpt: Wanneer de AI werd gedwongen om eerst na te denken voordat er gehandeld werd, presteerde het beter bij zowel solo-taken als teamwork.

De Verrassing van het "Gemengde Team"

De onderzoekers probeerden ook verschillende AI-modellen in één team te mengen (bijv. een Gemini-agent die samenwerkt met een GPT-agent). Ze verwachtten dat het team zo goed zou zijn als het slimste lid. In plaats daarvan presteerde het team op het gemiddelde van de twee. Het blijkt dat een super-slimme teamgenoot niet helpt als de andere teamgenoot het plan of de communicatiestijl niet begrijpt.

De Kernboodschap

Dit paper laat zien dat coördinatie een unieke vaardigheid is die de huidige AI nog niet onder de knie heeft. Alleen omdat een AI goed is in het beantwoorden van vragen of het oplossen van puzzels in zijn eentje, betekent niet dat het in een team kan werken.

ALEM biedt een gecontroleerde manier om deze specifieke "teamwork-bottleneck" te meten. Het laat zien dat om AI te bouwen die echt met mensen of andere AI's kan samenwerken in de echte wereld, we ons minder moeten richten op het simpelweg slimmer maken van ze in solo-taken, en meer op het leren van hoe ze moeten communiceren, samen plannen en elkaar te vertrouwen.

De code voor deze "survival simulator" is nu openbaar beschikbaar zodat andere onderzoekers het kunnen gebruiken en verbeteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →