← Nieuwste papers
💻 computer science

Closed-Loop Vision-Language Planning for Multi-Agent Coordination

Het artikel introduceert COMPASS, een nieuw multi-agentkader dat Vision-Language-modellen benut voor decentrale planning in een gesloten lus met code-gebaseerde vaardigheidsverfijning en gestructureerde communicatie, en dat state-of-the-art prestaties bereikt op de SMACv2-benchmark door traditionele MARL-baselines aanzienlijk te overtreffen.

Oorspronkelijke auteurs: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep van vijf vrienden probeert te leren een complex, snel tempo spelend videospel spelen zoals StarCraft tegen een team van vijf tegenstanders. De adder onder het gras? Elke vriend kan alleen een klein cirkeltje om zich heen zien. Ze kunnen het hele kaart niet zien, ze kunnen niet vrij praten zonder in de war te raken, en ze moeten binnen een splitseconde beslissingen nemen om te winnen.

Dit is de uitdaging die het artikel aanpakt. Traditionele AI-methoden (zoals "Multi-Agent Reinforcement Learning") zijn als proberen deze vrienden te leren door hen het spel miljoenen keren te laten spelen, in de hoop dat ze uiteindelijk per ongeluk een winnende strategie vinden. Het is traag, verspillend en moeilijk te begrijpen waarom ze een specifieke zet hebben gedaan.

De auteurs introduceren een nieuw systeem genaamd COMPASS. Denk aan COMPASS als een team van vijf vrienden dat wordt begeleid door een super slimme, visueel onderlegde coach (een Vision-Language Model) die het scherm kan zien en de tekstlogboeken kan lezen. Hier is hoe COMPASS werkt, opgesplitst in drie eenvoudige onderdelen:

1. De Coach met een "Vaardigheidsboek" (De Planner & Vaardigheidsbibliotheek)

In plaats dat de coach willekeurige instructies schreeuwt zoals "Ga links!" of "Aanvallen!", heeft de coach een Vaardigheidsbibliotheek. Dit is als een kookboek met vooraf geschreven recepten (Python-code) voor specifieke tactieken, zoals "Focus Fire" (allen aanvallen op dezelfde vijand) of "Kiting" (wegrennen terwijl je schiet).

  • Hoe het leert: De coach begint niet vanaf nul. Het leest eerst een "videoreplay" van een menselijk expert dat het spel speelt (dit is de "warm start"). Het zet die expertbewegingen om in code en plaatst ze in het kookboek.
  • Hoe het zich aanpast: Tijdens het spel, als de coach een situatie ziet waar het huidige recept niet werkt, schrijft het ter plekke een nieuw recept. Bijvoorbeeld, als het team een specifieke veldslag verliest, kan de coach een nieuw script schrijven genaamd "Aggressive Flank" en dit direct aan het boek toevoegen.
  • De lus: De coach kijkt naar het scherm, kiest een recept, de agenten voeren het uit, en vervolgens controleert de coach het resultaat. Als het mislukt, reflecteert de coach, schrijft een beter recept en probeert het opnieuw. Dit is het "gesloten-lus" gedeelte—het blijft in real-time aanpassen.

2. Het "Fluisternetwerk" (Gestructureerde Communicatie)

In veel games raken agenten in de war of verzinnen ze dingen (hallucinaties) als ze gewoon willekeurig kletsen. COMPASS gebruikt een streng "Fluisternetwerk".

  • Het probleem: Agent A ziet een vijand. Agent B zit achter een muur en kan ze niet zien.
  • De oplossing: Agent A fluistert naar Agent C, die fluistert naar Agent B. Dit heet multi-hop propagatie.
  • De analogie: Stel je een spel "Telefoon" voor, maar in plaats van dat het bericht vervormt, geven de agenten nauwkeurige feiten door: "Vijand #1 is 5 meter Oost." Hierdoor kan het hele team een gedeeld mentaal beeld van het slagveld opbouwen, zelfs als geen enkele agent alles kan zien.

3. De "Zelfcorrectie" (Reflectie)

Na elke zet vraagt de coach zichzelf af: "Werkte dat?"

  • Als het team een vijand succesvol omsingelde, zegt de coach: "Groot, bewaar dat recept."
  • Als het team uitgeschakeld werd, zegt de coach: "Dat was te agressief. Laten we een nieuwe regel schrijven om de volgende keer voorzichtiger te zijn."
    Deze constante zelfreflectie stelt het team in staat slimmer te worden naarmate het spel vordert, in plaats van gewoon dezelfde fouten te herhalen.

De Resultaten: Hoe goed presteerden ze?

Het team testte COMPASS op een zeer moeilijke versie van de StarCraft-uitdaging genaamd SMACv2.

  • De grote overwinning: In een specifiek scenario waarbij beide teams 5 Protoss-eenheden hadden (een evenwichtige strijd), won COMPASS 57% van de tijd. De beste vorige AI-methode (QMIX) won slechts 27%. Dat is een enorme sprong.
  • De beperking: Het systeem had moeite met de "Zerg"-ras (een zwerm van snelle, zwakke eenheden). Omdat de coach het scherm bekijkt en elke 10–20 seconden (in speltijd) nieuwe code schrijft, was het te traag voor de Zerg-eenheden, die binnen een splitseconde moeten reageren. Het is als proberen een zwerm bijen te dirigeren met een traag bewegend verkeersagent; de bijen bewegen te snel voor de instructies om bij te houden.

Samenvattend

COMPASS is een systeem dat AI-agenten in staat stelt samen te werken door:

  1. Het spel te lezen als een mens (met behulp van visie en tekst).
  2. Hun eigen instructiehandleidingen (code) te schrijven terwijl ze spelen, beginnend met expertvoorbeelden.
  3. Informatie te delen via een gestructureerde keten zodat iedereen weet wat er gebeurt, zelfs als ze het niet kunnen zien.

Het bewijst dat door het redeneervermogen van grote AI-modellen te combineren met een gestructureerde manier om informatie te delen en code te schrijven, robots (of game-agenten) veel sneller en intelligenter kunnen leren samenwerken dan voorheen—op voorwaarde dat het spel niet te snel beweegt voor de AI om bij te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →