← Nieuwste papers
🤖 machine learning

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

Dit artikel introduceert Visual Inspection of Policies (VIP), een nieuw open-eind multi-agent reinforcement learning-framework dat een Video Language Model gebruikt om beleidsvideo's te analyseren en effectieve curricula te genereren, waarmee het zowel tekstgebaseerde als op scalaire scores gebaseerde methoden op de StarCraft Multi-Agent Challenge overtreft.

Oorspronkelijke auteurs: Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

Gepubliceerd 2026-07-10
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een squad videogame-personages probeert te leren hoe ze een chaotische strijd in StarCraft kunnen winnen. In het verleden moesten coaches (de algoritmen) raden wat ze de volgende stap moesten leren op basis van een simpel scoreformulier: "Hadden ze gewonnen? Ja of Nee." Als ze verloren, nam de coach aan dat de taak te moeilijk was. Als ze wonnen, nam de coach aan dat ze klaar waren voor het volgende niveau.

Maar hier is het probleem: soms verliest een team een strijd terwijl ze bijna perfect speelden. Missale hadden ze een enorme numerieke voorsprong, maar raakte een van hun eenheden in paniek en rende weg, wat een kettingreactie veroorzaakte die de wedstrijd deed verliezen. Een coach die alleen naar het "Winst/Verlies"-scoreformulier kijkt, zou denken: "Oh, ze zijn verschrikkelijk op deze kaart," en zou hen misschien overzetten naar een makkelijkere, saaie kaart. De coach zou missen dat het team eigenlijk bijna bij een doorbraakstrategie was.

Dit is waar de nieuwe methode, genaamd Visual Inspection of Policies (VIP), om de hoek komt kijken. In plaats van alleen een rapportcijfer te lezen, huurt VIP een superintelligente AI-coach in die ook daadwerkelijk de video van de wedstrijd kan bekijken.

De "Sportcoach"-analogie

Denk aan de oude manier als een coach die alleen een krantenkop leest: "Team verloor." De coach heeft geen idee waarom ze verloren. Speelden ze slecht? Maakte de scheidsrechter een fout? Was het weer slecht?

VIP is als een coach die met het team gaat zitten en de wedstrijdbeelden bekijkt. De coach ziet de video en zegt: "Hey, kijk eens naar dit! Ondanks dat ze verloren, gebruikte het team in de eerste helft een briljante strategie. Ze raakten aan het einde gewoon nerveus. Laten we specifiek op deze kaart blijven oefenen zodat ze leren om kalm te blijven."

Door de video te bekijken, ziet de VIP-coach de "veelbelovende" momenten die een simpel scoreformulier mist. Het ziet dat de agents aan het leren zijn, zelfs als de scorebord zegt dat ze hebben verloren.

Hoe het werkt (Het magische recept)

De onderzoekers testten dit idee in de StarCraft Multi-Agent Challenge (SMAC), een complex spel waar teams van digitale troepen tegen elkaar vechten. Hier is het recept dat ze gebruikten:

  1. Het Spel: De AI-agents spelen een ronde StarCraft.
  2. De Opname: Het systeem neemt een video van de strijd op (ongeveer 1 tot 10 seconden lang).
  3. De Coach: Deze video, samen met een klein tekstnotitie die zegt "Win Rate: 10%", wordt gevoed aan een Video Language Model (VLM). Denk aan deze VLM als een robot die de video kan zien en het verhaal van de strijd kan begrijpen.
  4. De Aanbeveling: De robot bekijkt de video en zegt: "Ik zie dat ze beter worden in 'kiting' (wegrennen terwijl ze schieten), maar ze raken in paniek als ze in de minderheid zijn. Laten we ze op deze kaart houden maar het iets moeilijker maken," of "Laten we overgaan naar een nieuwe kaart die deze specifieke zwakte uitdaagt."
  5. De Controle: Omdat robots soms nep-kaartnamen verzinnen (hallucinaties), controleert een simpel "spellingscontrole"-module (een sentence similarity module) de suggestie van de robot om er zeker van te zijn dat het een echte kaart is die in het spel bestaat.

Wat ze vonden (De resultaten)

Het team draaide simulaties om te zien of deze "video-bekijkende" coach beter was dan de oude "scoreformulier-alleen" coaches.

  • De Scoreformulier-coaches faalden: Wanneer ze methoden gebruikten die alleen naar cijfers keken (zoals "Positive Value Loss" of "Max Monte Carlo"), liepen de agents vaak vast. Op de moeilijkste kaarten wonnen deze agents bijna nooit (winstpercentages nabij 0%). Ze werden steeds naar de verkeerde taken gestuurd omdat de cijfers het hele verhaal niet vertelden.
  • De Tekst-alleen Coach was oké: Ze probeerden een versie waarbij de robot alleen een tekstuele samenvatting van het spel las (zonder video). Dit was beter dan het scoreformulier, maar bleef moeite hebben.
  • De VIP Coach Won: Wanneer de robot de video kon bekijken, leerden de agents veel sneller.
    • Op een moeilijke kaart genaamd 3s vs 4z bereikten de VIP-agents een winrate van ~84% na fine-tuning.
    • Op 3s5z bereikten ze ~76%.
    • In contrast hiermee bleef de tekstversie (zonder video) steken op 0% op de 3s vs 4z kaart.

De paper suggereert dat de video het "geheime ingrediënt" was. Het stelde het systeem in staat om te zien dat de agents dicht bij een winnende strategie waren, zelfs toen ze de wedstrijd verloren.

Wat ze uitsloten

De paper is zeer duidelijk over wat niet zo goed werkt als VIP:

  • Alleen naar cijfers kijken: Methoden die vertrouwen op enkel scalaire scores (zoals "hoeveel punten hebben ze gekregen?") zijn te bot. Ze missen de nuance van hoe de agents spelen.
  • Alleen tekst lezen: Het samenvatten van het spel in woorden (zonder de video te tonen) is niet genoeg. De visuele aanwijzingen van paniek, coördinatie of slimme tactieken gaan verloren in een tekstuele samenvatting.
  • De toekomst voorspellen: De paper spreekt zich uit tegen methoden die proberen het "leervermogen" van een taak te voorspellen zonder daadwerkelijk het gedrag van de agent te zien.

Hoe zeker zijn ze?

De auteurs zijn zelfverzekerd over deze resultaten, maar ze benadrukken dat dit simulaties zijn.

  • Ze voerden 5 onafhankelijke tests (seeds) uit voor elke methode om er zeker van te zijn dat de resultaten niet op geluk berustten.
  • Ze gebruikten een lichte, open-source robotbrein (VideoLLaMa2-7B) die slechts ~1% van de totale computertijd in beslag nam. De andere 99% was de game-training zelf. Dit bewijst dat het video-bekijken het proces niet vertraagde.
  • Ze vergeleken VIP met een "supervised" methode die een enorme grid search gebruikte (het proberen van 1.700 verschillende instellingen) om de perfecte leraar te vinden. Hoewel de grid search-methode (MAPPO*) op twee kaarten iets beter was, was VIP 100 keer efficiënter in termen van de stappen die nodig waren om te leren. VIP bereikte vergelijkbare resultaten op één kaart (3s5z) met veel minder pogingen.

De Kernboodschap

De paper suggereert dat als je AI-agents wilt leren om echt goed te worden in complexe, multi-agent games, je niet alleen naar het scorebord moet kijken. Je moet de game bekijken. Door een AI-coach de video van het gedrag van de agents te laten inspecteren, kun je een curriculum (een leertraject) creëren dat perfect is afgestemd op wat de agents daadwerkelijk kunnen, waardoor ze winnende strategieën ontdekken die anders verborgen zouden blijven.

Het is het verschil tussen een coach die alleen de eindstand kent en een coach die de beelden bekijkt, het potentieel ziet en precies weet welke oefening hij de volgende keer moet laten doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →