Superhuman AI for Generals.io Using Self-Play Reinforcement Learning
Dit artikel presenteert een superhumane AI-agent voor het realtime strategische spel Generals.io die de #1-positie op de publieke leaderboard bereikt door een JAX-native simulator met een versnelling van 10.000x te benutten om efficiënte end-to-end training van een vision transformer-policy via self-play reinforcement learning mogelijk te maken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een digitaal slagveld voor genaamd Generals.io. Het is een real-time strategisch spel waarbij twee commandanten (of teams) legers aansturen op een raster. Ze kunnen niet het hele landkaart tegelijk zien; ze zien alleen het land dat ze bezitten en de directe omgeving rond hun troepen. De rest is verborgen in een "fog of war" (mist van oorlog). Het doel is simpel: de vijandelijke hoofdkwartier (de Generaal) veroveren terwijl je je eigen beschermt.
Dit artikel beschrijft hoe een team van onderzoekers een AI heeft gebouwd die zo goed is in dit spel, dat het de allerbeste menselijke spelers ter wereld heeft verslagen. Hier is het verhaal van hoe ze het deden, onderverdeeld in eenvoudige concepten.
1. De "Super-Snelheid" Simulator
Voordat ze de AI konden trainen, hadden ze een manier nodig om te oefenen. In het verleden was het trainen van AI op dit spel als proberen te leren autorijden door te kijken naar een auto die één inch per uur beweegt. Het was te traag.
De onderzoekers bouwden een nieuwe "simulator" (een digitale versie van het spel) met behulp van een speciale tool genaamd JAX. Denk hierbij aan de upgrade van een fiets naar een supersonische straaljager.
- De Oude Manier: De vorige versie kon ongeveer 3.500 spelstappen per seconde draaien op een standaard computer.
- De Nieuwe Manier: Hun nieuwe versie draait 50 miljoen stappen per seconde op een enkele grafische kaart.
- Het Resultaat: Dit is een versnelling van 10.000x. Dit betekent dat de AI miljoenen spellen kan spelen in de tijd die een mens nodig heeft om één spel te spelen. Deze snelheid verwijderde de grootste flessenhals: de AI kon eindelijk snel genoeg leren om echt goed te worden.
2. De "Self-Play" Trainingskamp
In plaats van de AI te onderwijzen door video's van menselijke experts te laten zien (wat is als het leren spelen van schaken door alleen grootmeesterpartijen te tonen), lieten ze de AI tegen zichzelf spelen.
- De Methode: De AI speelt miljoens spellen tegen kopieën van zichzelf.
- De Beloning: Het spel is erg simpel: je wint (+1 punt) of je verliest (-1 punt). Er zijn geen "troostprijzen" of punten voor het doden van een paar vijandelijke soldaten. Je krijgt pas een beloning als je de vijandelijke Generaal verovert.
- De Uitdaging: Omdat de beloning zo zeldzaam is (je krijgt hem pas aan het einde van een lang spel), is het moeilijk voor de AI om te begrijpen wat hij goed heeft gedaan. Het is als proberen te leren een taart te bakken door alleen het eindproduct te proeven, zonder feedback of je te veel suiker of te weinig bloem hebt toegevoegd.
3. Het Geheime Recept: Wat Werkte Eigenlijk?
De onderzoekers testten veel verschillende "recepten" om te zien wat de AI supermenselijk maakte. Ze ontdekten dat sommige dingen die mensen noodzakelijk achtten eigenlijk nutteloos waren, terwijl een paar simpele trucjes het verschil maakten.
- Geen "Spiekbriefjes" Nodig: Ze hadden geen complexe regels of handmatig afgestelde beloningen nodig voor het doen van "goede" dingen (zoals het veroveren van een kasteel). Gewoon het simpele "Winst of Verlies" signaal was genoeg, dankzij de supersnelle simulator.
- De "Gemiddelde" Student (EMA): In veel AI-systemen gebruik je de allerlaatste versie van de AI die de training heeft voltooid. De onderzoekers ontdekten dat het nemen van een Exponential Moving Average (EMA) van de hersenen van de AI over de tijd beter werkte.
- Analogie: Stel je een student voor die elke dag een toets maakt. De "laatste iteratie" is slechts hun score op de laatste dag. De "EMA" is als het nemen van het gemiddelde van hun prestaties over de hele maand. De onderzoekers ontdekten dat de "gemiddelde student" consistenter en slimmer was dan de student op hun beste (of slechtste) dag.
- Filteren van de "Goede" Games (Top-Advantage Filtering): De AI speelde miljoenen games, maar de meeste waren saai of willekeurig. De onderzoekers realiseerden zich dat ze niet van elke game hoefden te leren. Ze hielden alleen de bovenste 25% van de games waarbij de AI een duidelijk voordeel had en leerden van die.
- Analogie: Als je probeerd te leren zwemmen, hoef je niet naar elk moment te kijken waarop je wild in het water spartelt. Je hoeft alleen de momenten te bestuderen waarop je soepel en efficiënt zwom. Dit maakte het trainen veel sneller en efficiënter.
- Klein Beginnen: Ze begonnen de AI niet op een enorme kaart. Ze begonnen met de Genera's heel dicht bij elkaar, zodat de AI kon leren hoe hij snel kon winnen. Daarna brachten ze de Genera's langzaam verder uit elkaar, waardoor de AI stap voor stap kon leren over langetermijnstrategie.
4. De Resultaten: De Mensen Verslaan
Na het trainen voor vier dagen op krachtige computers, ging de AI (genaamd "Average Joe") naar de publieke ranglijst.
- Ranglijst: Het bereikte de #1 positie van meer dan 5.000 menselijke spelers.
- Het Gat: Het versloeg de tweede menselijke speler met een enorme marge. Sterker nog, het gat tussen de AI en de tweede menselijke speler was even groot als het gat tussen de tweede menselijke speler en de 25e menselijke speler.
- Directe Confrontatie: Wanneer ze direct tegen de top twee menselijke spelers speelden, won de AI 199 games en verloor hij er slechts 70.
- Tegen de Oude Bots: Het verpletterde ook de vorige beste AI en de beste "regelgebaseerde" bot (die wiskundige formules gebruikt in plaats van leren) met een perfect winpercentage van 100%.
5. Wat de AI "Zag"
De onderzoekers keken in de hersenen van de AI om te zien of hij dacht zoals een mens.
- De "Mist" Detector: Ze vonden één specifiek deel van de hersenen van de AI dat leek te volgen waar de vijandelijke Generaal zich verborg.
- De Analogie: Stel je voor dat je een spelletje verstoppertje speelt in het donker. In het begin denk je dat de persoon overal zou kunnen zijn. Naarmate je een geluid hoort of een schaduw ziet, beperk je de mogelijkheden tot een paar plekken. Uiteindelijk zie je ze. De hersenen van de AI deden precies dit: ze begonnen met een gok, verfijnden deze naarmate ze aanwijzingen verzamelden, en "sloten" zich vervolgens vast op de locatie van de vijandelijke Generaal, zelfs toen ze die niet direct konden zien.
Samenvatting
Het artikel bewijst dat je geen complexe, handmatig ontworpen regels of enorme hoeveelheden menselijke data nodig hebt om een supermenselijke AI voor strategische spellen te creëren. Als je een voldoende snelle simulator hebt en een simpele "Winst of Verlies" beloning, kan een standaard leeralgoritme de rest zelf uitzoeken. De belangrijkste ingrediënten waren snelheid, geduld (het middelen van de resultaten) en het focussen op alleen de meest informatieve games.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.