Coachable agents for interactive gameplay
Dit artikel presenteert een raamwerk dat universele waarde-functiebenaderers combineert met gespecialiseerde trainings-technieken om real-time, door de gebruiker gecontroleerde "stijl"-modificaties voor reinforcement learning-agenten mogelijk te maken over diverse domeinen zoals videogames en robotica, waarbij wordt gewaarborgd dat zij de taakprestaties behouden terwijl ze zich aanpassen aan specifieke gedragspreferenties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljant, superintelligent videogamepersonage of een robot hebt die getraind is om te winnen. Meestal zijn deze AI-systemen als eliteatleten die één specifieke manier van winnen tot in de perfectie hebben beheerst: de absoluut snelste, meest efficiënte manier. Als je hen vraagt een kamer op te ruimen, doen ze dat via het meest efficiënte pad mogelijk. Als ze een raceauto besturen, nemen ze elke keer weer de perfecte racelijn.
Maar wat als je niet "perfect" wilt? Wat als je wilt dat ze rijden als een roekeloze durfal, de kamer stil opruimen omdat er een baby slaapt, of een videospelbaas bevechten met alleen een specifere soort magie?
Dit artikel introduceert een nieuwe manier om AI-agenten te trainen zodat ze hun stijl ter plekke kunnen veranderen ("on the fly"), zonder dat ze vanaf nul opnieuw getraind hoeven te worden.
Hier is de uitleg van hoe ze het hebben gedaan, met behulp van eenvoudige analogieën:
1. Het Probleem: De "One-Size-Fits-All" Atleet
Beschouw een standaard AI-agent als een Formule 1-coureur die één perfecte ronde uit het hoofd heeft geleerd. Ze zijn ongelooflijk snel, maar als je hen vraagt om "als een toerist te rijden" of "agressief te rijden", dan weten ze niet hoe. Ze kennen alleen de ene optimale manier om te winnen. In de echte wereld geven gebruikers vaak om hoe een taak wordt uitgevoerd, niet alleen om het feit dat deze wordt uitgevoerd.
2. De Oplossing: De "Stijlcoach"
De onderzoekers hebben een systeem gebouwd waarbij de AI een hele familie van gedragingen leert in plaats van slechts één. Ze noemen dit "Style-Conditioned" leren.
Stel je een menselijke coach voor die tegen een atleet praat. In plaats van alleen te zeggen "Ren sneller", zegt de coach: "Ren snel, maar houd je armen laag," of "Ren snel, maar neem brede bochten." De atleet leert de hoofdtaken (rennen) uit te voeren, maar past hun secundaire bewegingen (de stijl) aan op basis van de instructies van de coach.
In dit artikel is de "coach" een set instructies die aan de AI wordt gegeven op het moment dat deze begint te spelen. De AI heeft een "regelknop" (een zogenaamde "style vector") waarmee de gebruiker de acties direct kan aanpassen.
3. Hoe ze de AI hebben geleerd (De Trainingsgym)
Om de AI deze stijlen te leren, lieten ze haar niet gewoon normaal spelen. Ze creëerden speciale trainingsscenario's:
- Het Beloningssysteem: Ze gaven de AI twee soorten punten.
- Taakpunten: Punten voor het winnen van de race, het verslaan van de vijand of het vooruit lopen.
- Stijlpunten: Punten voor het doen van iets op een bepaalde manier. Bijvoorbeeld: "Als je vuurpijlen gebruikt, krijg je extra punten," of "Als je langzaam rijdt om brandstof te besparen, krijg je extra punten."
- Het "Universele" Brein: Ze gebruikten een speciaal type AI-brein (een zogenaamde UVFA) dat kan begrijpen dat "Winnen" het doel is, maar dat "Hoe je wint" kan veranderen. Het is als een chef-kok die weet hoe hij een geweldige biefstuk moet maken (de taak), maar die direct kan schakelen tussen het kruiden met zout, peper of truffelolie (de stijl) afhankelijk van wat de klant vraagt.
4. De Drie Testritten
Het team testte dit "Coachable Agent" framework in drie zeer verschillende werelden om te bewijzen dat het overal werkt:
De Raceauto (Gran Turismo 7):
Ze trainden een AI om een raceauto te besturen. Normaal gesproken rijdt de AI om de snelste tijd neer te zetten. Met het nieuwe systeem konden ze de AI vertellen: "Rijd om brandstof te besparen" of "Rijd om banden te sparen."- Het resultaat: De AI leerde langzamer en voorzichtiger te rijden om het brandstofbereik met 60% te verlengen, of om rond bochten te driften voor de stijl, terwijl ze nog steeds de race voltooiden. Ze kon zelfs de opdracht krijgen om "agressief te rijden" of "voorzichtig te rijden" door simpelweg aan een knop te draaien.
De Videogameheld (Horizon Forbidden West):
Dit was de grote test. De AI speelde als een held die strijdt tegen gigantische robot dieren. Het spel bevat veel wapens, vallen en elementaire krachten (vuur, ijs, elektriciteit).- Het resultaat: De onderzoekers konden de AI vertellen: "Vecht met alleen vallen," of "Gebruik alleen vuurwapens," of "Gebruik niet je sterkste wapen."
- De AI volgde niet alleen blindelings op; ze werd slim. Als de opdracht "IJs" was, koos de AI een zwak ijswapen om de vijand te bevriezen, en schakelde daarna over naar een krachtig wapen om de vijand af te maken terwijl deze bevroren was. De AI leerde om stijlen te combineren, zoals het gebruik van een specifiek wapen en een specifiek elementair effect tegelijkertijd.
De Robotloper (Humanoid):
Ze trainden een digitale robot om over een vloer te lopen.- Het resultaat: Ze konden de robot vertellen om te lopen met een "korte pas" of een "lange pas", en zelfs de houding van de armen te veranderen (zoals het vasthouden van een dienblad of het zwaaien met de armen). De robot kon tussen deze loopstijlen schakelen terwijl hij direct in balans bleef.
5. De Magie van "Runtime" Controle
Het belangrijkste deel van dit artikel is dat de gebruiker niet hoeft te wachten tot de AI een nieuwe stijl heeft geleerd. De AI leert alle stijlen tegelijkertijd tijdens de training.
Wanneer de gebruiker daadwerkelijk speelt of de robot gebruikt, kan de gebruiker de stijl kiezen in real-time.
- Analogie: Stel je een muziekspeler voor. Normaal gesproken moet je een nieuw nummer downloaden om een ander genre te horen. Met dit systeem is de AI als een DJ die elk genre in zijn hoofd heeft. Je kunt op een knop drukken en de AI schakelt direct van "Jazz" (rustig, veilig rijden) naar "Rock" (snel, agressief rijden) zonder de muziek te stoppen.
Samenvatting
Het artikel laat zien dat we AI-agenten flexibel kunnen maken. In plaats van een rigide robot die slechts één manier kent om dingen te doen, kunnen deze "Coachable Agents" hun persoonlijkheid en strategie ter plekke aanpassen. Of het nu gaat om een raceauto die brandstof bespaart, een videogameheld die specifieke wapens gebruikt, of een robot die met een bepaalde tred loopt: de gebruiker bepaalt hoe de taak wordt uitgevoerd, niet alleen dát deze wordt uitgevoerd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.