Tackling Decision Processes with Non-Cumulative Objectives using Reinforcement Learning
Dit artikel introduceert een algemene mapping die Non-Cumulative Markov Decision Processes (NCMDP's) transformeert naar standaard MDP's, waardoor de directe toepassing van bestaande reinforcement learning-technieken mogelijk wordt om willekeurige beloningsfuncties te optimaliseren en een verbeterde prestatie en trainingsefficiëntie over diverse taken aantoont.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van kunstmatige intelligentie bestaat er een krachtig raamwerk dat wordt gebruikt om machines te leren hoe ze beslissingen moeten nemen. Stel je een robot voor die leert lopen, een computerprogramma dat een videospel onder de knie krijgt, of een handelsalgoritme dat een aandelenportefeuille beheert. Deze systemen werken door een reeks acties te ondernemen, één na de andere, als reactie op hun omgeving. Bij elke beweging ontvangt het systeem een signaal, vaak een beloning genoemd, dat aangeeft of die actie goed of slecht was. Decennialang was de standaardregel voor succes in deze scenario's simpel: maximaliseer de totale som van alle verzamelde beloningen over een bepaalde tijd. Als een robot een klein punt krijgt voor elke stap vooruit, is het doel om aan het einde van de reis zoveel mogelijk punten te verzamelen. Deze benadering, bekend als een Markov-beslissingsproces, is ongelooflijk succesvol geweest en heeft alles gestuurd, van industriële robots tot zelfrijdende auto's.
De werkelijkheid is echter vaak ingewikkelder dan een simpel scoreblad. Soms is de belangrijkste uitkomst niet de totale hoeveelheid goede dingen die zijn gebeurd, maar het slechtste moment dat heeft plaatsgevonden, of de consistentie van de prestaties over een bepaalde tijd. Denk aan een ruimtevaartuig dat op een planeet landt. Het doel is niet alleen om veilig te landen; het is om te garanderen dat het vaartuig tijdens de gehele afdaling nooit een gevaarlijke snelheid overschrijdt, ongeacht hoe soepel de rest van de vlucht was. In de financiële wereld geeft een investeerder misschien minder om de totale winst die gedurende een jaar is gemaakt, en meer om de mate waarin die winst fluctueerde, waarbij men streeft naar een stabiel rendement in plaats van een riskante gok. Deze scenario's omvatten wat onderzoekers niet-cumulatieve doelstellingen noemen, waarbij de eindscore afhangt van een specifieke functie van de gehele geschiedenis van beloningen, zoals de maximale waarde die bereikt is of de ratio van de gemiddelde winst ten opzien van de volatiliteit. Tot nu toe was het moeilijk om kunstmatige intelligentie te leren deze complexe, geschiedenisafhankelijke doelen te optimaliseren, wat vaak aangepaste algoritmen vereiste die lastig toe te passen waren op nieuwe problemen.
Een team van onderzoekers van het Max Planck Instituut voor de Wetenschap van het Licht en de Friedrich-Alexander-Universität Erlangen-Nürnberg heeft een algemene oplossing ontwikkeld voor dit probleem. Ze ontdekten een manier om deze complexe, niet-cumulatieve uitdagingen te vertalen naar het standaardformaat dat bestaande, krachtige instrumenten voor kunstmatige intelligentie al kennen. In plaats van een nieuw type leeralgoritme vanaf nul uit te vinden, hebben zij een brug geslagen. Ze toonden aan dat door de manier waarop de machine zijn huidige situatie waarneemt en hoe hij zijn directe feedback berekent licht te wijzigen, elk complex doel kan worden omgezet in een standaard "som van beloningen"-probleem. Dit stelt onderzoekers in staat om de meest geavanceerde, kant-en-klare leersoftware van vandaag te gebruiken en deze direct toe te passen op problemen die voorheen buiten bereik lagen, zonder de software zelf te hoeven aanpassen.
De kern van hun methode houdt in dat de kunstmatige agent een beetje meer geheugen krijgt. In een standaardopstelling heeft een agent alleen zijn huidige staat nodig om een beslissing te nemen. Maar wanneer het doel afhangt van de gehele geschiedenis van beloningen — zoals het onthouden van de hoogste snelheid die tot nu toe is bereikt — moet de agent die informatie met zich meedragen. De onderzoekers stelden een systeem voor waarbij de "staat" van de agent wordt uitgebreid met een lopende samenvatting van het verleden, zoals de hoogste of laagste beloning die tot dat moment is gezien. Tegelijkertijd pasten ze de directe beloning aan die de agent bij elke stap ontvangt. In plaats van een beloning te krijgen die simpelweg de huidige actie weerspiegelt, ontvangt de agent een berekende waarde die, wanneer deze over de hele reis wordt opgeteld, het complexe doel perfect reconstrueert. Bijvoorbeeld, als het doel is om de maximale snelheid te minimaliseren, wordt de agent op een manier beloond die hem alleen straft wanneer hij een nieuw snelheidsrecord vestigt, waardoor het "minimum van de maxima"-probleem effectief wordt omgezet in een standaard som.
Deze benadering werd getest over een breed scala aan moeilijke taken, wat de veelzijdigheid ervan bewees. In een simulatie van een maanlander trainden de onderzoekers een agent om een ruimtevaartuig te laten landen terwijl de maximale snelheid strikt werd beperkt. Ze vergeleken hun methode met een standaardbenadering die probeerde het doel te benaderen door aan het einde van de vlucht een straf toe te voegen. De nieuwe methode, die de snelheidslimiet als een continu onderdeel van het leerproces behandelde, vond een veel betere balans tussen veilig landen en efficiënt bewegen. In de wereld van de financiën pasten ze de techniek toe op portefeuilleoptimalisatie, waarbij het doel is om de Sharpe-ratio te maximaliseren — een maatstaf voor risico-gecorrigeerd rendement die de gemiddelde winst deelt door de volatiliteit van die winsten. Eerdere methoden moesten vertrouwen op ruwe benaderingen van deze ratio. Door gebruik te maken van de nieuwe mapping, konden de agents leren om de exacte ratio direct te maximaliseren, wat resulteerde in aanzienlijk betere beleggingsstrategieën tijdens de training.
De onderzoekers verkenden ook discrete optimalisatieproblemen, zoals het vinden van de meest efficiënte arrangement van kwantumlogische poorten of het vereenvoudigen van complexe diagrammen die worden gebruikt in quantum computing. In deze taken is het doel vaak om de enkelvoudige beste staat te vinden die tijdens een lange zoektocht is bereikt, in plaats van de som van alle verbeteringen die onderweg zijn gemaakt. Hierdoor konden de agents in deze nieuwe methode gedurfder verkennen. Omdat de agent niet werd gestraft voor tijdelijke tegenslagen die nodig waren om later een betere oplossing te bereiken, leerde hij sneller en vond hij kwalitatief betere oplossingen dan agents die getraind werden met standaard cumulatieve beloningen. In één experiment met betrekking tot kwantumfoutcorrectie verbeterde de nieuwe methode de prestaties met een aanzienlijke marge, waarbij betere oplossingen werden gevonden in minder tijd.
De kracht van dit werk ligt in de eenvoud en algemeenheid ervan. De onderzoekers hebben geen nieuw leeralgoritme gecreëerd; ze hebben een vertaallaag gecreëerd. Dit betekent dat elke expert in een specifiek vakgebied, van robotica tot financiën, hun bestaande probleem kan nemen, deze mapping kan toepassen en onmiddellijk de krachtigste tools voor reinforcement learning kan gebruiken. De methode werkt zowel in voorspelbare omgevingen als in omgevingen vol willekeurige ruis, en het gaat zowel met eenvoudige als complexe doelen om. Hoewel de onderzoekers opmerkten dat het uitgebreide geheugen dat de agent vereist het probleem iets groter kan maken, zijn moderne deep learning-technieken goed in staat om hiermee om te gaan. Het resultaat is een verenigd raamwerk dat de barrière tussen complexe, echte doelstellingen en de geavanceerde instrumenten van kunstmatige intelligentie wegneemt, wat de deur opent voor machines om strategieën te leren die voorheen te moeilijk te definiëren waren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.