Learning optimal policies from event logs through reinforcement learning: a comparison of deep and MDP-based approaches
Dit artikel stelt een Reinforcement Learning-framework voor Prescriptive Process Monitoring voor, dat optimale gedragsbeleid direct leert van historische event logs om acties aan te bevelen voor het optimaliseren van Key Performance Indicators, waarbij een model-gebaseerde Markov Decision Process-benadering wordt vergeleken met een model-vrije Deep RL-methode en wordt aangetoond dat beide effectief KPI's verbeteren terwijl de model-gebaseerde benadering een superieure computationele efficiëntie biedt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de manager bent van een drukke bank. Elke dag vragen klanten een lening aan. Soms wordt de lening goedgekeurd, soms wordt deze afgewezen, en soms loopt de klant gewoon weg. Je doel is simpel: zoveel mogelijk klanten "Ja" laten zeggen tegen je leningaanbod.
Je hebt echter niet de volledige controle. Je beheert de acties van de bank (zoals het versturen van een aanbod of het vragen om meer informatie), maar je beheert niet de acties van de klant (zoals het besluiten om te accepteren, te weigeren of te stoppen). Het is als het spelen van een spellet evenals schaken waarbij je alleen je eigen stukken kunt bewegen, maar je tegenstander (de klant) zijn zetten doet op basis van zijn stemming.
Dit artikel gaat over het leren van een computer om de beste bankmanager te zijn door te kijken naar oude gegevens van hoe de bank het spel in het verleden heeft gespeeld. Het doel is om de perfecte strategie te bepalen om vaker te winnen.
De twee "Coaches"
De onderzoekers testten twee verschillende manieren (of "coaches") om de computer deze strategie te leren met behulp van Reinforcement Learning (een vorm van AI die leert door middel van vallen en opstaan, maar in dit geval leert uit een geschiedenisboek in plaats van live te spelen).
1. De "Kaartenmaker" (MDP-gebaseerde aanpak)
Deze coach kijkt naar de duizenden eerdere leningaanvragen en probeert een gedetailleerde kaart van het spel te maken.
- Hoe het werkt: Het groepeert vergelijkbare situaties (zoals "Klant vroeg om $10k en wij stuurden een aanbod") en berekent de kansen op wat er daarna gebeurt. Het creëert een duidelijke regelset: "Als je in Situatie A bent, doe dan Actie B."
- De analogie: Stel je een GPS voor die elke weg in een stad heeft in kaart gebracht. Het weet precies welke afslag tot files leidt en welke tot een kortere route. Het bouwt eerst een volledig model van de stad voordat het je vertelt waar je heen moet gaan.
- Het nadeel: Het maken van deze kaart kost wat werk, en als de kaart te gedetailleerd is, kan het in de war raken door zeldzame, vreemde gebeurtenissen. Om dit op te lossen, voegden de onderzoekers een "filter" toe om onbetrouwbare, zeldzame paden in het geschiedenisboek te negeren.
2. De "Diepe Leerling" (Offline Deep RL)
Deze coach probeert geen kaart te maken. In plaats daarvan gebruikt het een superintelligent neuraal netwerk (zoals een brein met vele lagen) om naar het geschiedenisboek te kijken en direct de beste zet te raden.
- Hoe het werkt: Het leest de oude gegevens en probeert verborgen patronen te vinden die een mens of een eenvoudige kaart misschien zou missen. Het leert door de gegevens keer op keer te bekijken.
- De analogie: Stel je een grootmeester bij schaken voor die miljoenen partijen heeft bekeken. Ze hebben geen kaart van het bord nodig; ze "voelen" de juiste zet simpelweg op basis van intuïtie die is opgebouwd door ervaring.
- Het nadeel: Dit "brein" is erg zwaar. Het duurt lang om te trainen en vereist veel rekenkracht, zoals het proberen op te lossen van een gigantische puzzel met een supercomputer.
Het Experiment: De Simulatie-arena
Omdat je niet zomaar slecht advies aan echte klanten kunt geven om te zien wat er gebeurt (dat zou de bank geld kosten), hebben de onderzoekers een virtuele simulatie gebouwd.
- Ze hebben een "videogame"-versie van het leningproces gemaakt.
- Ze lieten de computer het spel duizenden keren spelen met behulp van de strategieën die het heeft geleerd.
- Ze maten de score: Hoeveel winst maakte de bank? (Winst = ontvangen rente minus de tijd besteed aan het verwerken van de lening).
Wat ze vonden
De resultaten waren interessant:
- Beide coaches wonnen: Zowel de "Kaartenmaker" als de "Diepe Leerling" bedachten strategieën die veel beter waren dan de oude, standaard manier van de bank. Ze hielpen de bank beide om meer "Ja"-antwoorden van klanten te krijgen.
- De Kaartenmaker was iets beter: De "Kaartenmaker" (MDP) vond consequent iets betere strategieën, vooral in de lastige, zeldzame situaties. Het was betrouwbaarder in het weten wat er precies moest gebeuren.
- De Kaartenmaker was veel sneller: Dit was het grootste verschil. De "Kaartenmaker" leerde zijn strategie in een kwestie van minuten. De "Diepe Leerling" deed er uren over (of zelfs dagen, afhankelijk van de omvang van de gegevens) om te trainen.
- Analogie: De Kaartenmaker was als een student die een tekstboek bestudeerde en de toets in 10 minuten haalde. De Diepe Leerling was als een student die de hele encyclopedie 100 keer moest herlezen om hetzelfde cijfer te halen.
De Kern van het Verhaal
De paper concludeert dat als je een computer wilt leren hoe hij een bedrijfsproces (zoals leninggoedkeuringen) moet aansturen met behulp van historische gegevens:
- Je hebt niet altijd de meest complexe, zware AI (Deep Learning) nodig.
- Een eenvoudigere aanpak die een duidelijk model van het proces bouwt (MDP) werkt even goed, zo niet beter, en is veel sneller en goedkoper in gebruik.
Het is een herinnering dat soms een goede, duidelijke kaart beter is dan een supercomplexe hersenstructuur, vooral wanneer je gewoon efficiënt een taak wilt volbrengen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.