← Nieuwste papers
🤖 machine learning

Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning

Dit artikel leidt een policy gradient theorem af voor Cumulative Prospect Theory (CPT) doelstellingen in finite-horizon reinforcement learning en stelt een bewezen convergerend first-order algoritme voor met behulp van Monte Carlo orde statistieken om niet-convexe risico-gevoelige policies te optimaliseren.

Oorspronkelijke auteurs: Olivier Lepel, Anas Barakat

Gepubliceerd 2026-09-09
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Olivier Lepel, Anas Barakat

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Mensen zijn berucht slecht in het berekenen van risico's. We wegen kansen niet af zoals een wiskundige dat doet; in plaats daarvan voelen we ze. We hebben de neiging om een kleine kans op een vreselijk verlies veel meer te vrezen dan een grote kans op een matig verlies, en we jagen vaak op een minuscule kans op een enorme windfall, zelfs wanneer de kansen tegen ons zijn. Dit is geen fout in onze software; dit is hoe we bedraad zijn. Decennialang hebben economen en psychologen een raamwerk gebruikt genaamd Cumulative Prospect Theory om deze eigenaardigheden te beschrijven. Het suggereert dat we uitkomsten niet beoordelen op hun absolute waarde, maar op hoe ze zich verhouden tot een persoonlijk referentiepunt, en dat we de waarschijnlijkheid van gebeurtenissen vervormen door zeldzame rampen te overschatten en veelvoorkomende gebeurtenissen te onderschatten.

Een lange tijd negeerde het vakgebied van kunstmatige intelligentie, specifiek reinforcement learning, deze menselijke eigenaardigheden. In dit vakgebied leert een agent beslissingen te nemen door interactie met een omgeving om een beloning te maximaliseren. De standaardbenadering gaat ervan uit dat de agent perfect rationeel is, waarbij hij de gemiddelde verwachte uitkomst van elk mogelijk pad berekent en degene kiest met het hoogste getal. Dit werkt goed voor machines, maar het slaagt er niet in te vatten hoe mensen zich daadwerkelijk gedragen in complexe, onzekere situaties. Wanneer we proberen AI te bouwen die samen met mensen werkt of beslissingen voor hen neemt, handelt een puur rationele agent vaak op manieren die voor een menselijke waarnemer koud, irrationeel of simpelweg fout aanvoelen. De vraag die onderzoekers zich hebben gesteld is of we machines kunnen leren om meer zoals wij te denken, niet alleen in hun uiteindelijke keuzes, maar ook in hoe ze risico en beloning waarnemen.

Een team van onderzoekers heeft nu een belangrijke stap gezet richting het beantwoorden van die vraag. Ze hebben een nieuw wiskundig raamwerk ontwikkeld dat kunstmatige intelligentie-agents in staat stelt hun gedrag te optimaliseren op basis van de principes van de menselijke psychologie in plaats van koude berekening. In een reeks simulaties hebben ze aangetoond dat door een agent te leren de wereld te zien door de lens van Cumulative Prospect Theory, de machine begint te vertonen met dezelfde genuanceerde, soms tegenstrijdige risicogedragingen die mensen laten zien. De onderzoekers hebben niet alleen een theorie voorgesteld; ze hebben een praktisch algoritme gebouwd dat deze gedragingen kan leren en bewezen dat het wiskundig werkt, wat een manier biedt voor AI om af te stemmen op menselijke voorkeuren in situaties met hoge inzet, zoals de financiële sector, de gezondheidszorg en verkeersmanagement.

De kern van hun werk is een nieuwe methode om een agent te leren hoe hij moet leren. In traditionele reinforcement learning probeert de agent de som van de beloningen te maximaliseren die hij verwacht te krijgen. De nieuwe methode verandert het doel. In plaats van te vragen: "Wat is de gemiddelde beloning?", vraagt het: "Hoe neemt een mens deze stroom van beloningen waar?" Om dit te doen, moet de agent eerst beslissen wat als een winst en wat als een verlies telt ten opzichte van een specifiek referentiepunt. Een daling in pijn van niveau zeven naar vijf kan aanvoelen als een enorme overwinning als het basisniveau van de patiënt zeven is, maar als een kleine verbetering als het basisniveau twee is. De agent past vervolgens een speciale transformatie toe op deze winsten en verliezen, waardoor de pijn van een verlies zwaarder aanvoelt dan de vreugde van een gelijkwaardige winst. Ten slotte vervormt het de waarschijnlijkheden, waardoor zeldzame gebeurtenissen waarschijnlijker lijken en veelvoorkomende gebeurtenissen minder waarschijnlijk, precies zoals een menselijk brein dat doet.

De onderzoekers liepen een aanzienlijke hindernis op bij het werkend maken hiervan. Het wiskundige landschap dat wordt gecreëerd door deze menselijke vervormingen is ongelooflijk ruig en complex. In tegen tegenstelling tot de gladde, voorspelbare heuvels van standaardoptimalisatie, is dit nieuwe landschap vol scherpe pieken en diepe dalen, wat het moeilijk maakt voor een algoritme om het beste pad te vinden zonder vast te lopen. Bovendien waren de standaardinstrumenten die worden gebruikt om AI te leren hoe ze hun beslissingen kunnen verbeteren, hier niet op van toepassing omdat de menselijke doelfunctie niet de eenvoudige regels van optelling en lineariteit volgt waar de meeste leeralgoritmen op vertrouwen. Het team moest een volledig nieuwe set regels afleiden, een "policy gradient theorem", die fungeert als een kompas voor de agent. Dit nieuwe theorema biedt een manier om te berekenen in welke richting de agent zijn gedrag moet veranderen om zijn prestaties te verbeteren, zelfs wanneer die prestaties worden gemeten door een complexe, menselijke standaard.

Om hun nieuwe kompas te testen, hebben de onderzoekers een reeks experimenten uitgevoerd. In een eenvoudig scenario plaatsten ze een agent in een situatie waarin hij moest kiezen tussen een veilige, kleine beloning en een risicovolle, grote beloning. Een standaard, rationele agent koos altijd de optie met de hoogste gemiddelde uitbetaling, zelfs als dat betekende dat hij een gok moest wagen. Een risicomijdende agent, ontworpen om onzekerheid te vermijden, vermeed de gok consequent. Maar de agent die getraind was met het nieuwe menselijke raamwerk, vertoonde iets interessanter. Wanneer de keuze een potentiële winst inhield, handelde hij voorzichtig en gaf hij de voorkeur aan de veilige optie. Echter, wanneer het scenario werd omgedraaid naar een situatie met potentiële verliezen, werd dezelfde agent plotseling gedurfd en koos hij de risicovolle optie om een zeker verlies te vermijden. Deze gedragsverandering, bekend als het reflectie-effect, is een kenmerk van menselijke besluitvorming waar standaard AI-modellen moeite mee hebben om dit te repliceren. Het nieuwe algoritme legde deze nuance perfect vast, door dezelfde interne instellingen voor beide scenario's te gebruiken.

De onderzoekers hebben hun methode ook vergeleken met bestaande benaderingen die probeerden risico te modelleren. Ze ontdekten dat oudere methoden, die vertrouwden op zeroth-order schatting (in essentie de richting van verbetering raden door kleine veranderingen uit te proberen en te kijken wat er gebeurde), moeite hadden naarmate de problemen complexer werden. Deze methoden werden inefficiënt en traag wanneer het aantal variabelen toenam. In contrast hiermee schaalde het nieuwe algoritme, dat gebruikmaakt van first-order informatie om de exacte richting van verbetering te berekenen, veel beter. Het bleef efficiënt, zelfs naarmate de complexiteit van de omgeving groeide, wat suggereert dat het toegepast kan worden op real-world problemen met veel bewegende delen, zoals het beheren van een elektriciteitsnet of het handelen in aandelen.

De implicaties van dit werk reiken verder dan eenvoudige spellen. De onderzoekers illustreerden hoe deze aanpak gebruikt kan worden in kritieke velden. In de gezondheidszorg bijvoorbeeld, kan een arts die de chronische pijn van een patiënt beheert, een balans moeten vinden tussen onmiddellijke verlichting en het risico op langdurige afhankelijkheid. Een standaard AI zou simpelweg de gemiddelde pijnscore kunnen minimaliseren, waarbij het potentieel de angst van de patiënt voor ontwenningsverschijnselen negeert. Een mens-gealigneerde agent kan echter de angst voor een zeldzaam maar catastrofaal bijeffect zwaarder laten wegen, wat leidt tot behandelplannen die veiliger en zorgzamer aanvoelen voor de patiënt. Op dezelfde manier kan een agent in de financiële sector worden afgestemd op de specifieke risicotolerantie van een investeerder, niet alleen door een enkel getal aan te passen, maar door fundamenteel te veranderen hoe het de waarschijnlijkheid van marktcrashes of windfalls waarneemt.

De studie verduidelijkte ook wat vereist is om deze agents te laten werken. De onderzoekers merkten op dat voor het functioneren van het algoritme de menselijke voorkeuren — hoeveel een persoon een verlies vreest of hoe zij waarschijnlijkheden vervormen — vooraf bekend moeten zijn. Deze worden niet door de agent vanaf nul geleerd, maar worden als onderdeel van het model verstrekt, vergelijkbaar met het instellen van de regels van een spel. Dit maakt het systeem in staat om op maat gemaakt te worden voor specifieك individuen of groepen. De onderzoekers lieten zien dat door het referentiepunt of de gevoeligheid voor verliezen aan te passen, het gedrag van de agent drastisch kon worden verschoven, wat bewees dat het systeem flexibel genoeg is om een breed scala aan menselijke attitudes te modelleren.

Hoewel de resultaten veelbelovend zijn, zijn de onderzoekers voorzichtig om hun bevindingen binnen de grenzen van hun simulaties te kaderen. Ze hebben bewezen dat het algoritme convergeert naar een stabiele oplossing en dat het optimale policies kan vinden in complexe, niet-lineaire omgevingen. Ze hebben via simulaties aangetoond dat het oudere methoden overtreft in termen van snelheid en schaalbaarheid. Ze hebben echter nog niet een dergelijk systeem ingezet in een live, real-world setting waar menselijke levens of financiële activa direct in het geding zijn. Het werk blijft een theoretische en computationele doorbraak, een bewijs van concept dat machines kunnen leren navigeren door het rommelige, irrationele landschap van menselijke risicoperceptie.

De weg vooruit houdt in dat deze modellen worden verfijnd en getest in meer diverse, real-world scenario's. De onderzoekers suggereren dat toekomstig werk zich kan richten op het direct leren van menselijke voorkeuren uit data, in plaats van ze vooraf te programmeren, en het uitbreiden van de theorie naar continue, oneindige horizon-problemen. Ze zien ook potentieel in het combineren van deze aanpak met andere methoden van leren van menselijke feedback, waardoor een hybride systeem ontstaat dat kan adapteren aan veranderende voorkeuren in de loop van de tijd. Voor nu staat de prestatie als een brug tussen twee werelden: de koude logica van machine-optimalisatie en de warme, vaak tegenstrijdige realiteit van menselijke besluitvorming. Het biedt een manier om AI te bouwen die niet alleen de beste uitkomst berekent, maar begrijpt wat die uitkomst betekent voor de mensen die het dient.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →