Risk-Aware Preference Learning for Stochastic Outcomes
Dit artikel toont aan dat het integreren van Cumulative Prospect Theory om menselijke risicosensitiviteit te modelleren de herstel van beloningsfuncties aanzienlijk verbetert en spijt vermindert bij voorkeursleren voor stochastische robotnavigatie vergeleken met traditionele aannames van verwachte nut.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij zich als een beleefde mens moet gedragen. Je kunt niet zomaar een lange lijst met regels schrijven zoals "sla mensen niet" of "loop snel", want het leven is rommelig en vol verrassingen. In plaats daarvan hebben wetenschappers een slimme truc gevonden: laat de robot op twee verschillende manieren bewegen en vraag aan een mens: "Welke ziet er beter uit?" Door dit duizenden keren te doen, kan de robot een verborgen "scorekaart" leren van wat mensen werkelijk waarderen. Dit wordt voorkeursgebaseerd beloningsleren genoemd.
Echter, er schuilt een lastige aanname op de achtergrond van de meeste van deze studies. Het gaat ervan uit dat mensen als perfecte rekenmachines zijn die simpelweg de goede en slechte delen van een situatie bij elkaar optellen, waarbij ze rekening houden met de waarschijnlijkheid van elk deel. Dit wordt Verwachte Nut genoemd. Maar echte mensen zijn geen rekenmachines; wij zijn emotioneel. We maken ons veel te veel zorgen over zeldzame rampen (zoals een auto-ongeluk) en we haten het meer om dingen te verliezen dan dat we ervan houden om dingen te winnen. Dit artikel stelt een simpele vraag: wat gebeurt er als we een robot trainen met een model dat ervan uitgaat dat mensen perfecte rekenmachines zijn, terwijl de mensen in werkelijkheid risicomijdend en emotionele besluitvormers zijn?
De onderzoekers aan de University of Colorado Boulder besloten dit idee te testen in een gesimuleerde wereld waarin een robot door een menigte voetgangers moet navigeren. In deze wereld is elke beweging die de robot maakt niet één enkele, gegarandeerde route. In plaats daarvan is het alsoer het gooien met een dobbelsteen: de robot kan soepel glijden, of hij kan tegen iemand aanbotsen, of hij kan vast komen te zitten. De uitkomst is een wolk van mogelijkheden, geen rechte lijn.
Het team stelde een digitale experiment op met twee soorten "leraren" (de mensen van wie de robot de voorkeuren probeert te leren). De ene leraar was een "perfecte rekenmachine" die alleen om de gemiddelde uitkomst gaf (Verwacht Nut). De andere leraren waren "risicosensitieve" mensen die een complex psychologisch model gebruikten genaamd Cumulatieve Prospect Theorie (CPT). Dit model houdt rekening met het feit dat echte mensen zeldzame, enge gebeurtenissen overschatten en de pijn van een botsing veel scherper voelen dan de vreugde van een soepel pad.
De onderzoekers trainden vervolgens twee soorten "studenten" (de leeralgoritmen). De ene student ging ervan uit dat de leraar een perfecte rekenmachine was (de EU-leerling), terwijl de andere student een risicosensitieve mens was (de CPT-leerling). Ze voedden beide studenten duizenden "welk pad is beter?" vragen gegenereerd door de leraren en keken hoe goed ze de ware scorekaart leerden.
Dit is wat ze vonden in hun simulaties. Wanneer de leraar een perfecte rekenmachine was, leerde de rekenmachine-student perfect, terwijl de risicosensitieve student een beetje in de war raakte door de extra complexiteit. Maar wanneer de leraar een risicosensitief mens was, presteerde de rekenmachine-student aanzienlijk slechter. De student probeerde de angst van de mens voor zeldzame crashes te verklaren door de herstelde scorekaart te vervormen, waardoor de robot dacht dat botsingen slechts "een beetje slecht" waren in plaats van "catastrofaal", wat resulteerde in een bevooroordeelde beloning. De robot leerde een minder nauwkeurige les.
In contrast hiermee presteerde de risicosensitieve student (de CPT-leerling) veel beter. Het realiseerde zich dat de mens niet alleen de waarde van de uitkomst anders waardeerde, maar dat de mens de onzekerheid anders meeweegt. Door de "waarde" van de uitkomst te scheiden van de "angst" voor het risico, herstelde de CPT-leerling een scorekaart met een aanzienlijk lagere fout dan de rekenmachine-leerling.
Het artikel suggereert dat als we willen dat robots veilig en afgestemd zijn op menselijke waarden in de echte wereld — waar zeldzame ongelukken eng zijn en mensen van nature angstig zijn over hen — we niet simpelweg kunnen aannemen dat mensen logische machine-wezens zijn. We moeten robots bouwen die de menselijke angst en risicosensitiviteit begrijpen, anders leren ze misschien gevaarlijke kortere wegen te nemen omdat ze denken dat wij de risico's niet erg vinden. Hoewel dit resultaat voortkomt uit computersimulaties en nog niet uit echte mensen die echte robots testen, wijst het bewijs op een duidelijke noodzaak: om robots te leren hoe ze veilig moeten zijn, moeten we eerst leren hoe mensen zich werkelijk voelen over het onbekende.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.