Risk-Aware Preference Learning for Stochastic Outcomes
Questo articolo dimostra che l'incorporazione della Cumulative Prospect Theory per modellare la sensibilità al rischio umano migliora significativamente il recupero della funzione di ricompensa e riduce il rimpianto nell'apprendimento delle preferenze per la navigazione robotica stocastica rispetto alle tradizionali assunzioni di utilità attesa.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di cercare di insegnare a un robot come comportarsi come un essere umano educato. Non puoi semplicemente scrivere una lunga lista di regole come "non colpire le persone" o "cammina velocemente", perché la vita è disordinata e piena di sorprese. Invece, gli scienziati hanno trovato un trucco astuto: mostrare al robot due modi diversi di muoversi e chiedere a un essere umano: "Quale dei due sembra migliore?". Facendo questo migliaia di volte, il robot può apprendere una "scheda di valutazione" nascosta di ciò che gli esseri umani realmente valorizzano. Questo è chiamato apprendimento della ricompensa basato sulle preferenze (preference-based reward learning).
Tuttavia, un'ipotesi complicata si nasconde sullo sfondo di gran parte di questi studi. Essa assume che gli esseri umani siano come calcolatori perfetti che si limitano ad aggiungere le parti buone e quelle cattive di una situazione, pesandole in base a quanto sia probabile che accadano. Questo è chiamato Utilità Attesa (Expected Utility). Ma i veri esseri umani non sono calcolatori; siamo emotivi. Ci preoccupiamo troppo per i disastri rari (come un incidente stradale) e odiamo perdere le cose molto più di quanto amiamo guadagnarle. Questo articolo si pone una domanda semplice: cosa succede se insegniamo a un robot usando un modello che assume che gli esseri umani siano calcolatori perfetti, quando gli esseri umani sono in realtà decisori avversi al rischio ed emotivi?
I ricercatori dell'Università del Colorado Boulder hanno deciso di testare questa idea in un mondo simulato in cui un robot deve navigare attraverso una folla di pedoni. In questo mondo, ogni mossa che il robot compie non è un singolo percorso garantito. Invece, è come lanciare un dado: il robot potrebbe scivolare fluidamente, oppure potrebbe urtare qualcuno, o potrebbe rimanere bloccato. L'esito è una nuvola di possibilità, non una linea retta.
Il team ha predisposto un esperimento digitale con due tipi di "insegnanti" (gli esseri umani le cui preferenze il robot cerca di apprendere). Un insegnante era un "calcolatore perfetto" che si preoccupava solo dell'esito medio (Utilità Attesa); l'altro era un essere umano "sensibile al rischio" che utilizzava un complesso modello psicologico chiamato Teoria del Prospetto Cumulativa (Cumulative Prospect Theory - CPT). Questo modello tiene conto del fatto che le persone reali sovrastimano la probabilità di eventi rari e spaventosi e percepiscono il dolore di una collisione molto più intensamente rispetto alla gioia di un percorso fluido.
I ricercatori hanno poi addestrato due tipi di "studenti" (gli algoritmi di apprendimento). Uno studente assumeva che l'insegnante fosse un calcolatore perfetto (lo studente EU), mentre l'altro assumeva che l'insegnante fosse un essere umano sensibile al rischio (lo studente CPT). Hanno fornito a entrambi gli studenti migliaia di domande del tipo "quale percorso è migliore?" generate dagli insegnanti e hanno osservato quanto bene imparassero la vera scheda di valutazione.
Ecco cosa hanno scoperto nelle loro simulazioni. Quando l'insegnante era un calcolatore perfetto, lo studente calcolatore imparava perfettamente, mentre lo studente sensibile al rischio rimaneva un po' confuso dalla complessità aggiuntiva. Ma quando l'insegnante era un essere umano sensibile al rischio, lo studente calcolatore otteneva prestazioni significativamente peggiori. Cercava di spiegare la paura umana per le collisioni rare distorcendo la scheda di valutazione recuperata, facendo pensare al robot che le collisioni fossero solo "un po' brutte" invece che "catastrofiche", risultando in una ricompensa distorta. Il robot imparava una lezione meno accurata.
Al contrario, lo studente sensibile al rischio (lo studente CPT) otteneva prestazioni molto migliori. Si è reso conto che l'insegnante non stava solo valutando l'esito in modo diverso; stava pesando diversamente l'incertezza. Separando il "valore" dell'esito dalla "paura" del rischio, lo studente CPT ha recuperato una scheda di valutazione con un errore sostanzialmente inferiore rispetto allo studente calcolatore.
L'articolo suggerisce che, se vogliamo che i robot siano sicuri e allineati ai valori umani nel mondo reale — dove gli incidenti rari sono spaventosi e le persone sono naturalmente ansiose riguardo ad essi — non possiamo limitarci ad assumere che gli esseri umani siano macchine matematiche logiche. Dobbiamo costruire robot che comprendano la paura e la sensibilità al rischio umane, altrimenti potrebbero imparare a prendere scorciatoie pericolose perché pensano che a noi non importi del rischio. Sebbene questo risultato derivi da simulazioni al computer e non ancora da test su persone reali con robot reali, l'evidenza punta verso una necessità chiara: per insegnare ai robot come essere sicuri, dobbiamo prima insegnare loro come gli esseri umani si sentono realmente di fronte all'ignoto.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.