← Ultimi articoli
🤖 machine learning

Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning

Questo articolo deriva un teorema del gradiente di politica per obiettivi di Cumulative Prospect Theory (CPT) nell'apprendimento per rinforzo a orizzonte finito e propone un algoritmo del primo ordine provabilmente convergente che utilizza le statistiche d'ordine di Monte Carlo per ottimizzare politiche non convesse e sensibili al rischio.

Autori originali: Olivier Lepel, Anas Barakat

Pubblicato 2026-09-09
📖 8 min di lettura🧠 Approfondimento

Autori originali: Olivier Lepel, Anas Barakat

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Gli esseri umani sono notoriamente scarsi nel calcolare il rischio. Non pesiamo le probabilità come un matematico; al contrario, le sentiamo. Tendiamo a temere una piccola possibilità di una perdita terribile molto più di una grande possibilità di una moderata, e spesso inseguiamo una minuscola possibilità di un enorme colpo di fortuna anche quando le prob odds sono contro di noi. Questo non è un glitch nel nostro software; è il modo in cui siamo cablati. Per decenni, economisti e psicologi hanno utilizzato un framework chiamato Teoria del Prospetto Cumulativo per descrivere queste stranezze. Essa suggerisce che giudichiamo i risultati non in base al loro valore assoluto, ma in base a come si confrontano con un punto di riferimento personale, e che distorciamo la probabilità degli eventi, sovrastimando i disastri rari e sottostimando quelli comuni.

Per molto tempo, il campo dell'intelligenza artificiale, specificamente l'apprendimento per rinforzo, ha ignorato queste stranezze umane. In questo campo, un agente impara a prendere decisioni interagendo con un ambiente per massimizzare una ricompensa. L'approccio standard assume che l'agente sia perfettamente razionale, calcolando l'esito atteso medio di ogni possibile percorso e scegliendo quello con il numero più alto. Questo funziona bene per le macchine, ma non riesce a catturare come gli esseri umani si comportano realmente in situazioni complesse e incerte. Quando cerchiamo di costruire un'IA che lavori accanto alle persone o prenda decisioni per loro, un agente puramente razionale agisce spesso in modi che sembrano freddi, irrazionali o semplicemente sbagliati a un osservatore umano. La domanda che i ricercatori si sono posti è se possiamo insegnare alle macchine di pensare più come noi, non solo nelle loro scelte finali, ma nel modo in cui percepiscono il rischio e la ricompensa.

Un team di ricercatori ha ora compiuto un passo significativo verso la risposta a quella domanda. Hanno sviluppato un nuovo framework matematico che permette agli agenti di intelligenza artificiale di ottimizzare il proprio comportamento basandosi sui principi della psicologia umana piuttosto che sul freddo calcolo. In una serie di simulazioni, hanno dimostrato che insegnando a un agente di vedere il mondo attraverso la lente della Teoria del Prospetto Cumulativo, la macchina inizia a esibire gli stessi comportamenti di rischio sfumati e talvolta contraddittori che mostrano gli esseri umani. I ricercatori non si sono limitati a proporre una teoria; hanno costruito un algoritmo pratico capace di apprendere questi comportamenti e hanno dimostrato matematicamente che funziona, offrendo un modo per allineare l'IA alle preferenze umane in ambienti ad alto rischio come la finanza, la sanità e la gestione del traffico.

Il cuore del loro lavoro è un nuovo metodo per insegnare a un agente come apprendere. Nell'apprendimento per rinforzo tradizionale, l'agente cerca di massimizzare la somma delle ricompense che prevede di ottenere. Il nuovo metodo cambia l'obiettivo. Invece di chiedere: "Qual è la ricompensa media?", chiede: "Come percepisce un essere umano questo flusso di ricompense?". Per farlo, l'agente deve prima decidere cosa conta come guadagno e cosa conta come perdita rispetto a un punto di riferimento specifico. Un calo del dolore da un livello sette a cinque potrebbe sembrare una vittoria enorme se il baseline del paziente è sette, ma un miglioramento minore se il suo baseline è due. L'agente applica poi una trasformazione speciale a questi guadagni e perdite, rendendo il dolore di una perdita più pesante della gioia di un equivalente guadagno. Infine, distorce le probabilità, facendo sentire gli eventi rari più probabili e quelli comuni meno probabili, proprio come fa la mente umana.

I ricercatori hanno affrontato un ostacolo significativo nel far funzionare tutto questo. Il panorama matematico creato da queste distorsioni simili a quelle umane è incredibilmente accidentato e complesso. A differenza delle colline lisce e prevedibili della standard ottimizzazione, questo nuovo panorama è pieno di picchi acuti e valli profonde, rendendo difficile per un algoritmo trovare il percorso migliore senza bloccarsi. Inoltre, gli strumenti standard utilizzati per insegnare all'IA come migliorare le proprie decisioni non erano applicabili qui, perché l'obiettivo di apprendimento umano non segue le semplici regole di addizione e linearità su cui si basano la maggior parte degli algoritmi di apprendimento. Il team ha dovuto derivare un insieme completamente nuovo di regole, un "teorema del gradiente della policy", che funge da bussola per l'agente. Questo nuovo teorema fornisce un modo per calcolare la direzione in cui l'agente dovrebbe cambiare il proprio comportamento per migliorare le proprie prestazioni, anche quando tali prestazioni sono misurate da uno standard umano complesso.

Per testare la loro nuova bussola, i ricercatori hanno eseguito una serie di esperimenti. In uno scenario semplice, hanno posto un agente in una situazione in cui doveva scegliere tra una ricompensa piccola e sicura e una ricompensa grande e rischiosa. Un agente razionale standard sceglieva sempre l'opzione con il payout medio più alto, anche se ciò significava rischiare. Un agente avverso al rischio, progettato per evitare l'incertezza, evitava costantemente il rischio. Ma l'agente addestrato con il nuovo framework simile a quello umano ha mostrato qualcosa di più interessante. Quando la scelta coinvolgeva potenziali guadagni, agiva con cautela, preferendo l'opzione sicura. Tuttavia, quando lo scenario veniva invertito per includere potenziali perdite, lo stesso agente diventava improvvisamente audace, scegliendo l'opzione rischiosa per evitare una perdita certa. Questo spostamento di comportamento, noto come effetto riflesso, è un tratto distintivo del processo decisionale umano che i modelli di IA standard faticano a replicare. Il nuovo algoritmo ha catturato questa sfumatura perfettamente, utilizzando le stesse impostazioni interne per entrambi gli scenari.

I ricercatori hanno anche confrontato il loro metodo con approcci esistenti che cercavano di modellare il rischio. Hanno scoperto che i metodi più vecchi, che si affidavano alla stima di ordine zero (essenzialmente indovinare la direzione del miglioramento provando piccoli cambiamenti e vedendo cosa succedeva), faticavano man mano che i problemi diventavano più complessi. Questi metodi diventavano inefficienti e lenti all'aumentare del numero di variabili. Al contrario, il nuovo algoritmo, che utilizza informazioni di primo ordine per calcolare la direzione esatta del miglioramento, scalava molto meglio. È rimasto efficiente anche al crescere della complessità dell'ambiente, suggerendo che potrebbe essere applicato a problemi del mondo reale con molte parti in movimento, come la gestione di una rete elettrica o il trading azionario.

Le implicazioni di questo lavoro vanno oltre i semplici giochi. I ricercatori hanno illustrato come questo approccio possa essere utilizzato in campi critici. In ambito sanitario, ad esempio, un medico che gestisce il dolore cronico di un paziente potrebbe dover bilanciare il sollievo immediato con il rischio di dipendenza a lungo termine. Un'IA standard potrebbe semplicemente minimizzare il punteggio medio del dolore, potenzialmente ignorando la paura del paziente per i sintomi da astinenza. Un agente allineato all'uomo, invece, potrebbe pesare più pesantemente la paura di un effetto collaterale raro ma catastrofico, portando a piani di trattamento che sembrano più sicuri e rispettosi del paziente. Allo stesso modo, in finanza, un agente potrebbe essere tarato per riflettere la specifica tolleranza al rischio di un investitore, non solo regolando un singolo numero, ma cambiando fondamentalmente il modo in cui percepisce la probabilità di crolli o colpi di fortuna del mercato.

Lo studio ha anche chiarito cosa è necessario affinché questi agenti funzionino. I ricercatori hanno osservato che, affinché l'algoritmo funzioni, le preferenze umane — quanto una persona teme una perdita o come distorce le probabilità — devono essere note in anticipo. Queste non vengono apprese dall'agente da zero, ma sono fornite come parte del modello, proprio come si impostano le regole di un gioco. Ciò consente al sistema di essere personalizzato per specifici individui o gruppi. I ricercatori hanno dimostrato che, regolando il punto di riferimento o la sensibilità alle perdite, il comportamento dell'agente può cambiare drasticamente, provando che il sistema è abbastanza flessibile da modellare una vasta gamma di atteggiamenti umani.

Sebbene i risultati siano promettenti, i ricercatori sono cauti nel inquadrare le loro scoperte entro i limiti delle loro simulazioni. Hanno dimostrato che l'algoritmo converge verso una soluzione stabile e che può trovare politiche ottimali in ambienti complessi e non lineari. Hanno dimostrato attraverso le simulazioni che supera i metodi precedenti in termini di velocità e scalabilità. Tuttavia, non hanno ancora implementato questo sistema in un contesto reale, dove vite umane o asset finanziari sono a rischio immediato. Il lavoro rimane un breakthrough teorico e computazionale, una prova di concetto che le macchine possono essere istruite per navigare nel disordinato e irrazionale panorama della percezione del rischio umano.

Il percorso da seguire prevede il perfezionamento di questi modelli e il test in scenari del mondo reale più diversificati. I ricercatori suggeriscono che il lavoro futuro potrebbe concentrarsi sull'apprendimento delle preferenze umane direttamente dai dati, piuttosto che averle pre-programmate, ed estendere la teoria a problemi continui a orizzonte infinito. Vedono anche potenziale nel combinare questo approccio con altri metodi di apprendimento dal feedback umano, creando un sistema ibrido capace di adattarsi alle mutevoli preferenze nel tempo. Per ora, l'impresa rappresenta un ponte tra due mondi: la fredda logica dell'ottimizzazione delle macchine e la calda, spesso contraddittoria, realtà del processo decisionale umano. Offre un modo per costruire un'IA che non si limiti a calcolare il miglior risultato, ma che comprenda cosa quel risultato significhi per le persone che serve.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →