← Ultimi articoli
🤖 machine learning

Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics

Questo articolo introduce i Residual Reward Models (RRM), un metodo che decompone la funzione di ricompensa in una componente di conoscenza a priori e un offset residuo apprendibile per migliorare significativamente l'efficienza campionaria e l'applicabilità nel mondo reale del reinforcement learning basato sulle preferenze nella robotica.

Autori originali: Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

Pubblicato 2026-08-28
📖 6 min di lettura🧠 Approfondimento

Autori originali: Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Insegnare a un robot come eseguire un compito fisico complesso, come premere un pulsante o raccogliere un oggetto delicato, è un difficile rompicapo per gli ingegneri. Nel mondo della robotica, la macchina ha bisogno di un insieme di istruzioni che le dicano cosa sta facendo bene e cosa sta facendo male. Questo insieme di istruzioni è chiamato funzione di ricompensa (reward function). Se le istruzioni sono vaghe o errate, il robot potrebbe imparare a aggirare il sistema, trovando un modo per ottenere un punteggio alto senza completare effettivamente il compito, oppure potrebbe semplicemente arrendersi perché non riesce a capire cosa ci si aspetti da lui. Tradizionalmente, gli esseri umani devono scrivere queste istruzioni a mano, ipotizzando quali movimenti porteranno al successo. Questo processo è lento, costoso e spesso fallisce quando il robot incontra una situazione che l'essere umano non aveva anticipato.

Un approccio più recente, noto come apprendimento basato sulle preferenze (preference-based learning), cerca di risolvere questo problema permettendo agli esseri umani di dire semplicemente quale tra due movimenti di un robot sembri migliore, invece di scrivere regole complesse. Sebbene questo sembri più semplice, crea un nuovo problema: il robot ha bisogno di vedere migliaia di questi confronti per imparare qualcosa di utile. In un contesto reale, chiedere a un essere umano di osservare e giudicare un robot così tante volte è impraticabile e costoso. Il robot impara troppo lentamente e il costo dell'attenzione umana diventa un collo di bottiglia che impedisce a queste macchine di essere utili al di fuori di un laboratorio controllato.

Ricercatori dell'Università di Toronto e dell'Università Tsinghua hanno sviluppato un metodo per velocizzare significativamente questo processo. Chiamano il loro approccio Modello di Ricompensa Residua (Residual Reward Model). Invece di partire da zero e chiedere a un essere umano di insegnare al robot tutto partendo dal nulla, questo metodo consente al robot di partire con una "migliore ipotesi" su come il compito debba essere eseguito. Questa ipotesi può derivare da una semplice regola scritta da un ingegnere, da una descrizione generata da un modello linguistico di grandi dimensioni (large language model) o persino da una funzione di ricompensa appresa osservando un essere umano eseguire il compito una sola volta. Il robot utilizza quindi questa ipotesi iniziale come fondamento. Quando un essere umano fornisce una preferenza, dicendo "questo movimento era migliore di quello", il robot non cerca di riscrivere l'intero libro delle regole. Invece, impara solo la piccola differenza, o "residuo", necessario per correggere l'ipotesi iniziale.

Pensate a uno studente che conosce già le regole base di uno sport ma ha bisogno di un allenatore che gli indichi le sfumature specifiche della sua tecnica. Lo studente non ha bisogno di imparare di nuovo come correre o lanciare; deve solo regolare leggermente la sua forma in base al feedback dell'allenatore. Allo stesso modo, il robot utilizza il feedback umano per apportare piccoli e precisi aggiustamenti alla sua comprensione preesistente del compito. Questa struttura mantiene stabile il processo di apprendimento. Se l'ipotesi iniziale è imperfetta, il robot può comunque imparare perché deve solo correggere gli errori piuttosto che scoprire l'intero concetto partendo dal nulla.

I ricercatori hanno testato questa idea in una varietà di ambienti simulati, inclusi compiti in cui un braccio robotico doveva premere pulsanti, spazzare oggetti in un contenitore o sbloccare porte. Hanno testato l'idea anche su un vero robot fisico, un braccio Franka Panda, in un ambiente di laboratorio. In ogni caso, il metodo che utilizzava la "migliore ipotesi" più le piccole correzioni apprese è stato molto più veloce dei metodi che cercavano di imparare tutto solo dalle preferenze umane. Nelle simulazioni, il robot che utilizzava questo nuovo metodo ha raggiunto un tasso di successo perfetto in molti compiti, richiedendo molti meno giudizi umani. Ad esempio, in un compito in cui un robot doveva premere un pulsante, un metodo standard che cercava di imparare da zero si è bloccato a un tasso di successo del venti per cento, mentre il nuovo metodo ha raggiunto il cento per cento.

Lo studio ha anche dimostato che questo approccio è robusto contro gli errori. Se l'ipotesi iniziale era leggermente errata, o se il feedback umano era occasionalmente rumoroso o incoerente, il robot poteva comunque apprendere il comportamento corretto. L'ipotesi iniziale fungeva da rete di sicurezza, impedendo al robot di vagare verso comportamenti inutili, mentre le correzioni garantivano che trovasse comunque la strada giusta. Questo è stato particolarmente importante quando i ricercatori hanno testato il sistema con un feedback umano molto limitato. Anche quando all'essere umano veniva chiesto di fornire solo un numero minimo di giudizi, il robot che utilizzava il metodo residuo continuava a migliorare, mentre il metodo standard non riusciva a imparare nulla di utile.

Forse la cosa più importante è che i ricercatori hanno dimostrato che questo apprendimento può trasferirsi direttamente da una simulazione al computer a un vero robot fisico senza alcuna regolazione aggiuntiva. Hanno addestrato il robot in un ambiente virtuale e poi hanno applicato la politica appresa su un vero braccio Franka Panda per eseguire compiti come raggiungere un oggetto, spingere un blocco o raccogliere qualcosa e spostarlo. Il robot addestrato con il metodo residuo ha avuto successo in questi compiti reali molto più velocemente del metodo di base. In un compito difficile che consisteva nel spingere un oggetto, il metodo standard è riuscito a completarlo solo la metà delle volte dopo un addestramento esteso, mentre il nuovo metodo ha raggiunto un tasso di successo del novantacinque per cento con lo stesso tempo di addestramento.

I risultati suggeriscono che, combinando la conoscenza pregressa con il feedback umano, i robot possono apprendere abilità fisiche complesse con molta meno supervisione umana di quanto precedentemente ritenuto possibile. Questo non significa che il robot sappia tutto in anticipo, ma piuttosto che utilizza ciò che sa come punto di partenza per trarre il massimo da ogni pezzo di feedback umano ricevuto. Questa efficienza potrebbe essere un passo chiave verso la rendere pratici gli assistenti robotici per i lavori del mondo reale, dove il tempo e l'attenzione umana sono risorse limitate. Il lavoro conferma che dare a un robot un vantaggio iniziale, anche se approssimativo, permette di imparare dalle preferenze umane in un modo che è sia più veloce che più affidabile rispetto al partire da una tabula rasa.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →