← Ultimi articoli
💻 computer science

HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

Il documento propone HaWMPO, un framework di ottimizzazione della policy basato su un modello del mondo consapevole delle allucinazioni che migliora le policy robotiche generaliste stimando e sopprimendo le allucinazioni di predizione durante i rollout immaginati, migliorando così significativamente i tassi di successo in compiti di manipolazione complessi a lungo termine sia su benchmark che su robot reali.

Autori originali: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

Pubblicato 2026-09-10
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot capaci di imparare a eseguire una vasta gamma di compiti, dal sovrapporre blocchi al piegare il bucato, sono da tempo un obiettivo dell'intelligenza artificiale. Per raggiungere questo scopo, i ricercatori hanno sviluppato politiche "generaliste", che sono essenzialmente sistemi simili a cervelli addestrati per comprendere il linguaggio e la visione per decidere come un robot debba muoversi. Tuttavia, insegnare questi sistemi nel mondo reale è lento, costoso e rischioso. Ogni volta che un robot tenta una nuova azione, potrebbe rompere qualcosa o danneggiare se stesso, rendendo il processo di tentativi ed errori pericoloso. Per risolvere questo problema, gli scienziati si sono rivolti ai "modelli del mondo" (world models), ovvero simulatori digitali che permettono ai robot di esercitarsi all'interno di un computer. Questi modelli prevedono cosa accadrà dopo in base alle azioni correnti, creando uno spazio sicuro per l'apprendimento. Eppure, questi simulatori digitali non sono perfetti; man mano che prevedono più lontano nel futuro, spesso iniziano a inventare dettagli mai accaduti, un fenomeno noto come "allucinazione". Se un robot impara da questi scenari finti, potrebbe imparare a eseguire azioni che funzionano nel computer ma che falliscono completamente nel mondo reale.

Un team di ricercatori ha sviluppato un nuovo metodo per aiutare i robot a imparare efficacemente da queste simulazioni digitali imperfette senza essere fuorviati dai loro errori. Chiamano il loro approccio HaWMPO, un sistema progettato per rendere i robot consapevoli di quando il loro campo di addestramento digitale sta mentendo loro. Inveve di trattare ogni scenario immaginato come ugualmente prezioso, il nuovo sistema include una componente speciale che agisce come un ispettore del controllo qualità. Questo ispettore osserva la sequenza di immagini che il simulatore genera e assegna un punteggio che indica quanto sia affidabile tale sequenza. Se il simulatore inizia a scivolare nella fantasia, creando immagini che non corrispondono alle leggi della fisica o all'esito previsto, l'ispetto lo segnala. Il sistema utilizza quindi questa informazione per regolare il processo di apprendimento, dicendo efficacemente al robot di ignorare le parti della simulazione che sembrano troppo inaffidabili e di concentrarsi sulle parti che appaiono realistiche.

I ricercatori hanno testato questo metodo utilizzando un insieme standard di compiti robotici in un ambiente informatico chiamato LIBERO, che consiste nello spostare oggetti in posizioni specifiche. Hanno confrontato il loro nuovo sistema con altri metodi che utilizzano modelli del mondo ma che mancano di questa funzione di controllo qualità. I risultati hanno mostrato un chiaro vantaggio per il nuovo approccio. Nella simulazione, il robot che utilizzava il sistema consapevole delle allucinazioni ha raggiunto un tasso di successo del 63,7 percento, che è significativamente superiore al secondo miglior metodo. Il miglioramento è stato particolarmente evidente nei compiti che richiedono ragionamento spaziale e manipolazione di oggetti, dove la capacità del robot di distinguere tra scenari reali e falsi lo ha aiutato a imparare strategie più robuste. I ricercatori hanno scoperto che, penalizzando il robot quando si affidava a scenari altamente allucinati, il sistema ha impedito al robot di apprendere cattive abitudini che funzionerebbero solo in una simulazione difettosa.

Per garantire che questo metodo funzionasse anche al di fuori del computer, il team lo ha testato su un robot fisico in un ambiente del mondo reale. Hanno assegnato al robot due sfide specifiche: posizionare un fazzoletto in una scatola e mettere delle cuffie su un supporto. Senza il nuovo sistema, il robot completava con successo questi compiti circa il 60 percento delle volte nel compito delle cuffie. Dopo l'applicazione dell'addestramento consapevole delle allucinazioni, il tasso di successo è salito a un AUC di 0,8 in media, con il robot che raggiungeva l'85% nel compito del fazzoletto e il 75% in quello delle cuffie. Questo salto nelle prestazioni dimostra che le lezioni apprese nel mondo digitale erano effettivamente trasferibili al mondo fisico, perché il robot aveva imparato a ignorare il rumore digitale che di solito confonde questi sistemi. I ricercatori hanno osservato che il sistema funziona controllando costantemente la coerenza del futuro simulato, assicurando che il robot impari solo dalle traiettorie che appaiono fisicamente plausibili.

Lo studio evidenzia che la chiave per un migliore apprendimento robotico non è solo avere un simulatore, ma avere un modo per fidarsi di esso. Costruendo un sistema in grado di rilevare quando una simulazione perde il contatto con la realtà, i ricercatori hanno creato un percorso più stabile per il miglioramento dei robot. Sebbene gli attuali test siano stati condotti su compiti relativamente brevi, il successo suggerisce che questo approccio potrebbe essere vitale per missioni più complesse e a lungo termine, dove un robot deve pianificare molti passaggi in avanti. Il lavoro conferma che, affinché i robot diventino veri assistenti general-purpose, devono imparare a distinguere tra una previsione utile e una bugia convincente, una capacità che questo nuovo metodo fornisce rendendo il processo di apprendimento stesso consapevole dei propri limiti.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →