← Ultimi articoli
🤖 machine learning

Reinforcement Learning for Real-Time Vision-Language-Action Policies

Questo articolo introduce Real-Time EXPO-FT, un framework di apprendimento per rinforzo che disaccoppia la generazione di azioni lente ed espressive dall'editing di azioni rapide e reattive per consentire un adattamento efficiente in termini di campionamento e ad alte prestazioni dei grandi modelli Vision-Language-Action alle dinamiche del mondo reale, nonostante la latenza di inferenza.

Autori originali: Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn

Pubblicato 2026-09-17
📖 5 min di lettura🧠 Approfondimento

Autori originali: Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot hanno lottato a lungo per muoversi con la fluidità degli esseri viventi. Sebbene possano essere programmati per seguire un insieme rigido di istruzioni in una fabbrica, il mondo reale è disordinato, imprevedibile e si muove velocemente. Per navigare in questo contesto, i ricercatori si sono rivolti a un tipo di intelligenza artificiale noto come modello visione-linguaggio-azione. Questi sono enormi programmi informatici addestrati su enormi quantità di dati, che permettono loro di capire ciò che vedono attraverso una telecamera, leggere un'istruzione testuale e decidere come muovere un braccio robotico. Sono potenti perché hanno visto così tanti esempi di come funziona il mondo, agendo come una vasta biblioteca di esperienze. Tuttavia, c'è un grosso problema: poiché questi modelli sono così grandi e complessi, impiegano un tempo considerevole per pensare. Nel frazione di secondo che il computer impiega per elaborare un'immagine e decidere un movimento, il mondo fisico è già cambiato. Se un robot sta cercando di afferrare una palla o di bilanciare un oggetto, l'informazione utilizzata per prendere la decisione è già vecchia al momento dell'effettivo movimento, causando spesso il fallimento dell'azione.

Un team di ricercatori dell'Università di Stanford ha sviluppato un nuovo modo per insegnare a questi grandi modelli come agire in tempo reale, anche quando sono lenti a pensare. Il loro approccio, chiamato Real-Time EXPO-FT, risolve il problema del ritardo dividendo il processo decisionale del robot in due parti distinte. Invece di costringere il modello enorme e lento a compiere ogni singolo aggiustamento al secondo, gli permettono di svolgere il lavoro pesante di pianificazione di un percorso generale, mentre un programma informatico molto più piccolo e veloce gestisce le correzioni immediate. Immaginate un direttore d'orchestra che guida un'orchestra; il direttore stabilisce il tempo e la melodia generale, ma i singoli musicisti devono regolare il proprio gioco istantaneamente per rimanere in sincronia. In questo sistema, il modello grande agisce come il direttore, proponendo una sequenza di movimenti basata su ciò che ha visto un momento prima. Poi, un assistente leggero osserva lo stato attuale del mondo e apporta piccole e rapide modifiche a quei movimenti proposti per garantire che siano ancora corretti per l'esatto momento in cui il robot deve agire. Ciò consente al robot di utilizzare la profonda conoscenza del grande modello senza essere frenato dalla sua velocità di pensiero.

I ricercatori hanno testato questo metodo in due ambienti molto diversi: un mondo simulato di fisica e il mondo fisico reale. Nella simulazione, hanno sfidato il robot con dieci diverse attività dinamiche, come bilanciare una palla su un piatto, calciare un pallone da calcio evitando un difensore e afferrare un oggetto in movimento. Hanno confrontato il loro nuovo metodo con diverse tecniche esistenti che cercavano di gestire i ritardi. I risultati sono stati chiari: il nuovo approccio ha permesso al robot di avere successo in quasi tutte le prove, superando tutti gli altri metodi, inclusi quelli che non dovevano affrontare alcun ritardo. Questo è stato un risultato significativo perché ha dimostrato che, insegnando esplicitamente al sistema di tenere conto della propria lentezza, il robot poteva diventare più affidabile rispetto ai sistemi che erano teoricamente più veloci ma meno adattabili.

Per dimostrare che questo funzionava nel mondo reale, il team ha spostato il robot in un ambiente di laboratorio e gli ha assegnato quattro compiti impegnativi che richiedevano una reazione costante e rapida. Questi includevano mantenere in equilibrio una pallina da ping pong su un piatto rotante, raccogliere un blocco da una superficie rotante, afferrare un oggetto passato da un altro braccio robotico e calciare una palla in un gol mentre un difensore si muove intorno. I ricercatori hanno limitato il tempo di addestramento a soli dieci minuti di interazione del robot con l'ambiente, assicurando che il sistema potesse imparare rapidamente senza necessitare di ore infinite di pratica. Prima di applicare il loro metodo, il tasso di successo del robot su questi compiti era piuttosto basso, con una media del 42 percento. Dopo l'uso del nuovo framework di addestramento in tempo reale, il tasso di successo è balzato al 97 percento. Il robot ha imparato ad adattarsi ai movimenti caotici degli oggetti e ai vincoli temporali dei compiti senza alcuna interazione umana durante il processo di addestramento.

Lo studio ha anche esplorato quanto bene il sistema reggesse sotto diverse condizioni. Quando i ricercatori hanno aumentato artificialmente il ritardo nel processo di pensiero del robot, il nuovo metodo ha mantenuto il suo alto livello di prestazione, mentre altri metodi fallivano al crescere del ritardo. Allo stesso modo, quando la velocità degli oggetti in movimento aumentava, il robot che utilizzava questo nuovo framework continuava a avere successo, mentre altri approcci faticavano a tenere il passo. Ciò dimostra che il sistema non funziona solo per una specifica velocità o ritardo, ma è abbastanza robusto da gestire la natura imprevedibile di un ambiente dinamico. I ricercatori hanno osservato che, sebbene il loro sistema sia altamente efficace, esso richiede ancora che un essere umano riposizioni il robot dopo che un compito è terminato, e richiede un modo specifico per definire il successo di ogni compito. Tuttavia, il traguardo fondamentale è la dimostrazione che i grandi e potenti modelli di IA possono essere resi operativi in tempo reale, colmando il divario tra la pianificazione lenta e riflessiva dell'intelligenza artificiale e le richieste rapide e reattive del mondo fisico.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →