← Ultimi articoli
💻 computer science

ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control

ViBe è un framework di post-training parametrico-efficiente che adatta i tracker di movimento per il controllo percettivo del corpo intero di umanoidi tramite l'innesto di feedback visivi rilevanti per il compito attraverso adapter a basso rango, abilitando un robusto trasferimento zero-shot sim-to-real attraverso diversi compiti di locomozione e manipolazione.

Autori originali: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

Pubblicato 2026-09-10
📖 7 min di lettura🧠 Approfondimento

Autori originali: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot che camminano e si muovono come gli esseri umani sono da tempo un obiettivo dell'ingegneria, ma insegnare loro a farlo nel mondo reale è un enigma composto da due parti distinte. Primo, c'è la capacità di imitare il movimento umano, una competenza che i ricercatori hanno padroneggiato addestrando le macchine a copiare vaste librerie di dati sul movimento umano. Questi "tracker" sono eccellenti nel seguire uno script, muovendo le loro membra in modi naturali e fluidi su terreni piatti e prevedibili. Tuttavia, sono progettati intenzionalmente per essere ciechi rispetto al loro ambiente; non vedono un marciapiede, una palla o una scatola. Secondo, c'è la capacità di percepire il mondo e reagire ad esso. Tradizionalmente, gli ingegneri hanno risolto questo problema costruendo un sistema separato che agisce come un pianificatore: osserva l'ambiente, decide cosa il robot debba fare e poi dice al tracker cieco di eseguire quel piano. Questa separazione funziona, ma crea un divario. Il tracker non può effettuare piccoli aggiustamenti istantanei, come spostare un piede per evitare una roccia o schivare un oggetto in arrivo, perché è in attesa di istruzioni dall'alto. Gli manca i riflessi visivi che permettono a un essere umano di inciampare e recuperare senza pensare.

Un team di ricercatori della University of Southern California ha sviluppato un nuovo modo per colmare questo divario, permettendo a un robot di vedere e reagire direttamente mentre si muove. Chiamano il loro sistema ViBe, un metodo che prende un robot già addestrato a camminare come un essere umano e gli conferisce la capacità di adattare i suoi movimenti in base a ciò che vede, senza dover imparare di nuovo a camminare da zero. Inveve di costruire un nuovo cervello o un nuovo pianificatore, hanno inserito un'interfaccia piccola ed efficiente tra gli occhi del robot e i suoi muscoli. Questa interfaccia impara a individuare i dettagli visivi specifici che contano per un compito — come il bordo di un marciapiede o la posizione di una palla — e alimenta direttamente il sistema di movimento del robot con tali informazioni. Il risultato è una macchina in grado di eseguire compiti complessi e dinamici nel mondo reale, come correre il parkour su un terreno irregolare, schivare una palla lanciata o riorientare un cubo nella mano, il tutto mantenendo il naturale movimento umano che le era stato originariamente insegnato.

I ricercatori sono partiti da un robot che aveva già imparato a tracciare perfettamente il movimento umano su terreno piano. Questo robot era "cieco" nel senso che non usava immagini della telecamera per guidare i suoi passi; seguiva semplicemente una sequenza prestabilita di movimenti. Per dotarlo della vista, il team ha collegato un sistema visivo pre-addestrato, che aveva già imparato a riconoscere oggetti e scene da milioni di immagini. Tuttavia, mostrare semplicemente un feed video al robot non era sufficiente; il robot doveva sapere quali parti dell'immagine fossero importanti. Un muro di pixel contiene troppe informazioni, e la maggior parte di esse è irrilevante per il compito di camminare o schivare. Il team ha progettato un piccolo modulo, un estrattore, che agisce come un filtro. Esso osserva la posizione corporea attuale del robot e il compito che sta cercando di compiere, poi usa questo contesto per scansionare l'immagine della telecamera e selezionare solo gli indizi visivi più utili. Se il robot sta cercando di saltare un marciapiede, l'estrattore si concentra sul bordo del marciapiede. Se sta cercando di prendere una palla, si concentra sulla traiettoria della palla.

Questa informazione visiva selezionata viene poi iniettata nel sistema di movimento del robot attraverso una tecnica che modifica solo una frazione minuscola delle impostazioni interne del robot. I ricercatori hanno mantenuto il tracker del movimento originale congelato, preservando la sua andatura naturale e umana, e hanno regolato solo i piccoli percorsi che trasportavano i nuovi dati visivi. Questo approccio ha permesso loro di addestrare il robot per compiti specifici utilizzando un metodo chiamato apprendimento per rinforzo (reinforcement learning), in cui il robot impara per tentativi ed errori, ricevendo ricompense per le azioni di successo. Hanno testato questo sistema su quattro sfide molto diverse. In una, il robot doveva camminare e correre su marciapiedi e terreni irregolari, adattando il posizionamento del piede in tempo reale per evitare di inciampare. In un'altra, doveva eseguire il parkour, saltando attraverso spazi e atterrando su superfici strette. Un terzo compito coinvolgeva lo spostamento di oggetti grandi, dove il robot doveva regolare il proprio equilibrio e la presa mentre trasportava una valigia o un cestino della spazzatura. L'ultima sfida era il dodgeball, dove il robot doveva stare fermo, osservare una palla volare verso di sé e muovere il corpo per spostarsi senza cadere.

I risultati hanno mostrato che questo metodo ha funzionato sorprendentemente bene. Quando testato nel mondo reale, il robot ha eseguito questi compiti con un alto grado di successo, spesso eguagliando le prestazioni di sistemi che ricevevano informazioni perfette e privilegiate sull'ambiente che i robot reali non possono avere. Ad esempio, nel compito di parkour, il robot ha navigato con successo ostacoli che hanno causato la caduta e l'incidente di una versione cieca dello stesso robot. Nello scenario del dodgeball, il robot ha imparato a schivare la palla mantenendo l'equilibrio, un'impresa che richiedeva di deviare dalla sua posizione eretta standard in modo controllato e reattivo. I ricercatori hanno anche scoperto che il sistema era robusto; funzionava bene anche quando la luce cambiava dalla luce solare intensa alle condizioni di interni soffuse, o quando i colori degli oggetti cambiavano. Ciò suggerisce che il robot abbia imparato a comprendere la forma e la posizione delle cose piuttosto che limitarsi a memorizzare colori o texture specifiche.

Per dimostrare che il robot stava realmente reagendo a ciò che vedeva, i ricercatori hanno confrontato il loro sistema con una versione che non poteva vedere. Il robot cieco, nonostante avesse lo stesso addestramento di base sul movimento, falliva nel percorrere i marciapiedi o nell'evitare gli ostacoli, spesso andando fuori rotta o collidendo con oggetti. La versione con la visione, invece, effettuava correzioni locali precise al proprio movimento. Regolava il posizionamento del piede per atterrare su un marciapiede, spostava il peso per trasportare un oggetto pesante e muoveva il corpo per evitare una palla. Questi non erano grandi manovre pre-pianificate, ma piccoli aggiustamenti immediati che avvenivano mentre il robot si muoveva. Il team ha anche dimostato che questa adattabilità visiva poteva essere combinata con un semplice pianificatore di alto livello. In un compito in cui il robot doveva riorientare un cubo in modo che una faccia colorata specifica fosse rivolta verso l'alto, un pianificatore molto basilare sceglieva semplicemente una sequenza di movimenti. Il sistema visivo del robot gestiva poi il lavoro difficile di trovare il cubo, afferrarlo e regolare la presa per rendere l'azione un successo, anche se il cubo si trovava in una posizione leggermente diversa da quella prevista.

Lo studio evidenzia un cambiamento significativo nel modo in cui i robot possono essere istruiti per interagire con il mondo. Invece di addestrare un robot da zero per ogni nuovo compito, o fare affidamento su complessi sistemi di pianificazione separati, è possibile prendere un robot che sa già come muoversi e dargli la capacità di vedere e reagire. I ricercatori hanno dimostrato che mantenendo intatte le competenze di movimento fondamentali e addestrando solo la piccola connessione tra visione e azione, potevano creare un robot che è sia naturale nel movimento sia capace di gestire l'imprevedibilità del mondo reale. Sebbene il sistema non sia perfetto e possa talvolta essere confuso da oggetti che si muovono velocemente o da insolite distrazioni visive, rappresenta un passo avanti potente. Dimostra che un robot non ha bisogno di essere insegnato tutto dall'inizio; può imparare ad adattare le sue abilità esistenti a nuove situazioni semplicemente imparando cosa guardare. Questo approccio offre una via pratica verso la creazione di umanoidi che possano muoversi nel nostro mondo con la stessa fluidità e adattabilità che ci aspettiamo da un essere umano.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →