← Ultimi articoli
💻 computer science

SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

SWIM è un framework basato sulla comprensione visione-linguaggio che consente ai robot continui morbidi di eseguire manipolazioni interattive complesse dell'intero corpo, integrando una policy VLA basata sulla diffusione con la Propriocezione Visiva Morbida per generare sequenze di attuazione eseguibili che sfruttano la compliance intrinseca per una robusta esecuzione fisica.

Autori originali: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

Pubblicato 2026-09-16
📖 5 min di lettura🧠 Approfondimento

Autori originali: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Nel mondo della robotica, esiste una distinzione netta tra le macchine costruite con telai metallici rigidi e quelle realizzate con materiali morbidi e flessibili. I robot rigidi, come le braccia che si vedono nelle fabbriche di automobili, si muovono con una certezza precisa e pre-programmata, ma faticano quando devono infilarsi in spazi stretti o manipolare oggetti delicati e irregolari senza schiacciarli. I robot soft, al contrario, sono fatti di materiali conformabili che possono piegarsi, allungarsi e torcersi come tessuto vivente. Questa flessibilità permette loro di avvolgersi attorno agli oggetti e di adattare la propria forma all'ambiente circostante, offrendo una potenziale soluzione per compiti in spazi confinati o per interagire in sicurezza con gli esseri umani. Tuttavia, questa stessa flessibilità crea un nuovo problema: controllare un corpo che può deformarsi in innumerevoli modi è incredibilmente difficile. Quando un essere umano dà un comando semplice come "prendi quello", un robot rigido può calcolare un unico percorso per muovere la mano. Un robot soft, con l'intero corpo capace di cambiare forma, deve capire come contorcersi con tutta la sua struttura per raggiungere lo stesso obiettivo, un compito che richiede di comprendere non solo l'oggetto, ma anche la complessa geometria del robot stesso in tempo reale.

Recentemente, i ricercatori hanno sviluppato un nuovo sistema chiamato SWIM per risolvere questa specifica sfida, insegnando a un robot soft a comprendere il linguaggio e le scene visive per eseguire la manipolazione dell'intero corpo. Il team si è concentrato su un robot a forma di spirale azionato da cavi, simile al modo in cui i muscoli tirano sulle ossa, il che gli permette di arricciarsi, allungarsi e avvolgersi attorno agli oggetti. La difficoltà principale affrontata è stata che i metodi precedenti spesso cercavano di controllare questi robot concentrandosi solo sulla punta del braccio, ignorando la forma complessa del resto del corpo. Questo approccio falliva perché la posizione della punta non descrive appieno come il resto del robot sia piegato o come stia toccando il mondo. Per risolvere il problema, i ricercatori hanno creato un sistema di apprendimento che osserva contemporaneamente l'intera forma del robot, la scena visiva e un'istruzione vocale. Hanno addestrato questo sistema in un ambiente simulato dove il robot poteva esercitarsi migliaia di volte, imparando a prevedere una sequenza di movimenti dei cavi che avrebbe raggiunto un obiettivo, come riporre un oggetto, raggiungere un bersaglio o afferrarlo.

Una chiave innovazione nel loro metodo è una tecnica che chiamano "propriocezione visiva soft". In termini semplici, ciò significa che il robot impara a "vedere" la propria forma corporea da un'immagine della telecamera, integrando la propria conoscenza interna della tensione dei cavi. Durante l'addestramento, il sistema ha utilizzato il vettore attuale della lunghezza dei tendini come input propriocettivo per comprendere la propria configurazione, pur mostrando anche le coordinate esatte di diversi punti lungo il corpo del robot nella simulazione. Forzando il modello informatico a prevedere dove si trovassero questi punti, il sistema ha imparato a mantenere una mappa mentale della geometria del robot. Ciò gli ha permesso di capire che, per raggiungere un oggetto specifico, il robot potrebbe dover arricciare la sezione centrale in modo diverso rispetto a quanto farebbe per riporre qualcosa. Inoltre, invece di cercare di prevedere un singolo percorso perfetto verso un obiettivo, il sistema ha imparato a prevedere una gamma di possibili movimenti di successo. Questo è fondamentale perché, con un corpo morbido, esistono spesso molti modi diversi per avvolgersi attorno a un oggetto, e il sistema doveva essere abbastanza flessibile da poter scegliere qualsiasi opzione valida piuttosto che incastrarsi in un unico piano rigido.

I ricercatori hanno testato questo approccio in due modi: prima in una simulazione al computer e poi sul robot fisico reale. Nella simulazione, il sistema è stato straordinariamente efficace, completando i compiti di riposizione il 100% delle volte, raggiungendo i bersagli il 96% delle volte e afferrando gli oggetti l'88% delle volte. Questi risultati sono stati significativamente migliori rispetto ad altri metodi che non utilizzavano la consapevolezza della forma del corpo o il modello di previsione flessibile. Tuttavia, la vera prova è arrivata quando hanno spostato il sistema nel mondo reale. Quando hanno provato a far girare il "cervello" del robot direttamente sulla macchina fisica, collegandolo alla telecamera e ai motori in tempo reale, le prestazioni sono crollate drasticamente. Il robot ha fallito l'afferraggio degli oggetti nel 75% dei tentativi, principalmente perché i lievi ritardi nell'elaborazione e le differenze tra la simulazione e la realtà hanno causato un comportamento del robot basato su informazioni obsolete.

Per superare questo ostacolo, i ricercatori hanno introdotto una strategia di implementazione intelligente. Invece di chiedere al robot di pensare e reagire in tempo reale mentre si muove, lo fanno pianificare l'intera sequenza di movimenti in una simulazione virtuale prima. Il robot osserva il mondo reale, crea un gemello digitale della scena e poi esegue il compito nella sua mente, generando un elenco completo di comandi. Una volta che questa sequenza completa è pronta, il robot la esegue senza fermarsi per guardare o pensare di nuovo. Poiché il corpo del robot è naturalmente morbido e flessibile, può gestire piccoli urti e variazioni di contatto autonomamente, senza bisogno di una costante correzione informatica. Quando hanno utilizzato questo metodo "pianifica ed esegui", il tasso di successo del robot fisico è tornato a salire al 100% per la riposizione, all'80% per il raggiungimento e al 75% per l'afferraggio. Ciò ha dimostrato che combinando una profonda comprensione della propria forma con una strategia che sfrutta la naturale flessibilità fisica, i robot soft possono essere guidati da un linguaggio semplice per eseguire compiti complessi dell'intero corpo che prima erano fuori portata.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →