Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
Il documento introduce VLAct, un approccio di pre-addestramento continuo incentrato sulla rappresentazione per i modelli Vision-Language-Action che sfrutta dati eterogenei di multi-embodiment per ottenere una trasferibilità e prestazioni superiori attraverso diversi compiti e robot non visti, anche con budget computazionali modesti e dati a valle limitati.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
I robot hanno lottato a lungo per imparare dall'esperienza nel modo in cui lo fanno gli esseri umani. Mentre un bambino può osservare un genitore versare un bicchiere d'acqua e comprenderne il movimento, un robot richiede tipicamente migliaia di istruzioni specifiche e codificate a mano per eseguire la stessa attività. Per anni, gli scienziati hanno cercato di risolvere questo problema fornendo ai robot enormi quantità di dati, sperando che il puro volume potesse insegnare loro come muoversi. Questo approccio si basa su modelli Vision-Language-Action (Visione-Linguaggio-Azione), sistemi informatici in grado di vedere un'immagine, comprendere una frase e decidere un movimento fisico. La convinzione prevalente è stata che, se si raccoglievano semplicemente abbastanza movimenti robotici, il sistema sarebbe diventato naturalmente abbastanza intelligente da gestire qualsiasi situazione. Tuttavia, raccogliere dati robotici è incredibilmente difficile e costoso; a differenza di foto o testi presenti su Internet, i movimenti dei robot devono essere registrati nel mondo fisico reale, spesso da esseri umani che guidano le macchine. Questa scarsità significa che anche i più grandi dataset robotici sono minuscoli e sparsi rispetto alla vastità del mondo fisico.
Un team di ricercatori ha ora proposto una strada diversa per il futuro, suggerendo che la qualità di ciò che un robot impara sia più importante della quantità di dati che vede. Essi sostengono che, invece di limitarsi a memorizzare movimenti specifici, il cervello di un robot debba apprendere una comprensione profonda e flessibile di come gli oggetti e le azioni siano correlati tra loro. Concentrandosi su questa "rappresentazione" — la mappa interna che il robot costruisce del mondo — hanno creato un nuovo metodo di addestramento che permette ai robot di generalizzare molto meglio. Il loro lavoro dimostra che, con un modo più intelligente di insegnare al nucleo centrale del cervello del robot, un sistema può imparare a eseguire compiti complessi su robot che non ha mai visto prima, utilizzando solo una frazione dei dati precedentemente ritenuti necessari.
I ricercatori, operanti sotto il nome di VLAct, sono partiti da una domanda fondamentale: perché i robot non riescono a generalizzare? Quando un robot viene addestrato su un set specifico di movimenti, spesso diventa troppo specializzato, imparando a imitare esattamente i pattern che ha visto piuttosto che comprendere la fisica sottostante del compito. Per investigare su questo, il team ha esaminato come diversi modi di insegnare a un robot influenzassero la sua comprensione interna. Hanno scoperto che, se un robot viene addestrato a prevedere le azioni utilizzando un solo metodo specifico, diventa "bloccato" in quel metodo. È come uno studente che impara a risolvere problemi di matematica usando una sola formula specifica; se l'esame cambia il formato della domanda, lo studente fallisce perché non ha mai appreso il concetto stesso. I ricercatori hanno scoperto che questo "blocco" avviene quando il cervello del robot è costretto a far rientrare la propria conoscenza in una struttura singola e rigida durante l'addestramento.
Per risolvere questo problema, il team ha sviluppato una nuova ricetta di addestramento che mantiene flessibile il cervello del robot. Hanno iniziato con un potente modello vision-language, un tipo di intelligenza artificiale già addestrata su vasti quanti di immagini e testi di Internet, che fornisce una comprensione ampia del mondo. Invece di lasciare che l'addestramento del robot sovrascriva questa ampia conoscenza, hanno protetto gli strati inferiori del cervello che gestiscono il riconoscimento visivo di base. Hanno poi introdotto una tecnica di addestramento unica in cui al robot veniva chiesto di prevedere gli stessi movimenti fisici utilizzando tre diversi metodi matematici simultaneamente. Costringendo il robot a soddisfare tutti e tre i metodi contemporaneamente, i ricercatori hanno impedito che si specializzasse in uno solo di essi. Questo approccio ha garantito che il robot apprendesse una comprensione universale dell'azione, piuttosto che una competenza ristretta legata a un singolo modo di calcolare il movimento.
Inoltre, il team ha affrontato il problema dei diversi corpi robotici. Un robot con due braccia si muove diversamente da un robot con un braccio, e un robot con una pinza si muove diversamente da uno con una mano. I metodi precedenti spesso trattavano queste differenze come problemi separati, addestrando un cervello unico per ogni tipo di robot. Il team VLAct ha invece creato un linguaggio condiviso per il movimento. Hanno insegnato al robot che aprire una pinza su una macchina è lo stesso concetto che aprire una pinza su un'altra, anche se le meccaniche fisiche differiscono. Ci sono riusciti allineando le parti dell'azione che sono fisicamente simili, come l'apertura e la chiusura di una mano, lasciando separate le parti uniche di ciascun corpo robotico. Ciò ha permesso al robot di trasferire ciò che ha imparato su un tipo di macchina a un tipo completamente diverso di macchina che non aveva mai incontrato prima.
I risultati di questo approccio sono stati sorprendenti. Quando testato su una vasta gamma di compiti, il nuovo sistema ha costantemente superato i modelli esistenti, inclusi quelli addestrati su dataset molto più grandi. In un benchmark di simulazione chiamato LIBERO-Plus, che testa quanto bene un robot gestisce cambiamenti di illuminazione, angoli di visuale e posizionamento degli oggetti, il nuovo sistema ha raggiunto un tasso di successo dell'82,6 percento. Questo era significativamente più alto di altri sistemi all'avanguardia, provando che il robot aveva appreso una comprensione robusta del compito piuttosto che limitarsi a memorizzare uno scenario specifico. In un altro benchmark chiamato RoboTwin 2.0, che coinvolge due braccia robotiche che lavorano insieme, il sistema ha raggiunto un tasso di successo del 92,5 percento, superando sistemi industriali su larga scala che si affidano a dati proprietari e massiccia potenza di calcolo.
Forse la prova più convincente della potenza di questo metodo è arrivata da un test che coinvolgeva un robot umanoide completamente nuovo nei dati di addestramento. I ricercatori hanno addestrato il loro sistema su dati provenienti da braccia robotiche standard e poi hanno chiesto al sistema di controllare un robot umanoide con gambe e torso, una macchina che non aveva mai visto prima. Utilizzando solo il 20 percento dei dati tipicamente richiesti per addestrare un robot per questo specifico corpo, il sistema è stato in grado di performare meglio di un modello di base addestrato con il 100 percento dei dati. Ciò suggerisce che il robot avesse appreso un concetto fondamentale di "come muoversi" che poteva essere applicato a qualsiasi corpo, piuttosto che memorizzare semplicemente i movimenti specifici delle braccia su cui era stato addestrato.
I ricercatori hanno anche testato il loro sistema nel mondo reale, utilizzando braccia robotiche fisiche per eseguire compiti come impilare blocchi, pulire tavoli e piegare vestiti. In questi esperimenti nel mondo reale, il sistema ha continuato a superare il modello di base, mostrando maggiore stabilità e precisione. Ha gestito con successo oggetti nuovi che non aveva mai visto prima, come prendere un peperone invece di una carota, e ha gestito compiti complati e multi-fase come raccogliere fagioli e versarli in una ciotola senza saltare passaggi. Il sistema ha inoltre eccelso nel coordinare due braccia per lavorare insieme, come tenere una presa mentre si estrae una spina, dimostrando un livello di sincronizzazione che i modelli precedenti faticavano a raggiungere.
Ciò che rende questo lavoro particolarmente significativo è che è stato ottenuto utilizzando solo dati open-source e una quantità modesta di potenza di calcolo, nello specifico una configurazione con 16 unità di elaborazione grafica (GPU). Questo contrasta con molti dei sistemi con le migliori prestazioni nel campo, che si affidano a dataset proprietari e risorse di calcolo su scala industriale massiccia. I ricercatori hanno dimostrato che, concentrandosi su come il robot rappresenta internamente il mondo, piuttosto che limitarsi a scalare la quantità di dati, è possibile costruire robot più capaci e adattabili. Le loro scoperte suggeriscono che il futuro dell'apprendimento robotico non risiede nella raccolta di flussi infiniti di dati, ma nella progettazione di metodi di addestramento che aiutino il robot a costruire una comprensione più profonda e flessibile del mondo fisico.
Lo studio conclude che il modo in cui un robot viene insegnato è importante quanto ciò che gli viene insegnato. Preservando la vasta conoscenza di un cervello pre-addestrato e incoraggiando il robot a imparare le azioni in un modo che non sia legato a un singolo metodo o tipo di corpo, i ricercatori possono creare sistemi che siano molto più capaci di gestire la natura imprevedibile del mondo reale. Questo approccio offre una strada promettente verso robot general-purpose che possono imparare nuovi compiti rapidamente e adattarsi a nuovi ambienti senza richiedere enormi quantità di nuovi dati. Il lavoro è stato reso disponibile al pubblico, permettendo ad altri scienziati di costruire sulle scoperte e approfondire ulteriormente come insegnare alle macchine a muoversi con la stessa flessibilità e comprensione degli esseri viventi.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.