← Ultimi articoli
🤖 AI

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLA è un modello Vision-Language-Action con meno di un miliardo di parametri che raggiunge una robustezza allo stato dell'arte nel benchmark LIBERO-Plus sfruttando tecniche di supervisione strutturata — tra cui input temporali a doppia vista, distillazione gerarchica della catena di pensiero e aumento per parafrasi — anziché aumentare le dimensioni del modello.

Autori originali: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Pubblicato 2026-07-29
📖 7 min di lettura🧠 Approfondimento

Autori originali: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un mondo in cui i robot non siano solo macchine senza mente che seguono un codice rigido, ma compagni utili che comprendono le nostre parole parlate e riescono a capire come muovere le proprie braccia per portare a termine dei compiti. Questo è il sogno dell' "IA incarnata" (embodied AI), un campo in cui i computer imparano a vedere il mondo attraverso le telecamere, a comprendere il linguaggio umano e a tradurre queste due cose in azioni fisiche. Per molto tempo, i robot più intelligenti hanno avuto bisogno di cervelli massicci — modelli informatici con miliardi di "neuroni" — per gestire tutto questo. Questi modelli giganteschi erano come supercomputer che necessitavano di enormi e costosi server per funzionare, rendendo impossibile inserirli in un piccolo robot che potesse rotolare per casa o aiutare in una cucina. La grande domanda che i ricercatori si sono posti è: Possiamo creare un robot che sia altrettanto intelligente e affidabile, ma abbastanza piccolo da poter stare in uno zaino?

Questo articolo presenta un nuovo cervello robotico chiamato CoTinyVLA. Pensatelo come un cervello robotico minuscolo e super efficiente che riesce a superare i modelli massicci e pesanti che attualmente guidano il settore, pur utilizzando solo una frazione della memoria. I ricercatori non si sono limitati a rimpicciolire il cervello; gli hanno insegnato un modo migliore di pensare. Invece di cercare di memorizzare ogni possibile situazione, hanno fornito al robot un "foglio di trucchi" per il ragionamento. Gli hanno insegnato a scomporre un compito grande in un piano semplice (come una lista di cose da fare) e poi a riflettere su ogni piccolo passaggio prima di muoversi. Gli hanno anche dato un paio di occhi speciali — uno che guarda da lontano per vedere l'intera stanza e uno sul polso per vedere esattamente ciò che la sua mano sta toccando — e gli hanno insegnato a guardare un breve video degli ultimi secondi per comprendere il movimento. Il risultato è un modello robotico con soli 0,9 miliardi di parametri (piccolo rispetto ai giganti da 7 miliardi di parametri) che può gestire situazioni reali difficili e disordinate meglio di modelli otto volte più grandi.

Il Problema: Grandi Cervelli, Piccoli Robot

Per anni, i migliori robot per seguire istruzioni sono stati come enormi e pesanti carri armati. Per comprendere un comando come "prendi la tazza blu e mettila sul tavolo", questi robot utilizzano modelli informatici massicci con 3 o 7 miliardi di parametri. Sebbene questi modelli siano incredibilmente intelligenti, sono anche enormi. Richiedono circa 20 gigabyte di memoria informatica solo per funzionare. È come cercare di far stare una biblioteca intera in uno zaino; semplicemente non ci sta nei piccoli computer alimentati a batteria che si trovano sui robot mobili o sui dispositivi di assistenza.

I ricercatori volevano sapere: Abbiamo davvero bisogno di un cervello così gigante per essere intelligenti? O possiamo costruire un robot piccolo ed efficiente che sia altrettanto bravo a gestire l'imprevedibile confusione del mondo reale?

La Soluzione: Un Cervello Piccolo con una Grande Strategia

Il team ha costruito CoTinyVLA, un cervello robotico con soli 0,9 miliardi di parametri. Per rendere questo modello minuscolo forte quanto i giganti, non si sono limitati a nutrirlo con più dati; hanno cambiato il modo in cui imparava e a cosa prestava attenzione. Hanno usato tre trucchi principali, che chiamano "supervisione strutturata", per insegnare al robot a pensare meglio.

1. Il "Due Occhi" Macchina del Tempo
Immaginate di cercare di prendere al volo una palla. Se vedete solo un'immagine della palla, non sapete se sta venendo verso di voi o se si sta allontanando. Avete bisogno di vedere un breve video per comprendere il movimento.
CoTinyVLA è istruito a guardare il mondo attraverso due diversi "occhi" contemporaneamente:

  • L'Occhio in Terza Persona: Una telecamera che guarda l'intera stanza per vedere dove si trova ogni cosa.
  • L'Occhio al Polso: Una telecamera sulla mano del robot per vedere esattamente ciò che la pinza sta toccando.
    Inveve di guardare solo l'istante attuale, il robot guarda un breve "filmato" degli ultimi 16 fotogrammi (8 da ciascun occhio). Questo gli conferisce un senso del tempo e del movimento, aiutandolo a capire quanto velocemente le cose si muovono e dove stanno andando.

2. Il Foglio di Trucchi "Pianifica e Pensa"
Questo è il trucco più importante. Prima che il robot si muova, gli viene insegnato a scrivere una storia.

  • Il Piano: All'inizio di un compito, il robot scrive una "lista di cose da fare" di alto livello (ad esempio, "Primo, prendi la tazza. Secondo, sollevala. Terzo, mettila sul tavolo"). Questo piano rimane invariato per tutto il compito.
  • Il Pensa: Prima di ogni piccolo movimento, il robot scrive una breve nota su ciò che sta facendo in quel momento (ad esempio, "Sto chiudendo la mia pinza" oppure "Sto sollevando la tazza").
    Il robot impara questo osservando un robot molto più grande e intelligente (un "insegnante" da 35 miliardi di parametri) che risolve gli stessi compiti. Il piccolo robot copia il processo di pensiero dell'insegnante. Questo aiuta il piccolo robot a capire perché sta facendo qualcosa, non solo cosa fare.

3. Il Gioco della "Parafrasi"
I robot spesso si confondono se dici la stessa cosa in un modo diverso. Se un robot è addestrato solo sulla frase "prendi la tazza", potrebbe bloccarsi se dici "afferra la tazza".
Per risolvere questo problema, i ricercatori hanno addestrato il robot con 40 istruzioni di base, espandendole in 800 versioni diverse. Hanno sostituito le parole (come cambiare "prendere" con "afferrare" o "sollevare"), hanno cambiato le descrizioni degli oggetti (come "ciotola nera" con "ciotola scura") e hanno persino aggiunto frasi gentili come "Potresti per favore...". Questo ha insegnato al robot a comprendere il significato del comando, non solo le parole specifiche.

I Risultati: Il Piccolo Vince Grande

I ricercatori hanno testato CoTinyVLA su LIBERO-Plus, una suite di test impegnativa progettata per vedere quanto bene i robot gestiscono i cambiamenti nel mondo. Il test include oltre 10.000 scenari diversi in cui le cose sono scombinate: il robot parte da una posizione strana, la luce cambia, lo sfondo è diverso o le istruzioni sono formulate in modo insolito.

I risultati sono stati sorprendenti. CoTinyVLA, con i suoi minuscoli 0,9 miliardi di parametri, ha battuto i modelli più forti da 7 miliardi di parametri in tutte e quattro le principali categorie di test:

  • Spaziale: 90,8% di successo (superando i grandi modelli di 4,7 punti).
  • Oggetto: 87,3% di successo (superando i grandi modelli di 2,8 punti).
  • Obiettivo: 86,6% di successo (superando i grandi modelli di ben 15,9 punti).
  • Lungo: 80,7% di successo (superando i grandi modelli di 3,0 punti).

La vittoria più grande è stata nella categoria "Obiettivo", dove il piccolo robot è stato quasi 16 punti migliore del miglior robot gigante. Questo è particolarmente impressionante perché il piccolo robot gira su un computer che utilizza solo 2,25 GiB di memoria, una dimensione sufficiente per stare su molti robot del mondo reale.

Perché è Importante

L'articolo dimostra che non è necessario un cervello enorme per essere un robot intelligente. Insegnando a un piccolo robot come "pensare" in modo strutturato (creando piani e controllando i propri passaggi) e fornendogli il tipo giusto di addestramento visivo e linguistico, esso può gestire il mondo reale disordinato e imprevedibile meglio di modelli molto più grandi.

I ricercatori hanno anche scoperto che la parte "Piano" del processo di pensiero è cruciale. Se si toglie al robot la capacità di scrivere un piano, il suo tasso di successo scende di 40 o 45 punti. Questo prova che il robot non sta solo tirando a indovinare; sta effettivamente usando il piano per guidare le sue azioni.

In breve, CoTinyVLA dimostra che con i giusti metodi di insegnamento, un robot piccolo ed efficiente può essere capace quanto un enorme supercomputer, portandoci un passo più vicini ad avere robot utili e intelligenti nelle nostre case e nei nostri luoghi di lavoro.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →