← Ultimi articoli
💬 NLP

M2{M}^2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

Il documento propone M2\mathcal{M}^2Tok, un nuovo tokenizer di azioni multi-head e multi-codebook che riduce significativamente l'errore di ricostruzione e migliora le prestazioni dei modelli Vision-Language-Action decomponendo le caratteristiche latenti in teste specializzate con codebook indipendenti per catturare meglio la dinamica fine delle azioni.

Autori originali: Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu

Pubblicato 2026-09-17
📖 8 min di lettura🧠 Approfondimento

Autori originali: Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot hanno lottato a lungo per muoversi con la grazia fluida di una mano umana. Mentre l'intelligenza artificiale moderna può ora scrivere poesie, diagnosticare malattie e generare immagini sbalorditive, dare a una macchina la capacità di manipolare fisicamente il mondo rimane una sfida ostinata. Il cuore del problema risiede nel modo in cui i computer comprendono il movimento. A differenza del testo, che è composto da lettere distinte, o delle immagini, che sono composte da pixel, le azioni fisiche di un braccio robotico sono flussi continui di dati. Un braccio robotico non salta semplicemente da una posizione all'altra; scorre attraverso un numero infinito di minuscole posizioni intermedie. Per insegnare a un robot utilizzando i potenti modelli linguistici che guidano l'IA odierna, gli ingegneri devono prima tradurre questo movimento fluido e continuo in una serie di passi discreti, proprio come trasformare un fiume in un flusso in una serie di singole perle. Questo processo di traduzione è noto come tokenizzazione. Se la traduzione è troppo grossolana, il robot perde i dettagli fini del suo movimento, risultando in azioni scattose e imprecise che falliscono nei compiti delicati. Se la traduzione è troppo complessa, il computer non riesce a elaborarla abbastanza velocemente da reagire in tempo reale.

Per anni, i ricercatori hanno cercato di risolvere questo problema di traduzione, ma i metodi esistenti spesso tentano di infilare un perno quadrato in un foro rotondo. Alcuni approcci trattano ogni movimento come una semplice lista di categorie fisse, ignorando le sottili tempistiche e le relazioni tra i passi. Altri cercano di comprimere i dati raggruppando i movimenti, ma spesso perdono i dettagli specifici necessari per un controllo preciso, come l'angolo esatto di un polso o la leggera pressione di una pinza. Questa perdita di dettaglio crea un collo di bottiglia, impedendo ai robot di apprendere abilità complesse come impilare oggetti fragili o assemblare parti intricate. Il risultato è un robot in grado di eseguire compiti ampi e semplici, ma che inciampa quando si trova di fronte alle sfide sfumate del mondo reale.

Un team di ricercatori ha ora proposto un nuovo modo per gestire questa traduzione, offrendo un metodo che preserva la ricchezza del movimento mantenendo i dati abbastanza compatti da poter essere elaborati dall'IA moderna. Chiamano il loro sistema M2Tok, uno strumento progettato per scomporre il flusso continuo di azioni robotiche in un formato che i modelli linguistici possano comprendere senza perdere la dinamica fine necessaria per il successo. Invece di trattare l'intero corpo del robot come un unico blocco monolitico di dati, il loro approccio suddivide il movimento in canali separati e specializzati. Immaginate un braccio robotico che deve muovere spalla, gomito, polso e pinza tutti insieme. I metodi più vecchi cercherebbero di comprimere tutti questi diversi movimenti in un unico codice, costringendo spesso il sistema a scegliere tra l'accuratezza per il braccio e l'accuratezza per la pinza. Il nuovo metodo, invece, separa questi movimenti in gruppi distinti, permettendo all'IA di concentrarsi sulle sfumature specifiche di ogni parte in modo indipendente.

I ricercatori hanno ottenuto questo dividendo i dati di movimento del robot in più "teste", dove ogni testa è responsabile di un diverso aspetto del movimento. Una testa potrebbe tracciare la posizione del braccio, mentre un'altra traccia l'apertura e la chiusura della pinza. Fondamentalmente, ciascuna di queste teste utilizza il proprio dizionario indipendente di codici di movimento. Utilizzando molteplici dizionari che lavorano in parallelo, il sistema crea un numero vastissimo di combinazioni possibili, molto superiore a quanto un singolo dizionario potrebbe mai offrire. Questa potenza combinatoria permette al sistema di rappresentare una varietà molto più ampia di movimenti con alta precisionzza. È simile a come un musicista può creare un numero infinito di melodie combinando un set limitato di note su strumenti diversi; il nuovo sistema combina set limitati di codici di movimento attraverso i diversi "strumenti" del corpo del robot per ricreare azioni complesse con una fedeltà straordinaria.

Per testare questa idea, i ricercatori hanno addestrato il loro sistema su una grande collezione di compiti robotici simulati, che vanno dal colpire un blocco con un martello al raccogliere bottiglie diverse e posizionare contenitori su piatti. Hanno confrontato il loro nuovo metodo con diverse tecniche esistenti utilizzate nel campo. I risultati hanno mostrato un chiaro vantaggio per il nuovo approccio. In una serie di dodici diversi compiti di simulazione, il robot che utilizza il nuovo metodo ha avuto successo nel 51 percento dei suoi tentativi, superando significativamente il secondo miglior metodo, che ha avuto successo solo nel 45 percento dei casi. Il miglioramento è stato ancora più drammatico nei compiti difficili che richiedevano un'alta precisione. Ad esempio, in un compito che consisteva nello spostare una lattina in un vaso, il nuovo metodo ha avuto successo quasi il doppio delle volte rispetto al precedente miglior approccio. In un altro compito che prevedeva di posizionare una scatola di hamburger e patatine su un vassoio, il nuovo metodo ha raggiunto un tasso di successo del 64 percento, mentre il precedente miglior metodo è riuscito solo al 52 percento.

I ricercatori hanno anche testato il sistema in un set diverso di ambienti simulati per vedere se le abilità potessero trasferirsi in nuove situazioni. Qui, il nuovo metodo ha dimostrato ancora una volta una prestazione superiore, ottenendo un tasso di successo del 28 percento rispetto al 21 percento del principale alternativa. La differenza più sorprendente è apparsa in un compito che richiedeva al robot di raccogliere una melanzana e posizionarla in un cesto. La melanzana è un oggetto dalla forma irregolare difficile da afferrare, e i metodi precedenti non sono riusciti affatto a risolvere questo compito. Il nuovo metodo, tuttavia, ha avuto successo il 33 percento delle volte, suggerendo che la sua capacità di catturare i dettagli fini gli ha permesso di gestire la complessa geometria dell'oggetto laddove altri non potevano.

Per garantire che questi risultati non fossero solo frutto della simulazione, il team ha preso i loro modelli addestrati e li ha testati su robot reali. Hanno utilizzato una piattaforma mobile dotata di quattro bracci robotici e una telecamera, chiedendo ai robot di eseguire tre compiti diversi: suonare un campanello, posizionare un contenitore su un piatto e raccogliere diverse bottiglie. Questi erano test "zero-shot", il che significa che i robot non avevano mai visto questi specifici oggetti o ambienti reali prima d'ora; dovevano fare affidamento interamente su ciò che avevano appreso nella simulazione. Il nuovo metodo ha nuovamente superato gli altri, ottenendo un tasso di successo medio del 33 percento nei tre compiti, rispetto al massimo del 28 percento della migliore alternativa. L'evidenza visiva di questi test ha mostrato i robot che identificavano con successo le posizioni degli oggetti ed eseguivano operazioni di presa precise, confermando che l'alta qualità della traduzione dei dati di movimento reggeva quando i robot lasciavano il computer ed entravano nel mondo fisico.

Oltre all'accuratezza, i ricercatori hanno anche esaminato la velocità con cui il sistema poteva operare. Affinché un robot sia utile, deve prendere decisioni abbastanza velocemente da reagire al suo ambiente. Il nuovo metodo ha permesso al robot di operare a una frequenza di oltre 8 hertz, il che significa che poteva prendere più di otto decisioni ogni secondo. Si tratta di un miglioramento significativo rispetto ai vecchi metodi che operavano a soli 2 hertz. Inoltre, quando i ricercatori hanno ottimizzato il sistema per la velocità utilizzando un motore di elaborazione specializzato, il robot ha potuto raggiungere una frequenza di 56 hertz, superando di gran lunga la velocità richiesta per la maggior parte delle attività di manipolazione in tempo reale. Questa combinazione di alta precisione e alta velocità suggerisce che il nuovo metodo possa essere una soluzione pratica per l'impiego di robot avanzati in ambienti dinamici.

Il successo di questo lavoro si basa su un cambiamento fondamentale nel modo in cui i dati di movimento vengono elaborati. Rifiutando l'idea che tutto il movimento debba essere compresso in un unico codice uniforme, i ricercatori hanno permesso al sistema di rispettare la natura unica di diverse parti del corpo del robot. La separazione del movimento in canali indipendenti, combinata con l'uso di molteplici dizionari specializzati, ha creato un sistema in grado di catturare i dettagli sottili e ad alta frequenza del movimento che i metodi precedenti perdevano. Questo approccio non ha richiesto modifiche all'architettura sottostante dei modelli linguistici che guidano i robot; ha invece fornito un modo migliore per immettere i dati in essi. Il risultato è un robot capace di comprendere ed eseguire compiti fisici complessi con un livello di destrezza che era precedentemente fuori portata, colmando il divario tra l'intelligenza digitale dei modelli linguistici e la realtà fisica del mondo che devono navigare.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →