← Ultimi articoli
💻 computer science

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

DriftingVLA è un modello vision-language-action nativo a singolo step che utilizza un obiettivo di drifting della distribuzione con Per-Dimension Temporal Drifting per generare chunk di azioni completi in un unico passaggio in avanti, raggiungendo prestazioni allo stato dell'arte su task di benchmark pur fornendo un'accelerazione di 3,36 volte rispetto ai convenzionali metodi basati su flow a più step.

Autori originali: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

Pubblicato 2026-09-01
📖 5 min di lettura🧠 Approfondimento

Autori originali: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot capaci di vedere, comprendere il linguaggio e muoversi con una fluidità simile a quella umana sono da tempo il sogno dell'intelligenza artificiale. Per anni, i ricercatori hanno costruito sistemi che combinano una potente comprensione visiva e linguistica con la capacità di controllare bracci robotici. Questi sistemi, noti come modelli vision-language-action (visione-linguaggio-azione), fungono da cervello del robot, ricevendo ciò che la telecamera vede e le parole che un essere umano pronuncia, per poi decidere come muovere le articolazioni del robot per completare un compito. Tuttavia, un collo di bottiglia significativo ha frenato queste macchine dal raggiungere una vera reattività in tempo reale. Per generare una sequenza di movimenti fluida, questi modelli si affidano tradizionalmente a un processo complesso e multi-fase. Immaginate di cercare di disegnare un cerchio perfetto facendo piccole, esitanti correzioni ad ogni singolo punto lungo la linea; il robot deve calcolare un percorso, compiere un passo, controllare il proprio lavoro e poi compiere un altro passo, ripetendo questo ciclo molte volte per ogni singolo movimento che compie. Sebbene questo metodo produca risultati di alta qualità, è lento, introducendo un ritardo che rende il robot pigro e poco reattivo in un mondo dinamico.

Un team di ricercatori ha introdotto un nuovo approccio che cambia fondamentalmente il modo in cui questi robot pianificano i loro movimenti, permettendo loro di generare una sequenza completa di azioni in un unico istante. Il loro lavoro, incentrato su un sistema che chiamano DriftingVLA, sostituisce il lento processo di correzione iterativa con un metodo che impara a prevedere l'intero movimento futuro in una volta sola. Invece di calcolare un percorso passo dopo passo durante l'esecuzione effettiva del compito, il sistema impara una connessione diretta tra un punto di partenza casuale e il movimento finale desiderato durante la fase di addestramento. Questo passaggio permette al robot di saltare interamente i calcoli ripetitivi durante l'impiego, passando direttamente all'azione corretta. Nei test riguardanti complessi compiti di manipolazione, questo nuovo metodo non solo ha eguagliato la precisione dei vecchi sistemi più lenti, ma ha anche reso il robot più di tre volte più veloce, riducendo il tempo necessario per decidere un movimento da oltre duecento millisecondi a meno di settanta.

Il cuore di questa svolta risiede nel modo in cui i ricercatori hanno insegnato al robot a comprendere la relazione tra le sue diverse parti in movimento. Un braccio robotico non si muove solo in una singola linea; possiede molteplici giunti e gradi di libertà che devono lavorare insieme, come muoversi in avanti, ruotare e aprire una pinza. I tentativi precedenti di velocizzare questi sistemi spesso trattavano l'intero movimento come un unico grande blocco o lo frammentavano in momenti minuscoli e disconnessi nel tempo. Il nuovo approccio, invece, ha riconosciuto che ogni specifica direzione di movimento — come il sollevamento verticale di una pinza o la rotazione di un polso — ha il proprio ritmo unico e il proprio schema statistico. I ricercatori hanno sviluppato una tecnica chiamata Per-Dimension Temporal Drifting (Deriva Temporale per Dimensione), che tratta la storia completa di ogni singola direzione di movimento come un'unità separata da apprendere. Ciò consente al sistema di comprendere le sfumature specifiche di come una pinza debba aprirsi o come un polso debba ruotare, senza costringere questi diversi movimenti a conformarsi a un'unica, rigida regola matematica.

Fondamentalmente, questo metodo non sacrifica la capacità del robot di coordinare le sue membra. Anche se il sistema apprende i pattern di ogni direzione di movimento separatamente, genera comunque l'intero piano d'azione come un insieme unitario. Il cervello del robot, che comprende il linguaggio e la visione, rimane intatto e continua a guidare l'esperto d'azione che produce i movimenti. Addestrando il sistema a perfezionare le sue previsioni attraverso molti diversi scenari "cosa succederebbe se" simultaneamente, i ricercatori si sono assicurati che la decisione a singolo step sia accurata quanto il risultato di un calcolo lento e multi-fase. Ciò significa che il robot può ancora eseguire compiti delicati, come versare un liquido da un contenitore all'altro o impilare blocchi con due braccia che lavorano in sincronia, senza l'esitazione che affliggeva i modelli precedenti.

I ricercatori hanno testato questo nuovo sistema sia in ambienti simulati che nel mondo reale per vedere se la velocità fosse avvenuta a scapito dell'affidabilità. In una serie di sfidanti simulazioni che coinvolgevano compiti come raccogliere oggetti e riposizionarli, il nuovo sistema ha raggiunto un tasso di successo di quasi il 98,3 percento, superando leggermente i migliori modelli multi-fase esistenti. Quando spostato in un contesto reale con bracci robotici fisici, il sistema ha mantenuto il suo vantaggio, avendo successo nel 77,67 percento dei tentativi in sei diversi compiti, inclusi problemi di coordinazione a braccio singolo e a due braccia. Questa prestazione è stata notevolmente superiore ad altri metodi a singolo step che cercavano di velocizzare i vecchi sistemi semplicemente accorciando il loro processo di calcolo, il che spesso risultava in un calo significativo dell'accuratezza. Il nuovo metodo ha dimostrato che cambiando il modo in cui il sistema impara, piuttosto che solo il modo in cui calcola, è possibile ottenere sia velocità che precisione.

Oltre ai numeri puri, lo studio ha evidenziato i guadagni di efficienza derivanti dalla rimozione del ciclo di calcolo ripetitivo. Nel mondo reale, dove ogni frazione di secondo conta, il nuovo sistema ha ridotto il tempo necessario per generare un blocco di movimento da 227,61 millisecondi a 67,67 millisecondi. Questo rappresenta un'accelerazione di oltre tre volte, eliminando efficacementmente il lag che fa sentire i robot scollegati dal proprio ambiente. Sebbene il processo di addestramento abbia richiesto una potenza di calcolo leggermente superiore per gestire i molteplici scenari "cosa succederebbe se" durante la fase di apprendimento, questo costo è un investimento una tantum. Una volta addestrato, il robot opera con un'efficienza a singolo step snella che non richiede risorse extra. Il lavoro dimostra che il futuro della robotica reattiva potrebbe non risiedere nel costruire computer più veloci per eseguire algoritmi più lenti, ma nel riprogettare gli algoritmi stessi affinché siano intrinsecamente diretti e immediati.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →