← Ultimi articoli
💻 computer science

Technical Report: One-Step Drifting Action Heads for GR00T N1.7

Questo rapporto tecnico valuta una variante GR00T N1.7 con una testa di azione di drifting a singolo step che riduce significativamente la latenza di inferenza da 70,0 ms a 30,6 ms, ma comporta un compromesso sistematico di riduzione dei tassi di successo nei task attraverso i benchmark LIBERO, evidenziando i limiti della generazione deterministica a singolo step nel controllo a ciclo chiuso.

Autori originali: Xihe Shao

Pubblicato 2026-09-17
📖 5 min di lettura🧠 Approfondimento

Autori originali: Xihe Shao

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot capaci di vedere, comprendere e muoversi con le mani non sono più solo un sogno della fantascienza; vengono costruiti oggi utilizzando sistemi che combinano l'occhio di una telecamera con un cervello addestrato al linguaggio. Questi sistemi, noti come modelli visione-linguaggio-azione, permettono a una macchina di osservare una scena, leggere un comando come "prendi la tazza rossa" e poi individuare la sequenza precisa di movimenti per farlo. Tuttavia, affinché questi robot siano utili nel mondo reale, devono pensare abbastanza velocemente da reagire a un ambiente che cambia senza inciampare. Se il computer impiega troppo tempo per decidere la mossa successiva, il robot potrebbe mancare il bersaglio o urtare qualcosa. La sfida centrale per gli ingegneri è trovare un modo per prendere queste decisioni rapidamente senza sacrificare l'accuratezza necessaria per completare un compito.

Un nuovo rapporto tecnico di ricercatori della Zhejiang University e di LimX Dynamics investiga una specifica scorciatoia per velocizzare queste decisioni robotiche. Lo studio si concentra su un potente cervello robotico chiamato GR00T N1.7. Nella sua forma standard, questo sistema lavora come un pianificatore attento: per decidare una sequenza di quaranta movimenti futuri, esegue il suo motore di calcolo interno più volte, perfezionando il piano a ogni passaggio finché non è sicuro. Questo processo iterativo è accurato ma lento, impiegando circa 45 millisecondi solo per generare l'elenco delle azioni. I ricercatori si sono posti una domanda semplice: avrebbero potuto sostituire questa pianificazione attenta e multi-step con un singolo, istantaneo tentativo? Hanno costruito una versione del robot che salta i passaggi di raffinamento e cerca di prevedere l'intera sequenza di quaranta movimenti in un unico colpo.

I risultati di questo esperimento rivelano un netto compromesso tra velocità e successo. Passando al metodo a un singolo step, i ricercatori hanno ottenuto una drastica riduzione dei tempi di pensiero. Il tempo richiesto per generare l'elenco delle azioni è sceso da circa 45 millisecondi a soli 5 millisecondi, un aumento di velocità di nove volte. Quando hanno misurato il tempo totale che il computer ha impiegato per elaborare le informazioni visive e linguistiche per produrre un piano, il tempo è sceso da circa 70 millisecondi a poco più di 30 millisecondi. Questo è un significativo successo ingegneristico, che suggerisce che i robot potrebbero potenzialmente reagire molto più velocemente se questo metodo fosse perfetto.

Tuttavia, il rapporto chiarisce che questa velocità ha un costo elevato. Sebbene il robot sia diventato molto più veloce nel pensare, è diventato significativamente peggiore nel compiere il lavoro. I ricercatori hanno testato il nuovo sistema su un insieme standard di compiti che prevedevano lo spostamento di oggetti in diverse posizioni, il raggiungimento di obiettivi e il completamento di lunghe sequenze di azioni. Nei compiti che richiedevano ragionamento spaziale, il nuovo sistema ha avuto successo solo nel 64 percento dei casi, rispetto a un tasso di successo molto più alto per il sistema originale, più lento. Nei compiti che richiedevano al robot di raggiungere un obiettivo specifico, il successo è sceso al 52 percento. Il divario si è ampliato ulteriormente per i compiti lunghi e complessi, dove il nuovo sistema ha avuto successo solo nel 26 percento dei casi.

I ricercatori sono stati attenti a garantire che questi fallimenti non fossero dovuti alla sfortuna. Hanno eseguito l'esperimento tre volte con diversi punti di partenza casuali e i risultati sono stati costantemente scarsi in tutti e tre. Questa coerenza dice loro che il problema non è un caso isolato, ma un limite fondamentale dell'approccio a un singolo step. Il sistema sembra faticare perché è costretto a impegnarsi in una singola previsione immediatamente, invece di avere il lusso di perfezionare la propria idea attraverso diversi passaggi. Quando un compito è complesso o lungo, questa mancanza di raffinamento porta ad errori che si accumulano, causando il fallimento del robot.

Il rapporto esplora anche una versione più avanzata di questa idea chiamata "DrifOv", che tenta di gestire il problema del mondo reale dell'azione asincrona. In un vero robot, nuovi piani arrivano spesso mentre il robot sta ancora eseguendo quelli precedenti. I ricercatori hanno costruito un sistema in grado di prendere un piano parzialmente completato e riempire i passaggi futuri mancanti senza riscrivere ciò che è già stato impegnato. Sebbene questa funzionalità sia stata implementata con successo e testata durante l'addestramento, gli esperimenti standard non l'hanno utilizzata, il che significa che l'accelerazione e i tassi di fallimento riportati si applicano solo alla versione più semplice e sincrona. I ricercatori osservano che l'attuale configurazione non prova ancora che questo metodo avanzato risolverebbe il problema del successo, sebbene rimanga una direzione promettente per il lavoro futuro.

In definitiva, questo studio funge da controllo realistico sull'idea che i robot possano essere resi più veloci semplicemente rimuovendo la complessità. I ricercatori hanno scoperto che, sebbene potessero rendere il "cervello" del robot nove volte più veloce nella generazione di un elenco di mosse, il robot non era in grado di utilizzare quella velocità in modo affidabile per completare i compiti. L'accelerazione non si è tradotta in un sistema complessivo migliore perché l'accuratezza è scesa troppo per essere utile. Il rapporto conclude che la strada da seguire non è semplicemente scartare la pianificazione lenta e attenta, ma trovare un modo per mantenere l'accuratezza pur ottenendo velocità. I ricercatori suggeriscono che il lavoro futuro dovrebbe concentrarsi sul testare se l'esecuzione del piano del robot più frequentemente, piuttosto che in lunghi blocchi, possa aiutare a colmare il divario tra la velocità del nuovo sistema e l'affidabilità del vecchio. Per ora, la lezione è chiara: nel mondo della manipolazione robotica, pensare più velocemente non significa automaticamente fare meglio.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →