← Ultimi articoli
💻 computer science

Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

Jetson-PI è un framework innovativo per il deployment di modelli Vision-Language-Action su dispositivi onboard a bassa potenza come il Jetson Orin, che raggiunge il controllo in tempo reale combinando un modulo di correzione futura allineato alla preveggenza per risolvere il disallineamento tra percezione ed esecuzione con una pianificazione basata sulla confidenza e ottimizzazioni a livello di sistema per minimizzare il tempo di reazione e la latenza.

Autori originali: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

Pubblicato 2026-07-15
📖 6 min di lettura🧠 Approfondimento

Autori originali: Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di insegnare a un robot come piegare una camicia o prendere una ciotola. Gli dai un cervello (un modello IA super intelligente) che guarda un'immagine e un comando come "prendi la ciotola nera" e poi dice al braccio del robot cosa fare. Questo è chiamato un modello Vision-Language-Action (VLA).

Il problema? Questi cervelli sono enormi e voraci. Se provi a eseguire un modello del genere sul computer integrato del robot (come un Jetson Orin, che è potente ma minuscolo rispetto a un desktop), il robot si blocca in "modalità pensiero". Ci mette così tanto a calcolare la mossa successiva che, nel momento in cui il robot si muove effettivamente, il mondo è già cambiato. È come cercare di prendere una palla indossando occhiali che mostrano dove la palla era un secondo fa, non dove si trova ora. Il robot sbaglia il colpo.

La Grande Idea: "Foresight" e "Async"
Gli autori di questo articolo, Jetson-PI, hanno ideato un modo intelligente per far pensare questi robot più velocemente e muoversi in modo più intelligente senza aver bisogno di un supercomputer enorme e vorace di energia. Chiamano il loro metodo Jetson-PI.

Ecco come hanno risolto i due principali mal di testa:

1. La correzione del "Viaggio nel Tempo" (Risolvere il disallineamento)

Il Problema: Nel vecchio modo, il robot guarda un'immagine, pensa per molto tempo (diciamo 1,4 secondi) e poi si muove. Ma in quei 1,4 secondi, il robot potrebbe aver già urtato qualcosa, o l'oggetto potrebbe essersi spostato. Il robot sta agendo su "notizie vecchie".

La Soluzione: Invece di limitarsi ad aspettare, Jetson-PI usa un trucco chiamato "Foresight-Aligned". Immagina che il robot abbia una piccola e velocissima palla di cristallo (un modulo di correzione futura leggero).

  • Il robot si impegna in una mossa (come "allungarsi verso la ciotola").
  • La palla di cristallo prevede istantaneamente come apparirà il mondo dopo che quella mossa sarà terminata.
  • Il robot usa quindi questa "visione futura" per pianificare la mossa successiva.

È come un giocatore di scacchi che non si limita a guardare la scacchiera ora, ma visualizza istantaneamente la scacchiera dopo la prossima mossa dell'avversario, permettendogli di pianificare perfettamente la propria mossa successiva. Questo impedisce al robot di agire su informazioni obsolete.

2. La correzione dello "Smart Skip" (Risolvere la lentezza delle reazioni)

Il Problema: Anche con la palla di cristallo, il robot deve comunque controllare il mondo reale ogni tanto. Ma controllare il mondo è lento perché il "grande cervello" (il VLM) è pesante. Se controlli il mondo ogni singola volta, il robot si muove troppo lentamente.

La Soluzione: Gli autori hanno introdotto uno "Scheduler basato sulla confidenza".

  • La palla di cristallo (il modulo futuro) ha anche un "misuratore di confidenza". Dice: "Sono sicuro al 90% di sapere cosa sta succando dopo!".
  • Se la confidenza è alta, il robot salta il controllo del grande cervello e continua a muoversi usando solo la palla di cristallo. È come guidare su una strada familiare dove non hai bisogno di controllare il GPS ogni secondo.
  • Se la confidenza scende (magari il robot sta prendendo un oggetto complicato), lo scheduler dice: "Ok, pausa! Controlliamo il mondo reale con il grande cervello per sicurezza".

Questo significa che il robot esegue solo il lavoro pesante quando è assolutamente necessario, rendendolo molto più scattante.

3. L'Aggiornamento del Sistema (Accelerare il motore)

Gli autori si sono anche resi conto che il software in esecuzione sul robot era inefficiente. Hanno trattato il computer del robot come una cucina affollata:

  • Niente ricostruzione del forno: Invece di ricostruire le istruzioni di cottura (il grafo computazionale) ogni volta, l'hanno costruita una volta sola e l'hanno riutilizzata.
  • Niente camminate verso il frigorifero: Hanno tenuto tutti gli ingredienti (i dati) proprio sul bancone (memoria GPU) in modo che lo chef non dovesse fare avanti e indietro verso il frigorifero (memoria CPU).
  • Srotolamento dei passaggi: Hanno combinato molti piccoli passi in un unico movimento grande e fluido.

I Risultati: Funziona?

Gli autori hanno testato questo in simulazioni e su robot reali.

  • Velocità: Su un Jetson Orin, il loro metodo ha reso la frequenza di controllo del robot 8,66 volte più veloce rispetto all'uso del normale PyTorch e 5,41 volte più veloce rispetto a uno strumento chiamato vla.cpp.
  • Successo: In un test chiamato LIBERO (un benchmark per compiti robotici), il loro robot ha avuto successo il 14,8% in più rispetto a un precedente metodo di punta chiamato VLASH.
  • Batteria: Hanno dimostrato che l'uso di una potente scheda desktop (RTX 4090) scaricherebbe la batteria di un robot 6,0 volte più velocemente rispetto all'uso del Jetson Orin integrato. Jetson-PI permette al robot di funzionare con la propria batteria per molto più tempo.

Cosa dicono esplicitamente che NON funziona
Gli autori hanno testato alcune idee e le hanno scartate:

  • Elaborazione Parallela: Hanno provato a eseguire il "grande cervello" e l' "esperto di azioni" contemporaneamente per risparmiare tempo. Hanno scoperto che questo fallisce sui piccoli computer integrati perché entrambi competono per la stessa limitata larghezza di banda dei dati, rallentando tutto. Funziona solo su enormi computer desktop.
  • Prevedere solo lo stato del robot: I metodi precedenti cercavano di indovinare dove sarebbe stato il braccio del robot in futuro. Gli autori hanno scoperto che questo non è sufficiente perché non tiene conto di come l' ambiente (il tavolo, gli oggetti) cambia. Devi prevedere l'ambiente, non solo il robot.

Quanto sono sicuri?
Il paper è molto fiducioso nei numeri misurati. Hanno eseguito estese simulazioni sul benchmark LIBERO e hanno effettuato test su robot reali (come l'X2-W) in un ambiente di laboratorio. Hanno misurato esattamente i millisecondi di ritardo e i tassi di successo esatti. Affermano chiaramente che, sebbene il loro metodo sia un enorme miglioramento per i robot mobili, non può ancora eguagliare la potenza bruta di un enorme cluster di supercomputer se i modelli dovessero diventare ancora più grandi in futuro. Ma per un robot che deve muoversi autonomamente con la propria batteria? Suggeriscono che questa è una soluzione pratica e funzionante.

In breve, Jetson-PI insegna a un robot a "pensare avanti" e a "saltare il lavoro pesante" quando è sicuro, permettendogli di muoversi velocemente e intelligentemente senza aver bisogno di un supercomputer nello zaino.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →