← Ultimi articoli
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA introduce un framework unificato che integra navigazione e manipolazione in un'unica architettura con una testa d'azione condivisa e una strategia di addestramento progressiva a più stadi, raggiungendo prestazioni state-of-the-art sia in ambienti simulati che reali per far avanzare lo sviluppo di agenti robotici general-purpose.

Autori originali: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Pubblicato 2026-06-02
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un assistente robotico. Finora, costruire questo robot era come assumere due specialisti separati: una persona esperta nel camminare (navigazione) ma terribile nell'usare le mani, e un'altra persona che è un grande chef (manipolazione) ma non sa come attraversare la stanza per prendere gli ingredienti. Se volevi che il robot "andasse in cucina e mettesse una tazza nel microonde", dovevi passare da un "cervello" all'altro o addestrare due modelli separati.

Il documento presenta OneVLA, che è come assumere un unico dipendente "Coltellino Svizzero" che è naturalmente bravo sia a camminare che a usare le mani, il tutto all'interno di un unico cervello.

Ecco una semplice suddivisione di come ci sono riusciti:

1. Il "Telecomando Universale" (Unified Action Head)

La maggior parte dei robot ha "telecomandi" diversi per lavori diversi. Un telecomando ha tasti per muoversi in avanti o girare a sinistra. Un altro telecomando ha cursori per muovere un braccio robotico su, giù o ruotarlo.

OneVLA crea un unico telecomando universale.

  • Combina i tasti per camminare e i cursori per il braccio in un'unica lunga striscia di controlli.
  • Quando il robot riceve un'istruzione come "Vai alla porta", preme solo i "tasti del camminare" sulla striscia.
  • Quando l'istruzione è "Prendi la tazza", muove solo i "cursori del braccio".
  • La Magia: Il robot non ha bisogno di cambiare il suo cervello o il suo telecomando. Capisce semplicemente quale parte del telecomando utilizzare in base al compito.

2. Il "Campo di Addestramento in Tre Fasi" (Multi-Stage Strategy)

Non puoi semplicemente lanciare un robot in un mondo complesso e aspettarti che sappia tutto immediatamente. Gli autori hanno addestrato OneVLA in tre fasi specifiche, come uno studente che progredisce attraverso la scuola:

  • Fase 1: Imparare a usare le mani. Per prima cosa, hanno insegnato al robot come afferrare, sollevare e posizionare oggetti usando un braccio robotico. Gli hanno anche insegnato a guardare le immagini e a descriverle (così capisce il mondo).
  • Fase 2: Imparare a camminare. Successivamente, hanno aggiunto dati di navigazione. Ora il robot impara come spostarsi dal punto A al punto B. Poiché già sa "vedere" e "pensare" dalla Fase 1, impara a camminare più velocemente e in modo più intelligente.
  • Fase 3: Imparare a "pensare ad alta voce" (Chain-of-Thought). Infine, hanno insegnato al robot a "esplicitare" il proprio processo di pensiero. Prima di muoversi, dice a se stesso: "Sono nel corridoio. Devo girare a destra per arrivare in cucina". Questo passaggio aiuta il robot a collegare i punti tra ciò che vede, ciò che deve fare e come muoversi.

3. Il Risultato: Due Abilità, Un Cervello

Il documento afferma che addestrando queste due abilità insieme, esse si aiutano a vicenda a migliorare.

  • L'Analogia: Pensa a un giocatore di basket che gioca anche a calcio. Imparare a palleggiare con la palla da basket (manipolazione) potrebbe migliorare il suo gioco di piedi e l'equilibrio, aiutandolo a correre meglio sul campo da calcio (navigazione).
  • La Prova: Nei test, un singolo robot (OneVLA) ha battuto i robot che erano specializzati solo nel camminare o solo nell'usare le mani. Era anche migliore di altri robot "ibridi" che cercavano di fare entrambe le cose ma richiedevano ancora "modalità" o impostazioni separate per ogni compito.

In Sintesi

OneVLA è un nuovo tipo di cervello robotico che non ha bisogno di essere riprogrammato quando gli chiedi di camminare o quando gli chiedi di afferrare qualcosa. Utilizza un unico sistema unificato per comprendere il linguaggio, vedere il mondo e controllare sia i suoi piedi che le sue mani. Gli autori dimostrano che insegnare queste abilità insieme rende il robot più intelligente in entrambe rispetto a se venissero insegnate separatamente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →