← Ultimi articoli
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

HIL-UMI introduce un framework senza robot e con l'intervento umano (human-in-the-loop) per il post-training di modelli Vision-Language-Action che sfrutta un'Interfaccia di Manipolazione Universale portatile e un punteggio di energia guidato dalla policy per raccogliere in modo efficiente dati mirati e perfezionare gli stimatori di vantaggio, superando così i limiti del fine-tuning supervisionato statico e consentendo un miglioramento iterativo e scalabile senza l'impiego di robot fisici.

Autori originali: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

Pubblicato 2026-09-18
📖 5 min di lettura🧠 Approfondimento

Autori originali: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot stanno diventando sempre più capaci di comprendere il mondo attraverso la vista e il linguaggio, imparando da enormi quantità di dati per eseguire compiti complessi. Tuttavia, rimane un divario significativo tra ciò che questi sistemi di intelligenza artificiale apprendono in generale e ciò che possono effettivamente fare in una cucina, un'officina o una fabbrica specifica. Quando un robot viene dispiegato in un ambiente reale, spesso incontra situazioni che non ha mai visto prima, portando a errori che possono accumularsi finché il compito non fallisce. Per risolvere questo problema, i ricercatori si affidano tradizionalmente al "fine-tuning supervisionato", un processo in cui gli esseri umani dimostrano le azioni corrette direttamente sul robot, e la macchina impara a imitarle. Sebbene questo aiuti, è un processo lento, costoso e spesso non coglie i momenti specifici in cui il robot è più propenso a sbagliare, perché il robot impara solo dagli esempi che gli sono stati forniti, non dagli errori che commette mentre cerca di risolvere il problema da solo.

Un team di ricercatori ha sviluppato un nuovo approccio chiamato HIL-UMI che cambia il modo in cui i robot imparano dagli esseri umani, eliminando la necessità che il robot sia presente durante la fase di addestramento. Invece di guardare un robot che fatica e poi correggerlo, questo metodo utilizza un dispositivo portatile e manuale che assomiglia a una pinza robotica ed è impugnato da un operatore umano. L'operatore esegue il compito con questo dispositivo mentre un programma informatico, che esegue il "cervello" attuale del robot, osserva lo stesso flusso video e cerca di indovinare cosa farà l'umano successivamente. Il sistema non muove il robot; semplicemente confronta i movimenti reali dell'uomo con le proprie previsioni. Quando l'umano fa qualcosa che il computer non si aspettava, il sistema segnala quel momento come un'opportunità di apprendimento e lo registra. Ciò consente al robot di imparare dai propri punti ciechi senza dover mai tentare fisicamente il compito e rischiare il fallimento.

Il nucleo di questo metodo consiste in un ciclo continuo di osservazione e perfezionamento. Mentre l'umano dimostra un compito, il computer controlla costantemente se le proprie previsioni corrispondono alle azioni dell'uomo. Se l'ipotesi del computer è molto diversa da ciò che l'uomo sta facendo, il sistema sa di trovarsi in un "punto cieco" — una situazione che il robot non comprende bene. A quel punto, l'umano viene sollecitato a continuare la dimostrazione e il sistema salva questo specifico segmento di dati. I ricercatori hanno aggiunto anche un secondo livello di intelligenza: un modo per giudicare quanto il compito stia procedendo bene. Se il sistema pensa che il compito stia procedendo male, anche se l'umano si sta muovendo correttamente, registra quel momento per aiutare il computer a imparare come giudicare meglio il successo. Combinando questi due tipi di dati, il robot impara non solo cosa fare, ma anche quali azioni sono più utili per completare il lavoro.

Per testare questa idea, i ricercatori l'hanno applicata a quattro compiti distinti nel mondo reale utilizzando un braccio robotico standard. I compiti variavano dal piegare un asciugamano e pulire un tavolo, allo impilare cubi e timbrare un foglio di carta con alta precisione. In ogni caso, il robot è partito con un set base di istruzioni e poi ha affrontato diversi cicli di addestramento utilizzando il nuovo metodo manuale. I risultati hanno mostrato un chiaro miglioramento rispetto ai metodi tradizionali. Mentre le tecniche di addestramento standard spesso raggiungono un limite in cui l'aggiunta di nuovi dati non aiuta più, il nuovo metodo ha permesso al robot di migliorare costantemente ad ogni ciclo di addestramento. Il robot ha imparato a gestire sequenze di azioni lunghe e complicate e movimenti delicati e precisi in modo più efficace rispetto a prima.

Uno dei risultati più sorprendenti è stata la velocità con cui questo nuovo metodo ha raccolto informazioni utili. I metodi tradizionali che richiedono che un robot si muova fisicamente e venga corretto da un essere umano sono lenti e difficili da scalare. Al contrario, l'approccio manuale è risultato essere più di cinque volte più veloce nel raccogliere i dati necessari. Questo perché l'operatore umano può muovere il dispositivo liberamente senza dover aspettare che un robot si resetti o che un essere umano intervenga fisicamente su una macchina pesante. Il sistema ha identificato con successo l'esatto momento in cui il robot aveva bisogno di aiuto, concentrando l'addestramento sulle parti più difficili del compito invece di sprecare tempo nelle parti che il robot già comprendeva.

Lo studio suggerisce che questo approccio offre una via scalabile per insegnare nuove abilità ai robot in diverse località e da parte di persone diverse. Poiché l'addestramento avviene su un dispositivo manuale, più operatori potrebbero potenzialmente raccogliere dati simultaneamente in luoghi diversi, alimentando tutti lo stesso processo di apprendimento del robot. I ricercatori hanno scoperto che, concentrandosi sui vuoti specifici nella conoscenza del robot e utilizzando un sistema che premia il progresso, potevano creare un robot più affidabile ed efficiente. Questo lavoro punta verso un futuro in cui i robot possano essere adattati a nuovi ambienti rapidamente e in sicurezza, senza la necessità di ripetuti, costosi e lenti tentativi fisici.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →