← Ultimi articoli
🤖 machine learning

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

REFACTOR-VLA è un framework di tipo wake/sleep che apprende programmi motori riutilizzabili e tipizzati tramite il clustering di frammenti di azione attraverso un kernel di equivalenza comportamentale e un modello di mondo latente, raggiungendo prestazioni allo stato dell'arte nei compiti LIBERO a lungo orizzonte attraverso un decoder condizionato dalla libreria e un obiettivo di addestramento che privilegia la qualità del clustering rispetto alla capacità del modello.

Autori originali: Riyaaz Shaik, Chandru Venkataraman

Pubblicato 2026-09-02
📖 5 min di lettura🧠 Approfondimento

Autori originali: Riyaaz Shaik, Chandru Venkataraman

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot stanno diventando più bravi a vedere il mondo e a muoversi in esso, ma incontrano ancora difficoltà con i tipi di lavori complessi e multi-fase che gli esseri umani gestiscono con facilità. Quando una persona prepara un sandwich, non pensa a ogni singolo movimento muscolare necessario per afferrare il pane, spalmare il burro o affettare il pomodoro. Invece, si affida a una libreria mentale di azioni familiari — afferrare, spalmare, tagliare — che può concatenare in ordini diversi. Gli attuali modelli di intelligenza artificiale per i robot spesso mancano di questa capacità di organizzare il comportamento. Tendono a generare comandi grezzi, momento per momento, senza raggrupparli in abilità riutilizzabili e ben definite. Ciò rende difficile per loro pianificare compiti a lungo termine o spiegare ciò che hanno imparato. I ricercatori stanno ora cercando di insegnare alle macchine come costruire la propria libreria interna di abilità, permettendo loro di scomporre lavori complicati in pezzi più piccoli e gestibili che possano essere riutilizzati e combinati.

Un team di ricercatori di Apple ha sviluppato un nuovo sistema chiamato REFACTOR-VLA che tenta di risolvere questo problema insegnando a un robot come scoprire le proprie abilità senza etichette umane. Il sistema funziona in due fasi alternate, molto simile a come un essere umano potrebbe praticare un nuovo movimento e poi riposare per lasciare che il cervello organizzi la memoria. Nella prima fase, il robot impara a prevedere cosa accadrà dopo se esegue una determinata sequenza di movimenti. Costruisce un modello mentale del mondo, comprendendo come le sue azioni cambiano l'ambiente. Nella seconda fase, il sistema analizza la vasta quantità di dati di movimento che ha raccolto e cerca di trovare schemi. Pone una domanda semplice ma difficile: due diverse sequenze di movimenti producono lo stesso risultato? Se un robot muove il braccio in cerchio per prendere una tazza, o muove il braccio in linea retta per fare la stessa cosa, il sistema deve riconoscere che entrambi i percorsi raggiungono lo stesso obiettivo.

Per rispondere a questo, i ricercatori hanno creato uno strumento speciale che misura l'esito delle azioni piuttosto che la loro semplice apparenza. Invece di guardare il video grezzo del movimento del robot, il sistema simula l'azione nel suo modello mentale appreso per vedere dove finisce il robot e quale ricompensa ottiene. Se due diversi percorsi di movimento portano allo stesso stato finale e alla stessa ricompensa, il sistema li considera equivalenti. Successivamente, raggruppa questi percorsi simili in un'unica abilità riutilizzabile. Una volta formato un gruppo, il sistema cerca di scrivere un programma semplice e strutturato che descriva il modello comune di quell'abilità. Questo programma viene poi aggiunto a una libreria. Il robot può usare questa libreria in seguito per pianificare nuovi compiti, richiamando queste abilità pre-confezionate invece di calcolare ogni minimo movimento da zero.

I ricercatori hanno testato questo approccio su un set standard di compiti robotici che coinvolgono lo spostamento di oggetti in un ambiente simulato. Hanno scoperto qualcosa di sorprendente su come questi sistemi apprendono. Una credenza comune nell'intelligenza artificiale è che rendere un modello più grande e complesso porti sempre a prestazioni migliori. Tuttavia, quando i ricercatori hanno aumentato la dimensione del loro modello del mondo da circa 188 milioni di parametri a 430 milioni, il sistema è stato in realtà peggiore in ogni singola suite di test. Il modello più grande non è riuscito a organizzare correttamente le abilità, suggerendo che semplicemente aggiungere potenza di calcolo non sia la soluzione.

Inveve, la chiave del successo risiedeva nel modo in cui il modello veniva addestrato. I ricercatori hanno scoperto che l'aggiunta di un tipo specifico di obiettivo di apprendimento durante la fase iniziale di addestramento migliorava drasticamente i risultati. Questo obiettivo aiutava il sistema a distinguere tra diversi compiti in modo più chiaro, permettendogli di raggruppare i movimenti simili in modo molto più efficace. Con questo cambiamento, il sistema ha superato i metodi esistenti più forti in tutte e quattro le principali suite di test, migliorando il suo punteggio medio di un margine significativo. Il sistema ha costruito con successo una libreria di tre abilità distinte e riutilizzabili per un compito specifico, e un robot che utilizzava questa libreria è stato in grado di riscrivere ogni singola dimostrazione che aveva visto utilizzando queste nuove abilità.

Lo studio ha anche rivelato che la capacità del sistema di trovare queste abilità dipende fortemente dal tipo di dati che analizza. Mentre il sistema ha creato con successo una libreria di istruzioni basate sul linguaggio, come "prendi l'oggetto e mettilo nel cestino", non è riuscito a trovare schemi riutilizzabili nei comandi motori grezzi stessi. Ciò suggerisce che il sistema è più bravo a comprendere gli obiettivi di alto livello di un compito che i dettagli fisici di basso livello del movimento. I ricercatori hanno misurato la costanza dei loro risultati attraverso molteplici sessioni di addestramento e hanno scoperto che il sistema scopre regolarmente raggruppamenti di abilità simili, con un alto grado di accordo tra le diverse versioni del modello.

Questo lavoro dimostra che il modo in cui un robot organizza le sue esperienze è più importante della dimensione pura del suo cervello. Concentrandosi sugli esiti delle azioni e utilizzando un metodo strutturato per raggrupparli, il sistema può costruire una libreria di abilità che lo aiuta ad affrontare compiti complessi e a lungo termine. Le scoperte sfidano l'idea che "più grande è meglio" e puntano verso un futuro in cui i robot possono imparare a pensare in termini di azioni riutilizzabili, proprio come fanno gli esseri umani. I ricercatori hanno reso disponibili il codice e i dati, permettendo ad altri di verificare questi risultati e di costruire su questo nuovo approccio all'apprendimento robotico.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →