SmoothRL: Online Reinforcement Learning During Asynchronous Execution
SmoothRL è un framework di apprendimento per rinforzo online che consente l'affinamento efficiente in termini di campionamento di policy robotiche preaddestrate all'interno di loop di inferenza asincroni, modellando esplicitamente la linea temporale di esecuzione e propagando i gradienti solo attraverso le regioni di azione appena eseguite per garantire l'affidabilità in tempo reale e un controllo fluido.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
I robot hanno lottato a lungo per muoversi con la grazia fluida degli esseri viventi. Sebbene l'intelligenza artificiale abbia insegnato alle macchine a comprendere il linguaggio e a riconoscere oggetti con una precisione sorprendente, tradurre questa comprensione in movimento fisico rimane un ostacolo ostinato. Il problema non è solo che i robot debbano essere intelligenti; devono anche essere veloci e fluidi. Nel mondo reale, un braccio robotico non può fermarsi a riflettere tra ogni minimo movimento. Se si ferma a calcolare il passo successivo, il movimento diventa scattoso e il compito fallisce. Per muoversi fluidamente, un robot deve prevedere una serie di movimenti futuri ed eseguirli mentre calcola simultaneamente il set successivo. Ciò crea un complesso problema di tempistica: il robot agisce su istruzioni generate un istante prima, mentre il computer sta già lavorando sulle istruzioni per l'istante successivo. Se il robot cerca di imparare dai propri errori operando in queste condizioni, il processo di apprendimento spesso si interrompe, perché il robot viene giudicato su azioni che non ha mai effettivamente terminato, o azioni che è stato costretto ad abbandonare a metà strada.
Un team di ricercatori presso Astribot ha sviluppato un nuovo metodo chiamato SmoothRL per risolvere questo specifico enigma temporale. Il loro lavoro permette ai robot di imparare dall'esperienza in tempo reale, anche mentre operano su un programma complesso e sovrapposto in cui pensare e muoversi avvengono contemporaneamente. I ricercatori si sono concentrati su una discrepanza fondamentale nel modo in cui i robot vengono addestrati rispetto a come vengono utilizzati. In passato, gli scienziati addestravano i robot assumendo che la macchina si sarebbe fermata, avrebbe pensato e poi si sarebbe mossa in un ritmo perfetto e sincronizzato. Ma nel mondo reale, per mantenere il movimento fluido, i robot utilizzano un sistema in cui generano un "pezzo" (chunk) di movimenti futuri, inviano la prima parte ai motori e iniziano immediatamente a calcolare il pezzo successivo mentre il primo è ancora in fase di esecuzione. Questo crea una situazione in cui il robot scarta costantemente parti dei propri piani perché è arrivato un piano più nuovo e fresco. I ricercatori si sono resi conto che, affinché un robot possa imparare efficacemente in questo ambiente, deve smettere di cercare di imparare dalle parti del proprio piano che sono state scartate e concentrarsi solo sulle parti che ha effettivamente eseguito.
Il cuore della loro soluzione è un modo per insegnare al robot a ignorare le azioni "fantasma" che ha generato ma non ha utilizzato. Quando il robot crea un piano per i secondi successivi, divide quel piano in tre zone distinte. La prima zona contiene le azioni che sono già state decise dal ciclo di calcolo precedente; il robot non può cambiarle ora. La seconda zona contiene le nuove azioni che il robot effettivamente esegue mentre avviene il calcolo successivo. La terza zona contiene le restanti azioni future che saranno probabilmente sostituite dal calcolo successivo prima ancora che il robot ci arrivi. I ricercatori hanno costruito un sistema di addestramento che guarda solo alla seconda zona — le azioni che il robot ha realmente eseguito. Insegnano al robot ad aggiustare il proprio comportamento basandosi esclusivamente sulle conseguenze dei movimenti che ha effettivamente compiuto, tagliando efficacemente il segnale di apprendimento dalle parti del piano che sono state scartate. Ciò assicura che il robot impari dalla realtà, non da un futuro ipotetico che non è mai accaduto.
Per testare questo, i ricercatori hanno predisposto tre compiti fisici impegnativi su un robot mobile con due braccia. Il primo compito consisteva nel lanciare un oggetto in un contenitore, un movimento che richiede uno slancio continuo e ininterrotto. Se il robot esita o ha scatti nel momento in cui passa tra i cicli di calcolo, il lancio fallisce. Il secondo compito richiedeva al robot di chiudere una penna con estrema precisione, allineando due piccoli oggetti entro una tolleranza di pochi millimetri. Il terzo compito consisteva nello scollare una scatola di cartone guidando una lama lungo una piccola cucitura, un lavoro che richiede un'accuratezza millimetrica per evitare di tagliare la scatola stessa. In tutti e tre i casi, il robot è partito con un cervello pre-addestrato che era buono ma non perfetto. Quando i ricercatori hanno lasciato che il robot praticasse utilizzando il loro nuovo metodo di apprendimento asincrono, i risultati sono stati drammatici. La capacità del robot di lanciare l'oggetto con successo è passata dal trentanove per cento al novantaquattro per cento. La sua abilità nel chiudere la penna è salita da un misero otto per cento all'ottantatré per cento, e il suo tasso di successo nell'aprire la scatola è migliorato dal trenta per cento al novanta per cento.
Il miglioramento non riguardava solo l'esecuzione del compito più spesso; riguardava il modo in cui il robot si muoveva. I ricercatori hanno misurato la fluidità del movimento del robot e hanno scoperto che il nuovo metodo riduceva i sussulti improvvisi e le accelerazioni scattose di quasi la metà. Questa fluidità era critica per il compito dinamico del lancio, dove una pausa nel movimento farebbe cadere l'oggetto prima del previsto. Il sistema si è anche dimostrato abbastanza flessibile da gestire l'aiuto umano. Se un operatore umano aveva bisogno di intervenire per correggere un errore, il robot poteva assorbire quell'azione umana direttamente nel suo processo di apprendimento senza doverla tradurre in un codice diverso. La correzione dell'umano diventava semplicemente un altro esempio del modo corretto di muoversi, permettendo al robot di imparare sia dalle proprie prove che dalla guida umana simultaneamente.
I ricercatori hanno scoperto che l'apprendimento del robot non era sempre una linea retta. Nel compito di apertura della scatola, le prestazioni del robot sono effettivamente diminuite prima di migliorare, suggerendo che il sistema stava esplorando nuovi modi di muoversi che inizialmente sembravano peggiori prima di trovare la strada corretta. Ciò indica che il robot stava imparando davvero ad adattarsi piuttosto che limitarsi a memorizzare un insieme fisso di movimenti. Tuttavia, i ricercatori hanno anche notato i limiti del loro approccio. La capacità di apprendimento del robot è ancora legata alla qualità del suo cervello pre-addestrato iniziale. Se il robot di base è fondamentalmente confuso su un compito, i piccoli aggiustamenti apportati da questo sistema di apprendimento potrebbero non essere sufficienti a risolvere il problema. Inoltre, il sistema si basa sul fatto che i calcoli del robot finiscano entro un limite di tempo rigoroso; se il computer diventa troppo lento, la tempistica dei movimenti può uscire dalla sincronia, destabilizzando l'intero processo.
In definitiva, questo lavoro dimostra che, affinché i robot diventino veramente utili nel mondo reale, i loro algoritmi di apprendimento devono corrispondere alla realtà disordinata e sovrapposta di come si muovono. Insegnando al robot di concentrarsi solo sulle azioni che ha effettivamente completato e di ignorare quelle che ha scartato, i ricercatori hanno creato una via affinché le macchine possano apprendere compiti complessi e ad alta velocità senza sacrificare la fluidità necessaria per eseguirli. Il risultato è un robot che può lanciare, chiudere e tagliare con un livello di affidabilità e fluidità che prima era fuori portata, dimostrando che la chiave per un migliore apprendimento robotico risiede nel comprendere il momento preciso in cui un piano diventa realtà.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.