← Ultimi articoli
🤖 machine learning

Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control

Questo articolo introduce un meccanismo transformer a incremento a runtime che espande e pota dinamicamente le teste di attenzione durante l'apprendimento per rinforzo in base alla capacità rappresentativa del contesto e alla ridondanza delle teste, eliminando così i fallimenti catastrofici nel controllo adattivo a lungo termine di manipolatori robotici con memoria dell'attrito non osservabile e rimuovendo la necessità di costosi sintonizzaggi offline degli iperparametri.

Autori originali: Giansalvo Cirrincione, Adriano Fagiolini

Pubblicato 2026-09-15
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Giansalvo Cirrincione, Adriano Fagiolini

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

I robot che si muovono con precisione, come le braccia utilizzate nelle fabbriche per assemblare auto o manipolare materiali delicati, si affidano a una matematica complessa per sapere quanta forza applicare. Per decenni, gli ingegneri hanno utilizzato un metodo chiamato controllo della coppia computata (computed-torque control), che calcola la spinta o la trazione esatta necessaria per spostare un giunto verso un punto desiderato. Questo funziona bene quando il movimento del robot è prevedibile, ma le macchine del mondo reale affrontano un problema nascosto: l'attrito. Mentre parte dell'attrito è semplice e costante, altri tipi, come il comportamento di scivolamento viscoso noto come attrito di Stribeck, dipendono da uno stato interno nascosto che cambia nel tempo. Poiché i sensori di un robot non possono vedere direttamente questo stato nascosto, il sistema perde la capacità di prevedere il proprio comportamento futuro basandosi solo sulla posizione attuale. Per risolvere questo problema, i ricercatori si sono rivolti all'intelligenza artificiale, specificamente a un tipo di apprendimento chiamato apprendimento per rinforzo (reinforcement learning), in cui un programma informatico impara attraverso tentativi ed errori. Tuttavia, questi programmi utilizzano spesso una specifica caratteristica architettonica chiamata meccanismo di attenzione, che agisce come un riflettore, permettendo all'IA di concentrarsi su diverse parti della sua storia recente. Il numero di questi riflettori, o "teste", è solitamente fisso prima dell'inizio dell'addestramento, scelto attraverso un lungo ed costoso processo di ricerca. Se il numero scelto è troppo piccolo, il robot fallisce l'apprendimento; se è troppo grande, il sistema diventa inefficiente.

I ricercatori dietro questo studio hanno cercato di correggere questa rigidità creando un sistema capace di cambiare idea mentre sta imparando. Hanno sviluppato un nuovo controllore che non decide il numero di teste di attenzione in anticipo. Inveve, osserva le proprie prestazioni durante il processo di addestramento e aggiunge nuove teste quando sente di essere sopraffatto dalla complessità del compito, o le rimuove quando si rende conto che alcune non stanno facendo nulla. Questo avviene in tempo reale, senza interrompere il processo di apprendimento. Il sistema utilizza due segnali semplici per prendere queste decisioni. Primo, misura quanta nuova informazione arriva dalla storia del robot; se l'informazione è troppo complessa per l'attuale numero di teste, il sistema ne crea una nuova. Secondo, controlla quanto ogni testa contribuisce alla decisione finale; se una testa contribuisce pochissimo, il sistema la rimuove silenziosamente. Fondamentalmente, i ricercatori hanno progettato il sistema in modo che l'aggiunta o la rimozione di una testa non causi un salto improvviso o un errore nel comportamento del robot. Quando viene aggiunta una nuova testa, essa inizia con un'influenza pari a zero, garantendo che il movimento del robot rimanga fluido. Quando una testa viene rimossa, il cambiamento è così piccolo da non interrompere l'apprendimento.

Il team ha testato questo approccio su un braccio robotico simulato a due giunti che affrontava diversi livelli di memoria dell'attrito, spaziando da ritardi a breve termine a ritardi a lungo termine. In esperimenti precedenti che utilizzavano un numero fisso di teste, il sistema falliva completamente negli scenari più difficili a lunga memoria, causando spesso la perdita di controllo del robot o l'ignoranza del peso che stava trasportando. Con il nuovo sistema regolabile in tempo di esecuzione, il robot ha avuto successo in ogni singolo test, anche nei casi difficili in cui il vecchio metodo falliva. I ricercatori hanno scoperto che il sistema non ha scoperto un numero specifico di teste "naturale" intrinseco al compito; al contrario, ha saturato il limite massimo di teste in ogni esecuzione della campagna principale, e il trigger di potatura (prune trigger) non è mai scattato per rimuovere le teste inutilizzate. Interessante è che il beneficio non derivava dalla dimensione finale del sistema, ma dal modo in cui esso cresceva. Il processo graduale di aggiunta delle teste ha agito come un curriculum di addestramento, aiutando il robot a imparare passo dopo passo invece di essere gettato in un compito complesso tutto in una volta. Ciò suggerisce che la capacità di adattare l'architettura durante l'apprendimento sia più importante di avere una struttura massiccia e pre-costruita. Il risultato è un modo più robusto ed efficiente per insegnare ai robot come gestire l'attrito disordinato e imprevedibile del mondo reale, eliminando la necessità di costose ricerche per tentativi ed errori per trovare le impostazioni corrette prima che il robot si muova.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →