← Ultimi articoli
🤖 AI

RoboSSM: Scalable In-context Imitation Learning via State-Space Models

Il documento presenta RoboSSM, un framework di apprendimento per imitazione in-context scalabile che sostituisce i Transformer con il modello state-space Longhorn per ottenere un'inferenza in tempo lineare e una generalizzazione superiore su compiti a lungo termine e non visti all'interno del benchmark LIBERO.

Autori originali: Youngju Yoo, Jiaheng Hu, Yifeng Zhu, Bo Liu, Qiang Liu, Roberto Martín-Martín, Peter Stone

Pubblicato 2026-06-19
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Youngju Yoo, Jiaheng Hu, Yifeng Zhu, Bo Liu, Qiang Liu, Roberto Martín-Martín, Peter Stone

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di insegnare a un robot un nuovo compito, come "prendi il succo d'arancia e mettilo nel cestello".

Il Vecchio Modo (Il Robot "Transformer"):
In precedenza, i robot imparavano questo usando un sistema chiamato "Transformer". Pensa a questo come a uno studente che deve rileggere l'intero libro di testo ogni volta che riceve una nuova domanda. Se dai al robot un breve video di qualcuno che svolge il compito, funziona bene. Ma se provi a mostrargli un video molto lungo con molti esempi (un "prompt lungo"), lo studente si sente sopraffatto. Inizia a dimenticare l'inizio del video mentre arriva alla fine e le sue prestazioni crollano. Diventa anche molto lento perché deve rileggere tutto da capo.

Il Nuovo Modo (RoboSSM):
Il documento introduce RoboSSM, un nuovo modo per insegnare ai robot usando un'architettura cerebrale diversa chiamata Modello a Spazio di Stato (SSM - State-Space Model).

Ecco come funziona RoboSSM, usando analogie semplici:

1. Lo "Scorrimento Infinito" vs. La "Biblioteca"

  • Transformers (La Biblioteca): Immagina un bibliotecario che deve camminare verso ogni singolo libro sullo scaffale per trovare una connessione tra di essi. Se aggiungi più libri (più dimostrazioni), il bibliotecario impiega molto più tempo per trovare la risposta. Se lo scaffale diventa troppo lungo, si perde.
  • RoboSSM (Lo Scorrimento Infinito): RoboSSM è come uno scorrimento intelligente che si aggiorna man mano che leggi. Non ha bisogno di rileggere tutta la cronologia ogni volta. Mantiene un riassunto continuo nella sua "memoria" che si aggiorna istantaneamente. Questo significa che può gestire un video con 16 volte più esempi di quelli per cui è stato addestrato senza diventare lento o confuso.

2. La Regolazione "Beta" (La Manopola del Volume)

Il documento menziona un trucco speciale chiamato β\beta-scaling.

  • Immagina di ascoltare un coro. A volte vuoi sentire tutto il gruppo allo stesso modo. A volte, vuoi concentrarti intensamente sul solista (la nuova dimostrazione che hai appena mostrato al robot).
  • RoboSSM ha una "manopola del volume" (il parametro β\beta) che può girare su o giù. Quando il robot vede un nuovo compito, alza il volume sugli esempi recenti per assicurarsi di prestare molta attenzione ad essi, aiutandolo a imparare più velocemente senza dimenticare le vecchie regole.

3. I Risultati: Cosa hanno scoperto?

I ricercatori hanno testato questo sistema su un famoso test per robot chiamato LIBERO, che comprende compiti come prendere delle ciotole, aprire dei cassetti e impilare oggetti.

  • Il Test del "Video Lungo": Hanno addestrato il robot su un video breve (2 esempi) e poi lo hanno testato con un video molto lungo (32 esempi).
    • Il Vecchio Robot (ICRT): Ha fallito miseramente. Non riusciva a gestire la lunghezza extra.
    • RoboSSM: È diventato migliore man mano che vedeva più esempi. È riuscito a prendere oggetti che non aveva mai visto prima, semplicemente guardando una lunga lista di esempi.
  • Il Test del "Rallentatore": Hanno rallentato i video delle dimostrazioni (dilatazione temporale) per simulare un robot che si muove lentamente o esita.
    • Il Vecchio Robot: Si è confuso e ha fallito.
    • RoboSSM: È rimasto calmo e di successo, dimostrando di poter gestire le variazioni di tempo nel mondo reale.
  • Il Test della "Velocità":
    • Il Vecchio Robot: Diventava sempre più lento man mano che il video si allungava.
    • RoboSSM: È rimasto veloce ed efficiente, indipendentemente da quanto fosse lungo il video.

Il Quadro Generale

Il documento afferma che RoboSSM è il primo sistema che dimostra come sia possibile insegnare nuovi compiti ai robot "al volo", semplicemente mostrando loro una lunga lista di esempi, senza dover riaddestrare il cervello del robot. È più veloce, gestisce meglio le liste lunghe di istruzioni ed è più robusto rispetto ai cambiamenti di velocità o di tempo rispetto ai precedenti metodi "Transformer".

In breve: se il vecchio robot era uno studente che si stancava dopo aver letto 5 pagine, RoboSSM è uno studente che può leggere 80 pagine, ricordare perfettamente la prima pagina e rispondere comunque alla domanda rapidamente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →