RoboSSM: Scalable In-context Imitation Learning via State-Space Models
Le papier introduit RoboSSM, un cadre d'apprentissage par imitation en contexte (in-context imitation learning) scalable qui remplace les Transformers par le modèle d'espace d'état Longhorn afin d'atteindre une inférence en temps linéaire et une généralisation supérieure sur des tâches à long horizon et inédites au sein du benchmark LIBERO.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous enseigniez à un robot une nouvelle tâche ménagère, comme « ramasser le jus d'orange et le mettre dans le panier ».
L'ancienne méthode (le robot « Transformer ») :
Auparavant, les robots apprenaient cela en utilisant un système appelé « Transformer ». Considérez cela comme un étudiant qui doit relire l'intégralité de son manuel à chaque fois qu'il reçoit une nouvelle question. Si vous donnez au robot une courte vidéo de quelqu'un effectuant la tâche, cela fonctionne bien. Mais si vous essayez de lui montrer une vidéo très longue avec de nombreux exemples (un « long prompt »), l'étudiant est submergé. Il commence à oublier le début de la vidéo lorsqu'il arrive à la fin, et ses performances s'effondrent. Il devient également très lent car il doit tout relire depuis le début.
La nouvelle méthode (RoboSSM) :
Le document présente RoboSSM, une nouvelle façon d'enseigner aux robots en utilisant une architecture cérébrale différente appelée Modèle d'Espace d'États (SSM - State-Space Model).
Voici comment fonctionne RoboSSM, en utilisant des analogies simples :
1. Le « Défilement Infini » vs La « Bibliothèque »
- Transformers (La Bibliothèque) : Imaginez un bibliothécaire qui doit se rendre auprès de chaque livre sur l'étagère pour trouver un lien entre eux. Si vous ajoutez plus de livres (plus de démonstrations), le bibliothécaire met beaucoup plus de temps à trouver la réponse. Si l'étagère devient trop longue, il se perd.
- RoboSSM (Le Défilement Infini) : RoboSSM est comme un parchemin intelligent qui se met à jour au fur et à mesure que vous lisez. Il n'a pas besoin de relire tout l'historique à chaque fois. Il garde un résumé continu dans sa « mémoire » qui se met à jour instantanément. Cela signifie qu'il peut gérer une vidéo avec 16 fois plus d'exemples que ce pour quoi il a été entraîné, sans devenir lent ou confus.
2. L'ajustement « Bêta » (Le bouton de volume)
Le document mentionne une astuce spéciale appelée -scaling.
- Imaginez que vous écoutez une chorale. Parfois, vous voulez entendre tout le groupe de manière égale. Parfois, vous voulez vous concentrer intensément sur le soliste (la nouvelle démonstration que vous venez de montrer au robot).
- RoboSSM possède un « bouton de volume » (le paramètre ) qu'il peut tourner pour augmenter ou diminuer le son. Lorsqu'il voit une nouvelle tâche, il augmente le volume sur les nouveaux exemples pour s'assurer qu'il y prête une attention particulière, ce qui l'aide à apprendre plus rapidement sans oublier les règles précédentes.
3. Les résultats : Qu'ont-ils découvert ?
Les chercheurs ont testé cela sur un test célèbre pour les robots appelé LIBERO, qui implique des tâches comme ramasser des bols, ouvrir des tiroirs ou empiler des objets.
- Le test de la « Vidéo Longue » : Ils ont entraîné le robot sur une vidéo courte (2 exemples) puis l'ont testé avec une vidéo très longue (32 exemples).
- L'ancien robot (ICRT) : A échoué lamentablement. Il ne pouvait pas gérer la longueur supplémentaire.
- RoboSSM : Est devenu meilleur à mesure qu'il voyait des exemples. Il a réussi à ramasser des objets qu'il n'avait jamais vus auparavant, simplement en regardant une longue liste d'exemples.
- Le test du « Ralenti » : Ils ont ralenti les vidéos de démonstration (dilatation temporelle) pour simuler un robot se déplaçant lentement ou hésitant.
- L'ancien robot : A été confus et a échoué.
- RoboSSM : Est resté calme et efficace, prouvant qu'il peut gérer les variations de vitesse dans le monde réel.
- Le test de la « Vitesse » :
- L'ancien robot : Devenait de plus en plus lent à mesure que la vidéo s'allongeait.
- RoboSSM : Est resté rapide et efficace, peu importe la longueur de la vidéo.
La vue d'ensemble
Le document affirme que RoboSSM est le premier système à prouver que l'on peut enseigner de nouvelles tâches aux robots à la volée, simplement en leur montrant une longue liste d'exemples, sans avoir besoin de réentraîner le cerveau du robot. Il est plus rapide, gère mieux les longues listes d'instructions et est plus robuste aux changements de vitesse ou de timing que les précédentes méthodes basées sur les « Transformers ».
En bref : si l'ancien robot était un étudiant qui se fatiguait après avoir lu 5 pages, RoboSSM est un étudiant capable de lire 80 pages, de se souvenir parfaitement de la première page, et de répondre toujours aussi rapidement à la question.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.