← Derniers articles
💻 computer science

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

Ce papier présente HAMLET, un cadre évolutif qui transforme les modèles Vision-Language-Action en politiques conscientes de l'historique en intégrant des « tokens de moment » et un module de mémoire léger, permettant ainsi d'améliorer considérablement les performances des robots sur des tâches de manipulation à long terme dépendant du contexte passé.

Auteurs originaux : Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

Publié 2026-04-16
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🤖 Le Problème : Le Robot qui a la "mémoire de poisson rouge"

Imaginez que vous donnez des instructions à un robot pour qu'il range votre cuisine.

  • La situation : Vous lui dites : "Prends la tasse bleue, mets-la sous la soucoupe, puis empile la tasse rouge dessus."
  • Le problème des robots actuels : La plupart des robots intelligents d'aujourd'hui (appelés modèles VLA) sont comme des gens qui ont une mémoire de poisson rouge. Ils ne voient que l'image exacte devant eux à l'instant T.
    • Si le robot regarde la table et voit une tasse, il ne sait pas si il vient de la prendre ou s'il doit la prendre.
    • Si un objet est caché (occlusion), le robot panique car il ne se souvient pas de ce qu'il a vu il y a deux secondes.
    • C'est comme essayer de résoudre un puzzle en ne regardant qu'une seule pièce à la fois, sans jamais se souvenir des pièces précédentes.

💡 La Solution : HAMLET (Le Robot qui se souvient)

Les chercheurs ont créé HAMLET. C'est une petite "boîte à outils" intelligente que l'on peut ajouter à n'importe quel robot existant pour lui donner une mémoire à court terme.

Pour comprendre comment ça marche, imaginons que le robot est un chef cuisinier très occupé.

1. Les "Jetons de Moment" (Moment Tokens) : Les Post-it Magiques

Au lieu de faire lire au robot toutes les vidéos de la cuisine (ce qui serait trop lourd et lent), HAMLET utilise de petits Jetons de Moment.

  • L'analogie : Imaginez que le robot prend un "Post-it" à chaque seconde importante. Au lieu de noter tout ce qui se passe (le bruit, la couleur du mur, la poussière), il écrit seulement l'essentiel sur ce Post-it : "J'ai saisi la tasse bleue" ou "Le cube est caché".
  • L'astuce : Ces Post-it sont créés de manière spéciale (grâce à une technique appelée apprentissage contrastif temporel) pour s'assurer qu'ils ne notent que ce qui change et ce qui est important, en ignorant le fond statique.

2. Le Module Mémoire : Le Tableau de Bord

Ensuite, ces Post-it sont envoyés à un petit Tableau de Bord (le module mémoire).

  • L'analogie : Ce tableau ne colle pas tous les Post-it les uns sur les autres au hasard. Il agit comme un chef d'orchestre. Il regarde les Post-it passés et se demande : "Ah, 3 secondes plus tôt, j'ai vu le cube bleu ! C'est crucial pour décider quoi faire maintenant."
  • Il ignore les Post-it inutiles (comme "le mur est blanc") et se concentre sur les indices qui aident à prendre la bonne décision.

🚀 Pourquoi c'est génial ? (Les Résultats)

Le papier montre que cette méthode change la donne :

  1. C'est léger et rapide : Contrairement à d'autres méthodes qui essaient de faire lire au robot des heures de vidéo (ce qui le rend lent et gourmand en énergie), HAMLET est comme un résumé. Le robot reste rapide, mais il est beaucoup plus intelligent.
  2. Il résout les tâches complexes : Sur des tâches où il faut se souvenir de plusieurs étapes (comme "échanger deux cubes" ou "empiler des objets"), les robots sans mémoire échouent souvent. Avec HAMLET, leur taux de réussite explose.
    • Exemple : Dans un test réel, un robot qui réussissait seulement 29% des tâches complexes avec la méthode classique a atteint 76% avec HAMLET. C'est énorme !
  3. C'est universel : On peut ajouter cette "mémoire" à presque n'importe quel robot déjà existant sans avoir à le rééduquer de zéro. C'est comme ajouter un module GPS à une voiture qui n'en avait pas : elle roule déjà bien, mais maintenant elle ne se perd plus.

🎯 En Résumé

HAMLET, c'est comme donner à un robot une mémoire de travail humaine.

  • Sans HAMLET : Le robot regarde, agit, oublie, regarde, agit, oublie... (Il se trompe souvent).
  • Avec HAMLET : Le robot regarde, note l'essentiel sur un Post-it, consulte son tableau de bord pour se souvenir de l'action précédente, et agit avec précision.

C'est une avancée majeure pour rendre les robots capables de faire des tâches longues et complexes dans notre monde réel, sans avoir besoin de super-ordinateurs gigantesques.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →