← Derniers articles
💻 computer science

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

JEPA-WAM introduit un modèle d'action du monde latent construit sur un espace V-JEPA préentraîné qui unifie la prédiction de futur spatialement structurée et la génération d'actions continues via un prédicteur partagé, atteignant des performances de pointe sur les benchmarks de manipulation robotique sans nécessiter de préentraînement de politique à grande échelle.

Auteurs originaux : Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

Publié 2026-08-11
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot à cuisiner. Vous pourriez simplement lui montrer une vidéo d'un chef coupant des oignons et lui dire : « Fais comme ça. » Mais si le robot se contente de mémoriser l'apparence exacte de cette vidéo spécifique, il pourrait paniquer si le chef porte un chapeau différent ou si la lumière de la cuisine change. C'est le défi des modèles de Vision-Langage-Action (VLA) : ils sont excellents pour suivre des instructions dans des environnements familiers, mais ils trébuchent souvent lorsque le monde ressemble un peu différemment de ce pour quoi ils ont été entraînés.

Pour remédier à cela, les scientifiques ont essayé d'apprendre aux robots à être des « prédicteurs ». Au lieu de simplement réagir, le robot essaie d'imaginer ce qui va se passer ensuite. S'il peut prédire que « si je pousse cette tasse, elle glissera de la table », il peut mieux planifier. Cependant, demander à un robot de générer des vidéos complètes en haute définition du futur, c'est comme demander à un étudiant d'écrire un roman entier juste pour décider de ce qu'il doit faire ensuite — cela prend trop de temps et de puissance de calcul. Les chercheurs ont donc cherché un raccourci : un modèle « latent » qui prédit l'idée du futur sans dessiner l'image entière. Mais voici le problème : beaucoup de ces raccourcis soit perdent trop de détails, soit traitent la prédiction et l'action comme deux tâches distinctes et déconnectées.

Cela nous amène à JEPA-WAM, une nouvelle approche qui tente d'apprendre aux robots à « ressentir » le flux du temps sans s'enliser dans le dessin de chaque image. Elle pose une question simple : pouvons-nous apprendre à un robot à comprendre comment le monde change, et utiliser cette compréhension pour mieux bouger, le tout en un mouvement fluide ?


Le raccourci du « sens du temps » du robot

Rencontrez JEPA-WAM. Considérez-le comme un robot qui ne se contente pas de regarder une photo du présent et de deviner la photo suivante ; il apprend plutôt la relation entre les deux.

Imaginez que vous regardiez un tour de magie. Un magicien place une balle rouge dans une boîte, puis en sort une bleue. Un robot standard pourrait simplement mémoriser « Balle Rouge → Balle Bleue ». Mais JEPA-WAM est comme un détective qui remarque la transition : « La balle rouge a disparu, la boîte a tremblé, et une balle bleue est apparue. » Il apprend l'histoire du changement, pas seulement l'avant et l'après.

Les chercheurs ont construit ce système sur un « cerveau visuel » pré-entraîné appelé V-JEPA. Vous pouvez considérer V-JEPA comme un robot qui a déjà regardé des millions de vidéos et appris comment les objets bougent et interagissent. JEPA-WAM prend ce cerveau et y ajoute un module spécial de « voyage dans le temps ».

Voici le tour de magie : au lieu de demander au robot de générer une vidéo floue du futur (ce qui est lent et coûteux), JEPA-WAM demande au robot de prédire une carte conjointe. Imaginez prendre une photo de la cuisine maintenant et une photo de la cuisine cinq secondes plus tard, puis les superposer. JEPA-WAM n'essaie pas de dessiner la photo du futur à partir de zéro. Au lieu de cela, il observe la différence entre les deux photos superposées et apprend exactement comment les pixels ont bougé. Il apprend que « la tasse a bougé de deux pouces vers la gauche » et que « le tiroir s'est ouvert », préservant ainsi les détails précis de ce qui s'est passé.

Le cerveau partagé : un prédicteur, deux tâches

La partie la plus ingénieuse de JEPA-WAM est la façon dont il utilise son cerveau. Dans de nombreux anciens systèmes, la partie qui prédit le futur et celle qui fait bouger les bras du robot étaient comme deux personnes différentes se parlant à travers un mur. L'une devinait le futur, et l'autre essayait d'écouter.

JEPA-WAM utilise un Prédicteur Partagé. Imaginez un étudiant unique et très intelligent qui passe un examen.

  1. Tâche A : L'étudiant observe la scène actuelle et prédit comment le monde va changer (le « Sens du Temps »).
  2. Tâche B : L'étudiant utilise cette même compréhension pour décider comment bouger les bras du robot (l' « Action »).

Parce que l'étudiant accomplit ces deux tâches en même temps, l'apprentissage de la prédiction du futur façonne directement sa façon de décider de bouger. Le papier suggère que ce couplage étroit rend le robot beaucoup plus intelligent. C'est comme un danseur qui ne se contente pas de mémoriser des pas, mais qui comprend le rythme de la musique ; le mouvement est fluide car la prédiction et l'action naissent de la même compréhension.

Est-ce que cela fonctionne vraiment ?

Les chercheurs ont testé cette idée dans trois mondes différents : une simulation de jeu vidéo standard, une simulation plus chaotique avec des objets aléatoires, et un véritable bras robotique dans un laboratoire.

Dans les simulations :
Sur un benchmark appelé LIBERO-Plus, qui teste la capacité des robots à gérer les changements d'environnement (comme des éclairages différents ou des positions d'objets), JEPA-WAM a obtenu un score de 79,2 %. C'était le meilleur résultat parmi les robots n'ayant pas été pré-entraînés sur de vastes quantités de données robotiques. Plus impressionnant encore, lorsqu'ils ont appliqué ce truc de « sens du temps » à un cerveau robotique déjà puissant nommé π0.5, le score est passé de 84,5 % à 86,3 %. Cela suggère que même les robots intelligents peuvent devenir plus intelligents s'ils apprennent à prédire le flux du temps.

Dans le monde réel :
L'équipe a emmené son robot dans un vrai laboratoire avec une configuration à deux bras (deux bras robotiques travaillant ensemble). Ils lui ont demandé d'accomplir des tâches comme empiler des blocs, poser des fruits sur une assiette ou ouvrir un tiroir.

  • Lorsque la configuration était exactement celle attendue (In-Distribution), JEPA-WAM a obtenu environ 59,8 %.
  • Lorsque l'arrière-plan a été modifié ou que les objets ont été déplacés (Out-of-Distribution), JEPA-WAM a tout de même réussi à obtenir 54,2 %.
  • En comparaison, un robot standard (π0) est passé de 51,8 % à un faible 22,5 % lorsque l'environnement changeait.

Cela montre que JEPA-WAM est beaucoup plus robuste. Il ne mémorise pas une scène spécifique ; il apprend la logique de mouvement des objets, ce qui lui permet de gérer les surprises.

Ce qu'il n'est pas (et ce qu'il écarte)

Le document précise avec soin ce que JEPA-WAM n'est pas.

  • Il n'est pas un générateur de vidéo. Il ne cherche pas à créer une nouvelle vidéo haute définition du futur. Les auteurs soutiennent que tenter de générer chaque pixel est trop coûteux et souvent inutile pour contrôler un robot.
  • Il n'est pas uniquement axé sur la prédiction de l'état final. Les chercheurs ont testé une version qui ne regardait que l'image « future » sans l'image « actuelle », et elle a moins bien performé (77,3 % contre 79,2 %). Cela prouve que comprendre la relation entre « maintenant » et « plus tard » est plus important que de simplement deviner le résultat final.
  • Il n'est pas une solution miracle pour tout. Les auteurs notent que si la même scène visuelle conduit à deux résultats très différents selon une instruction spécifique (ex : « pousse la tasse » vs « tire la tasse »), le modèle pourrait avoir des difficultés car il se concentre sur les changements visuels plutôt que sur les objectifs spécifiques du langage.

L'essentiel à retenir

JEPA-WAM suggère que le secret pour rendre les robots plus adaptables n'est pas seulement de leur donner plus de données ou des cerveaux plus gros, mais de leur apprendre à comprendre le flux du temps d'une manière qui informe directement leurs actions. En utilisant un cerveau partagé pour prédire comment le monde change et décider comment bouger, le robot devient plus semblable à un humain habile capable de s'adapter à une cuisine désordonnée sans paniquer.

Les résultats, mesurés en simulations et lors d'essais en conditions réelles, suggèrent que cette approche de « prédiction conjointe » est un moyen puissant de construire des robots capables de gérer la nature imprévisible du monde réel. Bien qu'il ne s'agisse pas d'une solution parfaite pour toutes les tâches possibles, elle offre une nouvelle voie prometteuse pour créer des robots qui ne sont pas seulement obéissants, mais véritablement adaptables.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →