← Derniers articles
🤖 AI

UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning

UniJEPA est un cadre de politique robotique unifié qui exploite un préentraînement à grande échelle sur des vidéos d'instructions pour apprendre des représentations continues et discrètes combinées, permettant des performances supérieures dans des tâches hors distribution en simulation et dans le monde réel par rapport aux approches existantes de vision-langage et génératives.

Auteurs originaux : Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

Publié 2026-05-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'enseigner à un robot à faire des tâches ménagères autour de la maison. L'article présente une nouvelle méthode appelée UniJEPA (Unified Joint Embedding Prediction and Action) pour rendre ces robots plus intelligents, plus flexibles et meilleurs dans la gestion de situations qu'ils n'ont jamais rencontrées auparavant.

Voici le détail de son fonctionnement, en utilisant des analogies simples :

Le Problème : Le Robot « à Deux Têtes »

Actuellement, les cerveaux de robots tombent généralement dans deux camps, et chacun présente une faiblesse :

  1. Le « Parleur » (Modèles Vision-Langage) : Ces robots sont excellents pour comprendre le langage et les images. Si vous dites « Prends la tasse rouge », ils savent ce qu'est une tasse et ce que signifie « rouge ». Mais ils sont mauvais pour prédire la physique. Ils ne savent pas intuitivement comment la tasse va vaciller s'ils la saisissent trop fort, ni comment elle va rouler sur la table.
  2. Le « Prédicteur » (Modèles Génératifs) : Ces robots sont excellents pour deviner ce qui va se passer ensuite. S'ils voient une balle rouler, ils peuvent prédire où elle sera dans une seconde. Mais ils manquent souvent de « bon sens » ou de compréhension du langage. Ils peuvent savoir comment bouger, mais pas pourquoi ils bougent ou ce que l'humain leur a réellement demandé de faire.

La plupart des robots essaient d'utiliser l'un ou l'autre, ou tentent de les fusionner d'une manière qui fait perdre le meilleur des deux.

La Solution : Le « Rêveur Bilingue » (UniJEPA)

UniJEPA est comme un robot qui apprend à parler deux langues et à rêver de deux manières simultanément. Il combine le « Parleur » et le « Prédicteur » en un seul cerveau.

Imaginez un étudiant qui apprend à conduire une voiture :

  • Apprentissage Discret (Le « Parleur ») : C'est comme apprendre les règles de la route et le vocabulaire. « Panneau stop signifie stop », « Vert signifie avance ». Le robot apprend à comprendre des instructions complexes et à décrire ce qu'il voit en utilisant des mots.
  • Apprentissage Continu (Le « Rêveur ») : C'est comme apprendre la sensation de la voiture. Il ne s'agit pas seulement des règles ; c'est prédire le flux fluide du mouvement. Si vous tournez légèrement le volant, comment la voiture dérive-t-elle ? UniJEPA apprend à prédire la scène visuelle future non pas comme une vidéo floue, mais comme une « sensation » de haut niveau ou une carte de ce qui va se passer ensuite.

Comment Ils L'Ont Entraîné (Le Processus en Deux Étapes)

Étape 1 : La Phase « Bibliothèque et Cinéma » (Pré-entraînement)
Avant que le robot ne touche jamais un objet réel, on lui laisse « lire » et « regarder » d'énormes quantités de données.

  • Ils lui ont fait ingérer plus de 1 million de vidéos de humains et de robots effectuant des tâches (comme ouvrir des tiroirs ou ramasser des jouets).
  • L'Astuce : Ils ont demandé au robot de faire deux choses à la fois :
    1. Répondre à des questions : « Que fait le robot ? » (Cela affine son langage et sa compréhension).
    2. Prédire le futur : « Si le robot bouge son bras de cette manière, à quoi ressemblera l'image dans 1 seconde ? » (Cela affine sa compréhension de la physique et du mouvement).
  • En faisant les deux, le robot construit un modèle mental où les mots et le mouvement physique sont parfaitement liés.

Étape 2 : La Phase « École de Conduite » (Affinage)
Une fois que le robot possède cette connaissance générale, on lui apprend spécifiquement comment bouger son propre corps.

  • On lui montre des données provenant du bras ou de la main réelle du robot.
  • Le robot apprend à traduire ses « rêves » (prédictions du futur) et sa « compréhension » (instructions linguistiques) directement en jetons d'action (les commandes spécifiques pour déplacer les moteurs).
  • Il utilise un système spécial « expert » (comme une équipe de spécialistes) pour gérer les mathématiques complexes du déplacement d'un bras réel sans heurter d'obstacles.

Les Résultats : Pourquoi C'est Mieux

L'article a testé ce robot de deux manières :

  1. Dans un Jeu Vidéo (Simulation) : On lui a donné des tâches qu'il n'avait jamais vues auparavant, comme déplacer un objet spécifique d'une manière spécifique. UniJEPA a battu tous les autres robots de pointe avec une marge significative (environ 9 à 12 % de mieux).
  2. Dans le Monde Réel : Ils l'ont installé sur un bras robotique réel et sur une main robotique sophistiquée à 12 doigts.
    • La Magie : Lorsqu'ils ont donné au robot une tâche avec un objet complètement nouveau (par exemple, un jouet qu'il n'avait jamais vu, ou une couleur étrange), UniJEPA ne s'est pas perdu. Parce qu'il avait appris le concept de « saisie » et de « déplacement » plutôt que de simplement mémoriser des images spécifiques, il pouvait gérer ces situations « hors distribution » (étranges) bien mieux que la concurrence.

En Résumé

UniJEPA est un cerveau de robot qui ne se contente pas de mémoriser des instructions ou de simplement deviner la physique. Il apprend à comprendre le monde à travers le langage tout en simulant simultanément le futur par le mouvement. Cette double approche lui permet d'être un « généraliste » : un robot capable de s'adapter à de nouvelles tâches et de nouveaux objets sans avoir besoin d'être réentraîné depuis zéro à chaque fois.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →