← Derniers articles
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA introduit un cadre unifié qui intègre la navigation et la manipulation dans une architecture unique dotée d'une tête d'action partagée et d'une stratégie d'entraînement progressif à plusieurs étapes, atteignant des performances de pointe tant dans les environnements simulés que réels pour faire progresser le développement d'agents robotiques à usage général.

Auteurs originaux : Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Publié 2026-06-02
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un assistant robotique. Jusqu'à présent, construire ce robot revenait à embaucher deux spécialistes distincts : une personne experte en marche (navigation) mais incapable d'utiliser ses mains, et une autre qui est un chef cuisinier hors pair (manipulation) mais incapable de traverser la pièce pour aller chercher les ingrédients. Si vous vouliez que le robot « marche jusqu'à la cuisine et mette une tasse dans le micro-ondes », vous deviez alterner entre ces deux « cerveaux » différents ou entraîner deux modèles séparés.

Le papier présente OneVLA, qui est comme l'embauche d'un employé « couteau suisse » naturellement doué à la fois pour marcher et pour utiliser ses mains, le tout au sein d'un seul et même cerveau.

Voici une décomposition simple de leur méthode :

1. La « Télécommande Universelle » (Tête d'action unifiée)

La plupart des robots possèdent des « télécommandes » différentes selon les tâches. Une télécommande possède des boutons pour avancer ou tourner à gauche. Une autre possède des curseurs pour monter, descendre ou pivoter un bras robotique.

OneVLA crée une télécommande unique et universelle.

  • Il combine les boutons de marche et les curseurs du bras en une seule longue bande de commandes.
  • Quand le robot reçoit une instruction comme « Va vers la porte », il appuie uniquement sur les « boutons de marche » de la bande.
  • Quand l'instruction est « Prends la tasse », il déplace seulement les « curseurs du bras ».
  • La Magie : Le robot n'a pas besoin de changer de cerveau ou de télécommande. Il sait simplement quelle partie de la télécommande utiliser en fonction de la tâche.

2. Le « Camp d'Entraînement en Trois Étapes » (Stratégie multi-étapes)

On ne peut pas simplement jeter un robot dans un monde complexe et s'attendre à ce qu'il sache tout immédiatement. Les auteurs ont entraîné OneVLA en trois phases spécifiques, comme un élève progressant à travers l'école :

  • Étape 1 : Apprendre à utiliser les mains. D'abord, ils ont appris au robot comment saisir, soulever et poser des objets à l'aide d'un bras robotique. Ils lui ont également appris à regarder des images et à les décrire (pour qu'il comprenne le monde).
  • Étape 2 : Apprendre à marcher. Ensuite, ils ont ajouté des données de navigation. Désormais, le robot apprend comment passer d'un point A à un point B. Comme il sait déjà « voir » et « réfléchir » grâce à l'étape 1, il apprend à marcher plus vite et plus intelligemment.
  • Étape 3 : Apprendre à « penser à voix haute » (Chaîne de pensée / Chain-of-Thought). Enfin, ils ont appris au robot à « verbaliser » son processus de réflexion. Avant de bouger, il se dit à lui-même : « Je suis dans le couloir. Je dois tourner à droite pour atteindre la cuisine. » Cette étape aide le robot à faire le lien entre ce qu'il voit, ce qu'il doit faire et comment bouger.

3. Le Résultat : Deux Compétences, Un Cerveau

Le papier affirme qu'en entraînant ces deux compétences ensemble, elles s'entraident en réalité pour devenir meilleures.

  • L'Analogie : Pensez à un joueur de basket qui joue aussi au football. Apprendre à dribbler un ballon de basket (manipulation) peut améliorer son jeu de jambes et son équilibre, ce qui l'aide à mieux courir sur le terrain de football (navigation).
  • La Preuve : Lors de tests, ce robot unique (OneVLA) a battu des robots spécialisés uniquement dans la marche ou uniquement dans l'utilisation des mains. Il était également meilleur que d'autres robots « hybrides » qui essayaient de faire les deux mais nécessitaient toujours des « modes » ou des réglages distincts pour chaque tâche.

En Résumé

OneVLA est un nouveau type de cerveau robotique qui n'a pas besoin d'être reprogrammé quand vous lui demandez de marcher ou quand vous lui demandez de saisir quelque chose. Il utilise un système unifié pour comprendre le langage, voir le monde et contrôler à la fois ses pieds et ses mains. Les auteurs démontrent que l'enseignement de ces compétences conjointement rend le robot plus intelligent dans les deux domaines que si on les avait enseignées séparément.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →