← Derniers articles
💻 computer science

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

Gaze2Act est un nouveau cadre Vision-Language-Action qui améliore la manipulation robotique en intégrant le regard humain comme signal d'intention dynamique, comblant les écarts entre les vues ego et exo pour atteindre des performances de pointe en matière de désambiguïsation d'objets, d'interaction fine et de pilotage d'intention dynamique sur un humanoïde Unitree G1.

Auteurs originaux : Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

Publié 2026-05-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un robot comment vous aider en cuisine. Vous dites : « Passe-moi cette tasse. » Mais il y a cinq tasses sur la table : une rouge, une bleue, une avec une fissure, et deux blanches identiques. Si vous dites simplement « la tasse », le robot pourrait saisir la mauvaise, ou pire, saisir celle que vous ne voulez pas.

C'est le problème que l'article Gaze2Act tente de résoudre. Il soutient que le langage humain est souvent trop vague pour que les robots comprennent exactement ce que nous voulons, surtout lorsque nous devons être précis ou lorsque nos intentions changent en cours de tâche.

Voici comment l'article explique leur solution, en utilisant des analogies simples :

L'idée centrale : « Les yeux guident les mains »

Les auteurs ont remarqué quelque chose que les humains font naturellement : nous regardons ce que nous sommes sur le point de toucher avant de le toucher. Si vous voulez saisir une pomme spécifique, vos yeux se fixent dessus une fraction de seconde avant que votre main ne s'étende.

L'article propose que, au lieu de simplement parler au robot, nous devrions permettre au robot de « voir » où nos yeux regardent. Ils appellent cela Gaze2Act. C'est comme donner au robot une paire de « lunettes de télépathie » qui lui montrent exactement sur quoi vous vous concentrez, en temps réel.

Comment cela fonctionne : Le tour de magie en trois étapes

L'article décrit un système qui comble le fossé entre ce que vous voyez et ce que le robot voit.

1. Le Traducteur (Ancrage inter-vues)

  • Le problème : Vous portez des lunettes intelligentes et regardez une tasse depuis votre perspective. Le robot regarde la même tasse sous un angle différent. Votre « point de regard » (là où vos yeux regardent) ne correspond pas à la vue de la caméra du robot.
  • La solution : Le système agit comme un traducteur ultra-intelligent. Il prend votre point de regard et utilise un outil de « correspondance visuelle » pour trouver le même objet exact dans la vue de la caméra du robot. Il dessine un masque numérique (comme un surligneur) autour de l'objet que vous regardez et marque l'endroit exact où vous fixez votre regard.
  • Analogie : Imaginez que vous pointez un arbre spécifique dans une forêt depuis une colline. Le robot est au bas de la colline. Le système dessine instantanément un cercle lumineux autour de cet arbre précis dans la vue du robot, même si les angles sont totalement différents.

2. Le Surligneur (Amorçage au niveau de la perception)

  • Le problème : Savoir simplement « où » ne suffit pas ; le robot doit savoir quoi faire avec cette information.
  • La solution : Le système prend ce surlignage numérique et le peint directement sur l'image que le robot voit.
    • Si vous devez saisir l'objet entier, il dessine un contour coloré autour de lui.
    • Si vous devez toucher une petite partie spécifique (comme le manche d'un marteau), il peint une carte thermique (une tache rouge lumineuse) directement sur ce manche.
  • Analogie : C'est comme un enseignant pointant une carte et dessinant un cercle rouge autour de la ville que vous voulez visiter, afin que le robot n'ait pas à deviner quelle ville vous vouliez dire.

3. La Voix Intérieure (Conditionnement au niveau de l'action)

  • Le problème : Parfois, montrer simplement une image au robot ne suffit pas pour le faire bouger parfaitement. Il pourrait encore être un peu confus.
  • La solution : Le système ne montre pas seulement l'image au robot ; il chuchote aussi une instruction secrète directement dans le « cerveau » du robot (son code générateur d'actions). Il dit au robot : « Hé, ignore tout le reste, concentre-toi uniquement sur cette tache lumineuse spécifique. »
  • Analogie : C'est comme un entraîneur qui ne se contente pas de pointer le but, mais qui tape aussi l'épaule du joueur pour dire : « Cours tout droit vers cet endroit, pas celui à côté. »

Ce qu'ils ont testé (La preuve « du monde réel »)

Les chercheurs ont testé cela sur un Unitree G1, un robot humanoïde qui ressemble à un humain. Ils lui ont donné 16 tâches différentes, notamment :

  • Saisir la bonne tasse lorsqu'il y en a plusieurs de similaires (désambiguïsation).
  • Saisir des parties spécifiques d'un objet, comme le manche d'un marteau plutôt que la tête (interaction fine).
  • Changer la cible en cours de route. Imaginez que le robot commence à marcher vers une tasse rouge, mais que vous regardez soudainement une tasse bleue. Le robot s'arrête, réalise que vous avez changé d'avis, et passe à la tasse bleue.

Les résultats

L'article affirme que Gaze2Act était bien meilleur que les robots qui n'écoutent que le langage ou que les robots qui tentent de deviner à partir de descriptions textuelles.

  • Les robots basés uniquement sur le langage se perdaient facilement (environ 33 % de taux de réussite sur des tâches délicates).
  • Gaze2Act a eu raison presque à chaque fois (environ 89 % de taux de réussite).
  • Il était particulièrement bon pour changer d'avis lorsque le regard de l'utilisateur se déplaçait, quelque chose que les autres robots avaient du mal à faire.

En résumé

L'article conclut que le regard est un moyen naturel et peu exigeant de dire exactement à un robot ce que vous voulez. Cela élimine les suppositions. Vous n'avez pas besoin d'être un programmeur de robots ou de parler un code parfait ; vous avez juste besoin de regarder ce que vous voulez que le robot fasse, et le robot suivra votre regard.

Limitations mentionnées dans l'article :
Le système n'est pas encore parfait. Si vous bougez la tête trop vite, ou si quelque chose bloque votre vue (occlusion), le robot pourrait se perdre. De plus, le système suppose que vous regardez ce que vous avez l'intention de toucher, mais parfois les yeux des gens vagabondent ou regardent des choses qu'ils ne veulent pas réellement saisir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →