← Derniers articles
💻 computer science

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA unifie les modes de langage, de vision-langage et d'instruction visuelle en un modèle unique de Vision-Langage-Action en les canonisant sous forme de prompts textuels et de masques déictiques, démontrant une généralisation supérieure aux objets et expressions inédits par rapport aux modèles de base fondés uniquement sur le langage.

Auteurs originaux : Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Publié 2026-08-31
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un bras robotique posé dans une cuisine, prêt à aider. Pour lui dire quoi faire, un humain pourrait dire : « Prends la tasse rouge sur la gauche. » Cela semble simple, mais pour une machine, le monde est souvent encombré de nombreuses tasses rouges, ou de tasses qui se ressemblent presque de manière identique. Si l'humain essaie d'être plus précis, en disant : « Prends la troisième tasse rouge en partant de la gauche, celle qui est à côté de la serviette bleue », le robot pourrait tout de même être confus. Les robots modernes deviennent meilleurs pour comprendre le langage, mais ils peinent souvent lorsque les instructions sont trop détaillées ou lorsque les objets devant eux ne correspondent pas exactement aux images apprises lors de leur entraînement. Ils pourraient saisir le mauvais objet simplement parce qu'il lui semble un peu plus familier, ignorant ainsi les mots spécifiques que l'humain vient de prononcer.

Pour résoudre cela, des chercheurs explorent une autre façon de parler aux machines : utiliser un geste de pointage. Tout comme un humain pourrait dire : « Prends celle-ci », en pointant du doigt l'objet, un robot peut apprendre à comprendre un clic sur un écran comme une commande directe. Cette approche, appelée geste déictique, l'affranchit de la confusion du langage en montrant au robot exactement ce qui est visé. Cependant, jusqu'à présent, les robots étaient généralement entraînés soit à écouter uniquement les mots, soit à écouter les mots tout en étant pointés du doigt, mais rarement à gérer toutes ces formes de communication à la fois. Une nouvelle étude introduit un système qui unifie ces méthodes, permettant à un seul cerveau robotique de passer de manière fluide de l'écoute d'une phrase, à l'écoute d'une phrase tout en étant pointé du doigt, ou simplement de suivre un point sans aucun mot.

Les chercheurs, travaillant avec un type d'intelligence artificielle appelé modèle Vision-Langage-Action, ont développé un système qu'ils nomment DeicticVLA. Ces modèles sont comme le cerveau d'un robot qui aurait lu des millions de livres et vu des millions d'images, apprenant à connecter ce qu'il voit avec ce qu'il doit faire. Le défi était de rendre ce cerveau assez flexible pour accepter trois types de commandes différents : une commande textuelle, une commande textuelle combinée à un geste de pointage, ou simplement un geste de pointage. Dans le premier mode, l'utilisateur tape une phrase complète. Dans le second, l'utilisateur tape une phrase qui inclut un mot comme « ceci » ou « là » et clique sur l'écran pour définir ce que ce mot désigne. Dans le troisième, l'utilisateur clique sur l'objet qu'il veut déplacer et sur l'endroit où il doit aller, sans rien dire du tout.

Pour faire fonctionner cela, l'équipe a créé une étape de traduction qui transforme ces trois types d'entrées différentes en un même format interne. Lorsqu'un utilisateur clique sur un écran, le système utilise un outil puissant d'analyse d'image pour transformer ce simple clic en un contour précis de l'objet, un masque qui met en évidence exactement ce que l'humain touche. Ce masque est ensuite combiné avec une consigne textuelle. Si l'utilisateur a parlé, la consigne textuelle est ses propres mots. S'il a seulement cliqué, le système utilise une phrase par défaut comme « suivre l'instruction visuelle ». De cette façon, le cerveau du robot reçoit toujours un paquet cohérent : une instruction textuelle et une mise en évidence visuelle de la cible. Les chercheurs ont ensuite testé différentes manières d'injecter cette mise en évidence visuelle dans le cerveau du robot. Ils ont essayé de dessiner une boîte autour de l'objet sur l'image de la caméra, d'estomper le reste de la scène pour faire ressortir l'objet, ou de fournir le contour comme une couche d'information séparée que le robot traite parallèlement à l'image.

L'équipe a d'abord testé ces idées dans un environnement simulé, un monde numérique où les robots peuvent s'entraîner des milliers de fois sans rien casser. Ils ont découvert que le système pouvait apprendre à gérer les trois modes d'instruction simultanément. Lorsque le robot était sollicité pour effectuer des tâches qu'il n'avait jamais vues, comme ramasser un objet dans une nouvelle disposition de meubles ou identifier un objet par une nouvelle description spatiale, les méthodes de pointage fonctionnaient nettement mieux que les mots seuls. Dans un test impliquant des bols noirs identiques, où le robot devait prendre celui situé à côté d'un objet de référence spécifique, l'approche basée uniquement sur le langage échouait la plupart du temps. Cependant, lorsque l'utilisateur pointait le bon bol, le robot réussissait presque à chaque fois. L'étude a montré que la méthode d'entraînement en deux étapes était cruciale : le robot a d'abord appris à suivre des commandes textuelles, puis il a appris à combiner ces commandes avec des gestes de pointage. Cet ordre a permis au robot de conserver sa capacité à comprendre le langage tout en acquérant la nouvelle compétence de suivre un point.

Pour voir si cela fonctionnait dans le monde réel, les chercheurs ont construit une installation physique avec un bras robotique, une caméra et une tablette. Ils ont appris au robot à ramasser des blocs, à les placer dans des bols et à organiser des peluches. Ils ont testé le robot avec des instructions qu'il n'avait jamais entendues auparavant, comme lui demander de prendre le bloc le « plus à gauche » alors qu'il n'avait été entraîné que sur des instructions de « plus à droite », ou lui demander de déplacer un type de jouet qu'il n'avait jamais vu. Dans ces scénarios difficiles, le robot s'appuyant uniquement sur le langage avait du mal, se trompant souvent ou échouant à agir. Mais quand l'utilisateur pointait la cible, le taux de réussite du robot grimpait en flèche. Dans un test avec des catégories de peluches totalement nouvelles, le robot utilisant uniquement le langage ne réussissait qu'environ un sixième du temps. Les méthodes basées sur le pointage, cependant, atteignaient un taux de réussite parfait. Le robot n'avait pas besoin de connaître le nom du jouet ou sa catégorie ; il avait simplement besoin de voir où l'humain pointait.

Les résultats suggèrent que l'avenir de l'interaction humain-robot ne sera peut-être pas de choisir entre parler et pointer, mais d'avoir les deux disponibles en même temps. Le système permet à un utilisateur de commencer par une phrase, et si le robot semble confus, de simplement pointer pour clarifier. Ou, pour une tâche rapide et routinière, l'utilisateur peut simplement pointer sans dire un mot. La recherche indique que si le langage est puissant pour décrire des idées complexes, le pointage est un moyen plus fiable d'identifier des objets spécifiques dans un monde désordonné et changeant. En unifiant ces méthodes en un seul système, les chercheurs ont créé une façon plus flexible et robuste pour les humains de guider les machines, garantissant que le robot comprenne non seulement ce que nous disons, mais aussi ce que nous voulons dire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →