LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation
Cet article introduit LH-AVLN, un nouveau benchmark pour la navigation audio-visuelle-linguistique à long horizon qui met les agents au défi avec des missions à objectifs multiples dans des environnements intérieurs acoustiquement riches, et propose PAG-Nav, un agent sans entraînement qui exploite efficacement l'audio binaural pour la recherche tout en s'appuyant sur la vérification visuelle-sémantique pour l'accomplissement de l'objectif.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous appreniez à un robot à devenir l'ultime détective domestique. Habituellement, pour apprendre à un robot à se déplacer dans une maison, nous lui donnons une mission simple : « Va chercher la balle rouge ». Il regarde autour de lui avec ses yeux-caméras, peut-être se souvient de l'endroit où il est passé, et marche jusqu'à ce qu'il repère l'objet. Ce domaine scientifique est appelé « navigation incarnée » (embodied navigation), où le robot apprend à se déplacer dans le monde réel pour accomplir une tâche. Mais il y a un hic : la plupart de ces jeux d'entraînement sont complètement silencieux. Le robot ne peut voir que ce qui se trouve directement devant son objectif. Si la balle est derrière une porte fermée ou cachée dans un coin sombre, le robot est bloqué, aveugle à tout ce qui se trouve en dehors de son champ de vision actuel.
Maintenant, imaginez donner à ce robot un superpouvoir : des oreilles. Dans le monde réel, le son ne voyage pas seulement en ligne droite ; il rebondit dans les coins et s'infiltre par les fissures. Un robot doté de bonnes oreilles pourrait entendre un chien aboyer dans la pièce voissante ou un robinet qui goutte derrière un mur, lui donnant ainsi un indice sur l'endroit où aller même s'il ne voit pas encore l'objet. Cet article pose une question cruciale et complexe : que se passe-t-il si nous combinons ces deux superpouvoirs — la vue et l'ouïe — mais que nous rendons la mission beaucoup plus difficile ? Au lieu de chercher un seul objet, et si le robot devait trouver une liste entière de différents articles, certains décrits par des mots, d'autres par des images, et d'autres simplement par leur nom, le tout alors que les sons dans la maison changent sans cesse au fur et à mesure qu'il résout l'énigme ?
Les chercheurs derrière cette étude, dirigés par Rufeng Chen et ses collègues de l'Université des sciences et technologies de Hong Kong et de l'Université de Jilin, ont créé un nouveau défi appelé LH-AVLN. Considérez cela comme un jeu vidéo à haut risque et à plusieurs niveaux pour les robots. Dans ce jeu, le robot est parachuté dans une maison en 3D et reçoit une « mission globale » contenant deux à quatre objectifs différents. Ces objectifs sont complexes : l'un peut être « trouver le canapé » (une catégorie), un autre peut être « trouver le canapé gris clair à côté des rideaux transparents » (une description), et un troisième peut être « trouver cette photo spécifique d'un lit » (une référence d'image).
Le véritable rebondissement, cependant, c'est le son. Dans ce jeu, chaque objet que le robot recherche émet un bruit. Mais voici le piège : les sons ne sont pas des cibles fixes. À mesure que le robot trouve et termine un objectif, le bruit de cet objet s'arrête. Pendant ce temps, les objets qu'il n'a pas encore trouvés continuent de faire du bruit, se relayant pour être les plus forts. Cela crée une situation déroutante. Si le robot cherche un canapé, mais qu'il entend une chasse d'eau (parce qu'il n'a pas encore trouvé les toilettes), le son est une distraction. Le robot doit déterminer : « Est-ce que ce son m'aide à trouver ma cible actuelle, ou est-ce un leurre qui me dirige vers une autre tâche inachevée ? »
Pour tester cela, les auteurs ont créé un ensemble de données massif comprenant plus de 150 000 épisodes où des robots doivent naviguer dans ces missions bruyantes et multi-objectifs. Ils ont découvert que les robots existants, même les plus intelligents qui excellent dans le suivi d'instructions ou la mémorisation de cartes visuelles, échouent lamentablement. Lorsque le son devient confus ou que la mission se prolonge, ces robots se perdent ou abandonnent. Ils ne parviennent pas à faire la distinction entre un indice utile et un bruit distrayant.
Pour démontrer la difficulté de la tâche, l'équipe a construit son propre agent robotique appelé PAG-Nav. Ce robot n'utilise pas d'entraînement complexe pour apprendre ; il utilise plutôt une stratégie ingénieuse. Il garde une carte mentale de toute la maison, suivant où il est passé, ce qu'il a vu et d'où proviennent les sons. Il utilise le son pour guider sa recherche lorsqu'il ne voit rien, mais il refuse de dire « je l'ai trouvé ! » tant qu'il n'a pas obtenu une vue claire et nette de l'objet pour s'assurer qu'il s'agit du bon. Même avec cette stratégie intelligente, le robot ne réussit qu'environ 2 % à 3 % des missions ordonnées et 3 % à 5 % des missions non ordonnées.
La principale conclusion de cet article est que l'ajout du son à des missions longues et complexes rend les choses nettement plus difficiles, et non plus faciles, pour la technologie actuelle. Les auteurs suggèrent que, bien que le son soit un outil puissant pour trouver des objets cachés de la vue, il devient un cauchemar si le robot ne peut pas identifier à quel objet appartient chaque son. Ils soutiennent que l'avenir de la navigation robotique ne consiste pas seulement à mieux voir ou mieux entendre, mais à apprendre à ignorer le bruit et à se concentrer sur le bon indice au bon moment. L'article conclut que nous sommes loin d'avoir résolu ce casse-tête, laissant une grande place aux futurs inventeurs pour construire des robots capables de naviguer véritablement dans un monde bruyant et multi-tâches.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.