MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation
MemVLN est un cadre de navigation vision-langage en temps réel qui atteint des performances de pointe et une inférence de 14 FPS en intégrant une mémoire épisodique pyramidale pour une rétention efficace de l'historique à long terme avec une mémoire procédurale utilisant des actions atomiques de niveau intermédiaire pour contourner la latence du décodage auto-régressif.
Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot à marcher dans une maison qu'il n'a jamais vue, guidé uniquement par une voix disant : « Va à la cuisine, tourne à gauche au vase bleu, et arrête-toi près du frigo. » C'est le monde de la Navigation Vision-et-Langage (VLN). Il s'agit d'une branche de la robotique et de l'intelligence artificielle où un agent informatique doit comprendre des instructions parlées et regarder le monde à travers une caméra pour déterminer où se déplacer ensuite. La partie délicate est que le robot ne peut pas simplement sauter d'un point à un autre comme dans un jeu vidéo ; il doit effectuer de réelles actions, étape par étape, dans un espace continu. Pour bien faire cela, le robot a besoin de deux superpouvoirs : une mémoire à long terme pour se souvenir d'où il a commencé et où il va (pour ne pas se perdre) et des réflexes rapides pour réagir instantanément à ce qu'il voit en ce moment. Si le robot est trop lent à réfléchir, il cogne les murs ; s'il oublie le passé, il tourne en rond. Les scientifiques ont essayé de construire des robots capables de faire les deux en même même temps, mais généralement, ils doivent choisir entre être intelligents ou être rapides.
Entrez en scène MemVLN, un nouveau cerveau robotique conçu pour avoir le beurre et l'argent du beurre. Les chercheurs derrière ce projet ont réalisé que les robots actuels ont des difficultés car ils essaient de se souvenir de chaque détail de leur parcours avec la même qualité, ce qui les ralentit considérablement. MemVLটি résout ce problème en imitant le fonctionnement réel de la mémoire humaine. Il divise sa mémoire en deux types spéciaux : la Mémoire Épisodique et la Mémoire Procédurale. Considérez la Mémoire Épisodique comme un album photo où les photos les plus récentes sont en haute définition, tandis que les photos plus anciennes sont réduites à de minuscules vignettes. Cela permet au robot de garder une image claire de l'endroit où il se trouve actuellement tout en se souvenant de la forme générale du chemin parcouru il y a des heures, sans être accablé par trop de données. Ensuite, il y a la Mémoire Procédurale, qui est comme une mémoire musculaire pour la conduite ou la dactylographie. Au lieu que le robot s'arrête pour taper soigneusement une longue phrase comme « Je vais maintenant tourner à gauche et marcher vers l'avant », il possède un vocabulaire de raccourcis composé de « jetons d'action » pré-établis. Cela lui permet de prendre des décisions en un éclair, évitant ainsi le processus de réflexion lent, étape par étape, qui cause habituellement des retards.
L'article présente MemVLN comme un cadre qui combine avec succès ces deux styles de mémoire pour naviguer dans des environnements continus à une vitesse de 14 FPS (images par seconde). Il s'agit d'un bond significatif en termes de vitesse par rapport aux méthodes précédentes, que les auteurs notent souvent en difficulté pour équilibrer le besoin d'un historique visuel long avec le besoin d'un contrôle en temps réel. En utilisant une stratégie de « résolution pyramidale » pour sa mémoire épisodique, le système traite les vues immédiates à la résolution complète de 512 × 512, les vues à court terme à 256 × 256, et l'historique à long terme à une version compressée de 128 × 128. Cela garantit que le robot reste concentré sur ce qui se trouve juste devant lui tout en conservant un résumé compressé du passé. Pour sa mémoire procédurale, l'équipe a remplacé la méthode standard et lente de génération d'actions (qui prend plus de 300 ms pour une séquence) par un mécanisme d'« action rapide » qui utilise un seul jeton pour représenter un mouvement complexe, réduisant le temps à environ 70 ms.
Les résultats des tests de MemVLN sur des bancs d'essai de navigation standards, spécifiquement R2R-CE et RxR-CE, suggèrent que cette approche fonctionne très bien. Les auteurs ont constaté que leur modèle, MemVLN-4B, a surpassé l'architecture de référence Qwen3-VL-4B de 5,8 % en taux de réussite sur le jeu de données R2R et de 9,7 % sur le jeu de données RxR. Plus impressionnant encore, le nouveau système a atteint une accélération de 7× de la latence d'inférence, lui permettant de fonctionner en temps réel. L'article argumente explicitement contre l'idée que la fusion de jetons (une méthode utilisée par d'autres systèmes pour compresser les données) est la meilleure solution, notant qu'elle détruit la grille spatiale nécessaire à un positionnement avancé. Au lieu de cela, leur résolution pyramidale maintient la structure de la grille tout en compressant les données. Les auteurs ont également testé différentes « formes » de leur pyramide de mémoire et ont découvert qu'un design « ascendant », qui donne aux vues les plus récentes la résolution la plus élevée, fonctionnait le mieux. Bien que le modèle repose uniquement sur des vidéos RGB standard (tout comme l'œil humain) et le langage naturel, sans capteurs supplémentaires comme des caméras de profondeur, cela suggère qu'un système de mémoire intelligent peut compenser des données visuelles limitées. L'étude confirme qu'en équilibrant des observations récentes de haute fidélité avec un historique compressé, et en utilisant un vocabulaire d'action rapide, les robots peuvent naviguer dans des espaces complexes et inconnus plus efficacement et plus rapidement que jamais.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.