← Derniers articles
🤖 AI

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

Cet article introduit RuleMaze, un banc d'essai contrôlable pour évaluer la planification spatiale visuelle conforme aux règles dans les modèles de langage multimodaux de grande taille, ainsi qu'un cadre de génération de règles hybride et une méthode de Planification Multimodale Désenchevêtrée (DMP) qui améliorent considérablement l'adhérence aux règles et la généralisation en séparant la perception, l'exécution et la vérification.

Auteurs originaux : Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

Publié 2026-08-21
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où un ordinateur peut regarder une image et comprendre non seulement ce qui s'y trouve, mais aussi comment s'y déplacer. C'est la promesse des modèles de langage multimodaux à grande échelle, une nouvelle génération d'intelligence artificielle qui combine la capacité de lire et de raisonner avec la capacité de voir. Ces systèmes ont déjà appris à décrire des images, à répondre à des questions sur des photos et à résoudre des énigmes visuelles. Mais il existe une lacune dans leurs connaissances. Bien qu'ils puissent naviguer sur un chemin simple, ils éprouvent des difficultés lorsque le chemin est bloqué par un ensemble spécifique d'instructions qui changent d'un moment à l'autre. Dans le monde réel, un véhicule autonome ou un robot assistant doit non seulement trouver un moyen d'aller d'un point A à un point B, mais doit aussi obéir à un ensemble de règles en constante évolution, telles que « ne pas tourner à gauche au feu rouge » ou « éviter le sol mouillé ». Les modèles actuels échouent souvent ici, traitant les règles comme des suggestions plutôt que comme des contraintes strictes, ou les oubliant entièrement lors de la planification de leur prochain mouvement.

Pour comprendre pourquoi cela est si difficile, les chercheurs Yu Chen et son équipe de l'Université de Pékin et de Yinwang Intelligent Technology ont créé un nouveau terrain d'essai appelé RuleMaze. Ils ont construit un environnement numérique rempli de labyrinthes, mais ceux-ci n'étaient pas de simples puzzles de murs et d'espaces ouverts. Chaque labyrinthe était accompagné d'un ensemble unique de règles en langage naturel, écrites en anglais courant, qui dictaient exactement comment un personnage pouvait se déplacer. Certaines règles étaient simples, comme « vous ne pouvez pas marcher sur les carrés roses ». D'autres étaient complexes, exigeant que le personnage se souvienne de l'endroit où il s'était trouvé ou change son comportement en fonction de son emplacement actuel, tel que « si vous vous tenez sur un carré orange, votre prochain pas doit être vers le haut ». Les chercheurs ont généré des milliers de ces scénarios à l'aide d'une méthode qui transforme automatiquement les règles écrites par l'homme en une logique stricte et vérifiable par une machine. Cela leur a permis de tester si une intelligence artificielle pouvait véritablement comprendre et suivre une règle tout en naviguant dans un espace visuel, plutôt que de simplement deviner le bon chemin en se basant sur des motifs déjà vus auparavant.

L'équipe a découvert que le simple fait de demander à un modèle puissant de regarder le labyrinthe et de rédiger une liste de mouvements ne fonctionnait pas bien, surtout lorsque les règles étaient nouvelles ou compliquées. Lorsque les règles changeaient, les modèles oubliaient souvent les instructions ou les violaient sans s'en rendre compte. Pour résoudre cela, les chercheurs ont proposé une nouvelle façon de penser appelée Planification Multimodale Désengagée. Au lieu de forcer le modèle à tout faire en même temps — voir l'image, réfléchir aux règles et décider du prochain mouvement — ils ont divisé la tâche en trois emplois distincts et clairs. Premièrement, le modèle utilise un outil pour observer le labyrinthe et identifier où il se trouve et quels symboles spéciaux se trouvent à proximité. Deuxiement, il utilise un outil pour tenter un mouvement et voir à quoi ressemble la nouvelle image. Troisièmement, et c'est le plus important, il utilise un outil dédié pour vérifier si le mouvement qu'il vient de faire respecte les règles. Cet outil de vérification agit comme un arbitre strict qui dit instantanément « oui » ou « non » à chaque étape avant que le modèle ne soit autorisé à continuer.

Cette approche a changé le résultat de manière spectaculaire. Dans leurs tests, la nouvelle méthode a permis aux modèles de suivre les règles avec un taux de réussite de 90 % sur des tâches qu'ils n'avaient jamais vues auparavant, une amélioration massive par rapport aux méthodes précédentes qui échouaient souvent complètement face à de nouvelles règles. Les chercheurs ont constaté que lorsqu'ils forçaient le modèle à vérifier son travail à chaque étape, celui-ci cessait de commettre les types d'erreurs qui surviennent lorsqu'un système tente de planifier tout un voyage dans sa tête sans vérifier chaque étape. Le modèle a appris à faire une pause, à regarder la règle, à vérifier le mouvement, et seulement ensuite à procéder. Cela fonctionnait même lorsque les règles étaient difficiles, impliquant plusieurs conditions ou exigeant que le modèle se souvienne d'objets qu'il avait ramassés en cours de route. L'étude suggère que pour qu'une intelligence artificielle soit véritablement fiable dans des environnements complexes et régis par des règles, elle ne peut pas être un simple devineur intelligent ; elle doit être équipée d'un système qui la force à vérifier ses propres actions par rapport aux contraintes du monde qu'elle navigue. En séparant l'acte de voir, l'acte de bouger et l'acte de vérifier, les chercheurs ont montré que les machines peuvent apprendre à suivre des instructions avec un niveau de discipline qui était auparavant hors de portée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →