← Derniers articles
🤖 AI

Bridging Learned Visual Perception and Symbolic Belief-Space Planning

Cet article introduit un nouveau paradigme de « VLM-en-tant-que-base-de-connaissance-probabiliste » qui capture l'incertitude de la perception visuelle sous forme de distributions de probabilité sur des états symboliques, permettant une planification dans l'espace des croyances robuste qui surpasse les approches déterministes existantes dans les environnements partiellement observables.

Auteurs originaux : Guy Azran, Michael Navat, Sarah Keren

Publié 2026-09-16
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Guy Azran, Michael Navat, Sarah Keren

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un robot essayant de ranger un salon en désordre. Il voit un livre sur une table et une étagère à l'autre bout de la pièce, mais sa caméra est instable et la lumière est faible. Dans le monde réel, les robots ont rarement une vision parfaite. Ils ne peuvent pas tout voir à la fois ; des objets sont cachés derrière des meubles, et les capteurs interprètent souvent de travers ce qu'ils regardent. Pour qu'un robot agisse de manière sûre et efficace, il doit admettre ce qu'il ne sait pas. S'il se trompe dans son estimation de l'emplacement d'un objet, il pourrait essayer de saisir quelque chose qui n'existe pas, ou pire, tenter de poser un objet qu'il ne tient pas. Cette incertitude est le plus grand obstacle à l'enseignement de la navigation dans nos foyers complexes et imprévisibles.

Pendant des années, les chercheurs ont tenté de résoudre ce problème en dotant les robots d'un « cerveau » capable de regarder une image et de décider instantanément de ce qui est vrai. Ils utilisent de puissants modèles d'intelligence artificielle qui comprennent à la fois les images et le langage. L'idée était simple : montrer une photo au robot, lui demander « Est-ce que le placard est ouvert ? », et si le modèle répond « oui », le robot traite cela comme une vérité absolue et planifie sa prochaine étape. Mais en pratique, cette approche est fragile. Lorsque le modèle commet une erreur — ce qui arrive souvent quand les objets sont cachés ou que la vue est peu claire — le robot suit un plan basé sur un mensonge. Il peut passer des minutes à essayer d'ouvrir une porte qui est déjà ouverte, ou pire, abandonner complètement parce qu'il pense que la tâche est impossible. Le problème central est que ces systèmes traitent des suppositions incertaines comme des faits certains, ne laissant aucune place à l'erreur.

Une équipe de chercheurs du Technion, en Israël, a proposé une autre façon d'aborder ce problème. Au lieu de forcer le robot à faire une supposition unique et rigide sur le monde, ils lui ont appris à maintenir plusieurs possibilités en tête à la fois. Ils appellent ce nouveau système RoVLaP. Plutôt que de demander au modèle d'intelligence artificielle de dire « le livre est sur la table » ou « le livre n'est pas sur la table », le système demande au modèle d'indiquer la probabilité de chaque scénario. Il pourrait dire qu'il y a 60 % de chances que le livre soit sur la table et 40 % de chances qu'il soit caché dans un tiroir. En maintenant ces probabilités actives, le robot peut construire une « croyance » sur le monde qui reconnaît l'incertitude. Il ne planifie pas seulement pour le scénario le plus probable ; il planifie simultanément pour une gamme de scénarios probables.

Les chercheurs ont testé cette idée dans un environnement domestique simulé, un monde numérique rempli de meubles virtuels, de tiroirs et d'objets. Ils ont confié au robot des tâches courantes de tâches ménagères, telles que trier des livres sur des étagères, vider des tiroirs ou verrouiller des portes. Lors de ces tests, le robot devait se fier uniquement à ce que sa caméra pouvait voir, sans aucune connaissance particulière sur l'emplacement potentiel d'objets cachés. Ils ont comparé cette nouvelle méthode à deux autres approches courantes : une où le modèle d'IA dit directement au robot quoi faire étape par étape, et une autre où le modèle donne une description fixe et unique de la pièce pour qu'un planificateur standard puisse l'utiliser.

Les résultats ont montré un avantage clair pour la nouvelle approche. Dans les tests simulés, les méthodes standards échouaient souvent complètement lorsque la vue du robot était obstruée ou trompeuse. Par exemple, dans une tâche où un bol était caché à l'intérieur d'un placard fermé, le robot standard supposait que le bol était visible et tentait de le saisir immédiatement, échouant à chaque fois. Le nouveau système, cependant, a reconnu que le bol pourrait être caché. Il a planifié une séquence d'actions incluant l'ouverture du placard en premier. Ce simple changement a permis au robot de réussir dans des situations où les autres méthodes avaient échoué. Sur les tâches de difficulté élevée, le nouveau système a résolu 66,7 % des problèmes, alors que la méthode standard de « mise en correspondance » (grounder) n'en a résolu aucun. Sur les tâches de difficulté moyenne, il a amélioré les taux de réussite de plus de 160 % par rapport à la méthode standard.

Au-delà de la résolution de plus de tâches, le nouveau système était également plus efficace. Parce qu'il planifiait l'incertitude dès le départ, il commettait moins d'erreurs et devait moins souvent recommencer ses plans. Les méthodes standard devaient souvent s'arrêter, réaliser qu'elles s'étaient trompées, puis réessayer, gaspillant ainsi temps et énergie. Le nouveau système, en revanche, générait des plans suffisamment robustes pour gérer la confusion initiale sans avoir besoin de s'arrêter pour réfléchir. Il se déplaçait avec une sorte de confiance prudente, se préparant à la possibilité que sa première supposition soit erronée, et ayant un plan de secours prêt en cas de besoin.

Les chercheurs ont également prouvé que cette méthode est mathématiquement solide. Ils ont démontré que si le modèle d'intelligence artificielle est même légèrement meilleur qu'un choix aléatoire, le robot finira par découvrir l'état réel du monde s'il continue d'observer et de mettre à jour ses croyances. Le système ne nécessite pas que le modèle soit parfait ; il doit seulement être systématiquement meilleur qu'un lancer de pièce. Au fil du temps, à mesure que le robot recueille davantage de preuves visuelles, son incertitude diminue et ses plans deviennent plus précis. Cela offre un filet de sécurité : même si le robot commence avec une idée erronée, le système est conçu pour se corriger sans planter ou rester bloqué.

Ce travail représente un changement dans la manière dont nous construisons des agents autonomes. Il s'éloigne de l'idée qu'un robot doit connaître la vérité pour agir, et tend vers l'idée qu'un robot peut agir avec sagesse même lorsqu'il est incertain. En traitant le monde comme un ensemble de possibilités plutôt que comme une réalité unique et fixe, le robot devient plus adaptable et plus fiable. Dans les maisons simulées, cela signifiait la différence entre un robot qui abandonne lorsqu'il ne voit pas un objet caché et un robot qui ouvre patiemment le placard pour le trouver. Alors que les robots passent des laboratoires contrôlés à nos véritables foyers, où la lumière change, les objets bougent et les vues sont obstruées, cette capacité à planifier l'inconnu pourrait être la clé pour les rendre véritablement utiles.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →