Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments
Cet article introduit CogRun, un cadre de travail entièrement autonome embarqué qui permet aux robots terrestres critiques pour la sécurité d'effectuer un apprentissage au moment de l'exécution cognitivement fondé dans des environnements inconnus, sans cartes préalables ni connectivité, en intégrant un nouvel agent d'apprentissage à un agent rationnel dédié à la sécurité.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un robot envoyé dans une forêt qu'il n'a jamais vue, chargé de naviguer sur un sentier jonché de branches tombées, de trous cachés et de terrains irréguliers. Dans le monde de l'intelligence artificielle, ce scénario représente un obstacle fondamental. La plupart des robots actuels sont entraînés dans des mondes simulés parfaits ou des laboratoires contrôlés, apprenant à se déplacer dans des environnements prévisibles et statiques. Lorsque ces machines sont déployées dans la réalité chaotique et changeante d'une forêt sauvage ou d'une zone de catastrophe, elles éprouvent souvent des difficultés. Leur connaissance préprogrammée devient un handicap car le monde auquel elles font face ne correspond pas au monde dans lequel elles ont été enseignées. De plus, ces robots dépendent souvent d'une connexion constante à des ordinateurs puissants dans le cloud pour traiter leurs décisions. Dans des terrains reculés et accidentés, cette connexion est fréquemment rompue, laissant le robot bloqué ou incapable de s'adapter en temps réel. Le défi consiste donc à créer une machine capable d'apprendre à la volée, entièrement par elle-même, tout en restant assez sûre pour fonctionner sans intervention humaine.
Une équipe de chercheurs a relevé ce défi avec un nouveau système appelé CogRun, conçu pour permettre aux robots terrestres d'apprendre en toute sécurité alors qu'ils se déplacent réellement dans des espaces physiques inconnus. L'idée centrale est de donner au robot une forme d'apprentissage instantané qui se déroule entièrement sur son propre ordinateur embarqué, sans avoir besoin d'envoyer des données vers un serveur. Cette approche permet au robot de s'adapter aux nouveaux obstacles et aux conditions changeantes dès qu'il les rencontre. Le système est construit sur la compréhension que l'apprentissage dans le monde réel est dangereux ; un robot qui se contente d'essayer de nouvelles choses pour voir ce qui fonctionne pourrait basculer ou s'écraser. Pour résoudre ce problème, les chercheurs ont conçu un cadre où le processus d'apprentissage du robot est constamment surveillé et guidé par un système de sécurité distinct qui n'apprend pas. Cela garantit que, pendant que le robot cherche à mieux se déplacer, il ne fait jamais un pas qui pourrait le faire basculer ou entrer en collision avec quelque chose.
Le cadre fonctionne en divisant le cerveau du robot en trois parties distinctes qui travaillent ensemble. La première partie est l'« Agent d'Apprentissage » (Learning Agent), qui est l'explorateur curieux. Il essaie différents mouvements, observe les résultats et tente d'améliorer ses performances en fonction de ce qu'il expérimente. Cependant, comme cet agent est encore en phase d'apprentissage, il peut commettre des erreurs. Pour éviter que ces erreurs ne deviennent des catastrophes, une seconde partie, l'« Agent Rationnel » (Rational Agent), agit comme un gardien de sécurité strict. Cet agent n'apprend pas ; il s'appuie sur des règles établies et éprouvées pour garantir que le robot reste debout et évite les collisions. Si l'Agent d'Apprentissage suggère un mouvement qui semble risqué, l'Agent Rationnel prend immédiatement le contrôle pour exécuter une manœuvre sûre. Un troisième composant, le « Coordinateur » (Coordinator), surveille l'état du robot en temps réel et décide quel agent est aux commandes à un moment donné. Si le robot se déplace en toute sécurité, le Coordinateur laisse l'Agent d'Apprentissage piloter. Dès que le robot entre dans une situation dangereuse, le Coordinateur remet les commandes à l'Agent Rationnel jusqu'à ce que le danger passe.
Ce qui rend ce système unique, c'est la façon dont il gère les souvenirs de ses expériences. Lorsqu'un robot apprend, il génère une quantité massive de données sur ce qu'il a fait et ce qui s'est passé ensuite. La plupart des systèmes stockent ces données dans une liste simple et choisissent des exemples au hasard pour apprendre. Les chercheurs ont trouvé cela inefficace, surtout dans un environnement changeant où des données anciennes ou non pertinentes peuvent perturber le processus d'apprentissage. Au lieu de cela, CogRun utilise une méthode inspirée du fonctionnement de la mémoire humaine. Il hiérarchise les souvenirs selon trois facteurs : la similitude d'une expérience passée avec la situation actuelle, la récence de celle-ci et la fréquence à laquelle des situations similaires se sont produites. Cela permet au robot de concentrer son apprentissage sur les moments les plus pertinents, comme le moment précis où il a failli glisser sur une feuille mouillée, plutôt que de perdre du temps sur des données datant d'il y a plusieurs heures lorsque les conditions étaient complètement différentes.
Pour tester ce système, les chercheurs l'ont déployé sur un robot quadrupède dans une véritable forêt inconnue. L'environnement était rempli de zones mortes, de dépressions profondes dans le sol et de trous couverts de feuilles qui pourraient masquer une chute. Le robot avait pour mission de parcourir trente mètres depuis un point de départ jusqu'à un objectif. Lors de ces tests, le robot a dû apprendre à naviguer sur le terrain sans carte préalable. Les résultats ont montré que le système a réussi à maintenir le robot en sécurité tout au long du processus d'apprentissage. Bien qu'un système de sécurité standard puisse empêcher le robot de tomber, il était souvent trop prudent pour se déplacer efficacement. Le système CogRun, cependant, a permis au robot d'apprendre un chemin fluide et efficace en seulement quelques dizaines d'essais. Le robot a appris à ajuster sa démarche et sa vitesse pour gérer le terrain accidenté, atteignant finalement son objectif bien plus rapidement qu'avec une stratégie fixe et préprogrammée.
L'équipe a également testé le système sur un véhicule autonome tout-terrain dans un environnement de forêt simulé pour voir si l'approche fonctionnait sur différents types de machines. Ils ont comparé leur système à d'autres méthodes d'apprentissage avancées qui tentent de gérer la sécurité. Dans ces simulations, les autres systèmes perdaient fréquemment l'équilibre ou s'écrasaient contre des obstacles, échouant souvent à accomplir la tâche. En revanche, le système CogRun a complété la vaste majorité de ses passages sans aucune violation de sécurité. Le robot a appris à naviguer à travers des arbres denses et des sentiers rocheux, maintenant sa stabilité même lorsque le terrain changeait de manière inattendue. Les chercheurs ont noté que la capacité du système à mélanger les actions basées sur des règles de sécurité avec les actions basées sur l'apprentissage était cruciale. En mélangeant soigneusement les mouvements prudents du gardien de sécurité avec les mouvements adaptatifs de l'agent d'apprentissage, le robot pouvait explorer de nouvelles solutions sans jamais franchir la ligne de danger.
Ce travail démontre qu'il est possible pour les robots d'apprendre continuellement dans le monde réel sans dépendre d'une connexion au cloud ou d'une carte préexistante de l'environnement. En combinant un agent d'apprentissage qui cherche l'amélioration avec un agent rationnel qui garantit la sécurité, et en utilisant un système de mémoire qui hiérarchise les expériences les plus pertinentes, les chercheurs ont créé un cadre qui permet aux machines de s'adapter à la nature imprévisible du monde physique. Les expériences suggèrent que cette approche peut considérablement améliorer à la fois la sécurité et l'efficacité des robots opérant dans des environnements complexes et inconnus, ouvrant la voie à des machines plus capables pouvant aider dans la récupération après des catastrophes, l'exploration et d'autres tâches critiques où le terrain est trop dangereux ou imprévisible pour les opérateurs humains.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.