Towards smart and adaptive agents for active sensing on edge devices
Cet article présente un système agentique compact, basé sur l'inférence active, qui permet une détection active adaptative et en temps réel sur des dispositifs de bord aux ressources limitées en leur permettant de planifier et de contrôler dynamiquement les mouvements de la caméra pour surmonter les limitations des approches TinyML traditionnelles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez une caméra qui ne se contente pas d'enregistrer le monde, mais qui choisit activement ce qu'elle regarde, un peu comme l'œil humain qui saute d'un détail à l'autre pour construire une image complète. C'est le domaine de la perception active, un concept où les machines n'attendent pas passivement des données, mais déplacent leurs capteurs pour recueillir les informations les plus utiles. Pendant des années, le rêve a été de doter les petits appareils alimentés par batterie, situés là où l'action se déroule, comme une caméra de sécurité ou un robot, de ce genre de comportement intelligent et adaptatif, sans avoir besoin d'envoyer des données vers un serveur cloud distant. Le défi était que les systèmes d'intelligence artificielle puissants capables de cela nécessitent généralement des quantités massives de puissance de calcul et de mémoire, ce qui les rend impossibles à exécuter sur ces petits appareils locaux.
Une équipe de chercheurs a maintenant construit un système qui comble ce fossé, créant un agent intelligent capable de voir, de planifier et de déplacer une caméra en temps réel tout en fonctionnant sur un appareil pas plus grand qu'une petite carte informatique. Publiés dans une étude récente, ces travaux démontrent qu'il est possible de combiner deux approches différentes de l'intelligence artificielle : l'une excellente pour reconnaître des objets dans des images, et une autre excellente pour prendre des décisions en situation d'incertitude. Le résultat est un « agent de saccades », nommé d'après les mouvements oculaires rapides et saccadés que font les humains pour se concentrer sur des détails, capable de contrôler une caméra pour suivre des personnes ou explorer une pièce de manière autonome. Le système fonctionne entièrement sur l'appareil de bord (edge device), ce qui signifie qu'il traite tout localement, garantissant des réactions rapides et préservant la confidentialité des données.
Les chercheurs ont été confrontés à un problème spécifique : les modèles de deep learning standards, qui sont très doués pour repérer des choses comme des personnes ou des voitures dans un flux vidéo, sont rigides. Une fois entraînés, ils peinent à s'adapter si l'environnement change ou s'ils doivent décider où regarder ensuite pour trouver quelque chose de nouveau. Ils dépendent de quantités énormes de données et de puissance de calcul pour apprendre, ce qui est l'opposé de ce dont un petit appareil à faible consommation a besoin. Pour résoudre cela, l'équipe n'a pas cherché à rendre le modèle de deep learning plus grand ou plus intelligent. Au lieu de cela, elle a ajouté une seconde couche d'intelligence au-dessus, basée sur un principe appelé l'inférence active. Cette approche traite l'agent comme un scientifique qui met constamment à jour ses croyances sur le monde. Il se demande : « Qu'est-ce que je m'attends à voir ? » et « Qu'est-ce qui me surprendrait ? ». Si la caméra ne voit rien de nouveau, l'agent décide de se déplacer vers un autre endroit pour apprendre davantage. Si elle voit quelque chose d'intéressant, comme une personne, elle se concentre sur elle. Ce processus de prise de décision est incroyablement léger, nécessitant très peu de mémoire, ce qui lui permet de fonctionner aux côtés du logiciel de détection d'objets plus lourd.
Pour tester cette idée, l'équipe a construit un prototype physique utilisant un dispositif NVIDIA Jetson, un ordinateur puissant conçu pour les tâches d'intelligence artificielle en périphérie (edge). Ils ont connecté ce dispositif à une caméra capable de pivoter et de s'incliner (pan et tilt), semblable aux caméras de surveillance que l'on trouve dans de nombreux bâtiments. Le système a reçu une tâche simple mais puissante : surveiller une scène et décider où diriger l'objectif. La première partie du système, le module de perception, utilisait un outil de détection d'objets bien connu appelé YOLO pour scanner le flux vidéo et trouver des personnes ou des objets. Cet outil était optimisé pour fonctionner rapidement sur le matériel du dispositif. La seconde partie, le module de planification, prenait la liste des choses que la caméra voyait et utilisait l'inférence active pour décider du prochain mouvement. Elle calculait dans quelle direction la caméra devait tourner pour soit garder un œil sur une personne, soit scanner une zone vide pour voir si quelque chose de nouveau apparaissait.
Les résultats ont montré que cette combinaison fonctionnait remarquablement bien dans les limites strictes du matériel. L'ensemble du système, y compris le logiciel nécessaire pour le faire fonctionner, tenait dans une empreinte mémoire de seulement 304 mégaoctets, ce qui est minuscule pour un système d'intelligence artificielle. Dans une configuration, la caméra pouvait traiter la vidéo et prendre une décision sur l'endroit où regarder ensuite 108 fois par seconde, une vitesse assez rapide pour paraître instantanée pour un observateur humain. Dans une autre configuration, le système privilégiait la vitesse par rapport à la mémoire, atteignant 45 images d'analyse vidéo par seconde tout en prenant des décisions 250 fois par seconde. Les chercheurs ont constaté que le temps nécessaire pour prendre une décision était si court que le système pouvait facilement suivre le flux vidéo, permettant à la caméra de suivre des cibles en mouvement ou de balayer une pièce sans décalage.
Ce qui rend cette réussite significative, ce n'est pas seulement le fait que la caméra ait bougé, mais la manière dont elle a bougé. L'agent n'a pas suivi un chemin préprogrammé. Au contraire, il a réagi à l'environnement en temps réel. Si une personne entrait dans le champ, la caméra se verrouillait sur elle. Si la personne bougeait, la caméra la suivait. Si la personne partait et que la pièce était vide, l'agent décidait de scanner le reste de la pièce pour voir si autre chose se passait. Ce comportement imite la façon dont les humains explorent naturellement leur environnement, équilibrant le besoin de se concentrer sur ce qui est important et le besoin de rester conscient de l'ensemble de l'image. Les chercheurs ont démontré cela avec une caméra montée sur un petit robot, montrant que le système pouvait aider une machine à explorer un nouvel environnement et à recueillir des informations efficacement sans intervention humaine.
L'étude a également testé soigneusement différentes façons d'exécuter le logiciel sur le matériel pour trouver le meilleur équilibre entre vitesse et utilisation de la mémoire. Ils ont découvert que l'utilisation d'outils spécifiques conçus pour le processeur graphique du dispositif permettait de faire fonctionner le système beaucoup plus rapidement qu'en utilisant des méthodes standards. Cependant, ils ont aussi découvert que pour la partie prise de décision du système, qui est très petite, tenter de l'exécuter sur le puissant processeur graphique ralentissait en réalité le processus, car la surcharge de gestion de la tâche était supérieure au bénéfice de la puissance supplémentaire. Cette découverte souligne l'importance d'associer les bons outils logiciels au bon matériel, une étape cruciale pour rendre ces systèmes exploitables dans le monde réel.
Ce travail suggère que l'avenir des appareils intelligents ne nécessite pas nécessairement des supercalculateurs massifs basés sur le cloud. En combinant une capacité robuste de vision avec une capacité légère de planification, il est possible de créer des agents qui sont à la fois intelligents et efficaces. Les chercheurs ont montré que ces systèmes peuvent fonctionner de manière indépendante, en prenant des décisions en une fraction de seconde pour recueillir des informations dans des environaux complexes et changeants. Bien que le système actuel se concentre sur le contrôle d'une caméra, les mêmes principes pourraient être appliqués à d'autres tâches, comme aider un robot à naviguer dans une pièce bondée ou un drone à chercher une personne disparue. L'étude conclut que l'inférence active offre une voie prometteuse pour créer des machines adaptatives et économes en ressources capables de gérer l'imprévisibilité du monde réel, apportant la puissance de la perception intelligente directement à la périphérie.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.