Learning to build covering structures with continuous adjustments
Cet article présente HSAC, un cadre d'apprentissage par renforcement qui permet aux robots de construire de manière adaptative des structures complexes en générant des séquences en temps réel sans plans prédéfinis, en utilisant des réseaux de neurones sur graphes et une version étendue de l'algorithme Soft Actor-Critic pour gérer des espaces d'actions hybrides discrets-continus et réussir le transfert de la simulation vers le matériel physique.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où les robots pourraient construire des structures complexes non pas en suivant un plan rigide et pré-dessiné, mais en tâtonnant tout au long du processus, en s'ajustant à chaque infime vacillement et imperfection au fur et à mesure. C'est la promesse de la construction robotique, un domaine qui vise à utiliser les matériaux plus efficacement et à créer des formes trop difficiles à réaliser pour les mains humaines ou les machines traditionnelles. Cependant, un obstacle majeur s'est toujours dressé sur le chemin : le monde réel est désordonné. Peu importe la précision d'un plan, les matériaux physiques présentent de légères variations, et les machines commettent de petites erreurs. Dans la construction traditionnelle, si un bloc est placé ne serait-ce qu'une fraction de millimètre de travers, l'ensemble du plan peut devoir être abandonné et recommencé, ou pire, la structure pourrait s'effondrer. Les méthodes actuelles peinent à s'adapter à ces erreurs inévitables car elles reposent sur des instructions fixes qui ne peuvent pas rendre compte de la nature imprévisible de la réalité physique.
Une équipe de chercheurs a développé une nouvelle façon pour les robots d'apprendre à construire, une méthode qui abandonne totalement l'idée d'un plan directeur. Au lieu de suivre un script, leurs robots apprennent à construire par essais et erreurs, en utilisant un type d'intelligence artificielle connu sous le nom d'apprentissage par renforcement. Dans cette approche, le robot agit comme un étudiant qui apprend en faisant : il essaie de placer un bloc, voit ce qui se passe, et si la structure reste stable, il reçoit une récompense ; si elle vacille ou tombe, il apprend de son erreur. Les chercheurs se sont concentrés sur un défi spécifique : construire une arche de dévolte en faisant travailler deux robots ensemble. Un robot place les blocs, tandis que l'autre maintient l'extrémité libre pour empêcher la structure de basculer. Cette configuration est délicate ; la structure est toujours au bord de l'instabilité, nécessitant des ajustements constants et subtils pour rester debout.
Le cœur de leur découverte est un nouvel algorithme qui permet au robot de prendre deux types de décisions simultanément : choisir quel type de bloc utiliser et décider exactement où le placer. C'est un problème difficile car le choix du bloc et le positionnement sont profondément liés ; le meilleur endroit pour un type de bloc peut être médiocre pour un autre. Les méthodes précédentes tentaient de gérer cela en simplifiant le problème ou en s'en tenant à des plans rigides, mais les chercheurs ont découvert que ces approches restaient souvent bloquées dans des solutions locales, incapables de trouver la meilleure façon de construire. Leur nouvelle méthode, qu'ils appellent un algorithme d'acteur-critique hybride doux (hybrid soft actor-critic), traite le processus de construction comme une conversation continue entre le robot et la structure. Elle permet au robot d'explorer différentes possibilités, apprenant non seulement ce qui fonctionne, mais aussi comment se rétablir lorsque les choses tournent légèrement mal.
Pour faire fonctionner cela, les chercheurs ont représenté la structure non pas comme une liste de coordonnées, mais comme un réseau de connexions, semblable à la façon dont une carte montre comment les villes sont reliées par des routes. Cette vue basée sur des graphes aide le robot à comprendre la forme du bâtiment, quelle que soit sa rotation ou son déplacement dans l'espace. Une innovation clé de leur système a été une manière spécifique d'organiser cette information afin de garantir que les décisions du robot concernant le choix du bloc ne soient pas confondues avec ses décisions concernant son emplacement. En structurant l'information avec soin, le robot a pu apprendre à explorer un vaste nombre de possibilités sans être submergé, finissant par trouver un chemin vers une arche stable que d'autres méthodes avaient manqué.
L'équipe a d'abord testé son système dans un environnement simulé, où elle pouvait effectuer des milliers d'essais rapidement. Ils ont comparé leur nouvel algorithme à une méthode existante et ont constaté que leur approche était nettement meilleure pour l'apprentissage. Alors que l'ancienne méthode restait souvent bloquée dans une boucle de solutions sous-optimales, n'atteignant jamais l'arche parfaite, leur nouveau système trouvait systématiquement de meilleures façons de construire. Il était également robuste, ce qui signifie qu'il fonctionnait bien même lorsque les chercheurs changeaient les paramètres ou rendaient la tâche plus difficile en ajoutant plus de types de blocs à choisir. Le système pouvait gérer jusqu'à dix types de blocs différents sans perdre sa capacité d'apprentissage, montant ainsi qu'il pouvait passer à l'échelle pour des tâches plus complexes.
Pour prouver que cet apprentissage pouvait se traduire dans le monde réel, les chercheurs ont construit une installation physique utilisant deux robots industriels et un ensemble de blocs en plastique imprimés en 3D. Ils ont placé une caméra au-dessus de l'espace de travail pour suivre la position de chaque bloc lors de sa pose. Le robot utilisait les données de la caméra pour mettre à jour sa compréhension de la structure et décidait de l'endroit où placer le bloc suivant en fonction de ce qu'il avait appris dans la simulation. Le résultat fut une arche construite avec succès en temps réel, les robots ajustant leurs actions à mesure que la structure grandissait. Lorsqu'ils ont comparé ce processus de construction adaptatif à une méthode traditionnelle où l'ensemble du plan est calculé au préalable, l'approche adaptative s'est avérée bien plus performante. La structure construite par le robot apprenant est restée fidèle à sa forme prévue, tandis que la version pré-planifiée a dérivé de sa trajectoire en raison de petites erreurs inévitables.
Ce travail démontre que les robots peuvent apprendre à construire des structures complexes en s'adaptant au monde physique en temps réel, plutôt qu'en essayant de forcer le monde à correspondre à un plan parfait. En laissant le robot apprendre de ses propres erreurs et succès, les chercheurs ont montré une voie vers une construction plus résiliente, efficace et capable de gérer la réalité désordonnée du monde physique. Le succès de leur expérience physique suggère que cette approche pourrait éventuellement être utilisée pour construire avec une grande variété de matériaux, du plastique à la pierre, créant des structures qui sont à la fois belles et solides, construites par des machines qui comprennent l'art subtil de l'équilibre.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.