← Derniers articles
🤖 machine learning

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2 est un modèle de monde général auto-évolutif pour la manipulation dextre qui unifie la politique, la simulation et l'évaluation en une boucle fermée de décision et d'apprentissage, exploitant des architectures de modèles mis à l'échelle et des ensembles de données multimodaux progressivement élargis pour permettre une amélioration continue grâce à la fois aux démonstrations d'experts et aux données d'interaction auto-générées.

Auteurs originaux : Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiab
Publié 2026-09-01
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Pour construire un robot capable de gérer véritablement le monde désordonné et imprévisible des tâches humaines, les scientifiques cherchent depuis longtemps un système qui fasse plus que simplement suivre une liste d'instructions. L'objectif est de créer une machine capable de percevoir son environnement, d'imaginer ce qui pourrait se passer ensuite, de prendre une action, puis d'apprendre du résultat pour faire mieux la fois suivante. Ce concept, connu sous le nom de « modèle de monde », agit comme un simulateur interne pour le robot. Au lieu de simplement réagir à ce qu'il voit à l'instant présent, le robot exécute des simulations mentales pour deviner le résultat de ses mouvements avant même de les effectuer réellement. Bien que les versions antérieures de ces systèmes pouvaient prédire l'avenir ou suggérer un mouvement, elles fonctionnaient souvent de manière linéaire : voir, deviner, agir, et s'arrêter. Elles manquaient d'un moyen de regarder en arrière leurs propres prédictions, de juger si elles étaient bonnes ou mauv'es, et d'utiliser ce jugement pour améliorer leurs propres capacités de prise de décision sans avoir besoin qu'un humain leur montre le bon chemin à chaque fois.

Une équipe de chercheurs a introduit un système appelé Motus2, un cerveau robotique auto-évolutif conçu spécifiquement pour des tâches délicates et complexes comme l'utilisation d'outils ou la manipulation d'objets avec des mains humaines. Ce système représente une avancée significative car il boucle la boucle entre la pensée et l'apprentissage. Plutôt que d'être un simple observateur passif ou un simple exécutant, Motus2 agit comme son propre enseignant. Il propose une série de mouvements possibles, simule ce que ces mouvements donneraient dans le futur, puis évalue si ces résultats imaginés mèneront au succès. Si la simulation montre un échec, le robot apprend de cette erreur. Si elle montre un succès, il renforce cette voie. Ce cycle permet au robot d'améliorer sa propre politique, ou son propre ensemble de règles d'action, en testant et en affinant constamment ses propres idées, même lorsqu'il n'a aucun humain pour le guider à chaque étape.

Le fondement de ce système repose sur une quantité massive de données collectées à partir de mains humaines. Les chercheurs ont commencé par apprendre au robot comment les humains interagissent avec le monde en utilisant des vidéos enregistrées selon une perspective à la première personne, comme si la caméra était montée sur la tête de la personne. Ils ont commencé par des vidéos simples à objectif unique montrant une grande variété de tâches, de la cuisine à l'organisation, puis sont passés à des vidéos stéréo synchronisées plus avancées qui fournissent un sens de la profondeur, semblable à la vision binoculaire humaine. Cela a permis au robot d'apprendre la physique subtile de la façon dont les mains saisissent, soulèvent et manipulent les objets. Cependant, le simple fait de regarder les humains ne suffit pas pour un robot doté d'un corps différent. Les chercheurs ont ensuite guidé le système à travers une étape intermédiaire d'entraînement où il a appris à traduire ces mouvements humains dans la mécanique spécifique de ses propres bras et mains robotiques. Ce processus a impliqué de montrer au robot des milliers d'heures de données humaines, suivies d'exemples spécifiques de la manière dont les humains et les robots peuvent travailler ensemble, comblant ainsi efficacement le fossé entre l'intuition humaine et l'exécution robotique.

Ce qui rend Motus2 unique, c'est la façon dont il utilise ce savoir. Le système est construit autour d'un modèle unique et unifié qui porte simultanément trois chapeaux différents. Premièrement, il agit comme une politique, suggérant quelle action entreprendre ensuite. Deuxièmement, il agit comme un simulateur, prédisant à quoi ressemblera le monde après que l'action a été entreprise. Troisièmement, il agit comme un évaluateur, jugeant si ce futur prédit est bon ou mauvais. Dans les systèmes traditionnels, ces fonctions sont souvent séparées ou déconnectées, mais ici, elles sont étroitement tissées ensemble. Lorsqu'un robot envisage un mouvement, il exécute instantanément une simulation mentale pour voir les conséquences. Il se demande ensuite si cette conséquence est souhaitable. Si la réponse est non, il rejette cette voie et en essaie une autre. Si la réponse est oui, il s'engage dans l'action. Ce dialogue interne se produit si rapidement que le robot peut planifier plusieurs étapes à l'avance, choisissant la meilleure voie à suivre avant même de bouger un muscle.

Les chercheurs ont testé ce système sur une plateforme entièrement robotisée équipée de deux bras, de deux mains dextères et de capteurs capables de ressentir le toucher, semblables aux empreintes digitales humaines. Ils ont mis le robot au défi avec une série de tâches difficiles, telles que placer une balle à un endroit précis, visser une ampoule dans une douille ou fixer une gomme à un stylo. Lors de ces tests, la capacité du robot à apprendre de ses propres simulations s'est avérée cruciale. Lorsque le système a été autorisé à utiliser son évaluateur interne pour sélectionner les meilleures options pendant une tâche, son taux de réussite s'est considérablement amélioré. Plus impressionnant encore, lorsque le système a été autorisé à utiliser ses propres prédictions pour mettre à jour ses propres règles d'apprentissage, il est devenu encore meilleur dans la tâche. Le robot n'a pas seulement eu de la chance ; il a véritablement appris à éviter les erreurs qu'il avait simulées et à répéter les actions qu'il avait simulées comme étant fructueuses.

Un élément clé de ce succès a été la capacité du robot à se souvenir de ce qui s'est passé plus tôt dans une tâche, même si cette information était temporairement invisible. Dans de nombreux travaux complexes, une main peut bloquer la vue d'un objet, ou une étape critique peut se produire bien avant que le résultat final ne soit visible. Pour gérer cela, les chercheurs ont doté le robot d'une forme de mémoire de travail capable de conserver des détails visuels importants du passé. Ils ont testé différentes façons de gérer cette mémoire, allant de la conservation d'une fenêtre glissante récente des événements à la maintenance d'un historique plus long et plus détaillé. Les résultats ont montré que le fait d'avoir accès à cet historique plus long permettait au robot de résoudre des tâches nécessitant de se souvenir d'une séquence d'événements sur une période plus longue, prouvant que la capacité de se rappeler le passé est aussi importante que de prédire l'avenir.

Le système intégrait également un module spécialisé pour le toucher. Bien que la vision soit puissante, elle ne peut pas toujours dire si une prise est en train de glisser ou si une surface est trop molle. Le robot était équipé d'un système expert léger dédié au traitement du retour tactile. Cela lui a permis d'affiner ses mouvements en temps réel, ajustant sa prise dès qu'il sentait un glissement ou un changement de pression. Cette combinaison de vision, de sensation, de pensée et d'apprentissage a créé un système robuste capable de gérer l'incertitude du monde réel.

Les conclusions suggèrent que la voie vers des robots véritablement capables ne réside pas seulement dans la collecte de plus de données, mais dans la construction de systèmes capables de se questionner et de s'améliorer eux-mêmes. En combinant des données d'interaction humaine à grande échelle avec une boucle d'auto-correction de prédiction et d'évaluation, Motus2 a démontré que les robots peuvent apprendre à manipuler le monde physique avec un niveau d'adaptabilité qui était auparavant hors de portée. Les chercheurs ont constaté qu'en augmentant la quantité de données vidéo stéréo utilisées pour l'entraînement, la capacité du robot à prédire les actions humaines s'améliorait de manière constante et prévisible. Cette mise à l'échelle suggère qu'avec encore plus de données, ces systèmes pourraient devenir encore plus performants. En fin de compte, ce travail montre qu'un robot n'a pas besoin d'être programmé avec chaque solution possible à chaque problème possible. Au contraire, s'il peut simuler le futur, juger le résultat et apprendre de la différence, il peut faire évoluer ses propres compétences pour répondre aux défis d'un monde complexe et dextre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →