Riemann-1.0: An Embodied World Action Model for Physical AI
Riemann-1.0 est un modèle d'action mondiale autorégressif causal et unifié qui intègre des observations multi-vues, des états de robots et des actions dans un cadre unique, exploitant une stratégie de pré-entraînement progressif sur plus de 200 000 heures de données incarnées diverses pour atteindre des performances de pointe tant dans les tâches de manipulation à long horizon en simulation que dans le monde réel.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'intelligence artificielle est depuis longtemps une maîtresse du domaine numérique, capable de lire du texte, de reconnaître des images et de résoudre des énigmes dans les limites d'un écran d'ordinateur. Mais pour que les machines puissent véritablement nous rejoindre dans le monde physique, elles doivent faire plus que simplement comprendre ce qu'elles voient ; elles doivent apprendre à agir en son sein. C'est là tout le défi de l'intelligence incarnée : apprendre aux robots à percevoir leur environnement, à raisonner sur la cause et l'effet, et à exécuter des mouvements physiques avec la même fluidité qu'un humain utilise pour prendre une tasse ou plier une chemise. Pour qu'une machine réussisse, elle a besoin d'un modèle du monde qui comprenne non seulement l'apparence des objets, mais aussi la manière dont ils bougent et changent lorsqu'ils sont touchés. Elle doit apprendre que pousser un bloc le fait glisser, et que soulever un couvercle révèle ce qui se trouve à l'intérieur. Jusqu'à présent, créer un système unique capable à la fois de planifier ces actions physiques et de prédire les conséquences visuelles de ces actions a constitué un obstacle difficile, nécessitant souvent des systèmes distincts pour la pensée et pour le mouvement.
Une équipe de chercheurs a introduit un nouveau système appelé Riemann-1.0, conçu pour combler cette lacune en traitant les actions d'un robot et les changements qui en résultent comme une histoire unique et continue. Au lieu de construire des outils séparés pour décider de quoi faire et des outils pour imaginer ce qui va se passer ensuite, ce modèle apprend à faire les deux simultanément. Il repose sur un principe simple mais puissant : dans le monde réel, une action se produit toujours avant que le résultat ne soit vu. Si un robot tend la main vers une cuillère, le mouvement se produit d'abord, et le changement visuel — la cuillère qui bouge — suit. Riemann-1.0 est construit pour respecter cet ordre, apprenant d'une vaste collection de données vidéo et de mouvement pour prédire exactement ce qu'un robot devrait faire ensuite et à quoi le monde ressemblera après qu'il l'aura fait.
Pour enseigner ce système, les chercheurs ont rassemblé une immense bibliothèque d'expériences, totalisant plus de 200 000 heures d'interaction. Cette collection n'était pas seulement un amas de vidéos de robots ; c'était un mélange soigneusement organisé de trois types de matériel d'apprentissage différents. Premièrement, ils ont inclus des milliers d'heures de vidéos enregistrées du point de vue d'un humain, montrant des personnes accomplissant des tâches quotidiennes comme cuisiner ou nettoyer. Ces vidéos offraient une compréhension large de la manière dont les objets interagissent et comment les tâches se déroulent au fil du temps, bien qu'elles manquent des données mécaniques spécifiques d'un robot. Deuxièmement, ils ont ajouté des démonstrations provenant de préhenseurs robotiques tenus à la main et de dispositifs portables, qui servent de pont, montrant comment les mouvements de la main humaine se traduisent en commandes de type machine. Enfin, ils ont inclus des enregistrements précis de mouvements de robots réels, qui ont fourni les instructions exécutables exactes nécessaires pour apprendre à la machine comment bouger ses propres membres. En combinant ces sources, les chercheurs ont créé un ensemble de données unifié qui a permis au modèle d'apprendre de la vaste sagesse de l'expérience humaine tout en ancrant ce savoir dans la mécanique précise du contrôle robotique.
Le processus d'apprentissage de Riemann-1.0 a été structuré comme un programme scolaire, passant de l'observation générale à l'exécution spécifique. Dans la première étape, le modèle a étudié la vaste bibliothèque de vidéos humaines. Puisque ces vidéos ne comportaient pas de données de mouvement robotique, le système a utilisé un outil auxiliaire pour estimer les « actions » invisibles qui ont dû causer les changements visuels observés à l'écran. Cela a permis au modèle d'apprendre la dynamique de base de la façon dont le monde bouge sans avoir besoin de données robotiques parfaites. Dans la deuxième étape, le modèle a été introduit aux données mixtes de mains humaines et de préhenseurs robotiques, apprenant à aligner sa compréhension du mouvement avec des commandes physiques réelles. Enfin, dans la troisième étape, le modèle s'est concentré exclusivement sur des enregistrements de haute qualité de robots accomplissant des tâches. Cette phase finale a affiné sa capacité à générer des commandes précises et exécutables, garantissant que les actions qu'il planifie ne sont pas seulement visuellement plausibles, mais physiquement possibles pour une véritable machine.
Les résultats de cette approche ont été frappants. Testé sur une grande variété de tâches, tant dans des simulations informatiques que sur de vrais robots, Riemann-1.0 a surpassé les méthodes précédentes par une marge significative. Dans une simulation conçue pour tester des tâches longues et complexes impliquant de nombreuses étapes, le modèle a réussi 62,6 % du temps, une amélioration notable par rapport aux meilleurs systèmes existants. Dans une autre simulation axée sur des robots à deux bras, il a atteint un taux de réussite de 94,3 %. Plus impressionnant encore, lorsqu'il a été déployé sur des robots réels pour accomplir des tâches telles que l'empilement de blocs colorés, le pliage de vêtements, l'organisation d'un bureau encombré ou l'arrangement d'articles de cuisine, le système a accompli les tâches avec succès 85 % du temps. Il a également montré une capacité remarquable à s'adapter à de nouvelles situations qu'il n'avait pas rencontrées auparavant, comme placer un Rubik's Cube dans une boîte ou mettre une serviette dans un bassin, réussissant 85 % de ces essais inédits.
Au-delà de sa fonction de simple contrôleur de robot, Riemann-1.0 peut également fonctionner comme un simulateur. Parce qu'il comprend le lien causal entre une action et le résultat visuel, les chercheurs peuvent lui demander d'imaginer ce qui se passerait si un robot effectuait un mouvement spécifique. Le modèle peut générer une vidéo du futur, montrant exactement comment les objets bougeraient et où ils finiraient, sur la base de l'action fournie. Cette double capacité signifie que le système peut servir à la fois de cerveau qui décide de l'action à entreprendre et d'imagination qui vérifie si le plan fonctionnera avant même que le robot ne bouge. Cette capacité à prédire le futur du monde physique, ancrée dans la réalité de la façon dont les actions provoquent des changements, représente une étape importante vers la création d'une intelligence artificielle capable d'être un partenaire fiable dans le monde physique. Ces travaux suggèrent qu'en unifiant l'apprentissage de la manière d'agir et l'apprentissage de la réponse du monde, les machines peuvent développer une compréhension plus robuste et généralisable des tâches que nous accomplissons chaque jour.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.