← Derniers articles
🤖 AI

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

CLAP est un nouveau cadre qui permet la simulation physique zero-shot à travers diverses formes d'embodiments robotiques et humaines en s'entraînant sur des vidéos hétérogènes à l'échelle d'Internet, réconciliant des espaces d'action disparates grâce à une recette d'apprentissage basée sur un curriculum pour atteindre des performances de pointe en matière d'adaptation few-shot et de compréhension généralisable de la physique.

Auteurs originaux : Kechen Liu, Ola Shorinwa

Publié 2026-08-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kechen Liu, Ola Shorinwa

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots luttent depuis longtemps pour comprendre le monde physique de la même manière que les humains. Alors qu'un enfant apprend qu'une tasse tombera si elle est poussée hors d'une table ou qu'une serviette peut être pliée en tirant sur ses coins, les robots nécessitent souvent des milliers d'exemples spécifiques pour apprendre même l'une de ces règles les plus simples. Cette difficulté provient du fait que la plupart des systèmes d'apprentissage robotique sont entraînés sur des données provenant d'un seul type de machine. Un robot doté d'un bras long et fin apprend la physique différemment d'un robot doté d'une pince ou d'une main humaine, ce qui crée une barrière où le savoir acquis par l'un ne peut pas être facilement partagé avec l'autre. Pour surmonter cela, les scientifiques ont commencé à se tourner vers les modèles de génération de vidéos, qui sont des programmes informatiques capables d'imaginer ce qui se passe ensuite dans une scène. Si un robot pouvait regarder une vidéo et prédire le mouvement futur des objets, il pourrait planifier ses actions sans avoir besoin de les essayer physiquement d'abord. Cependant, ces modèles prédictifs ont historiquement été limités à un seul type de robot, empêissant ainsi d'apprendre de la vaste et diversifiée bibliothèque de vidéos humaines et robotiques disponibles sur Internet.

Une équipe de chercheurs de l'Université de Princeton a développé un nouveau cadre appelé CLAP pour combler cette lacune. Leurs travaux démontrent qu'un seul modèle vidéo peut apprendre les lois universelles de la physique en s'entraînant sur un mélange massif de vidéos présentant à la fois des humains et de nombreux types différents de robots. L'idée centrale est que, bien qu'une main humaine, un bras robotique et une pince soient tous différents, ils obéissent tous aux mêmes règles physiques lorsqu'ils déplacent des objets. En apprenant à un ordinateur à prédire le futur d'une scène, quel que soit l'auteur ou l'objet de l'action, les chercheurs ont créé un système qui comprend la mécanique sous-jacente du monde plutôt que simplement les mouvements spécifiques d'une seule machine. Cette approche permet au modèle d'apprendre à partir de vidéos non étiquetées d'Internet, où aucune instruction n'est fournie, ainsi qu'à partir de données robotiques détaillées, créant ainsi une compréhension beaucoup plus riche de la façon dont les choses bougent et interagissent.

Les chercheurs ont été confrontés à un obstacle important car les données qu'ils souhaitaient utiliser étaient désordonnées et incohérentes. Les vidéos d'humains ne comportent pas d'instructions sur la façon dont leurs mains ont bougé, et différents robots utilisent différentes manières de décrire leurs mouvements. Pour résoudre cela, l'équipe a créé une méthode pour traduire tous ces différents langages de mouvement en un format commun. Ils ont utilisé trois outils principaux : la position précise de la main d'un robot, des descriptions textuelles simples du mouvement, et une représentation d'action apprise et cachée que l'ordinateur déduit de lui-même. La stratégie la plus efficace impliquait un processus d'apprentissage par étapes. D'abord, le modèle a appris les règles de base de la physique en regardant des vidéos non étiquetées à l'aide des représentations d'actions cachées. Une fois qu'il a compris la dynamique fondamentale, les chercheurs ont affiné ses connaissances en utilisant des données précises provenant de robots avec des mouvements étiquetés. Cette approche en deux étapes a permis au système de monter en échelle en utilisant la vaste quantité de vidéos d'Internet tout en restant assez précis pour contrôler de vrais robots.

Les résultats de ce travail montrent que le nouveau système est aussi performant, et souvent meilleur, que les meilleurs modèles existants qui ont été entraînés sur un seul type de robot. Dans des environnements de test exigeants, le modèle pouvait prédire les images futures d'une vidéo avec une grande précision, simulant correctement la façon dont les objets tombent, glissent ou sont manipulés. Crucialement, le système a été capable de généraliser cette connaissance à des tâches du monde réel sans avoir besoin d'être réentraîné pour chaque nouveau robot. Lorsqu'il a été testé sur un robot à un seul bras, le système a réussi à aider le robot à planifier ses actions pour ramasser divers objets, tels que du ruban adhésif, du poisson ou du homard, surpassant les politiques robotiques standards. Plus impressionnant encore, le système a pu être appliqué à un robot à deux bras et à un robot humanoïde ayant une structure corporelle différente, bien qu'il n'ait jamais été entraîné sur des données provenant de ces machines spécifiques. En ajustant simplement la couche finale du modèle pour correspondre aux mouvements du nouveau robot, le système a conservé sa compréhension profonde de la physique et a continué à faire des prédictions précises.

Cette recherche suggère que le chemin vers des robots plus capables ne nécessite pas de construire un cerveau unique pour chaque nouvelle machine. Au lieu de cela, en s'entraînant sur un mélange diversifié de données, un seul modèle peut apprendre un ensemble général de principes physiques qui s'appliquent à presque n'importe quel agent. Les chercheurs ont découvert que, tandis que les mouvements relatifs, qui décrivent le changement plutôt que la position, fonctionnaient bien pour les instructions textuelles, les positions absolues étaient nécessaires pour un contrôle précis avec des bras robotiques. Ils ont également découvert que, si les vidéos humaines étaient excellentes pour enseigner au modèle les bases de la physique, les données provenant de robots réels étaient essentielles pour traduire cette connaissance en actions réussies dans le monde réel. Ce travail établit une nouvelle façon d'entraîner les robots, passant de systèmes isolés et à usage unique vers une approche plus unifiée où l'apprentissage d'une incarnation peut directement bénéficier à une autre. Bien que le système ne soit pas parfait et puisse parfois commettre des erreurs dans ses prédictions, il représente une étape significative dans l'enseignement aux machines comment comprendre le monde physique par l'observation et l'imagination.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →