← Derniers articles
💻 computer science

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

Le papier introduit WARP-RM, un modèle de récompense entièrement auto-supervisé qui génère des signaux de progression relative denses à partir de démonstrations de succès déformées temporellement pour permettre WARP-BC, une méthode de clonage de comportement qui améliore significativement les performances des robots sur des tâches à long horizon en filtrant et en repondérant les blocs d'actions provenant de données de qualité mixte.

Auteurs originaux : Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

Publié 2026-09-09
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots peinent depuis longtemps à apprendre en observant les humains. Alors qu'une personne peut jeter un coup d'œil à une tâche et comprendre le flux de mouvement, un robot entraîné sur des données vidéo apprend souvent les erreurs en même temps que les succès. Si un opérateur humain marque une pause pour réfléchir, manipule maladroitement un objet ou tente une prise gauche avant de réussir, le robot voit ces hésitations comme faisant partie du chemin correct. C'est un problème particulier pour les tâches longues et complexes comme plier le linge ou assembler des objets, où un seul moment de confusion peut faire dérailler toute la séquence. Pendant des années, les chercheurs ont essayé d'apprendre aux robots à ignorer ces mauvais moments, mais la plupart des méthodes nécessitaient des étiquettes humaines coûteuses pour marquer précisément où une erreur s'était produite, ou elles rejetaient des clips vidéo entiers s'ils contenaient la moindre erreur, jetant ainsi aux oubliettes des mouvements de récupération précieux cachés à l'intérieur de démonstrations imparfaites.

Une équipe de chercheurs de l'Université de Californie à Berkeley et de l'Université de Stanford a développé une nouvelle façon d'enseigner aux robots à distinguer le mouvement productif du temps perdu sans avoir besoin d'étiquettes humaines. Ils ont créé un système appelé WARP, qui signifie Warp-Augmented Relative Progress (Progrès Relatif Augmenté par Déformation). Au lieu de demander à un humain de regarder des heures de vidéo et de dessiner des cadres autour des bons et des mauvais moments, les chercheurs ont appris à l'ordinateur à comprendre la vitesse et la direction du progrès en visionnant les vidéos à différentes vitesses et même en sens inverse. En apprenant au robot à reconnaître ce qu'est un progrès « vers l'avant » par rapport à un mouvement « vers l'arrière » ou stationnaire, le système a appris à attribuer un score à chaque image de la vidéo. Ce score indique au robot à quelle vitesse la tâche progresse, s'il est bloqué ou s'il recule réellement.

Les chercheurs ont testé cette idée sur un robot physique doté de deux bras, en lui demandant de plier des T-shirts froissés dans un bac. Ils ont créé des ensembles de données d'entraînement de qualités variables. Dans les meilleurs ensembles de données, les démonstrations humaines étaient rapides et efficaces. Dans les pires, les démonstrations humaines étaient pleines de pauses, de tentatives et de longues périodes de tâtonnements. Lorsqu'ils ont entraîné un système d'apprentissage robotique standard sur ces vidéos désordonnées et de faible qualité, le robot a presque totalement échoué. Il restait bloqué dans des boucles de micro-ajustements inutiles, incapable de terminer la tâche. Cependant, lorsqu'ils ont utilisé le nouveau système WARP pour filtrer les données, les résultats ont radicalement changé. Le système identifiait automatiquement les parties lentes et hésitantes des vidéos et réduisait leur importance, tout en conservant les moments rapides et décisifs. Sur les ensembles de données désordonnés où le robot standard échouait vingt fois sur vingt, le robot entraîné par WARP a réussi dix-neuf fois sur vingt. Il a également plié les chemises près de dix-huit fois plus vite que le robot standard lorsqu'on lui donnait les mêmes données de mauvaise qualité.

L'équipe ne s'est pas arrêtée aux T-shirts. Elle a également testé la méthode sur une tâche où le robot devait placer des bouteilles en plastique dans un bac. Dans le monde réel, le nouveau système a placé soixante-quatorze bouteilles sur quatre-vingts, tandis que le système standard n'en a géré que cinquante-neuf. Le nouveau robot plaçait les bouteilles plus rapidement et avec plus de constance. Pour s'assurer que ces résultats n'étaient pas simplement un coup de chance lié au matériel robotique spécifique, les chercheurs ont lancé une simulation massive comprenant cinq cent douze scénarios différents. Dans ce test virtuel, le nouveau système a placé 290 bouteilles par heure, surpassant nettement le système standard qui en gérait 237 par heure. Même comparé à d'autres méthodes avancées qui tentent de nettoyer les données, cette nouvelle approche a produit de manière constante les résultats les plus rapides et les plus fiables.

Un élément clé de la raison pour laquelle cela fonctionne est la manière dont le système apprend à reconnaître le progrès. Les chercheurs n'ont pas dit à l'ordinateur à quoi ressemble un « T-shirt plié ». Au lieu de cela, ils ont pris des vidéos réussies d'humains pliant des chemises et les ont visionnées à des vitesses aléatoires, les ralentissant parfois jusqu'à l'arrêt total et les accélérant parfois. Ils ont également joué certaines vidéos en sens inverse. L'ordinateur devait ensuite deviner le temps écoulé entre le début d'un clip et le moment actuel. En apprenant à prédire le temps écoulé dans ces versions déformées et brouillées de la vidéo, l'ordinateur a appris à comprendre le rythme naturel de la tâche. Il a appris qu'un mouvement rapide et fluide signifie généralement que la tâche progresse, tandis qu'un mouvement lent et saccadé ou un mouvement vers l'arrière signifie que la tâche est au point mort ou en échec. Cela a permis au système de générer un score continu pour chaque image de la vidéo, indiquant au robot exactement quelles parties de la démonstration il doit surveiller et lesquelles il doit ignorer.

Les chercheurs ont découvert que le simple fait de jeter les mauvaises vidéos ne suffisait pas. La stratégie la plus efficace consistait à conserver les vidéos désordonnées mais à changer la façon dont le robot apprenait d'elles. Le système prenait un segment d'action de la vidéo et regardait le score de progrès à la fin de ce segment. Si le score était élevé, signifiant que la tâche progressait rapidement, le robot apprenait de ce segment avec une intensité totale. Si le score était bas ou négatif, signifiant que le robot hésitait ou reculait, le système soit ignorait entièrement ce segment, soit apprenait de celui-ci de manière très légère. Cette approche a permis au robot d'apprendre des mouvements de récupération effectués par les humains lorsqu'ils lâchaient un T-shirt et le ramassaient, sans apprendre la panique et l'hésitation qui avaient causé la chute.

Ce travail suggère que les robots n'ont pas besoin de démonstrations humaines parfaites pour apprendre des compétences complexes. Ils peuvent apprendre à partir de données réelles et désordonnées s'ils disposent d'un moyen de comprendre le flux du temps et du progrès au sein de ces données. Les chercheurs ont noté que leur méthode repose sur un type spécifique d'augmentation de données où les vidéos sont jouées en sens inverse, ce qui est physiquement impossible pour un vrai robot. Cependant, le système a tout de même appris des modèles utiles à partir de cet entraînement artificiel. Bien que la méthode ne soit pas une solution magique qui fonctionne pour toutes les tâches possibles, elle constitue un nouvel outil puissant pour enseigner aux robots comment ignorer le bruit de l'erreur humaine et se concentrer sur le signal de l'action réussie. L'équipe a rendu son code et ses données disponibles afin que d'autres chercheurs puissent tester ces idées sur leurs propres robots et tâches, ouvrant potentiellement la voie à une nouvelle génération de robots capables d'apprendre rapidement du monde imparfait et quotidien.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →