← Derniers articles
🤖 machine learning

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

RynnValue est un modèle de fondation de valeur robotique en open-source qui passe à l'échelle avec des millions de clips conditionnés par instructions en utilisant la distance temporelle comme cible de supervision, surpassant les méthodes basées sur la préférence lors de l'évaluation et augmentant considérablement le succès des politiques en conditions réelles sans nécess avoir besoin d'annotations explicites de récompense ou de progression.

Auteurs originaux : Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

Publié 2026-08-11
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot à cuisiner un repas, mais au lieu de lui donner une recette, vous dites simplement : « Fais bien ! » en espérant qu'il comprenne le reste. C'est le monde de l'apprentissage robotique, une branche de la science où les ingénieurs tentent d'apprendre aux machines à bouger et à interagir avec le monde physique. Le plus grand obstacle n'est généralement pas le cerveau du robot (sa capacité à bouger), mais la récompense. Dans le monde de l'IA, une « récompense » est comme un bulletin de notes ou un « bravo » qui dit au robot : « Bon travail ! » ou « Réessaie ! ». Le problème est que donner un bulletin de notes parfait pour chaque mouvement est incroyablement difficile. Si le bulletin est trop vague, le robot est confus. S'il est trop spécifique à une tâche, le robot ne peut rien apprendre de nouveau. Les scientifiques ont essayé de construire un « bulletin à usage général » qui fonctionne pour n'importe quel robot effectuant n'importe quelle tâche, mais ils sont restés bloqués sur la manière de le créer sans qu'un humain ait besoin de noter manuellement chaque tentative.

C'est ici qu'intervient une nouvelle idée appelée RynnValue. Considérez cela comme une nouvelle façon de noter la performance d'un robot. Au lieu de demander : « À quel point es-tu proche de la ligne d'arrivée ? » (ce qui est difficile à mesurer si la ligne d'arrivée est différente pour chaque tâche), RynnValue demande : « Combien de temps reste-t-il avant que tu n'aies fini ? ». Cela traite le voyage du robot comme un compte à rebours. Si le robot est loin du but, le minuteur est élevé. S'il est proche, le minuteur est bas. La magie de ce papier est qu'elle montre que vous n'avez pas besoin qu'un humain appuie sur un bouton pour dire « Bon travail » afin de créer ce minuteur. Vous pouvez simplement regarder l'horloge. Si une vidéo d'un robot en train de cuisiner commence à 10 minutes et se termine à 0, l'ordinateur peut automatiquement comprendre qu'à la marque des 5 minutes, le robot avait 5 minutes restantes. Ce tour de magie simple permet au robot d'apprendre de milliers d'heures de vidéos sans que personne n'ait besoin de les noter manuellement.

Le Problème : Le Piège du « Progrès »

Pendant longtemps, les scientifiques ont essayé d'enseigner aux robots en mesurant le « progrès ». Imaginez un robot essayant d'empiler des blocs. Un modèle de progrès essaierait de deviner si le robot est terminé à 10 %, 50 % ou 90 %. Mais voici le piège : « 50 % de progression » ressemble totalement à autre chose pour l'empilement de blocs que pour le versement d'eau. Un robot pourrait être à mi-chemin par la hauteur, tandis qu'un autre le serait par le temps. Cela rend très difficile l'entraînement d'un robot capable de faire beaucoup de choses différentes, car la définition du « progrès » change à chaque fois que la tâche change. C'est comme essayer d'enseigner les mathématiques à un élève en lui disant : « Tu es à la moitié ! » sans jamais lui donner la réponse finale attendue.

Les auteurs de ce papier soutiennent que cette approche par le « progrès » est une impasse. Ils affirment que nous devons arrêter d'essayer de deviner à quel point le robot est avancé et commencer à compter à rebours le temps jusqu'à ce que le travail soit terminé. Ils appellent cela la distance temporelle. C'est le « coût pour aller à destination » (cost-to-go), ou simplement : « Combien de temps me reste-t-il ? ».

La Solution : RynnValue et l'Horloge Magique

L'équipe de l'Académie DAMO d'Alibaba et du Hupan Lab a construit un modèle appelé RynnValue. Au lieu d'essayer de deviner un pourcentage de progression, RynnValue regarde une vidéo d'un robot et une instruction textuelle (comme « pose la tasse sur la table ») et prédit exactement combien de secondes il reste avant que la tâche ne soit terminée.

Voici la partie astucieuse : ils n'ont pas eu besoin que des humains écrivent « 5 secondes restantes » pour chaque vidéo. Ils ont simplement utilisé les horodatages déjà présents sur les fichiers vidéo. Si une vidéo commence à 0:00 et que le robot termine à 0:10, l'ordinateur sait qu'à 0:05, le robot avait 5 secondes restantes. Cela signifie qu'ils ont pu entraîner le modèle sur une immense bibliothèque de plus de 7 000 heures de vidéos de robots — environ 3 millions de clips — sans avoir besoin d'un seul humain pour les noter manuellement. C'est comme enseigner la lecture à un élève en le laissant regarder des milliers de films sous-titrés, plutôt que d'avoir un professeur qui note chaque phrase qu'il lit.

Les Astuces Sournoises (et comment elles ont été stoppées)

Vous pourriez penser : « Si le robot apprend juste à regarder l'horloge, n'est-il pas en train d'exploiter un raccourci ? ». Les scientifiques s'en inquiétaient aussi. Ils savaient que s'ils montraient simplement les vidéos dans l'ordre, le robot pourrait apprendre un raccourci : « Oh, la 3ème image de la vidéo est toujours à la moitié du chemin ! » ou « Si la vidéo dure 10 secondes, le milieu est toujours à 5 secondes ». Le robot arrêterait de regarder réellement les bras du robot et se contenterait de deviner en fonction de la position de la vidéo.

Pour empêcher cela, ils ont ajouté du « chaos » à l'entraînement :

  1. Échantillonnage Aléatoire : Ils n'ont pas montré la vidéo au robot de manière linéaire. Ils ont choisi des moments aléatoires dans la vidéo, de sorte que le robot ne puisse pas deviner le temps en fonction de l'ordre des images.
  2. Mélange (Shuffling) : Ils ont parfois montré la vidéo à l'envers ou dans un ordre désordonné. Si le robot voyait un état « terminé » avant un état « de départ », il devait réaliser que l'état « terminé » était en fait plus éloigné dans le temps, forçant ainsi le robot à réellement regarder l'image du robot, et non juste l'ordre des images.
  3. Isolation : Ils se sont assurés que le robot ne pouvait pas jeter un coup d'œil aux réponses de l'image suivante tout en devinant l'actuelle. Il devait résoudre chaque instant de manière autonome.

Les Résultats : Est-ce que ça marche ?

L'équipe a testé RynnValue sur un ensemble de différents robots et tâches qu'il n'avait jamais vus auparavant. Les résultats sont étonnamment bons.

  • Tâches de Classement : Lorsqu'on lui a demandé de classer différentes tentatives de robots de la « meilleure » à la « pire », RynnValue a obtenu un score de 0,675. C'est mieux que les meilleurs modèles précédents qui reposaient sur des humains notant manuellement les vidéos (qui ont obtenu 0,655).
  • Robots Réels : Ils ont pris le modèle et l'ont utilisé pour apprendre à de vrais robots à effectuer des tâches délicates, comme mettre du pain dans un panier ou déplacer un steak avec une spatule.
    • Avec RynnValue, les robots ont réussi 72,5 % du temps lors d'un apprentissage en ligne (pendant le mouvement).
    • Sans lui, en utilisant les anciennes meilleures méthodes, ils ne réussissaient que 52,5 % du temps.
    • En apprentissage hors ligne (apprentissage à partir d'une base de données de mouvements passés), RynnValue a fait passer le succès de 63,8 % à 82,5 %.

Pourquoi cela importe

La chose la plus excitante dans ce papier est qu'elle suggère que nous n'avons pas besoin d'être parfaits pour noter les robots afin de leur apprendre. Nous avons juste besoin de savoir quand ils ont terminé. En utilisant le simple « chronomètre » automatique du temps, RynnValue crée un langage universel pour les récompenses de robots. Cela fonctionne pour un robot avec deux bras, un robot avec une roue ou un robot avec une main, tant que nous pouvons dire quand le travail est fini.

Les auteurs précisent avec prudence que ce n'est pas une baguette magique qui résout instantanément tous les problèmes de robotique. Ils ont constaté que pour des tâches très complexes nécessitant un alignement précis (comme mettre une boîte dans un tiroir), le modèle éprouvait encore quelques difficultés car les indices visuels étaient déroutants. Mais globalement, ils ont démontré que la distance temporelle est un moyen puissant et évolutif d'enseigner aux robots. Cela transforme le problème complexe et désordonné de « quel est un bon mouvement ? » en le problème simple et soluble de « combien de temps reste-t-il ? ».

En résumé, RynnValue est comme donner un chronomètre à un robot plutôt qu'un bulletin de notes. Cela transforme le monde chaotique de l'apprentissage robotique en un compte à rebours simple, et cela semble mieux fonctionner que les anciennes méthodes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →