← Derniers articles
🤖 AI

Stubborn: A Streamlined and Unified Reinforcement Learning Framework for Robust Motion Tracking and Fall Recovery for Humanoids

Cet article propose « Stubborn », un cadre d'apprentissage par renforcement unifié qui intègre le suivi de mouvement robuste et la récupération de chute pour les humanoïdes en employant une représentation alignée sur le lacet, un mécanisme de terminaison probabiliste basé sur Bernoulli pour encourager l'exploration dans des états instables, et une stratégie d'échantillonnage adaptative pour améliorer l'efficacité de l'entraînement.

Auteurs originaux : Xiao Ren, Yuhui Yang, Zongbiao Weng, Zhijie Liu, He Kong

Publié 2026-06-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xiao Ren, Yuhui Yang, Zongbiao Weng, Zhijie Liu, He Kong

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez la danse à un robot. Habituellement, si le robot trébuche et tombe, l'enseignant (le programme informatique) arrête immédiatement la leçon, dit « Game Over » et réinitialise le robot à sa position de départ. Le robot n'a jamais la chance d'apprendre comment se relever parce qu'on ne lui permet jamais de rester au sol assez longtemps pour comprendre comment faire.

L'article présente un nouveau système appelé Stubborn qui change cette approche. Au lieu d'abandonner quand le robot trébuche, Stubborn apprend au robot à être « têtu » (stubborn) : à continuer d'essayer de se remettre sur ses pieds même après une chute, tout en apprenant à danser parfaitement.

Voici comment cela fonctionne, décomposé en concepts simples :

1. La perspective « Tête la première » (Suivi aligné sur le lacet/Yaw)

Imaginez que vous essayiez de suivre un partenaire de danse. Si vous avez le vertige et que vous perdez la trace du « Nord », vous pourriez essayer de faire pivoter tout votre corps pour corriger votre direction, gaspillant ainsi de l'énergie et déréglant vos pas.

Stubborn apprend au robot à ignorer la direction du « Nord » et à se concentrer uniquement sur son propre corps et le sol. Il aligne sa vision avec sa propre tête (le lacet ou yaw). De cette façon, si le robot est poussé ou pivote, il ne panique pas pour savoir où il se trouve dans la pièce ; il se concentre simplement sur le maintien de son équilibre et sur le suivi des mouvements de danse par rapport à lui-même. Cela rend le robot beaucoup moins sensible aux sensations de « vertige ».

2. La règle du « Peut-être, ou peut-être pas » (Terminaison probabiliste)

Dans les anciennes méthodes d'entraînement, si un robot commettait une grosse erreur (comme une chute), la session d'entraînement s'arrêtait instantanément. C'est comme si un élève échouait à un examen de mathématiques et que l'enseignant le mettait immédiatement dehors de la classe avant qu'il ne puisse essayer de résoudre le problème à nouveau.

Stubborn utilise une astuce ingénieuse appelée Terminaison Probabiliste. Lorsqu'un robot commet une grosse erreur, au lieu de mettre fin immédiatement à la leçon, l'ordinateur lance une pièce virtuelle.

  • Pile : La leçon se termine.
  • Face : La leçon continue !

Cela donne au robot une « période de grâce » pour rester au sol et expérimenter. Il apprend que même lorsqu'il tombe, il a une chance de comprendre comment se relever. Parce que le robot n'est pas immédiatement puni par un « Game Over », il découvre naturellement comment se relever de ses chutes par lui-même, sans avoir besoin d'un enseignant spécial qui lui dise exactement comment se tenir debout.

3. La stratégie « Se concentrer sur les choses difficiles » (Échantillonnage adaptatif)

Imaginez que vous pratiquiez un morceau de piano. Vous jouez les parties faciles parfaitement, mais vous trébuchez sans cesse sur un accord spécifique et difficile. Un enseignant normal pourrait simplement vous laisser jouer toute la chanson du début à la fin à chaque fois, de sorte que vous ne pratiquiez ce accord difficile qu'un tout petit peu.

Stubborn agit comme un coach intelligent qui vous regarde jouer. S'il voit que vous trébuchez sur ce accord difficile, il dit : « D'accord, recommençons la chanson juste avant cette partie difficile. » Il modifie les probabilités pour que le robot passe plus de temps à pratiquer les moments difficiles et vacillants, et moins de temps sur les parties faciles et fluides. Cela permet au robot d'apprendre beaucoup plus vite car il concentre son énergie exactement là où elle est nécessaire.

4. Le résultat : Un seul robot, deux compétences

Le plus beau dans tout cela, c'est que Stubborn n'a pas besoin de deux enseignants différents — un pour la danse et un pour la chute. Il utilise un seul cerveau (une seule politique) pour faire les deux.

  • Il apprend à suivre des mouvements complexes et rapides (comme la danse ou les arts martiaux).
  • Il apprend à se remettre après des poussées ou des chutes importantes.

Les chercheurs ont testé cela sur un vrai robot (le Unitree G1) et dans des simulations informatiques. Les résultats ont montré que Stubborn était meilleur pour suivre les mouvements et bien meilleur pour se remettre de ses chutes par rapport aux autres méthodes. Il ne s'est pas contenté de survivre à la chute ; il a appris à se relever et à continuer de danser, le tout sans avoir besoin d'instructions spéciales pour la partie récupération.

En bref : Stubborn est une méthode d'entraînement qui refuse de laisser un robot abandonner lorsqu'il tombe. En laissant le robot rester un peu plus longtemps dans les moments « désordonnés » et en concentrant la pratique sur les parties les plus difficiles, cela crée un robot qui est à la fois un excellent danseur et un survivant endurci.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →