← Derniers articles
💻 computer science

Position: Good Embodied Reward Models Need Bad Behavior Data

Ce document d'orientation soutient que la communauté de l'IA incarnée doit donner la priorité à la collecte et à l'utilisation de données robotiques « mauvaises » — telles que des comportements ratés, sous-optimaux ou dangereux — afin d'entraîner des modèles de récompense qui s'alignent avec précision sur les préférences humaines et évitent de sur-récompenser des accomplissements de tâches superficiels ou dangereux.

Auteurs originaux : Ran Tian, Yilin Wu, Andrea Bajcsy

Publié 2026-06-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ran Tian, Yilin Wu, Andrea Bajcsy

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot à plier du linge ou à verser un verre d'eau. Pour bien l'enseigner, vous avez besoin d'un « enseignant » (un modèle de récompense) qui puisse regarder ce que fait le robot et dire : « Bon travail ! » ou « Non, c'est un désastre. »

Cet article soutient que nos enseignants de robots actuels échouent parce qu'ils n'ont vu que des exemples parfaits. On ne leur a jamais montré ce qu'est un désastre.

Voici la décomposition de l'argument de l'article en utilisant des analogies simples :

1. Le problème : Le biais de l'« étudiant parfait »

Actuellement, lorsque nous entraînons ces enseignants de robots, nous ne montrons que des vidéos de robots accomplissant des tâches parfaitement. C'est comme essayer d'apprendre à un étudiant à conduire une voiture en ne lui montrant que des vidéos de conducteurs professionnels par temps clair, sans jamais lui montrer un pneu crevé, une glissade ou une collision évitée de justesse.

Parce que les enseignants n'ont jamais vu de « mauvais » comportements, ils sont excessivement optimistes.

  • Le résultat : Si un robot renverse un bol en essayant de ramasser une tasse, l'enseignant pourrait quand même dire : « Excellent travail ! Vous avez ramassé la tasse ! » parce qu'il voit la tasse bouger. Il ne remarque pas le fait que le robot a cassé autre chose.
  • La réalité : L'article a testé trois enseignants de robots de pointe. Tous ont donné des scores élevés à des robots qui échouaient réellement, qui étaient dangereux ou qui utilisaient des « triche » pour terminer la tâche. À mesure que les tâches devenaient plus difficiles (comme utiliser un outil), les enseignants devenaient moins performants, se contentant essentiellement de deviner au hasard.

2. La solution : Nous avons besoin de données « mauvaises »

Les auteurs affirment que nous devons arrêter de jeter les « échecs ». Nous devons collecter et partager des vidéos de robots qui s'écrasent, qui laissent tomber des objets ou qui se déplacent dangereusement.

Pensez-y comme à une école de médecine. Si vous n'étudiez que des patients sains, vous ne saurez pas diagnostiquer une maladie. Vous devez aussi étudier des patients malades.

  • La thèse de l'article : Même une petite quantité de données « mauvaises » (des vidéos de robots en situation d'échec) aide l'enseignant à apprendre ce qu'il ne faut pas récompenser.
  • L'expérience : Les chercheurs ont testé cela en montrant à un enseignant une vidéo d'un robot en situation d'échec (par exemple, renversant des noix) accompagnée d'une description textuelle de l'erreur.
    • Texte uniquement : N'a pas beaucoup aidé. L'enseignant ne parvenait pas à connecter les mots au désordre physique.
    • Texte + Vidéo : A aidé un peu pour des tâches simples (comme ramasser un objet).
    • Texte + Vidéo + « Carnet de notes » : C'est ce qui a le mieux fonctionné. Ils ont donné à l'enseignant une vidéo de l'échec plus un carnet de notes détaillé montrant exactement quand et pourquoi le robot a échoué pendant la vidéo. Cela a permis à l'enseignant d'apprendre à pénaliser le robot dès l'instant où il commettait une erreur, même si le reste de la tâche semblait correct.

3. Pourquoi n'avons-nous pas encore ces données ?

Vous pourriez demander : « Pourquoi ne pas simplement enregistrer tous les échecs ? »

  • La barrière : Dans le monde numérique (comme pour les chatbots textuels), générer des données « mauvaises » est facile et peu coûteux. On peut simplement taper n'importe quoi.
  • Le monde des robots : Dans le monde réel, les robots sont physiques. Faire échir des robots signifie souvent casser des choses, perdre du temps ou créer des risques pour la sécurité. De plus, la plupart des laboratoires de robotique sont tellement concentrés sur la démonstration de succès qu'ils suppriment les vidéos d'échecs « moches » avant que quiconque ne les voie.

4. L'appel à l'action

Les auteurs demandent à la communauté de la robotique de faire quatre choses spécifiques :

  1. Publier les données « mauvaises » : Arrêtez de cacher les échecs. Les laboratoires et les entreprises devraient partager des ensembles de données de robots qui s'écrasent, qui font tomber des objets ou qui se déplacent de manière imprudente, tout comme ils partagent les histoires de succès.
  2. Simuler les échecs (synthétiquement) : Puisque les crashs réels sont coûteux, nous avons besoin de meilleures simulations informatiques capables de générer des scénarios d'échec réalistes (ex : « Et si le robot glissait ici ? »).
  3. Décentraliser les tests : Au lieu qu'un seul laboratoire teste les robots, nous avons besoin de nombreux endroits différents testant les robots dans des conditions réelles pour détecter davantage de types d'échecs.
  4. De meilleurs tests pour les enseignants : Nous avons besoin de nouveaux bancs d'essai pour tester les « enseignants » eux-mêmes, afin de s'assurer qu'ils apprennent réellement du feedback humain et qu'ils ne font pas que deviner.

Résumé

L'article soutient que pour construire des robots fiables, nous devons cesser de traiter l'« échec » comme une erreur à cacher. Au lieu de cela, nous devons traiter la donnée d'échec comme une ressource vitale. Sans voir les comportements « mauvais », nos enseignants de robots continueront de donner des scores élevés à des robots dangereux ou négligents, pensant qu'ils font du bon travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →