← Derniers articles
🤖 machine learning

Corruption Robust Offline Reinforcement Learning with Human Feedback

Cet article introduit les premiers algorithmes d'apprentissage par renforcement hors ligne avec rétroaction humaine (RLHF) prouvables et robustes, capables d'identifier des politiques quasi optimales à partir de jeux de données contenant une fraction ε\varepsilon de paires trajectoire-rétroaction corrompues, en apprenant des modèles de récompense avec des ensembles de confiance et en exploitant l'optimisation pessimiste via des oracles d'apprentissage par renforcement robustes à la corruption.

Auteurs originaux : Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

Publié 2026-07-01
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot à jouer à un jeu vidéo complexe. Habituellement, vous laisseriez le robot jouer, observeriez ce qu'il fait, et lui diriez : « Bon travail ! » ou « Mauvais travail ! » en fonction de ses performances. C'est l'Apprentissage par Renforcement à partir du Feedback Humain (RLHF).

Cependant, dans le monde réel, les données que vous collectez ne sont pas parfaites. Parfois, la personne qui donne le feedback est fatiguée et commet des erreurs (bruit). Parfois, un pirate malveillant peut délibérément inverser les étiquettes « Bien » et « Mal » pour tromper le robot (corruption).

Cet article s'attaque à un problème spécifique et difficile : Comment apprendre à un robot à bien jouer en utilisant un ensemble de données partiellement empoisonnées ou corrompues, sans jamais laisser le robot rejouer au jeu (Offline/Hors ligne) ?

Voici une décomposition simple de leur solution, utilisant des analogies créatives.

Le Problème Central : Le « Livre de Recettes Empoisonné »

Imaginez que vous vouliez apprendre à cuisiner le gâteau parfait. Vous avez un livre de recettes (le jeu de données) contenant 1 000 recettes. Mais, un adversaire s'est faufilé et a modifié 10 % des recettes. Certaines disent « ajoutez du sel » quand elles devraient dire « ajoutez du sucre », et certains ingrédients sont listés incorrectement.

Si vous suivez aveuglément le livre, vous cuisinerez un gâteau terrible. Si vous essayez d'apprendre en cuisinant et en goûtant (RL Online), vous pourriez tomber malade ou gaspiller beaucoup d'ingrédients. Les auteurs veulent une méthode pour examiner ce livre empoisonné, identifier les recettes qui sont probablement réelles, et apprendre au robot la meilleure façon de cuisiner sans jamais entrer dans une cuisine.

La Stratégie en Trois Étapes

Les auteurs proposent un processus de « détective » en trois étapes pour résoudre cela :

1. Le « Détecteur de Vérité » (Apprentissage de Récompense Robuste)

D'abord, le robot doit comprendre ce qu'est un « bon » résultat. Dans l'article, cela s'appelle apprendre un Modèle de Récompense (Reward Model).

  • L'Analogie : Imaginez que vous essayez de deviner le prix réel d'une maison en vous basant sur une liste de ventes. Certaines entrées sont fausses (par exemple, un manoir listé à 50 $).
  • La Méthode : Au lieu de faire la moyenne de tous les prix (ce qui serait faussé par les faux), les auteurs utilisent une technique appelée Maximum de Vraisemblance Élagué (Trimmed Maximum Likelihood). Voyez cela comme un filtre intelligent qui dit : « Je vais ignorer les 10 % de chiffres les plus extrêmes et les plus suspects et ne faire confiance qu'aux 90 % centraux. » Cela leur donne une estimation « propre » de ce que les humains préfèrent réellement, même si certaines données mentent.

2. Le « Filet de Sécurité » (Ensembles de Confiance)

Une fois qu'ils ont une « meilleure supposition » de la vraie récompense, ils ne la font pas confiance aveuglément. Ils construisent un Ensemble de Confiance (Confidence Set).

  • L'Analogie : Imaginez qu'un détective dise : « Je suis sûr à 95 % que le tueur se trouve dans ce quartier spécifique. » Il dessine un cercle autour de ce quartier. Il sait que le tueur est quelque part à l'intérieur de ce cercle, mais il n'est pas sûr de son emplacement exact.
  • La Méthode : Ils créent une « bulle » mathématique autour de leur estimation de la récompense. Ils savent que la vraie récompense se trouve à l'intérieur de cette bulle, même s'ils n'en connaissent pas le centre exact.

3. Le « Planificateur Prudent » (Politique Pessimiste)

Maintenant, le robot doit décider quels mouvements effectuer. Puisque les données sont corrompues, le robot doit être pessimiste (prudent).

  • L'Analogie : Imaginez que vous marchez dans une forêt brumeuse où certains sentiers sont marqués « Sûr » mais pourraient en réalité être des pièges. Un randonneur prudent ne choisirait pas simplement le chemin qui semble le meilleur ; il choisirait le chemin qui est le plus sûr, même dans le pire des scénarios à l'intérieur de la zone brumeuse.
  • La Méthode : Le robot examine chaque chemin possible à l'intérieur du « Filet de Sécurité » (l'ensemble de confiance) et demande : « Quelle est la pire récompense que je pourrais obtenir si je prends ce chemin ? » Il choisit ensuite le chemin qui maximise cette pire récompense. Cela garantit que même si les données étaient légèrement corrompues, le robot ne commettra pas d'erreur catastrophique.

Trois Stratégies de « Terrain » Différentes

L'article réalise que tous les ensembles de données ne sont pas les mêmes. Certains sont très riches (vous avez des données pour chaque mouvement possible), tandis que d'autres sont épars (vous n'avez des données que pour quelques mouvements). Ils ont conçu trois algorithmes différents selon le « terrain » des données :

  1. Couverture Uniforme (La « Carte Riche ») :

    • Scénario : Vous avez des données couvrant chaque recoin du monde du jeu.
    • Résultat : Le robot peut apprendre presque parfaitement, avec très peu d'erreurs, même avec la corruption. C'est comme avoir une carte complète et haute résolution où vous pouvez facilement repérer les fausses routes.
  2. Nombre de Condition Relative Faible (La « Carte Rugueuse ») :

    • Scénario : Vous n'avez pas de données pour chaque recoin, mais les données que vous possédez sont relativement représentatives de l'ensemble du monde.
    • Résultat : Le robot utilise un « oracle d'ordre zéro ». Pensez à un randonneur aveugle qui peut seulement sentir le sol sous ses pieds pour deviner la pente. C'est plus lent et moins précis, mais c'est prouvablement sûr. Le taux d'erreur est un peu plus élevé (il dépend de la racine carrée de la corruption).
  3. Couverture Généralisée Bornée (La « Carte Intelligente ») :

    • Scénario : Les données sont éparses mais suivent un schéma spécifique et prévisible.
    • Résultat : Le robot utilise un « oracle de premier ordre ». C'est comme un randonneur qui peut non seulement sentir le sol, mais aussi voir le gradient (la pente) devant lui. Cela permet au robot d'être beaucoup plus efficace, atteignant un taux d'erreur bien meilleur (proportionnel à la racine carrée de la corruption) avec moins de points de données.

La Grande Conclusion

La principale réussite de l'article est de prouver qu'on peut mathématiquement garantir qu'un robot apprendra une bonne stratégie à partir de données corrompues, à condition d'utiliser ces techniques spécifiques de « prudence » et de « filtrage ».

Ils n'ont pas seulement dit : « Ça marche probablement. » Ils ont construit un bouclier mathématique qui prouve : « Même si 10 % de vos données vous mentent, notre méthode trouvera une stratégie qui est presque aussi bonne que si vous aviez des données parfaites. »

C'est la première fois qu'une telle garantie rigoureuse est faite spécifiquement pour l'apprentissage hors ligne (offline) avec un feedback humain en présence d'attaques adverses. C'est comme donner à un robot des « lunettes de vérité » qui lui permettent de voir à travers les mensonges de son manuel d'entraînement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →