← Derniers articles
📊 statistics

Learning from the Unseen: Offline Reinforcement Learning with Hidden Actions

Cet article introduit LURE, la première méthode d'apprentissage par renforcement hors ligne avec des actions cachées, qui exploite les variables d'état suivant comme des substituts pour permettre une estimation de la valeur de politique multiplement robuste et statistiquement valide dans les processus de décision markoviens à horizon infini.

Auteurs originaux : Zeyu Bian, Ying Zhou, Yifan Cui

Publié 2026-07-29
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zeyu Bian, Ying Zhou, Yifan Cui

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot comment jouer à un jeu complexe, comme naviguer dans une ville ou gérer la santé d'un patient. Vous ne faites pas parcourir le jeu en temps réel au robot ; au lieu de cela, vous lui donnez un immense registre de tentatives passées effectuées par un joueur humain. C'est le monde de l'apprentissage par renforcement (Reinforcement Learning ou RL), une branche de l'intelligence artificielle où les ordinateurs apprennent par essais et erreurs pour prendre les meilleures décisions au fil du temps. L'objectif est généralement de déterminer : « Si nous suivions un ensemble spécifique de règles (une politique) à l'avenir, comment nous en sortirions-nous, sur la base de ce vieux registre ? »

Cependant, il y a un hic. Dans le monde réel, les registres sont rarement parfaits. Parfois, la personne qui a pris les notes a fait une erreur, ou le système qui a enregistré les données était défaillant. Dans le langage de cet article, l'« action » réellement entreprise par l'humain (comme administrer un médicament spécifique) peut être cachée, et tout ce que nous voyons est un « proxy » ou une estimation bruitée de ce qui s'est passé (comme une note de médecin qui dit « a donné le médicament » alors qu'en réalité il ne l'a pas fait, ou vice versa). Si vous essayez d'enseigner à votre robot en utilisant un registre rempli de ces erreurs, il apprendra les mauvaises leçons, ce qui mènera à de mauvaises décisions plus tard. Cet article s'attaque au problème délicat de la manière d'apprendre efficacement lorsque la partie la plus importante de l'histoire — la véritable action — est manquante ou déguisée.


Le mystère du mouvement manquant

Dans l'article intitulé « Learning from the Unseen » (Apprendre de l'invisible), les auteurs, Zeyu Bian, Ying Zhou et Yifan Cui, font face à une histoire de détective où l'indice principal est manquant. Imaginez que vous soyez un détective essayant de résoudre un crime en regardant une vidéo de surveillance. Mais voici le rebondissement : la vidéo montre l'ombre du suspect, et non le suspect lui-même. Vous voyez l'ombre bouger, mais vous ne savez pas exactement ce que les mains du suspect faisaient. Dans le monde de la science des données, cela s'appelle avoir des « actions cachées ».

Habituellement, lorsque les scientifiques essaient d'évaluer une stratégie à l'aide de données passées (un processus appelé Évaluation Hors-Politique ou Off-Policy Evaluation), ils supposent que le registre est parfait. Ils supposent que si le registre indique « L'action A a été entreprise », alors l'action A a effectivement été entreprise. Mais dans les scénarios réels désordonnés — comme les dossiers hospitaliers où un médecin peut noter un traitement des heures plus tard, ou un système qui étiquette accidentellement de travers l'appui sur un bouton — cette hypothèse est un piège. Si vous ignorez les erreurs, votre évaluation de la stratégie sera biaisée, comme juger les compétences culinaires d'un chef sur la base d'un menu qui liste les mauvais ingrédients.

La magie de l'étape suivante

La grande percée des auteurs est de réaliser que même si vous ne pouvez pas voir l'« action » directement, vous pouvez souvent voir son ombre dans l'instant suivant.

Pensez-y de cette façon : si un magicien agite une baguette (l'action cachée), vous pourriez ne pas voir la baguette clairement à cause d'une tache sur la caméra. Mais vous pouvez voir le lapin apparaître dans le chapeau (l'état suivant). Le lapin n'est pas apparu de nulle part ; il est apparu parce que la baguette a été agitée. En étudiant la relation entre l'« état suivant » (le lapin) et la « note bruitée » (la vidéo tachée), les auteurs ont trouvé comment reconstruire mathématiquement ce que le magicien a réellement fait.

Ils appellent leur nouvelle méthode LURE (Learning from the Unseen: Robust Estimator). C'est comme un détective super intelligent qui ne se contente pas de regarder la photo floue du suspect, mais qui regarde aussi les empreintes laissées derrière et le rapport météorologique pour déduire exactement ce qui s'est passé.

Comment fonctionne LURE : Le système de « double vérification » et la boîte à outils du détective

L'article présente une manière ingénieuse d'estimer la valeur d'une stratégie sans se faire piéger par les erreurs. Ils utilisent un concept appelé Robustesse Multiple.

Imaginez que vous essayiez de deviner la température extérieure, mais que votre thermomètre est cassé. Vous avez trois autres indices : un chien mouillé, un arbre qui oscille et une formation nuageuse.

  • Si votre thermomètre est cassé, vous pouvez toujours deviner correctement si votre indice du « chien mouillé » est précis.
  • Si le chien est sec mais que l'arbre oscille, vous pouvez toujours deviner correctement.
  • Le système est « robuste » car il n'a pas besoin que chaque indice soit parfait ; il a juste besoin que certaines combinaisons d'entre eux soient correctes.

LURE fonctionne de la même manière. Il construit un modèle mathématique qui vérifie plusieurs parties différentes des données. Même si le modèle pour l'« action bruitée » est légèrement erroné, ou si le modèle pour l'« état suivant » est légèrement imprécis, l'estimateur peut toujours trouver la valeur réelle de la stratégie tant qu'au moins une des autres parties est correcte. Cela rend la réponse finale beaucoup plus fiable que les méthodes précédentes, qui s'effondreraient si une seule partie des données était désordonnée.

Mais il existe une complexité cachée dans la façon dont LURE résout ce puzzle. Puisque les véritables actions ne sont jamais vues, l'ordinateur doit deviner les probabilités de ce qui s'est réellement passé. Pour ce faire, les auteurs ont développé un algorithme itératif spécial (basé sur une méthode appelée l'algorithme Expectation-Maximization, ou EM). Considérez cela comme un détective qui affine continuellement sa théorie :

  1. La supposition (Étape E) : L'ordinateur commence par une supposition sur ce que les actions cachées étaient.
  2. La mise à jour (Étape M) : En utilisant cette supposition, il met à jour ses modèles sur la façon dont les actions mènent aux récompenses et aux états suivants.
  3. Le raffinement : Il utilise ensuite ces modèles mis à jour pour faire une meilleure supposition sur les actions cachées, et répète le cycle jusqu'à ce que l'histoire fasse parfaitement sens.

Cependant, il y a un dernier rebondissement. Parce que l'ordinateur fait des suppositions, il pourrait accidentellement inverser les étiquettes. Il pourrait décider que l'« Action 0 » est en fait le « Médicament » et l'« Action 1 » est le « Pas de Médicament », alors qu'en réalité, c'est l'exact opposé. Le calcul fonctionne dans les deux sens, mais le sens est inversé. Pour corriger cela, les auteurs incluent une étape cruciale d'alignement des étiquettes. Avant de donner la réponse finale, le système vérifie quelle « supposition » fait le plus de sens avec les données bruitées (par exemple, quelle action cachée est la plus susceptible de résulter de la note observée « Médicament »). Il inverse ensuite les étiquettes si nécessaire pour s'assurer que le rapport final correspond à la réalité.

Tester la théorie

Les auteurs n'ont pas seulement écrit une théorie ; ils l'ont mise à l'épreuve de trois manières différentes :

  1. Simulations simples : Ils ont créé un petit monde imaginaire (un « MDP Tabulaire ») avec seulement trois états et deux actions. Ils ont intentionnellement faussé les données en étiquetant mal les actions de 5 % à 30 % du temps. Tandis que les autres méthodes étaient confuses et donnaient de mauvaises réponses, LURE est resté sur la bonne voie, devinant correctement la valeur de la stratégie.
  2. Simulations complexes : Ils sont passés à un monde continu plus complexe (comme un robot se déplaçant dans un espace fluide) et ont obtenu le même résultat : LURE a géré les erreurs avec élégance, tandis que les autres ont échoué.
  3. Données du monde réel : Ils ont testé LURE sur une base de données massive de dossiers réels de patients provenant d'un hôpital (MIMIC-III), en se concentrant spécifiquement sur le traitement du sepsis (une réaction potentiellement mortelle à une infection). Dans ce scénario réel, ils ont comparé LURE aux méthodes standards. Les résultats ont été frappants : les méthodes standards suggéraient qu'un traitement était meilleur qu'un autre, mais LURE, en tenant compte des erreurs cachées dans les dossiers médicaux, a suggéré un classement différent et plus fiable. En fait, les intervalles de confiance (la plage de réponses probables) des méthodes standards se chevauchaient tellement qu'elles ne pouvaient pas faire la différence, tandis que LURE fournissait une réponse claire et distincte.

Ce qu'il faut retenir

L'article conclut qu'ignorer les actions cachées est un pari dangereux. En utilisant l'« état suivant » comme un indice naturel pour découvrir la vérité, et en construisant un système robuste aux erreurs dans différentes parties du modèle, nous pouvons enfin évaluer les stratégies avec précision, même lorsque nos données sont imparfaites.

Ce n'est pas seulement une victoire théorique ; c'est un outil pratique pour l'avenir. Qu'il s'agisse de décider des traitements médicaux, de gérer les feux de signalisation ou d'entraîner des agents IA, LURE offre un moyen d'apprendre du passé sans être induit en erreur par le bruit. Les auteurs démontrent qu'avec le bon travail de détective mathématique, nous pouvons voir l'invisible et prendre de meilleures décisions pour demain.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →