← Derniers articles
🤖 machine learning

Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

Cet article propose un nouveau cadre d'évaluation et d'apprentissage hors politique trans-domaine qui exploite des ensembles de données historiques provenant à la fois des domaines cibles et sources pour surmonter des défis critiques tels que les données à tirage limité, les politiques de journalisation déterministes et les nouvelles actions, permettant ainsi une évaluation et une optimisation de politique efficaces dans des scénarios où les méthodes existantes échouent en raison d'une variance élevée ou d'une exploration limitée.

Auteurs originaux : Yuta Natsubori, Masataka Ushiku, Yuta Saito

Publié 2026-07-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yuta Natsubori, Masataka Ushiku, Yuta Saito

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes le capitaine d'un navire tentant de naviguer sur une mer agitée, mais que vous n'avez jamais parcouru cet itinéraire spécifique auparavant. Vous possédez une carte des anciens voyages de votre navire (les « données enregistrées »), mais cette carte est incomplète. Peut-être que l'ancien capitaine était trop prudent et n'a navigué que dans des eaux calmes, laissant les récifs dangereux non cartographiés. Ou peut-être que la carte est totalement absente parce que le navire était trop petit pour explorer l'océan entier. Dans le monde de l'informatique, plus précisément dans un domaine appelé l'apprentissage automatique (Machine Learning), il s'agit d'un problème courant connu sous le nom de Contextual Bandits (bandits contextuels). C'est ainsi que les ordinateurs apprennent à prendre des décisions — comme recommander un film, suggérer un médicament ou montrer une publicité — en fonction de la situation (le « contexte ») sans avoir à tester chaque option dans le monde réel, ce qui pourrait être coûteux ou risqué.

Pour résoudre cela, les scientifiques utilisent une technique appelée Off-Policy Evaluation (OPE) (évaluation hors politique). Considérez l'OPE comme un « simulateur de vol » pour la prise de décision. Au lieu de tester une nouvelle stratégie sur de vraies personnes (ce qui est risqué), vous la faites passer par un ordinateur en utilisant d'anciennes données pour voir comment elle se serait comportée. Le problème est que la plupart des simulateurs tombent en panne si les anciennes données sont trop ennuyeuses (le capitaine n'a fait qu'une seule chose) ou si la nouvelle stratégie veut essayer quelque chose que l'ancien capitaine n'a jamais fait. Si les anciennes données n'ont aucune trace d'une action spécifique, le simulateur ne peut pas deviner ce qui se passerait, ce qui mène à des suppositions sauvages ou à un échec total. Ce document traite de ce scénario délicat où les anciennes données sont soit trop limitées, soit trop rigides, soit totalement dépourvues de nouvelles options cruciales.

C'est ici qu'interviennent les chercheurs de Hakuhodo DY Holdings et de l'Université de Cornell, qui proposent une nouvelle façon ingénieuse de réparer ce simulateur défaillant. Ils appellent leur idée Cross-Domain Off-Policy Evaluation and Learning (Évaluation et apprentissage hors politique inter-domaines). Imaginez que vous essayez d'apprendre à surfer dans un nouvel océan inconnu (le « domaine cible »), mais que votre plage locale (le « domaine source ») présente un motif de vagues différent. Si vous ne regardez que votre plage locale, vous pourriez être confus face à une vague géante qui n'est jamais apparue chez vous. Mais, et si vous pouviez aussi regarder une vidéo de surf dans un océan voisin qui possède des vagues similaires ? Même si l'eau est légèrement différente, la physique de la vague peut être la même.

Les auteurs suggèrent qu'au lieu d'être coincés avec les données ennuyeuses ou incomplètes de votre situation actuelle, vous pouvez emprunter des enseignements d'autres situations similaires (d'autres « domaines »). Ils ont réalisé que, bien que chaque hôpital, pays ou groupe d'utilisateurs soit unique, ils partagent souvent des modèles sous-jacents. Par exemple, un traitement peut fonctionner de manière similaire dans deux hôpitaux différents, même si la démographie des patients varie légèrement. Le document introduit une nouvelle méthode appelée COPE (Cross-domain Off-Policy Evaluation). Elle fonctionne en divisant la « récompense » (le résultat positif) en deux parties : une partie commune qui est partagée entre des groupes similaires (comme la physique générale de la vague) et une partie unique qui est spécifique à votre groupe (comme le vent local).

En utilisant les données d'autres domaines pour comprendre la « partie commune », COPE peut combler les lacunes pour des actions qui n'ont jamais été testées dans vos données spécifiques. C'est comme utiliser la carte d'une ville voisine pour comprendre le tracé d'une rue dans votre propre ville que votre propre carte a oublié de dessiner. Les chercheurs ont testé cette méthode sur des données réelles provenant d'une application de partage de vidéos (KuaiRec) et ont découvert que lorsque les données cibles étaient rares, ou lorsque les anciennes données étaient trop rigides (déterministes), ou lorsqu'il y avait de toutes nouvelles actions à tester, leur méthode était bien plus précise que les anciennes méthodes. Ils ont montré qu'en combinant les données de plusieurs sources tout en tenant compte de leurs différences, on pouvait évaluer et apprendre de nouvelles politiques bien plus efficacement, même dans des situations où les méthodes précédentes abandonnaient simplement ou commettaient des erreurs énormes.

Dans leurs expériences, ils ont simulé des scénarios où les nouvelles actions représentaient jusqu'à 80 % des choix possibles, ou bien où les anciennes données étaient si limitées qu'il n'y avait qu'un seul point de donnée par action. Dans ces cas difficiles, leur nouvelle méthode a réduit les erreurs de manière significative par rapport aux approches standards. Ils ont également montré que cela fonctionne pour « l'apprentissage » (trouver la meilleure stratégie), et pas seulement pour « l'évaluation » (vérifier une stratégie). Le document suggère qu'en traitant les différentes sources de données comme une famille connectée plutôt que comme des îles isolées, nous pouvons construire des systèmes de prise de décision plus intelligents, plus sûrs et plus adaptables, surtout lorsque nous n'avons pas assez de données pour apprendre à partir de zéro.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →