Learning optimal policies from event logs through reinforcement learning: a comparison of deep and MDP-based approaches
Cet article propose un cadre d'apprentissage par renforcement pour la surveillance prescriptive de processus qui apprend des politiques comportementales optimales directement à partir de journaux d'événements historiques afin de recommander des actions pour optimiser les indicateurs clés de performance, en comparant une approche de processus de décision markovien basée sur un modèle avec une méthode d'apprentissage par renforcement profond sans modèle et en démontrant que les deux améliorent efficacement les indicateurs clés de performance alors que l'approche basée sur un modèle offre une efficacité computationnelle supérieure.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez le directeur d'une banque très occupée. Chaque jour, des clients demandent des prêts. Parfois, le prêt est approuvé, parfois il est refusé, et parfois le client abandonne simplement. Votre objectif est simple : faire en sorte que le plus grand nombre de clients possible dise « Oui » à votre offre de prêt.
Cependant, vous ne contrôlez pas tout. Vous contrôlez les actions de la banque (comme envoyer une offre ou demander des informations complémentaires), mais vous ne contrôlez pas les actions du client (comme décider d'accepter, de refuser ou d'abandonner). C'est comme jouer une partie d'échecs où vous ne pouvez déplacer que vos propres pièces, mais où votre adversaire (le client) déplace les siennes de manière aléatoire selon son humeur.
Ce document traite de l'apprentissage d'un ordinateur pour devenir le meilleur directeur de banque possible en examinant les archives passées de la façon dont la banque a joué au jeu par le passé. L'objectif est de trouver la stratégie parfaite pour gagner plus souvent.
Les deux « Entraîneurs »
Les chercheurs ont testé deux méthodes différentes (ou « entraîneurs ») pour enseigner cette stratégie à l'ordinateur en utilisant l'Apprentissage par Renforcement (un type d'IA qui apprend par essais et erreurs, mais qui, dans ce cas, apprend à partir d'un livre d'histoire plutôt qu'en jouant en direct).
1. Le « Cartographe » (Approche basée sur les MDP)
Cet entraîneur examine les milliers de demandes de prêt passées et tente de construire une carte détaillée du jeu.
- Comment cela fonctionne : Il regroupe les situations similaires (comme « Le client a demandé 10 000 $ et nous avons envoyé une offre ») et calcule les probabilités de ce qui se passera ensuite. Il crée un manuel de règles clair : « Si vous êtes dans la Situation A, faites l'Action B ».
- L'analogie : Imaginez un GPS qui a cartographié chaque route d'une ville. Il sait exactement quel virage mène aux embouteillages et lequel mène à un raccourci. Il construit un modèle complet de la ville avant de vous dire où aller.
- Le bémol : Construire cette carte demande du travail, et si la carte est trop détaillée, elle peut être confuse par des événements rares et étranges. Pour correr cela, les chercheurs ont ajouté un « filtre » pour ignorer les chemins rares et peu fiables dans le livre d'histoire.
2. Le « Apprenant Profond » (RL Profond Hors-Ligne)
Cet entraîneur ne cherche pas à construire une carte. À la place, il utilise un réseau de neurones super intelligent (comme un cerveau avec de nombreuses couches) pour examiner le livre d'histoire et deviner directement le meilleur coup.
- Comment cela fonctionne : Il lit les archives passées et tente de trouver des motifs cachés qu'un humain ou une carte simple pourrait manquer. Il apprend en examinant les données encore et encore.
- L'analogie : Imaginez un grand maître d'échecs qui a regardé des millions de parties. Il n'a pas besoin de dessiner une carte du plateau ; il « ressent » simplement le bon coup grâce à l'intuition construite par l'expérience.
- Le bémol : Ce « cerveau » est très lourd. Il prend beaucoup de temps pour être entraîné et nécessite beaucoup de puissance de calcul, comme essayer de résoudre un puzzle géant avec un supercalculateur.
L'Expérience : L'Arène de Simulation
Puisque vous ne pouvez pas commencer à donner de mauvais conseils à de vrais clients pour voir ce qui se passe (cela coûterait de l'argent à la banque), les chercheurs ont construit une simulation virtuelle.
- Ils ont créé une version « jeu vidéo » du processus de prêt.
- Ils ont laissé l'ordinateur jouer au jeu des milliers de fois en utilisant les stratégies apprises.
- Ils ont mesuré le score : Quel profit la banque a-t-elle réalisé ? (Profit = Intérêts gagnés moins le temps passé à travailler sur le prêt).
Ce qu'ils ont découvert
Les résultats sont intéressants :
- Les deux entraîneurs ont gagné : Le « Cartographe » et l'« Apprenant Profond » ont tous deux trouvé des stratégies bien meilleures que l'ancienne méthode standard de la banque. Ils ont tous deux aidé la banque à obtenir plus de réponses « Oui » de la part des clients.
- Le Cartographe était légèrement meilleur : Le « Cartographe » (MDP) a systématiquement trouvé de meilleures stratégies, surtout dans les situations rares et délicates. Il était plus fiable pour savoir exactement quoi faire.
- Le Cartographe était beaucoup plus rapide : C'était la différence majeure. Le « Cartographe » a appris sa stratégie en quelques minutes. L'« Apprenant Profond » a pris des heures (voire des jours, selon la taille des données) pour s'entraîner.
- Analogie : Le Cartographe était comme un étudiant qui a étudié un manuel et a réussi l'examen en 10 minutes. L'Apprenant Profond était comme un étudiant qui a dû relire toute l'encyclopédie 100 fois pour obtenir la même note.
Conclusion
Le document conclut que si vous voulez apprendre à un ordinateur comment gérer un processus métier (comme les approbations de prêts) en utilisant des données passées :
- Vous n'avez pas toujours besoin de l'IA la plus complexe et la plus lourde (Deep Learning).
- Une approche plus simple qui construit un modèle clair du processus (MDP) fonctionne tout aussi bien, sinon mieux, et est beaucoup plus rapide et moins coûteuse à exploiter.
C'est un rappel que, parfois, une bonne carte claire est préférable à un cerveau super complexe, surtout quand on veut simplement accomplir une tâche efficacement.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.