Position: Deployed Reinforcement Learning should be Continual
Ce document de position soutient que les systèmes d'apprentissage par renforcement déployés devraient adopter un paradigme d'apprentissage continu plutôt que l'approche traditionnelle d'entraînement puis de correction, car la non-stationnarité du monde réel nécessite que les agents ne cessent jamais de s'adapter pour maintenir une performance optimale.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous engagiez un chef brillant pour cuisiner le dîner de votre famille. Vous le formez pendant des mois dans une cuisine de test, en lui faisant goûter chaque recette dont il pourrait avoir besoin. Une fois qu'il a réussi l'examen final, vous verrouillez la porte de la cuisine, vous lui donnez un menu fixe et vous lui dites : « Vous avez fini d'apprendre. Contentez-vous de cuisiner ce menu pour toujours. »
C'est ainsi que fonctionnent la plupart des systèmes d'intelligence artificielle (IA) aujourd'hui. L'article appelle cela le paradigme « Train-Then-Fix » (Entraîner puis Fixer).
Les auteurs de cet article soutiennent que cette approche est fondamentalement erronée pour l'IA dans le monde réel. Ils pensent qu'une fois qu'une IA est déployée (mise au travail dans le monde réel), elle ne devrait jamais cesser d'apprendre. Ils appellent cela l'« Apprentissage par Renforcement Continu ».
Voici une décomposition de leur argument utilisant des analogies simples :
1. Le problème : Le monde est une cible mouvante
Dans le monde réel, les choses changent constamment.
- L'analogie du chef : Imaginez que les papilles gustatives de votre famille changent. Peut-être qu'ils se lassent des pâtes et qu'ils ont soudainement envie de sushi. Ou peut-être qu'un nouvel ingrédient devient populaire. Si votre chef est coincé sur l'ancien menu, la nourriture finira par avoir un mauvais goût et votre famille cessera de manger.
- La réalité de l'IA : L'article soutient que le monde réel est trop complexe (« Le Grand Monde ») pour qu'une IA puisse tout apprendre avant de commencer à travailler. Même si l'IA est intelligente, elle ne peut pas prédire tous les changements futurs. Si vous figez son « cerveau » après l'entraînement, elle deviendra progressivement obsolète et performante de manière médiocre.
2. Pourquoi le « Train-Then-Fix » échoue
Les auteurs identifient quatre raisons spécifiques pour lesquelles le monde change après le déploiement d'une IA, rendant impossible le simple fait de « configurer et oublier » :
- L'IA change le monde (Non-stationnarité induite par l'action) :
- Analogie : Imaginez une application de recommandation musicale. Si elle continue de suggérer le même type de chanson, l'utilisateur pourrait s'ennuyer et arrêter d'écouter ce genre. Les choix de l'application ont changé le goût de l'utilisateur.
- Réalité : Les actions d'une IA modifient souvent l'environnement dans lequel elle opère.
- Le monde change de lui-même (Dynamique de l'environnement) :
- Analogie : Les saisons changent, les modèles de circulation varient, ou le matériel (comme les articulations d'un robot) s'use avec le temps.
- Réalité : Les choses hors du contrôle de l'IA changent, rendant les anciennes règles inutiles.
- Les poteaux de but bougent (Évolution des objectifs) :
- Analogie : Une entreprise peut décider que la « vitesse » est la métrique la plus importante aujourd'hui, mais l'année prochaine, la « sécurité » devient la priorité.
- Réalité : Les priorités humaines et les réglementations changent, ce qui signifie que ce qui compte comme un « bon travail » change aussi.
- Événements de surprise (Nouveauté émergente) :
- Analogie : Un événement de type « Cygne Noir », comme une pandémie mondiale soudaine ou un nouveau type de code étrange que personne n'a jamais vu auparavant.
- Réalité : L'IA rencontrera inévitablement des situations sur lesquelles elle n'a jamais été entraînée.
3. La solution : Le « Déploiement Mesurable »
L'article se concentre sur un type spécifique de situation appelé « Déploiement Mesurable ».
- L'analogie : C'est comme un chef qui est encore observé. Même s'il cuisine pour de vrais clients, les clients laissent toujours des avis (notes, pourboires ou plaintes). Le chef sait si la nourriture est bonne ou mauvaise en temps réel.
- L'argument : Si l'IA reçoit un retour (un « signal de récompense ») lui indiquant comment elle s'en sort, c'est un gaspillage de potentiel d'ignorer ce retour. Au lieu d'attendre qu'un humain dise : « Hé, vos performances ont chuté, réentraînons-vous », l'IA devrait utiliser ce retour pour apprendre et s'adapter sur le champ.
4. Exemples concrets
L'article cite deux entreprises qui font déjà cela avec succès :
- Cursor Tab (Assistant de codage) : Cet outil aide les programmeurs à écrire du code. Il ne se contente pas de rester là ; il apprend de quelles suggestions de code les programmeurs acceptent réellement. Il met à jour son « cerveau » toutes les quelques heures en fonction du feedback en temps réel, plutôt que d'attendre des mois pour une nouvelle mise à jour logicielle.
- Lyft (VTC) : Lyft utilise l'IA pour faire correspondre les chauffeurs et les passagers. Comme le trafic, la demande et l'emplacement des chauffeurs changent chaque seconde, leur IA apprend et met à jour sa stratégie en temps réel. S'ils attendaient de réentraîner le modèle hors ligne, ils manqueraient des millions de dollars de courses potentielles.
5. Appel à l'action
Les auteurs exhortent deux groupes à changer de mentalité :
- Pour les Praticiens (Les bâtisseurs) : Ne considérez plus le déploiement comme la « fin » du processus d'apprentissage. Construisez des systèmes où l'IA peut apprendre de ses erreurs et de ses succès pendant qu'elle travaille. Traitez les données en direct comme des données d'entraînement.
- Pour les Chercheurs : Ne cherchez plus à construire une IA qui « converge » (qui arrête d'apprendre une fois qu'elle a trouvé la réponse parfaite). Construisez plutôt une IA conçue pour continuer à chercher et à s'adapter éternellement, car dans le monde réel, la « réponse parfaite » n'existe pas.
Résumé
Le message principal de l'article est simple : Si vous mettez une IA dans le monde réel où elle reçoit des retours, vous devez la laisser continuer d'apprendre. Figer ses connaissances, c'est comme dire à un conducteur de garder les yeux fermés après avoir réussi son permis de conduire. La route change, la voiture change et la destination change. La seule façon de rester sûr et efficace est de continuer à conduire, de continuer à regarder et de continuer à apprendre.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.