← Derniers articles
💻 computer science

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

Cette enquête présente un cadre modularisé pour l'apprentissage par renforcement dans les LLM en catégorisant la conception d'algorithmes en étapes de création de MDP, d'exploration et d'apprentissage, révélant un biais de recherche significatif vers les gradients de politique sans critique et les méthodes de Monte Carlo tout en mettant en évidence des opportunités inexplorées dans les techniques basées sur la valeur, hors politique et de bootstrapping.

Auteurs originaux : Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievsk
Publié 2026-06-23
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseignez à un étudiant brillant mais très littéral (le Grand Modèle de Langage, ou LLM) comment écrire une dissertation parfaite, résoudre un problème mathématique complexe ou écrire du code. Vous ne pouvez pas simplement lui donner une note sur chaque mot qu'il tape au fur et à mesure qu'il avance. Au lieu de cela, vous attendez qu'il ait terminé tout son travail pour lui dire : « Bon travail ! » ou « Réessaie ».

C'est le cœur du défi de l'apprentissage par renforcement (RL) pour l'IA : comment enseigner à un étudiant quand le feedback est différé, rare et ne parvient que tout à la fin ?

Ce document est une vaste « carte » ou un « sondage » qui organise toutes les différentes manières dont les chercheurs tentent de résoudre ce problème. Les auteurs soutiennent que, bien que tout le monde utilise actuellement quelques méthodes populaires (comme PPO et GRPO), il existe toute une boîte à outils d'autres techniques issues du monde de la robotique et de l'IA de jeu qui n'ont pas encore été essayées. Ils décomposent le problème en quatre étapes principales, comme la construction d'une maison :

1. Poser les fondations : Définir le jeu (Création du MDP)

Avant que l'IA puisse apprendre, vous devez définir les règles du jeu. Le document appelle cela créer un « processus de décision de Markov » (MDP).

  • La Récompense (La Note) : C'est la partie la plus importante. Si vous dites à l'IA « sois utile », comment mesurez-vous cela ?
    • L'intuition du document : La plupart des gens utilisent un « Modèle de Récompense » (une seconde IA entraînée à deviner ce que les humains aiment) ou des règles simples (par exemple, « Est-ce que le code a fonctionné ? »).
    • Le Piège : Parfois, l'IA devient « intelligente » de la mauvaise manière. Si vous la récompensez pour écrire des réponses longues, elle pourrait simplement écrire du non-sens pour obtenir un score élevé. C'est ce qu'on appelle le Reward Hacking (piratage de la récompense). Le document avertit que si vos règles ne sont pas parfaites, l'IA trouvera des failles.
  • L'État (Le Contexte) : L'IA doit savoir ce qu'elle a déjà écrit. Généralement, il s'agit du texte jusqu'à présent. Mais si le texte devient trop long, l'IA est submergée. Certains chercheurs essaient de résumer le passé ou d'en masquer certaines parties pour que l'IA reste concentrée.
  • L'Action (Le Mot Suivant) : Généralement, l'IA peut choisir n'importe quel mot de son dictionnaire. Certains chercheurs essaient de restreindre cela (comme forcer l'IA à ne choisir que des mots qui respectent une grammaire spécifique) pour faciliter l'apprentissage.
  • La Fin (Terminaison) : Quand l'IA s'arrête-t-elle ? Généralement, elle s'arrête lorsqu'elle tape un jeton spécial de « fin de phrase ». Mais parfois, l'IA parle trop. Le document note que les chercheurs expérimentent des moyens de dire à l'IA : « Arrête-toi quand tu as fini », sans simplement la couper net.

2. L'art de deviner : L'Exploration

L'IA commence en ne sachant rien. Elle doit essayer différentes choses pour voir ce qui fonctionne. C'est ce qu'on appelle l'Exploration.

  • La Température (Le lancer de dés) : Imaginez que l'IA choisisse un mot. Si vous réglez la « température » bas, elle choisit le mot le plus sûr, le plus évident. Si vous la réglez haut, elle fait des conjectures plus folles. C'est le moyen le plus simple de faire en sorte que l'IA essaie de nouvelles choses.
  • L'Entropie (Le bonus « Ne t'ennuie pas ») : Pour empêcher l'IA de rester bloquée dans une boucle de répétition de mots sûrs, les chercheurs ajoutent un bonus pour l'incertitude ou la diversité. C'est comme dire à l'étudiant : « Je te donnerai des points supplémentaires si tu essaies une approche différente, même si elle peut échouer. »
  • La Curiosité (Motivation intrinsèque) : Et si l'IA recevait une récompense simplement pour faire quelque chose qu'elle n'a pas encore vu ? Certaines méthodes donnent à l'IA un « score de curiosité » pour tester de nouveaux chemins, même si elle n'obtient pas encore une réponse parfaite.
  • La Recherche en Arbre (Le jeu du « Et si ») : Au lieu d'écrire une seule phrase à la fois, imaginez que l'IA se ramifie comme un arbre. Elle écrit trois phrases différentes, voit où elles mènent, puis choisit le meilleur chemin. C'est comme un joueur d'échecs qui réfléchit trois coups à l'avance.
  • L'Apprentissage par Curriculum (L'échelle) : Ne commencez pas par une thèse de doctorat. Commencez par une histoire de maternelle. Cette méthode enseigne à l'IA des problèmes faciles d'abord, puis les rend progressivement plus difficiles, pour qu'elle ne soit pas découragée.

3. Le processus d'apprentissage : Comment l'IA s'améliore

Une fois que l'IA a essayé des choses et reçu un feedback, comment apprend-elle réellement ? Le document catégorise cela en quatre grands choix :

  • Modèle-Free (Sans modèle) vs Model-Based (Avec modèle) :
    • Model-Free : L'IA se souvient simplement : « J'ai fait X, j'ai eu une bonne note. Je ferai X à nouveau. » Elle apprend par essais et erreurs. C'est ce que fait la plupart des IA actuelles.
    • Model-Based : L'IA essaie d'abord de construire une carte mentale du monde (« Si je dis X, Y arrive généralement »), puis elle planifie en se basant sur cette carte. C'est plus difficile, mais cela peut être plus efficace.
  • Value-Based (Basé sur la valeur) vs Policy-Based (Basé sur la politique) vs Actor-Critic (Acteur-Critique) :
    • Policy-Based : L'IA apprend simplement un ensemble d'habitudes (une « politique ») pour obtenir de bonnes notes.
    • Value-Based : L'IA apprend à prédire « À quel point cette situation est-elle bonne ? » avant même d'agir.
    • Actor-Critic : Une approche d'équipe. Une partie (l'Acteur) décide de ce qu'il faut faire, et une seconde partie (le Critique) juge si la décision était bonne. Le document note que bien que l'« Actor-Critic » soit la norme d'excellence en robotique, la plupart des chercheurs en IA utilisent actuellement des méthodes « sans critique » car elles sont moins coûteuses à faire tourner sur d'énormes ordinateurs.
  • On-Policy (Sur politique) vs Off-Policy (Hors politique) :
    • On-Policy : L'IA apprend uniquement à partir de ce qu'elle vient de faire exactement. Si elle fait une erreur, elle jette ces données et réessaie. C'est sûr, mais c'est du gaspillage.
    • Off-Policy : L'IA apprend de ses erreurs et de ses succès passés, même si elle utilise une stratégie légèrement différente maintenant. C'est comme un étudiant qui révise ses anciens examens pour apprendre de ses erreurs. Le document souligne que très peu de chercheurs en IA font cela pour le moment, même si c'est un avantage majeur dans d'autres domaines.
  • L'Attribution de Crédit (À qui revient le mérite ?) :
    • Si l'IA écrit une dissertation de 100 mots et obtient un « A », quels 5 mots étaient les plus importants ?
    • Le défaut actuel : La plupart des méthodes disent simplement : « Bravo pour toute la dissertation ! » et attribuent le mérite à chaque mot de manière égale.
    • L'écart : Le document soutient que nous avons besoin de meilleures façons de déterminer exactement quels mots ont mené au succès, surtout pour les tâches de raisonnement longues et complexes.

4. La vue d'ensemble : Ce qui manque

La conclusion principale des auteurs est que le domaine est déséquilibré.

  • La Foule : Presque tout le monde utilise les mêmes quelques outils (méthodes sans critique, attribution de crédit de Monte Carlo). C'est comme si tout le monde dans une ville conduisait le même modèle de voiture sur la même route.
  • Les Terrains Vides : Il existe de larges routes bien pavées dans le monde de l'apprentissage par renforcement (comme l'apprentissage Off-Policy, les méthodes Value-based et le Bootstrapping) qui sont complètement vides dans le monde de l'IA.
  • L'Opportunité : Le document suggère qu'en empruntant ces techniques « oubliées » du monde plus large du RL, nous pourrions apprendre à l'IA à mieux raisonner, à apprendre plus vite et à gérer des tâches plus difficiles sans avoir besoin d'autant de puissance de calcul.

En bref : Ce document est un appel à arrêter de réinventer la roue. Il dit : « Nous utilisons un ensemble très étroit d'outils pour entraîner l'IA. Il existe tout un entrepôt d'autres outils puissants qui fonctionnent très bien dans d'autres domaines, et nous devrions commencer à les essayer pour les modèles de langage. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →