← Derniers articles
🤖 machine learning

Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?

Cet article remet en question la sagesse conventionnelle consistant à préentraîner les fonctions Q pour l'ajustement fin par apprentissage par renforcement en ligne en révélant que le préentraînement naïf échoue souvent en raison d'un décalage de cible, et propose au lieu de cela la méthode d'Initialisation via un Ensemble de Politiques (IPE), qui exploite des déroulements de politiques diversifiés pour atteindre des performances nettement supérieures à celles de l'initialisation aléatoire et du préentraînement traditionnel.

Auteurs originaux : Perry Dong, Ron Polonsky, Dorsa Sadigh, Chelsea Fin

Publié 2026-07-30
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Perry Dong, Ron Polonsky, Dorsa Sadigh, Chelsea Fin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot à accomplir une tâche complexe, comme empiler des blocs ou assembler un jouet. Dans le monde de l'intelligence artificielle, il existe une stratégie populaire appelée « pré-entraînement suivi d'un ajustement fin » (fine-tuning). Considérez le pré-entraînement comme l'envoi d'un étudiant dans une bibliothèque pour lire des milliers de livres sur la façon de construire des choses. Il apprend la théorie et les règles. Ensuite, l'ajustement fin, c'est comme envoyer ce même étudiant dans un véritable atelier pour pratiquer, faire des erreurs et apprendre par l'expérience.

Dans ce recoin spécifique de la science, appelé l'apprentissage par renforcement (RL), l'« étudiant » est un programme informatique appelé politique (policy). C'est le cerveau qui décide quelle action entreprendre. Mais l'étudiant a aussi besoin d'une fonction Q (Q-function). Vous pouvez considérer la fonction Q comme un entraîneur très strict ou un arbitre. Il observe une situation et un mouvement potentiel, puis donne un score : « Si tu fais cela, tu obtiendras une grande récompense. Si tu fais cela, tu échoueras. » La politique écoute cet entraîneur pour décider quels mouvements sont bons. Généralement, lorsque nous avons beaucoup de données provenant de la bibliothèque (données hors ligne/offline), nous entraînons l'étudiant et l'entraîneur ensemble. Il semble logique que si l'étudiant est déjà intelligent grâce à ses lectures, l'entraîneur devrait aussi être intelligent grâce aux mêmes livres. Mais est-ce réellement le cas ? C'est la grande question que pose cet article.

Les chercheurs de l'Université de Stanford ont décidé de tester une croyance commune : « Si nous avons une politique de robot intelligente qui a été pré-entraînée sur des données hors ligne, devrions-nous également pré-entraîner son entraîneur (la fonction Q) sur ces mêmes données avant de laisser le robot pratiquer dans le monde réel ? »

Étonnamment, la réponse est non. L'article révèle que donner un coup d'avance à l'entraîneur en le pré-entraînant sur les mêmes données hors ligne n'aide pas réellement le robot à apprendre plus vite ou à mieux performer. En fait, cela peut parfois aggraver les choses. Les auteurs ont découvert un décalage fondamental : l'entraîneur formé sur les anciens livres apprend à juger les actions en se basant sur ce que l'ancien robot faisait. Mais quand le robot commence à pratiquer dans le monde réel (ajustement fin en ligne/online fine-tuning), il a besoin d'un entraîneur qui juge les actions en se basant sur ce que le nouveau robot, amélioré, fera éventuellement. Ces deux objectifs sont différents. L'entraîneur pré-entraîné est coincé dans le passé, jugeant le robot selon les normes de son ancien moi, moins compétent, plutôt que selon le potentiel de son futur moi, super-compétent.

Pour corriger cela, les auteurs proposent une nouvelle méthode ingénieuse appelée Initialisation par Ensemble de Politiques (IPE - Initialization via Policy Ensemble). Au lieu d'entraîner simplement un robot et un entraîneur, ils entraînent toute une équipe de robots légèrement différents (un ensemble) sur les mêmes données de la bibliothèque. Même s'ils ont tous appris des mêmes livres, chacun fait des erreurs légèrement différentes et tente des mouvements légèrement différents. Les chercheurs utilisent ensuite les données de tous ces robots différents pour entraîner l'entraîneur. Cela donne à l'entraîneur une vision beaucoup plus large de ce qui est possible, l'aidant à juger correctement les actions pour le futur, plutôt que de simplement copier le passé. Lorsqu'ils ont testé cette méthode sur des tâches de contrôle de robot exigeantes, la méthode IPE a amélioré la performance finale du robot de 26 % en moyenne par rapport à l'ancienne méthode consistant à pré-entraîner l'entraîneur de manière naïve.

Ainsi, l'idée principale est que même s'il semble juste d'entraîner tout en même temps, un entraîneur a parfois besoin de voir une plus grande variété de tentatives pour vraiment comprendre le jeu. En utilisant une équipe diversifiée d'« étudiants » pour entraîner l'« entraîneur », le robot apprend à devenir un champion beaucoup plus rapidement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →