← Derniers articles
🤖 machine learning

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

Cet article introduit un cadre de comptabilisation des FLOP et le protocole de diagnostic RACE pour démontrer que les stratégies optimales de post-entraînement par apprentissage par renforcement sous un budget fixe ne sont pas universelles mais dépendent d'une interaction complexe entre la taille du modèle, la profondeur de recherche, les mises à jour d'apprentissage et les mécanismes de rétroaction, incitant les chercheurs à rapporter les allocations de calcul détaillées plutôt que seulement le total des FLOP.

Auteurs originaux : Patrick Wilhelm, Odej Kao

Publié 2026-07-16
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Patrick Wilhelm, Odej Kao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un chef tentant de créer la soupe la plus délicieuse du monde, mais que vous soyez limité par une consommation stricte d'électricité pour votre cuisinière. Vous pourriez dépenser cette électricité pour une marmite géante et coûteuse qui contient beaucoup de soupe à la fois, ou bien vous pourriez utiliser une plus petite marmite mais la remuer pendant des heures. Vous pourriez aussi dépenser de l'énergie pour goûter la soupe constamment afin de voir si elle a besoin de sel, ou pour hacher les légumes plus rapidement. Dans le monde de l'intelligence artificielle, et plus précisément lorsqu'on enseigne à des programmes informatiques comment réfléchir et résoudre des problèmes, les scientifiques sont confrontés à un casse-tête similaire. Ils disposent d'un « budget » fixe de puissance informatique (mesuré en une unité appelée FLOPs, qui est simplement un décompte du nombre de calculs mathématiques que l'ordinateur peut effectuer). La grande question est : si vous avez une quantité déterminée de puissance, où devez-vous la dépenser ? Devez-vous utiliser un cerveau plus gros et plus intelligent pour l'IA ? Devez-vous laisser l'IA faire plus de tentatives avant d'apprendre ? Ou devriez-vous consacrer plus de puissance à un « enseignant » qui évalue le travail de l'IA ? Se tromper dans ce dosage signifie que l'IA apprendra lentement ou pas du tout, même si vous disposez de beaucoup de puissance.

Cet article, intitulé « Where Should RL Post-Training Compute Go? », explore précisément cette question. Les auteurs, Patrick Wilhelm et Odej Kao, traitent l'énergie de l'ordinateur comme un budget limité qui doit être réparti entre trois éléments principaux : la recherche (laisser l'IA essayer de nombreuses réponses différentes), l'apprentissage (réellement mettre à jour le cerveau de l'IA sur la base de ces réponses) et le feedback (utiliser un programme distinct pour noter la qualité de ces réponses). Ils ont découvert qu'il n'existe pas de « meilleure » façon unique de dépenser l'argent. Au lieu de cela, la recette parfaite change selon la taille du cerveau de l'IA, le type d'enseignant qui la note, et le type de test que vous voulez que l'IA réussisse plus tard.

Les chercheurs ont découvert que dire simplement « nous avons utilisé 100 unités de puissance » ne suffit pas pour comprendre comment une IA a été entraînée. C'est comme dire qu'un chef a utilisé 100 watts d'électricité sans préciser s'il les a dépensés pour la cuisinière, le mixeur ou les lumières. Si vous avez un petit cerveau d'IA, vous pourriez obtenir les meilleurs résultats en dépensant la majeure partie de votre puissance pour la laisser essayer de nombreuses réponses (recherche). Mais si vous avez un cerveau géant et puissant, cette même quantité de puissance ne pourrait vous acheter que quelques essais, donc vous devrez peut-être consacrer davantage d'énergie aux étapes d'apprentissage effectives. Ils ont également découvert que l'« enseignant » compte énormément. Si l'enseignant est un vérificateur simple basé sur des règles (comme une clé de correction mathématique), presque toute la puissance est consacrée à l'essai de l'IA. Mais si l'enseignant est un autre programme d'IA complexe, une énorme partie du budget de puissance est absorbée par le travail de l'enseignant lui-même, laissant moins de place pour que l'IA étudiante apprenne.

L'article suggère que la « meilleure » façon d'entraîner une IA dépend entièrement de ce que vous cherchez à accomplir. Si vous voulez qu'elle obtienne un score élevé à un test d'entraînement spécifique, un certain mélange de recherche et d'apprentissage pourrait être optimal. Mais si vous voulez qu'elle résolve un problème totalement nouveau plus tard, un mélange différent pourrait être préférable. Pour aider les scientifiques à déterminer cela sans gaspiller des millions de dollars en essais, les auteurs ont introduit un outil appelé RACE. Considérez RACE comme un test de goût rapide et peu coûteux. Il exécute une expérience minuscule et à faible puissance pour deviner où se trouve le « point idéal » pour dépenser le budget, afin que les chercheurs sachent quels tests à grande échelle valent la peine d'être réalisés. Les auteurs précisent bien que ce n'est pas une garantie magique que l'IA deviendra plus intelligente ; c'est juste un outil de diagnostic pour les aider à choisir la bonne direction avant de s'engager pleinement dans leurs ressources.

En fin de compte, la principale conclusion est que « plus de puissance » n'est pas la seule réponse. Le mouvement le plus intelligent est d'être un comptable prudent. Que vous entraîniez un robot à marcher ou un ordinateur à résoudre des problèmes mathématiques, vous devez rapporter exactement comment vous avez réparti votre énergie entre la taille du cerveau, les tentatives d'entraînement et le système de notation. Car, comme le montrent les auteurs, la même quantité d'énergie peut acheter un type d'intelligence complètement différent selon la manière dont vous la dépensez.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →