← Derniers articles
💬 NLP

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

Ce papier propose un cadre d'apprentissage par renforcement piloté par la recherche qui optimise itérativement les spécifications de fonctions de récompense grâce à une génération automatisée, une validation et un filtrage basé sur GRPO, démontrant qu'une boucle de rétroaction classée améliore significativement les performances en raisonnement mathématique sur GSM8K par rapport à des ensembles de récompenses statiques ou aléatoires.

Auteurs originaux : Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

Publié 2026-05-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Arash Ahmadi (Mike), Sarah Sharif (Mike), Yaser (Mike), Banad

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un étudiant très intelligent (un Grand Modèle de Langage) qui est excellent pour parler mais qui éprouve parfois des difficultés avec les mathématiques. Vous voulez lui apprendre à mieux résoudre des problèmes mathématiques. Habituellement, vous embaucheriez un enseignant pour corriger ses devoirs. Mais dans cet article, les auteurs posent une question différente : "Et si nous ne savions pas exactement comment corriger les devoirs parfaitement ? Et si nous laissions une IA nous aider à inventer les meilleures règles de notation ?"

Voici l'histoire de la manière dont ils l'ont fait, expliquée simplement.

1. Le Problème : Le Mystère de la "Grille de Notation"

Dans le monde de l'IA, pour enseigner à un modèle à mieux penser, vous utilisez un système appelé Apprentissage par Renforcement. Pensez-y comme à l'éducation d'un chien.

  • Le Chien : Le modèle d'IA.
  • La Friandise : Une "récompense" (un score positif).
  • Le Tour : Résoudre correctement un problème mathématique.

Le problème est que concevoir la "friandise" (la fonction de récompense) est difficile. Si vous dites à l'IA : "Bien joué si tu trouves la bonne réponse", elle pourrait tricher en devinant ou en copiant des modèles sans réellement réfléchir. Si vous essayez de récompenser les étapes qu'elle suit, vous devez écrire des règles complexes, et il est facile de faire une erreur dans ces règles.

2. La Solution : L'"Usine de Règles de Notation"

Les auteurs ont construit un système qui traite les règles de notation elles-mêmes comme quelque chose à optimiser. Ils n'ont pas écrit les règles à la main ; ils ont mis en place une usine où une IA (un modèle de "frontière" nommé Kimi K2) agit comme un Inventeur de Règles.

Voici comment l'usine fonctionne, étape par étape :

  • Round 1 : L'IA Inventeur de Règles reçoit 20 problèmes mathématiques et se voit demander d'écrire 10 nouvelles façons de les noter. Elle écrit ces règles sous forme de code informatique simple (comme une recette).
  • Le Contrôle de Sécurité : Avant que ces règles ne soient utilisées, elles passent par un "scanner de sécurité" pour s'assurer qu'elles ne sont ni dangereuses ni défectueuses.
  • L'Essai : Les chercheurs prennent un petit étudiant en mathématiques (un modèle d'IA de 3 milliards de paramètres) et le laissent s'entraîner à résoudre des problèmes en utilisant l'une de ces nouvelles règles pendant un court moment (500 étapes).
  • La Fiche de Notes : Ils voient comment l'étudiant s'est débrouillé lors d'un test. Si la nouvelle règle a aidé l'étudiant à obtenir de meilleurs scores, la règle obtient un classement élevé. Si la règle a confondu l'étudiant, elle obtient un classement bas.
  • La Boucle de Rétroaction : Les règles les plus performantes sont résumées et renvoyées à l'IA Inventeur de Règles. L'IA se voit dire : "Hé, les règles qui comptaient le nombre d'étapes de réflexion ont bien fonctionné. Les règles qui regardaient uniquement la réponse finale n'ont pas fonctionné aussi bien. Essayez d'inventer de nouvelles règles sur cette base."

Ils ont répété ce cycle 5 fois, générant 50 règles candidates différentes.

3. Les Résultats : Trouver les "Règles d'Or"

Après 5 tours, ils ont trouvé des gagnants.

  • La Meilleure Règle Unique : Une règle, appelée thinking_steps_count, était une championne. Elle accordait des points supplémentaires si l'IA écrivait son processus de réflexion en au moins trois lignes distinctes. Elle ne vérifiait pas si la réponse était juste (le système de base le faisait) ; elle encourageait simplement l'IA à montrer son travail.
  • La Puissance du Travail d'Équipe (Ensembles) : Ils ont réalisé qu'une seule règle ne suffit pas. Alors, ils ont pris les 5 meilleures règles et les ont combinées en une "équipe de sur-notation".
    • Le Résultat : Cette équipe de règles a aidé l'IA à passer d'un taux de réussite de 60 % (en utilisant uniquement des règles de base) à un taux de réussite de 79,5 %.
    • Le Test "Magique" : Pour prouver qu'il ne s'agissait pas seulement de chance ou du grand nombre de règles, ils ont essayé une "équipe aléatoire" de 5 règles choisies dans le tas. Cette équipe aléatoire a échoué, l'IA échouant presque à tout. Cela a prouvé que la boucle de rétroaction (apprendre quelles règles fonctionnaient et les renvoyer à l'inventeur) était l'ingrédient secret, et non pas simplement d'avoir plus de règles.

4. L'IA a-t-elle triché ? (L'Audit de "Piratage de Récompense")

Une crainte courante est que si vous dites à une IA "donne-moi plus de lignes de réflexion", elle remplira simplement la page de bêtises pour obtenir des points.

  • L'Audit : Les auteurs ont vérifié les réponses de l'IA. Ils ont constaté que lorsque l'IA trouvait la réponse juste, elle écrivait en réalité plus de lignes et utilisait plus de symboles mathématiques que lorsqu'elle se trompait.
  • La Conclusion : L'IA ne trichait pas en bourrant de l'espace vide ; elle réfléchissait vraiment plus dur parce que les règles l'y encourageaient.

5. Pourquoi Cela Compte

  • C'est Accessible : Vous n'avez pas besoin d'un supercalculateur. Ils ont fait tourner toute cette expérience sur une seule carte graphique haut de gamme grand public (comme celle que les joueurs utilisent) en environ 40 heures.
  • C'est Automatisé : Au lieu qu'un expert humain passe des semaines à deviner à quoi ressemble la grille de notation parfaite, ce système automatise la découverte de ces règles.
  • C'est Transparent : Les règles ne sont pas une boîte noire ; ce sont de simples codes Python que les humains peuvent lire, comprendre et ajuster.

En résumé : L'article montre que si vous laissez une IA vous aider à concevoir le système de notation pour une autre IA, et que vous continuez à affiner ces règles en fonction de la performance de l'étudiant, vous pouvez enseigner à l'étudiant à penser beaucoup mieux que si vous lui donniez simplement un ensemble statique de règles écrites par un humain.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →