← Derniers articles
💻 computer science

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

Cette étude révèle que les prouveurs de théorèmes Lean entraînés par RL souffrent d'un effondrement de mode à l'inférence, qui peut être efficacement atténué en appliquant un calendrier fixe de squelettes de tactiques diversifiés pour retrouver des gains de performance significatifs, tandis que le paraphrasage des invites et les commentaires non pertinents s'avèrent inefficaces ou préjudiciables.

Auteurs originaux : Zachary Burton

Publié 2026-05-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zachary Burton

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un étudiant brillant formé pour résoudre des énigmes mathématiques très difficiles en utilisant un langage informatique spécial appelé Lean. Cet étudiant, appelons-le « DeepSeek », est incroyablement intelligent mais a une étrange habitude : lorsqu'on lui demande de résoudre une énigme, il reste bloqué dans une ornière mentale.

Ce document est un rapport de diagnostic expliquant pourquoi cela se produit et comment y remédier. Voici l'histoire de ce que les chercheurs ont découvert, racontée en termes courants.

1. Le Problème : L'Effet « Disque Rayé »

Les chercheurs ont remarqué que lorsqu'ils demandaient à DeepSeek de résoudre la même énigme mathématique encore et encore (juste avec des graines aléatoires légèrement différentes, comme lancer des dés), l'étudiant continuait d'essayer exactement la même première étape.

  • L'Analogie : Imaginez que vous essayez d'ouvrir une porte verrouillée. Vous essayez la clé dans la serrure. Ça ne marche pas. Vous réessayez. Ça ne marche toujours pas. Vous essayez une troisième fois, et une centième fois. Même si vous essayez 64 fois, vous enfoncez simplement la même clé dans la même serrure de la même manière. Vous n'explorez pas d'autres clés ni d'autres façons d'ouvrir la porte.
  • Le Résultat : Dans l'étude, doubler le nombre de tentatives de 32 à 64 n'a pas résolu une seule nouvelle énigme. L'étudiant avait « effondré son mode » : il était coincé sur un chemin étroit et ne pouvait rien imaginer d'autre.

2. La Solution : Donner un Indice de « Première Étape »

Les chercheurs ont réalisé que l'étudiant n'était pas paresseux ; il était simplement trop coincé dans sa routine. Alors, ils ont essayé un nouveau tour : avant de demander à l'étudiant de résoudre l'énigme, ils lui ont donné une instruction spécifique sur la façon de commencer.

  • L'Analogie : Au lieu de simplement dire « Résolvez cette énigme », les chercheurs ont dit « Commencez par simplifier les nombres » ou « Commencez par introduire une nouvelle variable ». C'est comme donner à l'étudiant une clé spécifique à essayer en premier, plutôt que de le laisser deviner.
  • Le Résultat : Ce simple encouragement a brisé l'ornière. L'étudiant a soudainement commencé à résoudre beaucoup plus d'énigmes. L'« ornière » n'était pas due au fait que l'étudiant était mauvais en mathématiques ; c'était parce qu'il était trop rigide dans sa façon de commencer.

3. Le « Pourquoi » : C'est un Problème de Formation, Pas de Cerveau

Les chercheurs voulaient savoir : l'étudiant est-il naturellement mauvais en mathématiques, ou est-ce la formation qui l'a rendu rigide ?

  • L'Expérience : Ils ont testé l'étudiant avant qu'il ne reçoive la formation mathématique spéciale (le modèle « Base »).
  • La Découverte : L'étudiant non formé ne pouvait résoudre aucune énigme du tout. Il abandonnait simplement ou répétait la question.
  • La Conclusion : La formation spéciale (Apprentissage par Renforcement) est ce qui a appris à l'étudiant à résoudre des énigmes dès le départ. Mais, cette même formation est aussi ce qui l'a rendu rigide et coincé dans une ornière. La formation a créé la compétence, mais elle a aussi créé le problème du « disque rayé ».

4. Qui D'autre a Ce Problème ?

Les chercheurs ont testé d'autres « étudiants » (différents modèles d'IA) pour voir si c'était un problème universel.

  • L'Étudiant « SFT » : Un étudiant avait été formé différemment (Affinage Supervisé). Cet étudiant était en fait meilleur pour résoudre des énigmes dans l'ensemble, mais il ne souffrait pas du problème d'« ornière ». Lorsque les chercheurs lui donnaient des indices, cela le rendait en fait légèrement pire. Il était déjà assez flexible pour trouver son propre chemin.
  • Les Étudiants « RL » : Les étudiants formés avec la méthode spéciale d'« Apprentissage par Renforcement » (comme DeepSeek) étaient ceux qui restaient bloqués. Ils avaient besoin des indices de « première étape » pour sortir de leur pensée étroite.

5. La Preuve du « Premier Coup »

Pour prouver qu'il ne s'agissait pas d'un simple hasard, les chercheurs ont examiné les véritables « premiers coups » que les étudiants faisaient.

  • La Découverte : Sur 64 tentatives pour une seule énigme, l'étudiant « coincé dans une ornière » utilisait exactement le même premier coup dans presque la moitié des cas. Il était incroyablement prévisible.
  • La Métaphore : Si vous demandiez à un humain d'écrire une histoire 64 fois, il pourrait commencer par « Il était une fois », « Le soleil brillait » ou « C'était une nuit sombre ». Mais cet étudiant en IA commencerait par « Il était une fois » 32 fois, et « Le soleil brillait » 30 fois. Il n'avait presque aucune variété dans son ouverture.

Résumé

Le document conclut que l'Apprentissage par Renforcement (une méthode spécifique de formation de l'IA) crée une arme à double tranchant :

  1. Il apprend à l'IA comment résoudre des preuves mathématiques formelles (ce qu'elle ne pouvait pas faire auparavant).
  2. Mais il rend aussi l'IA si focalisée sur quelques stratégies « gagnantes » qu'elle cesse d'en explorer de nouvelles.

La solution n'est pas de donner à l'IA plus de puissance de calcul ou plus de temps pour réfléchir ; c'est de lui fournir un guidage structurel — un simple encouragement sur la façon de commencer la preuve. Cela force l'IA à briser sa routine et à explorer de nouveaux chemins, débloquant des solutions qu'elle était auparavant trop obstinée à trouver.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →