← Derniers articles
🤖 AI

LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks

L'article présente LEAP, un cadre agentique qui permet aux grands modèles de langage à usage général d'atteindre des performances de pointe en démonstration de théorèmes formels en faisant le pont entre le raisonnement informel et le retour du compilateur Lean, résolvant avec succès les 12 problèmes du concours Putnam 2025 et surpassant de manière significative les systèmes spécialisés sur le nouvel ensemble de données Lean-IMO-Bench.

Auteurs originaux : Po-Nien Kung, Linfeng Song, Dawsen Hwang, Jinsung Yoon, Chun-Liang Li, Simone Severini, Mirek Olšák, Edward Lockhart, Quoc V Le, Burak Gokturk, Thang Luong, Tomas Pfister, Nanyun Peng

Publié 2026-06-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Po-Nien Kung, Linfeng Song, Dawsen Hwang, Jinsung Yoon, Chun-Liang Li, Simone Severini, Mirek Olšák, Edward Lockhart, Quoc V Le, Burak Gokturk, Thang Luong, Tomas Pfister, Nanyun Peng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un mathématicien brillant, de classe mondiale, capable d'expliquer des idées complexes en langage courant, de raconter une excellente histoire et de raisonner sur des énigmes difficiles. Cependant, ce mathématicien est incapable d'écrire du code. Si vous lui demandez d'écrire un programme pour résoudre un problème mathématique, il pourrait écrire quelque chose qui semble correct mais qui plante immédiatement lorsque vous essayez de l'exécuter.

C'est l'état actuel des modèles de langage étendus (LLM) en mathématiques. Ils sont incroyables pour les mathématiques « informelles » (en parler), mais ils ont du mal avec les mathématiques « formelles » (écrire dans un langage strict, vérifiable par ordinateur comme Lean, où une seule faute de frappe casse toute la preuve).

Le document présente LEAP (LLM-in-Lean Environment Agentic Prover), un nouveau système qui agit comme un chef de projet super organisé pour aider ce mathématicien brillant à enfin écrire un code parfait.

Voici comment fonctionne LEAP, en utilisant des analogies simples :

1. Le problème : Le piège du « One-Shot »

Auparavant, si vous demandiez à une IA de prouver un théorème, elle essayait d'écrire toute la solution d'un seul coup, comme un étudiant essayant d'écrire une thèse de 50 pages en une seule respiration. S'il faisait une erreur à la page 3, tout l'ensemble échouait. Le document appelle cela la « formalisation one-shot », et cela fonctionne rarement pour les problèmes difficiles.

2. La solution : L'approche du « Blueprint » (Le Plan)

LEAP change la donne en décomposant le processus, un peu comme la construction d'un gratte-ciel :

  • Étape 1 : L'esquisse de l'architecte (Le Blueprint) : Au lieu d'essayer de construire tout le bâtiment d'un coup, LEAP demande d'abord à l'IA de dessiner un « blueprint ». C'est un plan de haut niveau écrit en langage courant. Il dit : « Pour résoudre ceci, nous devons d'abord prouver le Lemme A, puis le Lemme B, et enfin les combiner. »
  • Étape 2 : L'équipe de construction (La preuve formelle) : Une fois le blueprint approuvé, l'IA essaie d'écrire le code Lean réel pour une seule petite partie du plan.
  • Étape 3 : L'inspecteur (Le compilateur) : Le compilateur Lean agit comme un inspecteur de bâtiment très strict. Il vérifie le code. Si c'est parfait, tant mieux ! S'il y a une erreur, il renvoie un message spécifique : « La fondation est fissurée ici. »
  • Étape 4 : Le réparateur (L'auto-raffinement) : L'IA lit la note de l'inspecteur, corrige l'erreur spécifique et réessaie. Elle ne repart pas de zéro ; elle colmate simplement la brèche.

3. La recette secrète : La « Carte de Mémoire » (DAG)

La partie la plus ingénieuse de LEAP est la façon dont il se souvient de ce qu'il a fait. Imaginez que vous résolvez un immense labyrinthe.

  • L'ancienne méthode : Si vous arrivez dans une impasse, vous pourriez oublier d'où vous veniez et errer en rond, perdant ainsi votre temps.
  • La méthode LEAP : LEAP dessine une carte (appelée graphe orienté acyclique, ou DAG) de l'ensemble du labyrinthe.
    • S'il résout un petit puzzle (un « lemme ») dans une branche du labyrinthe, il l'inscrit sur la carte.
    • S'il rencontre ce même puzzle plus tard dans une autre branche, il ne le résout pas à nouveau. Il consulte simplement la carte, voit que la solution est déjà là, et l'utilise.
    • Cela empêche l'IA de gaspiller de l'énergie à réinventer la roue et lui permet de s'attaquer à des problèmes massifs et complexes qui prendraient autrement un temps infini.

4. Les résultats : De zéro à héros

Le document a testé ce système sur certains des problèmes mathématiques les plus difficiles au monde :

  • La compétition Putnam : C'est un concours de mathématiques éprouvant pour les étudiants universitaires en Amérique du Nord. En 2025, l'étudiant moyen a obtenu un score de 2 sur 120. LEAP a résolu 100 % des problèmes (les 12 d'entre eux).
  • L'IMO-Bench : Les auteurs ont créé un nouveau test basé sur les Olympiades Internationales de Mathématiques (IMO). Les systèmes d'IA spécialisés précédents (entraînés uniquement sur les mathématiques) ont résolu environ 48 % de ces problèmes. LEAP, utilisant une IA à usage général, a résolu 70 %.

5. La grande conclusion

Le document soutient que nous n'avons pas besoin de construire de petits robots spécialisés uniquement pour les mathématiques. Au lieu de cela, nous pouvons prendre une IA à usage général (qui connaît un peu de tout) et lui donner un bon flux de travail (le blueprint, l'inspecteur et la carte de mémoire).

Voyez cela comme ceci : Vous n'avez pas besoin d'un robot qui est uniquement bon en pâtisserie pour réussir un gâteau parfait. Vous avez juste besoin d'un chef polyvalent à qui l'on donne une bonne recette, un testeur de goût strict et un carnet pour se souvenir de ce qui a fonctionné. LEAP fournit cette recette, ce testeur de goût et ce carnet, transformant un « bon parleur » en un « prouveur parfait ».

En bref : LEAP ne rend pas l'IA plus intelligente ; il lui donne simplement une meilleure façon d'organiser ses pensées, de vérifier son travail et de se souvenir de ses succès, lui permettant de résoudre des problèmes mathématiques qui étaient auparavant impossibles pour une IA générale.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →