← Derniers articles
💻 computer science

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

L'article présente **Diffusion-Proof**, le premier cadre appliquant les grands modèles de langage basés sur la diffusion à la démonstration formelle de théorèmes, qui surpasse les bases traditionnelles autorégressives en exploitant le débruitage itératif pour la cohérence à longue portée et la correction locale, atteignant des améliorations significatives sur les benchmarks et résolvant un problème de l'IMO que les modèles de pointe n'avaient pas pu résoudre.

Auteurs originaux : Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

Publié 2026-06-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'Idée Générale : Réparer la « Rue à Sens Unique » des Mathématiques de l'IA

Imaginez que vous essayez de résoudre un casse-tête mathématique très complexe, comme une preuve dans un langage formel appelé Lean. Ce langage est comme un code informatique strict où chaque étape doit être logiquement parfaite. Si vous faites une seule petite erreur, toute la preuve s'effondre.

Pendant des années, les meilleurs modèles d'IA pour cette tâche ont été des modèles Auto-Régressifs (AR). Considérez ces modèles comme une personne écrivant une histoire un mot à la fois, strictement de gauche à droite. Ils ne peuvent pas voir ce qu'ils sont sur le point d'écrire, et ils ne peuvent pas facilement revenir en arrière pour changer un mot écrit il y a cinq minutes sans réécrire toute la phrase.

Le Problème :
Dans les preuves mathématiques longues, cette approche de « rue à sens unique » cause deux problèmes majeurs :

  1. L'Effet Domino : Si l'IA commet une petite erreur au début, elle continue de construire sur cette erreur, aggravant le problème jusqu'à ce que la preuve ne soit plus que du charabia.
  2. L'Impossibilité de « Regarder en Arrière » : Si l'IA se rend compte à mi-chemin que la première étape était fausse, elle ne peut pas facilement corriger uniquement cette première étape. Elle doit soit recommencer, soit essayer maladroitement de colmater la fin de la phrase pour qu'elle corresponde au début.

La Solution : L'Approche par « Diffusion »

Les auteurs de ce papier proposent une nouvelle façon de construire une IA pour les mathématiques appelée Diffusion-Proof. Au lieu d'écrire mot par mot, ils utilisent un Modèle de Langage de Diffusion (dLLM).

L'Analogie : Le Sculpteur vs Le Scribe

  • L'Ancienne Méthode (Modèle AR) : Imaginez un scribe écrivant une lettre. Une fois l'encre sèche, il ne peut plus la changer. S'il fait une faute d'orthographe, il doit la rayer et écrire une note désordonnée à côté.
  • La Nouvelle Méthode (Modèle de Diffusion) : Imaginez un sculpteur travaillant sur un bloc d'argile. Il ne se contente pas d'ajouter de l'argile ; il part d'un amas brut et bruité et le affine de manière itérative. Il peut regarder la forme globale à la fois, lisser une bosse sur le côté gauche tout en regardant la courbe sur le côté droit, et corriger les erreurs en « débruitant » l'ensemble de l'image jusqu'à ce qu'elle soit parfaite.

En termes techniques, le modèle de diffusion génère du texte par blocs (groupes de mots) plutôt que par mots isolés. Il peut regarder le début et la fin d'une phrase simultanément pour déterminer ce qui convient au milieu.

Comment fonctionne Diffusion-Proof : L'Équipe de Duo

Le papier introduit une équipe en deux parties pour résoudre ces problèmes mathématiques :

1. L'Architecte (dLLM-Prover-7B)

C'est le constructeur principal. Parce qu'il utilise la méthode du « sculpteur » (diffusion par blocs), il est bien meilleur pour la planification à longue portée.

  • Pourquoi c'est important : En construisant une preuve longue, l'Architecte peut voir la « vue d'ensemble ». Il sait que l'étape finale nécessite une condition spécifique, donc il prépare le début de la preuve pour qu'il corresponde parfaitement à cette condition. Il ne se perd pas au milieu car il peut « voir » tout le bloc de texte à la fois.

2. L'Inspecteur (dLLM-Corrector-7B)

Même le meilleur Architecte fait des erreurs. Parfois, la preuve semble correcte, mais une étape spécifique est erronée.

  • L'Ancienne Méthode : Si un modèle AR fait une erreur, il essaie souvent de la corriger en écrivant plus de texte après l'erreur, ce qui aggrave généralement la situation.
  • La Nouvelle Méthode : L'Inspecteur est un modèle spécial entraîné pour remplir les blancs. Si la preuve échoue, le système prend la partie défectueuse, la recouvre d'un « masque » (comme un espace vide) et demande à l'Inspecteur de réécrire juste ce bloc spécifique.
  • Le Superpouvoir : Parce que l'Inspecteur utilise la méthode de diffusion, il peut regarder le texte avant l'erreur et le texte après l'erreur pour comprendre exactement quelle pièce manquante doit s'y insérer. C'est comme un éditeur qui lit la phrase avant et la phrase après une faute de frappe pour deviner le mot correct, plutôt que de simplement deviner en se basant sur le mot précédent.

Les Résultats : Battre les Géants

Les chercheurs ont testé ce nouveau système sur deux benchmarks mathématiques célèbres :

  1. MiniF2F : Une collection de problèmes de mathématiques de niveau lycée et de compétition.
  2. ProofNet : Une collection de problèmes de mathématiques de niveau universitaire.

Le Tableau des Scores :

  • Le nouveau système Diffusion-Proof a battu les meilleurs modèles traditionnels (Auto-Régressifs) entraînés sur les mêmes données.
  • Il a résolu 6,14 % de problèmes en plus sur le test MiniF2F.
  • Il a résolu 1,61 % de problèmes en plus sur le test ProofNet.

Le Moment « IMO » :
Le résultat le plus excitant concerne un problème spécifique des Olympiades Internationales de Mathématiques (IMO). Un modèle d'IA très avancé et célèbre nommé DeepSeek-Prover-V2 (qui utilise le raisonnement par « Chaîne de Pensée » ou Chain of Thought) n'a pas réussi à résoudre ce problème. Diffusion-Proof l'a résolu.

Pourquoi ? Le modèle DeepSeek s'est retrouvé bloqué dans une boucle tentant de corriger son propre plan, car il ne pouvait pas percevoir la connexion à longue portée entre le début et la fin de la preuve. Le modèle de Diffusion, grâce à sa capacité à regarder l'ensemble du « bloc » de la preuve à la fois, a trouvé le chemin correct.

Résumé

Le papier affirme qu'en passant de « l'écriture d'un mot à la fois » à la « sculpture de blocs de texte », l'IA peut devenir bien meilleure en mathématiques formelles. Cela crée un système qui planifie mieux sur de longues distances et peut corriger ses propres erreurs en regardant l'ensemble du contexte, et non seulement le passé immédiat. Cela permet de résoudre des problèmes mathématiques difficiles que les modèles d'IA précédents ne pouvaient tout simplement pas résoudre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →