← Derniers articles
🤖 machine learning

VERITAS: Verifier-Guided Proof Search for Zero-Shot Formal Theorem Proving

Le papier introduit VERITAS, un cadre zero-shot qui améliore la preuve de théorèmes formels en réinjectant des signaux de vérification riches dans le processus de recherche via un protocole en deux phases de Best-of-N et de MCTS guidé par un critique, atteignant des performances de pointe sur des benchmarks comme miniF2F et un nouveau jeu de données de combinatoire.

Auteurs originaux : Manish Acharya, Zhenyu Liao, Yueke Zhang, Kevin Leach, Yu Huang, Yifan Zhang

Publié 2026-06-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Manish Acharya, Zhenyu Liao, Yueke Zhang, Kevin Leach, Yu Huang, Yifan Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre un casse-tête très difficile, comme un problème de mathématiques complexe, mais que vous le faites avec une équipe d'assistants IA. Habituellement, lorsque ces assistants IA tentent de résoudre un problème, ils proposent une solution, vérifient si elle fonctionne et, si elle échoue, ils reçoivent simplement un signal simple du type « Non, réessayez ». Ils jettent ainsi toutes les détails sur la raison de l'échec.

VERITAS est un nouveau système qui change la donne. Au lieu de simplement dire « Non », il écoute les raisons spécifiques de l'échec de la preuve et utilise ces raisons pour guider la tentative suivante. Considérez cela comme un détective qui ne se contente pas de dire « Le suspect est innocent », mais qui dit : « Le suspect est innocent parce qu'il était au magasin à 17h, donc cherchons quelqu'un d'autre qui était au magasin ».

Voici comment fonctionne VERITAS, décomposé en parties simples :

1. L'équipe de quatre spécialistes

VERITAS ne repose pas sur un seul cerveau IA. Il utilise une équipe de quatre agents spécialisés qui communiquent entre eux :

  • Le Stratège : Avant de tenter de résoudre le problème, cet agent décide d'un plan de haut niveau (par exemple, « Essayons de diviser cela par cas » ou « Essayons de prouver cela par l'absurde »). Il réduit ainsi la recherche pour que l'équipe ne perde pas de temps avec de mauvaises idées.
  • Le Chercheur : Cet agent est comme un bibliothécaire. Il trouve rapidement les livres de référence appropriés (règles mathématiques et lemmes) qui pourraient aider à résoudre l'étape actuelle.
  • Le Tacticien : C'est le travailleur principal. Il tente d'écrire les étapes réelles de la preuve. Crucialement, il consulte une liste des tentatives échouées précédentes. Si une tentative antérieure a échoué parce qu'elle a utilisé le mauvais nom pour une règle, le Tacticien est informé : « N'utilisez plus ce nom ; voici le message d'erreur ».
  • Le Critique : Cet agent agit comme un entraîneur. Il surveille la progression et dit : « Vous vous rapprochez » ou « Vous vous engagez dans une impasse », en se basant sur le retour spécifique de l'ordinateur qui vérifie les mathématiques.

2. Le plan de jeu en deux phases

Le système joue le jeu en deux tours distincts pour être efficace :

  • Phase 1 : Le « Balayage Rapide » (Best-of-N)
    L'équipe fait 5 tentatives rapides et indépendantes de la solution. Si l'une d'elles fonctionne, tant mieux ! Ils s'arrêtent immédiatement. C'est rapide et cela gère les problèmes « faciles ».
  • Phase 2 : L'« Immersion Profonde » (Recherche guidée par le Critique)
    Si le balayage rapide échoue, le système passe à un mode plus méticuleux. Il prend toutes les erreurs de la Phase 1 et les réinjecte dans le Tacticien sous forme d'« exemples négatifs ».
    • Analogie : Imaginez que vous essayez d'ouvrir une porte verrouillée. En Phase 1, vous essayez 5 clés différentes rapidement. Aucune ne fonctionne. En Phase 2, au lieu d'essayer des clés au hasard, vous examinez les 5 clés qui ont coincé la serrure, notez précisément comment elles ont coincé, et utilisez ces informations pour fabriquer une nouvelle clé qui s'adapte à la forme spécifique de la serrure.

3. Pourquoi cela importe : Le problème de la « Combinatoire »

L'article a testé cela sur deux types de problèmes mathématiques.

  • Problèmes mathématiques standards : VERITAS en a résolu plus que les méthodes précédentes (40,6 % contre 36,9 %).
  • Combinatoire (problèmes de dénombrement) : C'est ici que VERITAS s'est vraiment illustré. Dans ces problèmes, il faut souvent utiliser des noms très spécifiques et exacts pour les règles mathématiques.
    • Le Problème : L'IA de devinette standard a souvent tendance à « halluciner » (inventer) des noms de règles qui n'existent pas. Si une IA propose un faux nom de règle, un système standard dira simplement « Échec » et passera à la suite.
    • La Solution VERITAS : Parce que VERITAS lit le message d'erreur spécifique (« Constante inconnue 'X' »), il apprend en temps réel que « X » n'existe pas. Il corrige de manière itérative le nom jusqu'à trouver le vrai.
    • Résultat : Sur ces problèmes de dénombrement difficiles, le devinage standard devient en fait pire à mesure qu'il essaie (car il continue d'inventer de faux noms). VERITAS, lui, devient meilleur car il apprend de ses erreurs.

4. La garantie de « Monotonie »

Les auteurs se sont assurés que VERITAS ne perd jamais une solution qu'il a déjà trouvée.

  • La Garantie : Si le « Balayage Rapide » (Phase 1) résout un problème, VERITAS conserve cette solution et n'y touche plus. L'« Immersion Profonde » (Phase 2) ne travaille que sur les problèmes que la première phase n'a pas pu résoudre.
  • Pourquoi c'est important : Cela prouve que tout succès supplémentaire réalisé par VERITAS provient spécifiquement de la recherche intelligente pilotée par le feedback, et non pas simplement du fait d'essayer plus de devinettes aléatoires.

5. L'astuce du « Batch » (Lot)

L'une des astuces d'ingénierie ingénieuses de l'article concerne la façon dont ils vérifient les réponses.

  • L'ancienne méthode : Vérifier une supposition, attendre que l'ordinateur dise « Non », vérifier la suivante, attendre, vérifier la suivante... C'est lent.
  • La méthode VERITAS : Ils regroupent 6 suppositions dans un seul fichier et demandent à l'ordinateur de toutes les vérifier en même temps. Cela rend le système environ 10 à 20 fois plus rapide, économisant ainsi beaucoup de temps et d'argent.

Résumé

VERITAS est un système qui traite les messages d'erreur de l'ordinateur non pas comme un « panneau stop », mais comme une carte. En lisant les raisons spécifiques pour lesquelles une preuve a échoué (erreurs de syntaxe, types erronés, étapes manquantes) et en réinjectant ces informations dans la tentative suivante de l'IA, il peut résoudre des problèmes mathématiques difficiles auxquels les autres systèmes renoncent. Il combine une approche rapide de « essai et erreur » avec une approche intelligente de « apprentissage par l'échec » pour obtenir les meilleurs résultats.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →