ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
Cet article présente ProofCouncil, un agent LLM open-source utilisant une architecture auteur-critique qui a atteint des performances de pointe lors du défi FirstProof en résolvant de manière autonome six des dix problèmes mathématiques réels et en démontrant des progrès significatifs sur un ensemble plus large de problèmes ouverts.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous ayez confié à un tout nouveau robot super intelligent une pile des énigmes mathématiques les plus déroutantes au monde. Ce ne sont pas vos habituels casse-têtes du type « trouvez le nombre manquant » ; ce sont des problèmes ouverts sur lesquels des mathématiciens humains se cassent la tête depuis des années, sans que personne n'en connaisse la réponse.
Entrez dans ProofCouncil. Voyez cela non pas comme un simple robot, mais comme un petit atelier de mathématiques à enjeux élevés.
L'équipe de l'atelier : l'Auteur, le Critique et la Brigade
Le cœur de ce système est un jeu de « patate chaude » ingénieux joué par deux personnages principaux : l'Auteur et le Critique.
- L'Auteur est le rêveur. C'est une IA qui s'assoit pour tenter de rédiger une preuve parfaite (un argument mathématique étape par étape) pour un problème. Il possède un carnet magique où il griffonne des idées, teste du code et effectue même des recherches sur le web pour trouver des indices.
- Le Critique est l'éditeur strict. Il lit ce que l'Auteur a écrit et dit : « Attendez, cette étape n'a pas de sens », ou « Vous avez oublié de prouver cette partie ! ». Il ne se contente pas de dire que c'est « faux » ; il donne des commentaires spécifiques sur la façon de combler les lacunes.
Voici le rebondissement : l'Auteur ne se contente pas d'écrire une seule fois. Il écrit, reçoit des critiques, réécrit, reçoit de nouvelles critiques et continue ainsi. C'est comme un écrivain et un éditeur enfermés dans une pièce, polissant une histoire jusqu'à ce qu'elle soit parfaite.
Mais parfois, l'Auteur se retrouve bloqué. C'est alors qu'il appelle le Conseil et le Nœud de Calcul.
- Le Conseil est un panel d'autres IA super intelligentes (comme une équipe d'experts invités). L'Auteur leur demande : « Hé, je suis bloqué sur cette partie précise ; y a-t-il une autre façon de voir les choses ? »
- Le Nœud de Calcul est le travailleur de force. Si le problème nécessite un calcul massif ou un outil de logiciel mathématique spécialisé que l'Auteur ne peut pas exécuter seul, ce nœud effectue le gros travail, exécutant du code et brasant des chiffres pour vérifier si une intuition est vraie.
Toutes les quelques étapes, le Critique prend une « pause mentale » et repart de zéro avec une page blanche. Cela est crucial car si le Critique sitte trop habitué aux erreurs de l'Auteur, il pourrait cesser de les voir. Un regard neuf garantit que la preuve est réellement solide.
Le grand test : le défi FirstProof
L'équipe a soumis ProofCouncil au test ultime : un défi appelé FirstProof. Les règles étaient simples mais brutales : résoudre 10 problèmes mathématiques réels et non résolus en 24 heures, en utilisant uniquement des outils publics.
Les résultats ? ProofCouncil a été la star de la compétition. Sur les 10 problèmes, il a réussi à produire des solutions pour 6 d'entre eux que les arbitres humains ont jugées correctes (avec seulement de minuscules ajustements mineurs nécessaires). C'était la meilleure performance de toutes les équipes de la compétition.
Ils l'ont également testé sur 30 autres problèmes ouverts envoyés par de vrais mathématiciens. Sur les 21 problèmes ayant reçu un retour :
- 5 ont été jugés comme des solutions complètement correctes.
- 2 ont été considérés comme très prometteurs, attendant simplement une vérification finale.
- 8 ont fait des progrès utiles, même s'ils n'ont pas terminé la tâche.
- 4 ne présentaient aucune erreur mais n'ont pas vraiment fait bouger les lignes.
- 2 ont mal compris la question et ont résolu une version plus facile de celle-ci.
Il est important de noter qu'aucun expert n'a déclaré que les résultats étaient mathématiquement faux d'une manière qui briserait la logique. L'échec principal n'était pas une mauvaise mathématique, mais parfois une mauvaise lecture de l'énoncé du problème.
Le coût du génie
Voici le hic : être aussi intelligent est coûteux. Faire fonctionner ProofCouncil sur un seul problème a coûté environ 350 $ en temps informatique et appels de modèles. Comparez cela à une tentative d'IA plus simple, en un seul coup, qui n'a coûté que 12 $ mais a résolu moins de problèmes. L'article suggère que bien que l'approche par « équipe » fonctionne mieux, elle est actuellement un article de luxe. Les auteurs admettent qu'ils n'ont pas encore cherché à rendre cela moins coûteux, laissant cela comme un travail pour les futurs chercheurs.
Ce qu'il n'a pas fait (et ce qu'il n'a pas prétendu)
Il est important de savoir ce que ce robot n'a pas fait.
- Il n'a pas résolu les 10 problèmes du défi (il en a manqué 4).
- Il n'a pas produit un article de recherche poli et prêt à être publié. Les mathématiciens qui ont examiné le travail ont noté que l'écriture était dense et nécessitait une édition humaine pour être lisible par des non-experts.
- Il n'a pas « prouvé » que l'IA peut résoudre n'importe quel problème mathématique. Il a montré que pour certains problèmes difficiles, une équipe d'IA travaillant ensemble est plus efficace qu'une seule IA travaillant seule.
L'essentiel
ProofCouncil suggère que si vous voulez résoudre un problème mathématique ouvert et vraiment difficile, vous ne devriez pas simplement demander à une IA de « trouver la solution ». Au lieu de cela, vous avez besoin d'un système où une IA écrit, une autre démolit son travail, une troisième offre de nouvelles perspectives et une quatrième effectue les calculs mathématiques lourds.
Dans le monde du défi FirstProof, cette équipe « Auteur-Critique-Conseil » a été la stratégie la plus fructueuse testée jusqu'à présent. Elle n'a pas conquis toute la montagne, mais elle a grimpé plus haut que quiconque, prouvant que lorsque les agents d'IA travaillent ensemble comme une équipe de recherche humaine, ils peuvent s'attaquer à des problèmes qui étaient auparavant considérés comme hors de portée.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.