← Nieuwste papers
🤖 AI

Ax-Prover: A Deep Reasoning Agentic Framework for Theorem Proving in Mathematics and Quantum Physics

Ax-Prover is een multi-agent framework dat Large Language Models combineert met Lean-tools via het Model Context Protocol om zowel autonoom als collaboratief formeel stellingenbewijs mogelijk te maken in diverse wetenschappelijke domeinen, waarbij het superieure generalisatie op nieuwe benchmarks en praktische bruikbaarheid in complexe wiskundige taken demonstreert.

Oorspronkelijke auteurs: Benjamin Breen, Marco Del Tredici, Jacob McCarran, Javier Aspuru Mijares, Weichen Winston Yin, Kfir Sulimany, Jacob M. Taylor, Frank H. L. Koppens, Dirk Englund

Gepubliceerd 2026-05-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Benjamin Breen, Marco Del Tredici, Jacob McCarran, Javier Aspuru Mijares, Weichen Winston Yin, Kfir Sulimany, Jacob M. Taylor, Frank H. L. Koppens, Dirk Englund

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een ongelooflijk moeilijk raadsel op te lossen, zoals een complex wiskundig probleem of een fysica-mysterie. Je hebt twee soorten helpers:

  1. De Generalist: Een briljante, welgelezen mens die een beetje weet over van alles (wiskunde, fysica, geschiedenis) en uitstekend is in praten en brainstormen. Ze hebben echter nooit de strenge, rigide regels van een specifiek raadselspel genaamd "Lean" geleerd, waardoor ze vaak kleine fouten maken of de regels verkeerd interpreteren.
  2. De Specialist: Een robot die alleen is getraind op dat specifieke raadselspel. Het kent de regels perfect, maar is zo gespecialiseerd dat het in de war raakt als je een vraag stelt over een iets ander type raadsel, of als het reglement wordt bijgewerkt. Het kan ook niet met je praten of externe hulpmiddelen gebruiken om te helpen.

Ax-Prover is een nieuw systeem dat fungeert als een superintelligent projectmanager die de Generalist inhuurt, maar hen een speciale toolkit geeft om een perfecte raadseloplosser te worden.

Hoe het werkt: Het "driekoppige" team

In plaats van één groot brein dat alles probeert te doen, gebruikt Ax-Prover een team van drie "agenten" (AI-helpers) die samenwerken:

  • De Orchestrator (De Manager): Deze agent lost het raadsel niet zelf op. Het is als een dirigent in een orkest. Het neemt het probleem, wijst het toe aan de oplosser, luistert naar feedback en beslist wanneer het werk klaar is of wanneer het opnieuw moet worden geprobeerd.
  • De Prover (De Bouwer): Dit is de Generalist AI (zoals een slimme chatbot). Het probeert stap voor stap de oplossing te bouwen. Maar hier is de magie: het raadt niet zomaar. Het heeft een digitale gereedschapskist (genaamd MCP-tools) die het toestaat om:
    • Het reglement (de Lean-bibliotheek) te openen om definities te controleren.
    • De computer te vragen: "Is deze stap op dit moment correct?"
    • Te zoeken naar vergelijkbare raadsels die het eerder heeft gezien.
    • Zelf zijn eigen fouten direct te herstellen.
    • Analogie: Stel je een timmerman voor die direct kan controleren of een snede recht is met een laserniveau voordat hij het hout vastspijkerd. Als het scheef is, repareert hij het direct.
  • De Verifier (De Inspecteur): Deze agent is de strenge kwaliteitscontroleur. Het bekijkt het eindwerk en controleert het tegen de regels. Als er zelfs maar één klein foutje zit, stuurt het het werk terug naar de Bouwer om het te herstellen. Het zorgt ervoor dat niets door de mazen van het net glipt.

Waarom dit een grote zaak is

Het artikel test dit systeem op twee soorten uitdagingen:

  1. Standaard Wiskundewedstrijden: Zoals het Putnam-examen (zeer moeilijk middelbaar/hoger onderwijs wiskunde).
  2. Nieuwe, Moeilijkere Velden: De auteurs hebben nieuwe tests ontwikkeld voor Abstracte Algebra (geavanceerde, onderzoeksgerichte wiskunde) en Kwantumfysica (de fysica van atomen en subatomaire deeltjes).

De Resultaten:

  • De Specialisten (Robots): Ze waren uitstekend in de standaardwiskunde waarvoor ze waren getraind, maar toen het team probeerde ze te gebruiken voor Kwantumfysica of nieuwe soorten algebra, faalden ze. Ze waren als een meesterkok die alleen Italiaans eten kan koken; als je vraagt om sushi te maken, weten ze niet wat ze moeten doen.
  • De Generalist (De Chatbot): Zonder de hulpmiddelen was het creatief, maar maakte te veel fouten om bruikbaar te zijn.
  • Ax-Prover (Het Team): Het versloeg de specialisten in de nieuwe velden (Kwantum en Algebra) en presteerde zeer goed in standaardwiskunde. Het bewees dat door een slimme, algemene AI de juiste hulpmiddelen te geven om zijn eigen werk te controleren, het problemen kan oplossen in velden waarvoor het niet specifiek is getraind.

Wereldwijd voorbeelden uit het artikel

De auteurs hebben niet alleen tests uitgevoerd; ze hebben laten zien hoe dit werkt met echte wetenschappers:

  • De Cryptograaf: Een beveilingsexpert wilde een wiskundige formule bewijzen die wordt gebruikt om gegevens te beschermen. De expert kende de wiskunde, maar niet hoe deze in de strenge "Lean"-taal moest worden geschreven. Ax-Prover trad op als partner, vertaalde de ideeën van de expert naar code, vond een verborgen fout in de oorspronkelijke logica en produceerde binnen twee dagen op een gewone laptop een geverifieerd certificaat.
  • De Kwantumfysicus: Onderzoekers wilden een regel bewijzen over hoe informatie verloren gaat in kwantumcomputers. Ax-Prover hielp hun redenering in de stijl van de fysica om te zetten in een strenge, door de machine gecontroleerde bewijsvoering, zodat de wiskunde 100% solide was.

De Conclusie

Ax-Prover laat zien dat je niet voor elk wetenschappelijk vakgebied een nieuwe, dure robot hoeft te bouwen. In plaats daarvan kun je een slimme, algemene AI nemen, deze een set hulpmiddelen geven om zijn eigen werk te controleren en met experts te praten, en het wordt een krachtige, flexibele assistent die kan helpen bij het verifiëren van complexe bewijzen in wiskunde, fysica en cryptografie. Het verandert de AI van een "gokmachine" in een "voorzichtige wiskundige" die elke stap dubbelcheckt voordat hij verder gaat.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →