← Nieuwste papers
🤖 AI

Goedel-Architect: Streamlining Formal Theorem Proving with Blueprint Generation and Refinement

Goedel-Architect is een agentisch framework voor Lean 4 stellingbewijzen dat gebruikmaakt van een blauwdrukgeneratie- en verfijningsstrategie om state-of-the-art prestaties te behalen op uitdagende wiskundige benchmarks zoals MiniF2F, Putnam en IMO met aanzienlijk lagere kosten dan bestaande pipelines.

Oorspronkelijke auteurs: Jui-Hui Chung, Ziyang Cai, Zihao Li, Qishuo Yin, Rohit Agarwal, Simon Park, Rodrigo Porto, Narutatsu Ri, Ziran Yang, Shange Tang, Xingyu Dang, Hongzhou Lin, Mengdi Wang, Danqi Chen, Chi Jin, Liam H Fo
Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jui-Hui Chung, Ziyang Cai, Zihao Li, Qishuo Yin, Rohit Agarwal, Simon Park, Rodrigo Porto, Narutatsu Ri, Ziran Yang, Shange Tang, Xingyu Dang, Hongzhou Lin, Mengdi Wang, Danqi Chen, Chi Jin, Liam H Fowl, Sanjeev Arora

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorm, ingewikkeld kasteel probeert te bouwen van LEGO-stenen. Je hebt een blauwdruk, maar het is geen tekening; het is een lijst met instructies die zegt: "Om de toren te bouwen, heb je eerst een fundament nodig, dan een muur, en dan een raam."

Het probleem is dat als je de hele toren in één enorme sprong probeert te bouwen, je halverwege vast kunt lopen, of je kunt halverwege de toren beseffen dat het fundament verkeerd is gebouwd.

Goedel-Architect is een nieuw, slim robotteam ontworpen om deze wiskundige "kasteelconstructies" (formele bewijzen) te bouwen in een taal genaamd Lean 4. In plaats van te proberen het hele kasteel in één keer te bouwen, gebruikt het een strategie genaamd Blueprint Generation and Refinement (Blauwdruk Generatie en Verfijning).

Zo werkt het, opgedeeld in eenvoudige stappen:

1. De Blauwdruk (Het Meesterplan)

Voordat de robot begint met bouwen, tekent hij een Blauwdruk.

  • Wat is het? Zie dit als een afhankelijkheidskaart. Het somt elke kleine stap (een "lemma" genoemd) op die nodig is om het grote wiskundige probleem te bewijzen.
  • Hoe het werkt: Het tekent pijlen die laten zien welke stappen van anderen afhankelijk zijn. Bijvoorbeeld: "Je kunt het dak niet bouwen totdat de muren klaar zijn."
  • De Twist: Soms, als het wiskundige probleem erg moeilijk is, krijgt de robot een Natural Language Proof (Bewijs in Natuurlijke Taal). Dit is alsof een menselijke wiskundige een ruwe schets of een verhaal geeft over hoe het probleem op te lossen. De robot gebruikt dit verhaal om direct vanaf het begin een betere, nauwkeurigere blauwdruk te tekenen.

2. De Bouwploeg (Parallel Proving)

Zodra de blauwdruk klaar is, stuurt de robot niet één voor één stappen uit, maar stuurt hij een heel team van gespecialiseerde bouwers (een "Lean prover") uit om aan alle kleine stappen tegelijkertijd te werken.

  • Elke bouwer kijkt alleen naar zijn eigen specifieke stap en de stappen die hij mag gebruiken (zijn "afhankelijkheden").
  • Ze proberen hun deel te bouwen. Als ze slagen, maken ze dat deel van de blauwdruk Groen.
  • Als ze falen, maken ze het deel Blauw (vastgelopen) of Rood (gebroken).

3. De Fix-It Loop (Verfijning)

Dit is waar Goedel-Architect verschilt van andere robots.

  • De Oude Manier: Veel andere AI-systemen proberen een probleem op te lossen, lopen vast, en proberen vervolgens dat ene vastgelopen stukje steeds opnieuw in kleinere stukjes te breken. Dit is als proberen een kapotte muur te repareren door steeds harder op dezelfde plek te slaan. Dit leidt vaak tot een doodlopend spoor.
  • De Goedel-Manier: Als een bouwer vastloopt, stopt het hele team en kijkt naar de volledige blauwdruk.
    • Diagnose: De robot vraagt: "Waarom is dit mislukt?"
      • Geval A (Rood): "O, deze stap is eigenlijk onjuist!" (De blauwdruk had een fout idee). De robot corrigeert de bewering.
      • Geval B (Blauw): "Deze stap is wel waar, maar het is nu te moeilijk om te bouwen." De robot breekt deze grote stap op in twee of drie kleinere, makkelijkere hulppasjes.
    • Revisie: De robot schrijft de blauwdruk opnieuw met deze nieuwe, kleinere stappen en stuurt de ploeg opnieuw uit.
    • Efficiëntie: Cruciaal is dat welk deel van het kasteel ook al succesvol is gebouwd (Groen), Groen blijft. De robot gooit het goede werk niet weg; hij repareert alleen de kapotte delen en voegt nieuwe hulppasjes toe.

Waarom is dit een grote zaak?

Het artikel beweert dat deze aanpak een "game changer" is om twee belangrijke redenen:

  1. Het is ongelooflijk slim en nauwkeurig:

    • Op een standaardtest van wiskundevragen voor het voortgezet onderwijs (MiniF2F), loste het 99,2% van de problemen op. Met een beetje hulp van een menselijk verhaal (Natural Language), loste het 100% op.
    • Op moeilijker niveau voor het hoger onderwijs (PutnamBench), loste het 75,6% zelfstandig op, en 88,8% met een beetje hulp.
    • Het loste zelfs problemen op uit zeer recente, supermoeilijke competities (zoals IMO 2025 en Putnam 2025) die geen enkele andere open-source robot heeft opgelost.
  2. Het is ongelooflijk goedkoop:

    • Andere top-tier robots die deze problemen oplossen, maken vaak gebruik van "black box"-modellen die duizenden dollars kosten om te draaien.
    • Goedel-Architect gebruikt een goedkopere, open-source hersenpan (DeepSeek-V4-Flash).
    • De Kosten: Om de volledige PutnamBench-test op te lossen, kostte Goedel-Architect ongeveer $294. De op één na beste open-source concurrent kostte ongeveer $163.000. Dat is een 500x besparing.

De Kern van het Verhaal

Goedel-Architect is als een meesterarchitect die niet alleen probeert een spijker in de muur te slaan; het tekent een kaart, stuurt een ploeg uit om parallel te bouwen, en wanneer er iets breekt, tekent het de hele kaart opnieuw om de logica te herstellen, waarbij het goede werk behoudt en alleen verandert wat noodzakelijk is. Het bewijst dat je niet de duurste, geheime AI nodig hebt om de moeilijkste wiskundeproblemen op te lossen; je hebt alleen een slimmere manier nodig om het werk te organiseren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →