← Nieuwste papers
🤖 AI

ProofWala: A Framework for Multilingual Proof Data Synthesis and Theorem-Proving

Dit artikel introduceert ProofWala, een meertalig framework gebouwd op een herbruikbare bibliotheek voor programmatische interactie met interactieve stellingbewijzers dat schaalbare, semantisch getrouwe bewijsdata-extractie en parallel zoeken mogelijk maakt, waarbij wordt aangetoond dat cross-linguale training over Lean en Rocq de prestaties van stellingbewijzen en domeinadaptatie aanzienlijk verbetert.

Oorspronkelijke auteurs: Amitayush Thakur, George Tsoukalas, Greg Durrett, Swarat Chaudhuri

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Amitayush Thakur, George Tsoukalas, Greg Durrett, Swarat Chaudhuri

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij complexe wiskundige puzzels moet oplossen. De robot moet de specifieke "taal" van een wiskundig bewijs leren, die zeer strikt en logisch is. Al een tijdje bouwen onderzoekers robots om dit te doen, maar ze werken in isolatie. Eén team bouwt een robot voor Lean (een specifieke wiskundige taal), en een ander team bouwt een andere robot voor Rocq (voorheen Coq, een andere wiskundige taal). Ze praten niet met elkaar en hun tools zijn lomp, alsof je een automotor probeert te repareren met een hamer die alleen op één specifieke bout past.

Het artikel introduceert ProofWala, een nieuwe "universele toolkit" die deze chaos probeert op te lossen. Dit is hoe het werkt, met behulp van eenvoudige analogieën:

1. Het Probleen: De "Vertaler"-kloof

Beschouw Lean en Rocq als twee verschillende landen met verschillende dialecten. Vóór ProofWala moest je, als je de werking van bewijzen in beide landen wilde bestuderen, twee aparte teams vertalers inhuren die verschillende kaarten en verschillende woordenboeken gebruikten.

  • De Oude Manier: Tools waren "assistent-specifiek". Als je een hele bibliotheek aan wiskundige bewijzen (een "repository") wilde analyseren, moest je dit bestand voor bestand doen, zoals een boek pagina voor pagina lezen terwijl je je adem inhoudt. Dit was traag, kwetsbaar en maakte het onmogelijk om het grote plaatje te zien of veel experimenten tegelijkertijd uit te voeren.
  • De Nieuwe Manier (ProofWala): De auteurs hebben een universele vertaler gebouwd genaamd itp-interface. Deze tool spreekt zowel Lean als Rocq vloeiend. Het leest niet alleen de tekst; het begrijpt de diepe structuur van de wiskunde, waardoor onderzoekers hele bibliotheken in één keer kunnen analyseren, net zoals het direct scannen van een hele boekenkast.

2. De Motor: Het "Klonen" van het Lab

Een van de coolste functies van ProofWala is hoe het omgaat met "parallelle bewijszoektocht".

  • De Analogie: Stel je voor dat je de uitgang probeert te vinden in een enorme, donkere doolhof.
    • Oude Methode: Je stuurt één persoon naar binnen. Die probeert een pad. Als het een doodlopend pad is, komt diegene terug, reset en probeert het volgende pad. Dit duurt eeuwig.
    • ProofWala Methode: Het systeem kan het doolhof en de ontdekkingsreiziger klonen. Het maakt 10, 20 of 100 identieke kopieën van het doolhof en stuurt tegelijkertijd een kloon over elk mogelijk pad.
    • Hoe het werkt: Het framework creëert "pools" van identieke bewijsomgevingen. Het voert veel "wat als"-scenario's gelijktijdig uit. Als één pad mislukt, maakt dat niet uit; de andere klonen blijven verder zoeken. Dit maakt de zoektocht naar een oplossing ongelooflijk snel en efficiënt.

3. De "Brein"-training: Meertalig Leren

De onderzoekers hebben deze toolkit gebruikt om een AI-model (een "brein") te trainen om de volgende stap in een bewijs te voorspellen.

  • Het Experiment: Ze trainden drie soorten breinen:
    1. Eén die alleen Lean leerde.
    2. Eén die alleen Rocq leerde.
    3. Eén die beide talen gemengd leerde (Meertalig).
  • Het Resultaat: Het "Meertalige" brein bleek het slimst te zijn. Ondanks dat het twee verschillende talen leerde, begon het patronen te herkennen die in beide talen voorkwamen.
    • De Analogie: Het is als een student die zowel Frans als Spaans leert. Hoewel de woorden verschillend zijn, beseft de student dat de grammaticaregels voor de "verleden tijd" vergelijkbaar zijn. Dit helpt hen om beide talen sneller en beter te leren dan wanneer ze slechts één taal hadden gestudeerd.
    • Het Bewijs: Bij het testen op de moeilijkste wiskundige problemen (de "Mathlib" benchmark) en in een gespecialiseerd veld genaamd "Categorietheorie", maakte het Meertalige brein aanzienlijk minder fouten dan de enkelvoudige-taal breinen. Het toonde aan dat het leren van meerdere "wiskundige talen" de AI helpt de onderliggende logica beter te begrijpen.

4. De "Röntgenblik": De Structuur Zien

ProofWala voert de bewijzen niet alleen uit; het laat onderzoekers ook in de machine kijken.

  • De Tool: Ze hebben een visueel dashboard gebouwd (zoals Google Maps voor wiskundige code) dat laat zien hoe verschillende wiskundige definities van elkaar afhankelijk zijn.
  • Het Voordeel: In plaats van alleen te zien of een bewijs werkte (een "Ja/Nee"-antwoord), kunnen onderzoekers zien hoe de AI dacht. Ze kunnen de "boom" van beslissingen visualiseren die de AI nam, waarbij ze zien welke paden het heeft geprobeerd en welke werkten. Dit maakt de "black box" van AI-redeneren transparant en begrijpelijk.

Samenvatting van Claims

Het artikel beweert dat:

  1. ProofWala een nieuw, open-source framework is dat de interactie met Lean en Rocq verenigt.
  2. Het metaprogrammering (code die code schrijft) gebruikt om diep te integreren met de wiskundige engines, wat zorgt voor snelle, parallelle verwerking en diepe structurele analyse.
  3. Het trainen van een AI op zowel Lean als Rocq data tegelijkertijd leidt tot betere prestaties dan trainen op slechts één taal, wat bewijst dat "cross-lingual" transfer werkt in formele wiskunde.
  4. Het systeem een schaalbare, parallelle zoekmethode biedt die veel sneller is dan eerdere single-threaded benaderingen.
  5. Alle tools, data en getrainde modellen open-source zijn, zodat iedereen deze "universele toolkit" kan gebruiken om betere wiskundige bewijs-robots te bouwen.

Kortom, ProofWala is het "Zwitserse zakmes" dat onderzoekers er eindelijk in staat stelt om wiskundige oplossende AI te bouwen, te trainen en te testen over verschillende talen heen op een verenigde, snelle en transparante manier.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →