← Nieuwste papers
🤖 AI

LeanSearch v2: Global Premise Retrieval for Lean 4 Theorem Proving

LeanSearch v2 is een tweemodi-terugvindsysteem dat state-of-the-art prestaties bereikt bij het identificeren van de volledige set bibliotheeklemma's die vereist zijn voor Lean 4-bewijzen, bestaande semantische zoek- en premisse-selectie-tools aanzienlijk overtreft en de downstream bewijssuccespercentages direct verbetert.

Oorspronkelijke auteurs: Guoxiong Gao, Zeming Sun, Jiedong Jiang, Yutong Wang, Jingda Xu, Peihao Wu, Bryan Dai, Bin Dong

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Guoxiong Gao, Zeming Sun, Jiedong Jiang, Yutong Wang, Jingda Xu, Peihao Wu, Bryan Dai, Bin Dong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorm, complex legpuzzel op te lossen. Je hebt een gigantische doos met 100.000 stukjes (de Mathlib-bibliotheek), en je doel is om een specifiek plaatje te bouwen (een wiskundig bewijs).

Het probleem is niet dat je de stukjes niet hebt; het is dat de stukjes door de kamer verspreid liggen, en de instructies zeggen niet: "Gebruik hier het blauwe luchtpartij-stukje." In plaats daarvan moet je zelf uitzoeken dat een stukje over "meetkundige sommen" en een stukje over "cyclotomische polynomen" (die volledig ongerelateerd klinken) eigenlijk passen om je specifieke probleem op te lossen.

Dit is de uitdaging die het artikel aanpakt. Het introduceert LeanSearch v2, een nieuw hulpmiddel dat is ontworpen om de juiste puzzelstukjes te vinden voor wiskundigen die werken met de computer taal Lean 4.

Hier is hoe het artikel dit uiteenlegt, met behulp van eenvoudige analogieën:

1. Het Probleem: "Globale Premise Retrieval"

De auteurs zeggen dat bestaande hulpmiddelen lijken op twee verschillende soorten helpers, maar dat geen van beide perfect is:

  • De Semantische Zoekmachine: Dit is als een bibliothecaris die een enkel boek vindt dat overeenkomt met een trefwoord. Als je vraagt om " priemgetallen", vindt het boeken over priemgetallen. Maar het weet niet dat je drie specifieke stellingen nodig hebt uit drie verschillende secties van de bibliotheek om je puzzel op te lossen.
  • De Premise Selector: Dit is als een tutor die je helpt met één stap van de puzzel tegelijk. Ze zeggen: "Oké, voor deze specifieke zet, gebruik dit stukje." Maar ze zien het hele plaatje niet. Ze weten niet dat je een route door de bibliotheek moet plannen die drie verre ideeën verbindt om de klus te klaren.

Het artikel noemt de ontbrekende vaardigheid "Globale Premise Retrieval". Het is het vermogen om naar een probleem te kijken en te zeggen: "Om dit op te lossen, moet ik deze drie specifieke, ogenschijnlijk ongerelateerde lemma's uit de bibliotheek halen en aan elkaar koppelen."

2. De Oplossing: LeanSearch v2

De auteurs bouwden een systeem met twee modi om dit op te lossen, dat fungeert als een slimme onderzoeksassistent met twee verschillende persoonlijkheden.

Modus A: De "Standaardmodus" (De Superbibliothecaris)

Dit is de basis. Het fungeert als een hogesnelheidszoekmachine voor de bibliotheek.

  • Hoe het werkt: Het neemt de volledige bibliotheek van meer dan 100.000 wiskundige declaraties en vertaalt deze van "computercode" naar "mensvriendelijke beschrijvingen". Het gebruikt vervolgens een tweestapsproces:
    1. Embedding: Het zet elke tekst om in een wiskundig "vingerafdruk" om vergelijkbare concepten te vinden.
    2. Reranking: Het neemt de top 50 matches en gebruikt een tweede, slimmere AI om ze opnieuw te sorteren, waarbij de absolute beste worden geselecteerd.
  • Het Resultaat: Het vindt het juiste stukje informatie beter dan enig vorig hulpmiddel, zelfs zonder specifiek te zijn getraind op wiskundedata. Het is alsof je een bibliothecaris hebt die de bibliotheek zo goed kent dat hij het exacte boek dat je nodig hebt kan vinden, alleen al door een vaag beschrijving ervan te horen.

Modus B: De "Redeneringsmodus" (De Detective)

Dit is de grote innovatie. Het zoekt niet alleen naar één stukje; het probeert de hele set stukjes te vinden die nodig zijn voor een bewijs.

  • Hoe het werkt: Het gebruikt een "Schets-Haal-Reflecteer"-lus, wat lijkt op een detective die een mysterie oplost:
    1. Schets: De AI doet een gok naar het "verhaal" van het bewijs (bijv. "Eerst doen we X, dan gebruiken we Y, dan Z").
    2. Haal: Het gebruikt de bibliothecaris van de "Standaardmodus" om de daadwerkelijke stukjes te vinden voor elke stap van dat verhaal.
    3. Reflecteer: Een "Rechter"-AI bekijkt de resultaten. Pasten de stukjes? Als de bibliothecaris geen stukje kon vinden voor stap Y, zegt de Rechter: "Dat verhaal werkt niet."
    4. Herzien: De AI gaat terug, verandert het verhaal (de schets) en probeert het opnieuw.
  • Het Resultaat: Het blijft in een lus totdat het een samenhangende set bibliotheeklemma's heeft gevonden die daadwerkelijk samenwerken om de stelling op te lossen.

3. Het Bewijs: Werkte het?

De auteurs testten dit systeem op twee hoofduitdagingen:

  • De Zoektest: Ze vroegen het systeem om specifieke stellingen te vinden op basis van beschrijvingen. LeanSearch v2 won, en vond het juiste antwoord vaker dan zijn concurrenten.
  • De "Globale" Test: Ze gaven het 69 moeilijke, graduate-niveau wiskundeproblemen en vroegen het om de groep lemma's te vinden die nodig waren om ze op te lossen.
    • De Concurrenten: Oude hulpmiddelen vonden de juiste groep stukjes slechts ongeveer 9% tot 38% van de tijd.
    • LeanSearch v2: Vond de juiste groep stukjes 46,1% van de tijd.
    • De "Bewijs"-test: Ze pluggen dit hulpmiddel in een robot die probeert bewijzen te schrijven. Toen de robot LeanSearch v2 gebruikte, slaagde het erin om bewijzen 20% van de tijd succesvol af te ronden. Zonder het hulpmiddel slaagde het slechts 4% van de tijd.

4. De Conclusie

Het artikel beweert dat LeanSearch v2 het eerste systeem is dat wiskundige ophaaltaken succesvol behandelt als een "redeneringstaak" in plaats van slechts een "zoekopdracht".

  • Analogie: Vorige hulpmiddelen waren als een GPS die je alleen de volgende straat kon vertellen waar je moet afslaan. LeanSearch v2 is als een GPS die de hele reis kan plannen, beseffend dat je om bij de bestemming te komen misschien een schilderachtige route moet nemen door een wijk die je niet kende, en het weet precies welke afslagen je moet nemen om daar te komen.

De auteurs benadrukken dat dit een hulpmiddel is voor oophalen (het vinden van de juiste gereedschappen), niet noodzakelijk voor het genereren van het bewijs zelf, hoewel betere ophaalresultaten duidelijk helpen om het bewijsgeneratieproces vaker te laten slagen. Ze hebben al hun code en data openbaar gemaakt zodat anderen deze "detective"-aanpak kunnen gebruiken om wiskundeproblemen op te lossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →