← Nieuwste papers
🤖 AI

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Het artikel introduceert Mask-Proof, een geautomatiseerde datacuratiepijplijn die echte wiskundige bewijzen transformeert naar gemaskeerde stap-taken die worden geëvalueerd door een op een LLM gebaseerde rechter, wat resulteert in de Mask-ProofBench-dataset die aantoont dat redeneringsversterkte modellen standaardmodellen significant overtreffen in stapsgewijze wiskundige redenering met een hoge overeenstemming met expertannotaties.

Oorspronkelijke auteurs: Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

Gepubliceerd 2026-06-16
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij complexe wiskundige problemen moet oplossen. Je hebt een stapel briljante, wetenschappelijke wiskundepapers van menselijke experts. Je wilt weten: "denkt" de robot echt door de logica heen, of raadt hij alleen het volgende woord op basis van patronen die hij eerder heeft gezien?

Het artikel "Mask-Proof" introduceert een nieuwe manier om dit te testen, genaamd Mask-Proof. Hier is hoe het werkt, uitgelegd aan de hand van eenvoudige analogieën.

1. Het Probleem: De "Invul-de-blanco" Valstrik

Normaal gesproken testen we AI op wiskunde door de AI een hele som te laten oplossen en het eindantwoord te controleren. Maar voor lange, complexe bewijzen is dit vergelijkbaar met een leerling vragen een hele essay te schrijven en vervolgens alleen de laatste zin te beoordelen. De AI kan het juiste einde bereiken door geluk of door een patroon te kopiën, zelfs als het midden van het essay nergens op slaat.

De auteurs realiseerden zich dat om "redeneren" echt te testen, we naar de tussenstappen moeten kijken. Maar er is een addertje onder het gras:

  • Het "Ontbrekende Context"-probleem: Echte wiskundige papers zeggen vaak dingen als "Zoals aangetoond in Lemma 2.3..." of "Gebruikmakend van de definitie van X." Als je zomaar een willekeurige zin uit een paper haalt en de AI vraagt deze in te vullen, kan de AI falen, niet omdat hij slecht is in wiskunde, maar omdat de zin steunt op informatie die niet in de vraag staat.
  • Het "Makkelijk Raden"-probleem: Als je een heel overduidelijk deel van een formule verbergt (zoals 2+2=2+2=), kan de AI dit raden zonder na te denken. Dat bewijst niet dat de AI slim is.

2. De Oplossing: De "Slimme Editor" Pipeline

De auteurs hebben een geautomatiseerd systeem gebouwd (een pipeline) dat fungeert als een super-slimme editor om deze rommelige onderzoekspapers om te zetten in eerlijke tests. Dit is het driestaps-proces:

  • Stap 1: De "Zelfvoorzienende" Fix (Het gereedschap verzamelen)
    Voordat de AI wordt getest, scant het systeem het paper om elke definitie, lemma of regel te vinden die de specifieke bewijsstap nodig heeft. Het verzamelt al deze "gereedschappen" en voegt ze toe aan de vraag.

    • Analogie: Stel je voor dat je iemand vraagt een automotor te repareren. Als je ze alleen een moersleutel geeft en zegt "repareer dit", kunnen ze falen omdat ze de handleiding of de andere gereedschappen niet hebben. De "Zelfvoorzienende" stap zorgt ervoor dat de AI de volledige gereedschapskist en de handleiding direct voor zich heeft liggen, zodat ze falen omdat ze niet weten hoe ze de tools moeten gebruiken, en niet omdat de tools ontbraken.
  • Stap 2: De "Strategische Maskering" (Het moeilijke deel verbergen)
    In plaats van een willekeurig woord te verbergen, gebruikt het systeem een AI-agent om de meest cruciale, moeilijkste stap in het bewijs te vinden—het deel waar de echte logica plaatsvindt. Het dekt deze specifieke stap af met een zwart blok (een "masker").

    • Analogie: Denk aan een goocheltruc. Een slechte test zou de truc verbergen waarbij de goochelaar een kaart in zijn hand houdt (te overduidelijk). Een goede test verbergt het moment waarop de goochelaar van kaart wisselt. Het systeem verbergt de "magische beweging" (de complexe wiskundige stap), zodat de AI moet uitzoeken hoe de truc werkt, in plaats van alleen het resultaat te raden.
  • Stap 3: De "Dubbelcheck" Rechter
    Wanneer de AI probeert de blanco in te vullen, controleert het systeem niet alleen of de letters exact overeenkomen. Wiskunde is flexibel; x+yx+y is hetzelfde als y+xy+x. Het systeem gebruikt een speciale "Judge AI" die naar de betekenis van het antwoord kijkt. Om er zeker van te zijn, vraagt het systeem de "Judge" om meerdere keren over het antwoord te stemmen om fouten door willekeurig raden te voorkomen.

3. Wat Ze Vonden (De Resultaten)

De auteurs creëerden een testbank genaamd Mask-ProofBench met 292 van deze "gemaskeerde" problemen uit echte onderzoekspapers. Ze testten 17 verschillende AI-modellen.

  • De "Denkende" Modellen Winnen: Modellen die zijn ontworpen om stap-voor-stap te "denken" (Reasoning-enhanced modellen) scoorden aanzienlijk beter (12% tot 27% hoger) dan standaardmodellen die alleen antwoorden uitspugen.
  • De "Willekeurige" Test Faalt: Wanneer ze probeerden de AI te testen door willekeurige delen van de wiskunde te verbergen (in plaats van de strategische delen), schoten de scores omhoog, maar het verschil tussen slimme en minder slimme modellen verdween. Dit bewees dat hun "Strategische Maskering"-methode de enige is die daadwerkelijk laat zien wie goed is in redeneren.
  • Menselijke Overeenstemming: Hun geautomatiseerde "Judge" stemde in 96,8% van de gevallen overeen met menselijke wiskundige experts. Dit betekent dat de computer bijna net zo goed is als een menselijke professor bij het beoordelen van deze specifieke stappen.

Samenvatting

Mask-Proof is een nieuwe manier om AI te beoordelen op wiskundige bewijzen. In plaats van de AI een heel essay te laten schrijven en te gokken of hij het midden begreep, doet het systeem het volgende:

  1. Het verzamelt alle noodzakelijke achtergrondinformatie zodat de AI niet in de war raakt.
  2. Het verbergt de moeilijkste, belangrijkste stap van het bewijs.
  3. Het vraagt de AI om die specifieke kloof in te vullen.

Als de AI in staat is om die kloof correct in te vullen, bewijst dat de AI de logica daadwerkelijk begrijpt, en niet alleen het patroon volgt. Dit helpt onderzoekers om betere, betrouwbaardere AI voor de wetenschap te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →