← Nieuwste papers
💻 computer science

ITPEval: Benchmarking Formal Translation Across Interactive Theorem Provers

Dit artikel introduceert ITPEval, de eerste benchmark en verenigde infrastructuur voor het evalueren van geautomatiseerde formele bewijsvertaling over vier belangrijke interactieve bewijsvoerders, waarbij wordt onthuld dat huidige grote taalmodellen aanzienlijk moeite hebben met bewijsvertaling vanwege mismatches in bibliotheken en dat native type-checking alleen vaak de semantische getrouwheid overschat.

Oorspronkelijke auteurs: Jiayi Wu, Robert Joseph George, Anima Anandkumar

Gepubliceerd 2026-07-23
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiayi Wu, Robert Joseph George, Anima Anandkumar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin wiskundigen vier verschillende talen spreken, maar ze proberen allemaal exact dezelfde puzzels op te lossen. In de hooggespannen arena van "formeel bewijzen" fungeren computers als de ultieme scheidsrechters, die elke individuele stap van een wiskundig bewijs controleren om te garanderen dat het 100% correct is. Echter, net zoals mensen die Frans, Japans, Swahili en Arabisch spreken, hebben deze computersystemen (genaamd Interactive Theorem Provers, of ITP's) hun eigen unieke grammatica, vocabulaire en bibliotheken met vooraf goedgekeurde feiten. Een bewijs dat perfect is geschreven in het ene systeem, is vaak onbegrijpelijk voor de anderen. Dit creëert een eenzaam probleem: als een briljant bewijs in één taal is geschreven, kan het niet gemakkelijk door de anderen worden gebruikt of gecontroleerd. Wetenschappers proberen "universele vertalers" te bouwen om deze kloof te overbruggen, in de hoop dat Kunstmatige Intelligentie (AI) deze wiskundige bewijzen automatisch kan leren vertalen, zodat de hele gemeenschap hun werk kan delen.

Maak kennis met ITPEVAL, een nieuwe studie die fungeert als een massaal, rigoureus taalexamen voor AI. De onderzoekers wilden zien of de slimste AI-modellen van vandaag daadwerkelijk wiskundige bewijzen tussen vier belangrijke systemen konden vertalen: Lean 4, Rocq, Isabelle en HOL Light. Ze vroegen de AI niet alleen om te gokken; ze bouwden een gespecialiseerde testomgeving met meer dan 1.500 bronbestanden en bijna 7.000 stellingen. Ze verdeelden de test in twee niveaus: een "Gecontroleerd" niveau met eenvoudige, op zichzelf staande wiskundige problemen (zoals een woordenschatquiz zonder externe referenties), en een "Ecosysteem"-niveau dat gebruikmaakt van echte, rommelige bibliotheekcode die steunt op complexe, systeem-specifieke regels (zoals een volledig gesprek met straattaal en culturele referenties).

De resultaten waren een mix van "niet slecht" en "nog steeds erg moeilijk". Wanneer de AI probeerde alleen de stellingen van de bewijzen te vertalen (het "wat"), hadden de beste modellen ongeveer 29,1% goed. Maar toen de AI werd gevraagd om de daadwerkelijke bewijzen te vertalen (het "hoe"), stortte het succespercentage naar slechts 10,5%. De studie vond dat de grootste hindernis niet de wiskunde zelf of de verschillende logische fundamenten waren; het was het "ecosysteem". De AI had de meeste moeite wanneer het moest navigeren door de specifieke bibliotheken, naamgevingsconventies en automatisatiestijlen van het doel systeem. Het is alsof de AI de zin "De kat zat op de mat" kon begrijpen, maar faalde wanneer het werd gevraagd dit te vertalen naar een specifiek dialect dat een specifiek merk mat en een specifiek type kat vereiste.

Bovendien ontdekten de onderzoekers dat het simpelweg krijgen van een computer om te zeggen "Dit ziet er correct uit" (een type-check) niet genoeg is. Ze voerden een diepere "betekeniscontrole" uit en ontdekten dat zelfs wanneer de vertaling van de AI de basiscontrole van de computer doorstond, deze in 46% van de gevallen wiskundig zwakker of licht anders was dan het origineel. De studie suggereert dat hoewel AI beter wordt in de basis, het nog steeds moet leren hoe het zich moet aanpassen aan de unieke "cultuur" van elk wiskundig systeem voordat het echt een universele vertaler kan zijn. De auteurs verkenden ook een "round-trip" test, waarbij ze wiskunde naar natuurlijke taal vertaalden en weer terug, waarbij ze vonden dat de resultaten sterk varieerden afhankelijk van welk systeem werd gebruikt, wat erop wijst dat het gebruik van meerdere systemen samen zou kunnen helpen, maar dat het nog geen magische oplossing is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →