MathAtlas: A Benchmark for Autoformalization in the Wild
Dit artikel introduceert MathAtlas, de eerste grootschalige benchmark voor autoformalisatie die ongeveer 52.000 wiskundige concepten op doctoraatsniveau uit 103 leerboeken omvat, en die de extreme moeilijkheid blootlegt van huidige modellen bij het verwerken van complexe, afhankelijkheidsrijke onderzoekswiskunde.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een briljante vertaler hebt die menselijke verhalen kan omzetten in een strikte, door computers leesbare taal genaamd "Lean". Lang is deze vertaler alleen getest op simpele verhalen – zoals middelbare school wiskundeproblemen of basispuzzels. De computer kon deze gemakkelijk vertalen omdat de regels eenvoudig waren en de computer dergelijke regels al eerder had gezien.
Maar wat gebeurt er als je deze vertaler vraagt om een complex, op doctoraatniveau geschreven onderzoeksartikel te vertalen? Dat is het probleem dat MathAtlas aanpakt.
Hier is een eenvoudige uiteenzetting van wat het artikel doet, met behulp van alledaagse analogieën:
1. Het Probleem: De "Bibliotheek" is Te Groot
Stel je voor dat je een huis (een formeel bewijs) probeert te bouwen op basis van een blauwdruk (een wiskundeleerboek).
- Oude Benchmarks: Eerdere tests vroegen de vertaler alleen om een klein schuurtje te bouwen. Het materiaal lag allemaal in de gereedschapskist en de instructies waren kort.
- De Realiteit: Gevorderde wiskunde is als het bouwen van een wolkenkrabber. Om de bovenste verdieping te bouwen, heb je de 50e verdieping nodig. Om de 50e verdieping te bouwen, heb je de 49e nodig, en zo verder, helemaal tot aan de fundering.
- Het Probleem: In geavanceerde wiskunde is de "fundering" (definities en theorieën) vaak nog niet in de taal van de computer gebouwd. Als de vertaler de definitie van een "Lie-algebra" (een complex concept) niet kent, kan hij de stelling die het gebruikt niet vertalen.
2. De Oplossing: MathAtlas (De "Wilde" Kaart)
De auteurs hebben MathAtlas gecreëerd, een enorme nieuwe testset.
- De Schaal: Ze hebben 103 wiskundige leerboeken op doctoraatniveau gescrapt. Het is alsof je een bibliotheek van 52.000 pagina's geavanceerde wiskunde hebt genomen en dit hebt omgezet in een digitale kaart.
- Het "Afhankelijkheidsgrafiek": Dit is de superkracht van het artikel. Stel je een "Kies je Eigen Avontuur"-boek voor waarbij elke pagina pijlen heeft die verwijzen naar andere pagina's die je eerst moet lezen. MathAtlas tekent deze pijlen. Het toont dat je om Propositie 15 te begrijpen, eerst Dedekindringen moet begrijpen, die op hun beurt * priemidealen* nodig hebben.
- Waarom dit belangrijk is: Het dwingt de AI niet alleen om één zin te vertalen, maar om uit te zoeken: "Heb ik de tools om dit te bouwen? Zo niet, kan ik dan eerst de tools vinden of bouwen?"
3. De Resultaten: De AI zit in de Modder
De auteurs hebben de slimste beschikbare AI-modellen getest op MathAtlas, en de resultaten waren vernederend.
- De Score: Zelfs de beste AI haalde minder dan 10% van de stellingen correct. Voor definities was dit ongeveer 16%.
- De "Diepte"-Valstrik: Hoe dieper de "afhankelijkheidsboom" (hoe meer stappen je terug moet om de definities te vinden), hoe slechter de AI presteerde.
- Analogie: Als de AI 10 eerdere concepten moet opzoeken om één zin te vertalen, raakt hij in de war en geeft het op. Bij de moeilijkste problemen (waar de afhankelijkheidsboom het diepst was), haalde de AI slechts 2,6% correct.
- Het "Mathlib"-Effect: De AI deed het iets beter wanneer het concept dat hij moest vertalen al in een beroemde bibliotheek genaamd "Mathlib" zat (wat een soort vooraf gebouwd gereedschapskist is die de AI waarschijnlijk heeft bestudeerd). Als het concept nieuw was en niet in die bibliotheek zat, had de AI veel meer moeite.
4. De "Vertrouwen"-test (MA-Align)
Het artikel creëerde ook een nieuwe test genaamd MA-Align.
- Het Probleem: Soms vertaalt een AI een zin in code die er perfect uitziet en zonder fouten draait, maar betekent het eigenlijk iets heel anders dan de oorspronkelijke wiskunde. Het is als "De kat zat op de mat" vertalen naar een computerprogramma dat zegt "De hond at de pizza". Het programma werkt, maar het is fout.
- De Test: Ze vroegen AI-rechters om te controleren of de vertaling "trouw" was (waarheidsgetrouw aan de betekenis). Ze ontdekten dat zelfs de beste AI-rechters vaak werden misleid, vooral bij complexe definities op doctoraatniveau.
De Conclusie
Het artikel concludeert dat AI, hoewel het goed wordt in simpele wiskunde, momenteel vreselijk is in het vertalen van complexe, real-world wiskunde op doctoraatniveau. De belangrijkste bottleneck is niet alleen het vertalen van woorden; het is het begrijpen van het enorme web van verbindingen tussen ideeën en het weten hoe je de nodige "tools" (definities) bouwt voordat je het "huis" (stellingen) bouwt.
MathAtlas staat nu open voor iedereen om te gebruiken als een uitdaging om AI te helpen leren hoe het deze diepe, complexe afhankelijkheden moet hanteren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.