CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean
Dit artikel introduceert CAM-Bench, een nieuwe Lean 4-benchmark bestaande uit 1.000 geformaliseerde problemen in computationele en toegepaste wiskunde die de ondervertegenwoordiging van deze domeinen in bestaande evaluaties aanpakt door gebruik te maken van een dependency-recovery-pijplijn om oefeningen uit leerboeken aan te passen en de prestaties van grote taalmodellen te analyseren op taken die lokale contextvolging en toepassing van elementaire stellingen vereisen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een briljante maar letterlijk denkende robot wiskunde te leren. Je hebt twee manieren om het te testen:
- De "Antwoorden" Test: Je geeft de robot een wiskundig probleem en het schrijft het eindgetal op. Als het getal klopt, krijg je een gouden ster. Dit is hoe de meeste huidige AI-wiskundetesten werken.
- De "Stap-voor-stap" Test: Je vraagt de robot om elke enkele logische stap op te schrijven, zoals een bewijs in een leerboek, en vervolgens controleer je of elke stap logisch onbreekbaar is. Dit is veel moeilijker, maar het bewijst dat de robot de wiskunde echt begrijpt, en niet alleen het antwoord raadt.
Dit artikel introduceert een nieuwe, super-zware "Stap-voor-stap" test genaamd CAM-Bench.
Het Probleem: De Robot Kent Alleen "Olympiade"-wiskunde
Momenteel lijken de meeste tests voor wiskunde-AI op Olympiade-puzzels. Het zijn lastige, zelfstandige raadsels (zoals "Bewijs dat als X waar is, Y ook waar is"). De AI is hier goed in omdat het geïsoleerde logica-spelletjes zijn.
Maar echte wereldwiskunde—zoals engineering, financiën of natuurkunde—is anders. Het is meestal geen net raadsel. Het is meer als een recept volgen uit een kookboek.
- Het recept (het probleem) gaat ervan uit dat je al weet wat "fruiten" betekent.
- Het gaat ervan uit dat je een specifiek type pan hebt (een definitie uit Hoofdstuk 3).
- Het gaat ervan uit dat je weet hoe je uien snijdt (een algoritme uit Hoofdstuk 1).
Als je de robot alleen de laatste zin van het recept geeft ("Maak de soep"), raakt het in de war omdat het niet de "lokale context" heeft (de definities, de tools, de vorige stappen) die de oorspronkelijke auteur ervan uitging dat je had.
CAM-Bench is ontworpen om te testen of AI deze "kookboekstijl" wiskunde aankan, specifiek op gebieden zoals optimalisatie (de beste manier vinden om iets te doen), numerieke lineaire algebra (wiskunde doen met enorme roosters van getallen) en numerieke analyse (benaderingen van oplossingen).
De Oplossing: De "Context-Detective" Pipeline
De auteurs hebben niet zomaar problemen uit leerboeken gepakt en aan de AI gegeven. Ze bouwden een geavanceerde pipeline (een fabriekslijn) om de problemen voor te bereiden. Denk hierbij aan een Context-Detective:
- De Ruwe aanwijzing: Ze beginnen met een rommelig leerboekoefening dat zegt: "Gebruik Algoritme 16.4 om Probleem 16.76 op te lossen."
- Het Detectivewerk: De pipeline gaat terug in het boek om uit te zoeken wat "Algoritme 16.4" eigenlijk is. Het graaft definities, formules en aannames op die verborgen zitten in eerdere hoofdstukken.
- De Reconstructie: Het naait al deze verspreide stukjes samen tot één grote, zelfstandige "informele stelling". Het is alsof je een recept dat zegt "voeg de geheime saus toe" herschrijft als "voeg de saus toe gemaakt van tomaten, basilicum en knoflook."
- De Vertaling: Totale vertaalt het dit schone, zelfstandige verhaal naar Lean, een strikte computertaal die fungeert als een super-pedant wiskundeleraar. Als de logica zelfs maar één klein gaatje heeft, verwierpt Lean het.
De Resultaten: De AI zit vast in het "Kookboek"
De auteurs testten enkele van 's werelds slimste AI-modellen op deze nieuwe benchmark. Dit is wat er gebeurde:
- De "Antwoorden" Kloof: De AI-modellen waren eigenlijk best goed in het oplossen van de problemen in plat Engels (het juiste antwoord krijgen). Maar toen ze het bewijs in Lean moesten schrijven (de strikte taal), stortte hun succespercentage in.
- Analogie: Het is alsof de AI je kan vertellen hoe je een taart bakt in een gesprek, maar als je het vraagt om de instructies te schrijven voor een robot die niets mag raden, verbrandt de robot de keuken.
- De "Lokale Context" Mislukking: De AI bleef de "lokale regels" vergeten. Het probeerde een tool te gebruiken die niet bestond in het huidige hoofdstuk, of het miste een kleine aanname (zoals "het getal moet positief zijn") die het leerboek impliceerde maar niet expliciet in die specifieke zin stelde.
- Het "Lange Keten" Probleem: Echte wiskundeproblemen vereisen vaak een lange keten van kleine stappen (zoals een huis bouwen steen voor steen). De AI-modellen raakten vaak kwijt in het midden van de keten, vergeten wat ze aan het bouwen waren of verloor de controle over het langetermijndoel.
De "Agent" Upgrade
De onderzoekers probeerden ook een geavanceerdere methode waarbij de AI fungeert als een menselijke detective met een gereedschapskist. In plaats van alleen het antwoord te raden, mag de AI:
- De computer (Lean) om hulp vragen als het een fout maakt.
- Zijn eigen werk controleren.
- Opnieuw proberen op basis van het foutbericht.
Deze "Agent"-aanpak werkte veel beter, waardoor het succespercentage verdubbelde. Het was echter nog lang niet perfect, en het kostte veel meer "hersencapaciteit" (computertokens) om het uit te voeren.
De Conclusie
CAM-Bench toont aan dat AI, hoewel het goed wordt in het oplossen van wiskundige raadsels, nog steeds worstelt met toegepaste wiskunde die vereist dat men context begrijpt, lokale regels onthoudt en lange, logische argumenten stap voor stap opbouwt.
Het artikel concludeert dat we, om AI echt betrouwbaar te maken voor wereldwiskunde, moeten stoppen met het testen op geïsoleerde raadsels en moeten beginnen met het testen op deze rommelige, context-zware "kookboek"-problemen. De huidige modellen zijn als studenten die antwoorden kunnen memoriseren, maar nog niet hebben geleerd hoe ze een huis vanaf de grond af moeten bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.