MioFFAn: an Annotation Software for Formula Formalization with LLM Automation Capabilities
Dit artikel introduceert MioFFAn, een open-source, aanpasbaar annotatieframework dat de MioGatto-architectuur uitbreidt om de creatie van hoogwaardige datasets voor formuleformalisatie te vergemakkelijken door menselijke annotatie te combineren met modulaire automatisering door Large Language Models.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar de aanwijzingen zijn geschreven in een geheime code die alleen een computer kan lezen, terwijl het verhaal is geschreven in een taal die alleen mensen begrijpen. Dit is de dagelijkse strijd van wetenschappers die papers vol schrijven met complexe wiskunde. Ze gebruiken prachtige, elegante formules om te beschrijven hoe de wereld werkt, maar deze formules zijn vaak slechts "plaatjes" van wiskunde—zoals een tekening van een brug. Om die brug daadwerkelijk te bouwen, heeft een computer de blauwdrukken nodig: de specifieke instructies, variabelen en logica die een machine precies vertellen hoe de spanning op het staal moet worden berekend. Dit proces van het omzetten van een "plaatje" van wiskunde naar "blauwdrukken" voor een computer wordt Formula Formalization genoemd.
Het probleem is dat computers, zelfs de superintelligente computers die worden aangedreven door Kunstmatige Intelligentie (AI), vreselijk slecht zijn in het zelfstandig lezen van deze blauwdrukken. Ze hebben een enorme bibliotheek aan voorbeelden nodig—duizenden paren van "wiskundig plaatje" en "computer blauwdruk"—om te leren vertalen. Maar hier komt de crux: niemand heeft deze bibliotheek nog gebouwd omdat het extreem moeilijk en saai is om te creëren. Mensen moeten elke individuele wiskundige symbool uit een paper handmatig herschrijven naar code, een taak die zo eentonig is dat het de wetenschappelijke vooruitgang vertraagt. Het is alsof je een robot probeert te leren koken door elk recept van elke gerecht ter wereld handmatig, ingrediënt voor ingrediënt, vanaf nul te herschrijven.
Hier komt een nieuwe tool genaamd MioFFAn om de hoek kijken. Beschouw dit als een high-tech, interactief notitieblok ontworpen om de saaie taak van het vertalen van wathsunde naar code veel sneller en minder pijnlijk te maken. De onderzoekers achter dit project hebben niet alleen een statische tool gebouwd; ze hebben een "human-in-the-loop" systeem gebouwd. Dit betekent dat de software fungeert als een slimme assistent die de vertaling raadt met behulp van AI, maar vervolgens een menselijke expert vraat om de fouten te controleren en te corrigeren. Het is alsof je een robot hebt die een brief voor je kan opstellen, maar je moet hem nog steeds ondertekenen en controleren of de feiten kloppen voordat je hem verstuurt. Door deze team-up benadering te gebruiken, laten de auteurs zien dat we die cruciale bibliotheek van wiskunde-naar-code voorbeelden veel sneller kunnen opbouwen dan voorheen, wat de deur opent voor computers om eindelijk de complexe wiskunde te begrijpen en uit te voeren die de drijvende kracht is achter de moderne wetenschap.
Het Verhaal van de Paper: Een Brug Bouwen tussen Wiskunde en Code
De paper introduceert MioFFAn, een stuk open-source software ontworpen om onderzoekers te helpen bij het annoteren van wetenschappelijke documenten. Het hoofddoel is het faciliteren van Formula Formalization, wat de handeling is van het nemen van een wiskundige expressie uit een paper en het omzetten daarvan in uitvoerbare symbolische code (zoals code die je in een computer algebra systeem zou schrijven). De auteurs stellen dat hoewel we geweldige tools hebben om documenten te scannen en tekst te lezen (OCR), we de "semantische diepte" missen om die gescande formules om te zetten in code die een computer daadwerkelijk kan uitvoeren.
Om dit op te lossen, hebben de auteurs MioFFAn gebouwd bovenop een oudere tool genaamd MioGatto. Ze realiseerden zich dat de oude tool goed was in het identificeren van individuele wiskundige symbolen (zoals de letter ), maar slecht was in het afhandelen van complexe groepen symbolen (zo[en] als een hele functie of een tensor ) en niet de flexibele, hiërarchische annotatie toeliet die nodig is voor de echte wereld van de wetenschap. MioFFAn lost dit op door verschillende belangrijke upgrades te introduceren:
- Groepering en Hiërarchie: In plaats van alleen losse letters te labelen, laat MioFFAn gebruikers toe om hele blokken van een formule als één eenheid te selecteren. Het behandelt een complexe expressie als een "groep" die nog steeds kan worden opgedeeld in haar onderdelen indien nodig.
- Aanpasbare Regels: De software is een kameleon. Het stelt gebruikers in staat om hun eigen "taxonomieën" (regels en categorieën) te definiëren voor verschillende wetenschappelijke velden. Bijvoorbeeld, een natuurkundige heeft misschien de behoefte om een variabele als een "vector" te labelen, terwijl een bioloog een "concentratie" moet labelen. De tool past zich aan deze behoeften aan.
- Contextuele Gronding: Het helpt om de wiskundige symbolen te koppelen aan de tekst in het document waar ze worden uitgelegd. Als een paper zegt "laat de snelheid zijn", helpt de tool je om die zin te markeren en te verbinden met het symbool in de formule.
- De "Human-in-the-Loop" Automatisering: Dit is het meest opwindende deel. De software bevat een functie waarbij een AI (specifiek een Large Language Model, of LLM) eerst probeert de annotatie te doen. Het suggereert welke delen van de formule wat zijn, wat de variabelen betekenen en waar ze in de tekst worden gedefieerd. De menselijke gebruiker wordt echter niet vervangen; hij fungeert als een supervisor. Zij beoordelen de suggesties van de AI, corrigeren eventuele fouten en bevestigen het eindresultaat.
De auteurs hebben dit systeem getest met behulp van een specifiek wetenschappelijk veld genaamd Finite Element Methods (FEM), dat wordt gebruikt voor het simuleren van zaken zoals hoe een auto crasht of hoe een brug doorbuigt. Ze hebben de software ingesteld om de specifieke wiskundige regels van FEM te begrijpen en voerden vervolgens een "proof-of-concept" experiment uit. Ze voedden de software met wetenschappelijke papers en lieten de AI proberen deze te annoteren, en vergeleken vervolgens het werk van de AI met een "gouden standaard" gecreëerd door menselijke experts.
De resultaten waren een mix van belofte en realiteit. De AI was verrassend goed in sommige dingen, maar worstelde met andere. Bijvoorbeeld, wanneer de AI de oorspronkelijke wiskundige symbolen mocht zien (zoals de Griekse letter ), deed het het veel beter bij het identificeren van de onderdelen van de formule (ongeveer 57,7% dekking) vergeleken met wanneer de symbolen werden vervangen door lange tekstnamen (waarbij de dekking daalde naar 36,2%). De AI was echter nog steeds niet perfect; het had vaak moeite met het exact aanwijzen van de locatie van de tekstdefinities in het document, waarbij het soms hele paragrafen markeerde in plaats van alleen de specifieke zin.
De paper sluit expliciet de mogelijkheid uit dat AI dit werk momenteel perfect zelfstandig kan doen. De auteurs stellen dat de geautomatiseerde resultaten "ver van ideaal" zijn en alleen als een "baseline" gebruikt moeten worden die een menselijke expert snel verfijnt. Ze betogen dat het proberen te gebruiken van AI voor een volledig automatische, end-to-end vertaling zonder menselijke controle waarschijnlijk zou leiden tot fouten die moeilijk te ontdekken zijn.
In hun evaluatie vonden de auteurs dat de "Original Characters" aanpak (het behouden van de wiskundige symbolen zoals ze zijn) het beste werkte voor de AI om de structuur van de wiskunde te begrijpen. Ze vergeleken ook drie verschillende AI-modellen (NVIDIA's Nemotron, Google's Gemma en Alibaba's Qwen) en vonden dat het Qwen3-4B-Instruct-2507 model aanzienlijk beter presteerde dan de anderen, met een dekking van 57,7% bij de identificatie van symbolen, vergeleken met ongeveer 33,9% voor het op één na beste model.
Uiteindelijk suggereert de paper dat MioFFAn een krachtige "speeltuin" is voor het ontwikkelen van betere automatiseringstrategieën. Het beweert niet het probleem van het vertalen van wiskunde naar code voor altijd te hebben opgelost. In plaats daarvan biedt het een flexibel framework waar onderzoekers verschillende AI-strategieën kunnen testen, kunnen zien wat werkt, en het systeem geleidelijk kunnen verbeteren. De auteurs concluderen dat hoewel de huidige automatisering slechts een "voorlopige" stap is, deze samenwerking tussen mens en AI de meest effectieve manier is om de hoogwaardige datasets te bouwen die nodig zijn om toekomstige, intelligentere systemen te trainen. Ze voorzien een toekomst waarin deze tool helpt bij het bouwen van een enorme, gedeelde bibliotheek van wiskunde-naar-code vertalingen, waardoor het makkelijker wordt voor computers om wetenschappers te helpen bij het oplossen van de meest complexe problemen ter wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.