LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning
Dit artikel behandelt het gebrek aan AI-ondersteuning voor de FORM symbolische manipulatierental door aan te tonen dat frontier large language models falen bij zero-shot FORM-taken, en introduceert vervolgens een verificatiegestuurde fine-tuning pipeline die de FORM-binary als oracle gebruikt om een compact 8B-parameter model te trainen dat veel grotere frontier modellen overtreft in code-executie en correctheid, terwijl algemene redeneerfaciliteiten behouden blijven.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de subatomaire wereld, waar deeltjes botsen en vervallen in fracties van een seconde, vertrouwen theoretisch fysici op een gespecialiseerde taal om de wiskunde van hun ontdekkingen te beschrijven. Deze taal, bekend als Form, is geen algemeen programmeergereedschap, maar een zeer specifiek systeem dat is ontworpen om algebraïsche expressies van overweldigende complexiteit te verwerken. Wanneer wetenschappers het gedrag van deeltjes berekenen met behulp van kwantumveldentheorie, kunnen de resulterende formules miljoenen of zelfs miljarden termen bevatten. Algemene computerprogramma's crashen vaak wanneer ze geconfronteerd worden met dergelijke massale berekeningen, maar Form is gebouwd om deze te beheren door tussenstappen op een harde schijf op te slaan in plaats van in het geheugen van de computer. Decennialang is dit instrument onmisbaar geweest voor het ontrafelen van de geheimen van het universum, toch blijft het moeilijk om te leren. De syntaxis is uniek, de regels zijn onvergeeflijk, en tot nu toe was er geen kunstmatige intelligentie in staat om een mens te helpen bij het schrijven van code voor deze taal.
Deze technologische kloof vormde een unieke uitdaging voor onderzoekers aan het Karlsruhe Instituut voor Technologie. Zij stelden een fundamentele vraag: kon een moderne kunstmatige intelligentie, getraind op enorme hoeveelheden internetdata, leren om code te schrijven voor een taal die nauwelijks voorkomt in die data? Het antwoord dat zij vonden, was een definitief nee. Toen zij de krachtigste, meest geavanceerde AI-modellen testten — waarvan sommige honderden miljarden parameters bevatten — faalden deze reuzen van de kunstmatige intelligentie volledig. Zonder een handleiding of een gids om naar te kijken, konden zij geen enkele regel geldige Form-code genereren. Voor de AI was deze taal effectief onzichtbaar, een domein met nul middelen waarbij de enorme omvang van het model minder belangrijk was dan de afwezigheid van specifieke training.
Om dit op te lossen, kozen de onderzoekers voor een andere aanpak. In plaats van te vertrouwen op een enorm model om de regels te raden, bouwden zij een gespecialiseerde, kleinere AI en leerden deze met behulp van een rigoureuze, zelfcorrigerende methode. Zij creëerden een pijplijn waarbij een krachtige AI kandidaat-programma's genereerde op basis van eenvoudige Engelse instructies, maar deze programma's werden niet direct vertrouwd. In plaats daarvan werden ze ingevoerd in de eigenlijke Form-software om te zien of ze correct draaiden. Als de code een fout of een verkeerd resultaat produceerde, werd deze weggegooid. Alleen de programma's die aan elke controle voldeden — syntaxis, uitvoering en logische consistentie — werden behouden. Dit proces genereerde een geverifieerde bibliotheek van meer dan 4.600 voorbeelden, variërend van eenvoudige tutorials tot complexe natuurkundige berekeningen.
Met behulp van deze hoogwaardige, geverifieerde data verfijnde het team een compact AI-model met acht miljard parameters. Het resultaat was een specialist die de grootste, duurste modellen ter wereld overtrof. Op een reeks van 664 specifieke berekeningstaken loste dit kleine, gespecialiseerde model 97,7% van hen correct op. In contrast hiermee slaagden de grootste frontier-modellen, zelfs wanneer ze een syntaxisgids kregen om te lezen, er slechts voor ongeveer 75% van dezelfde taken in om syntactisch geldige code te genereren die zonder fouten draaide. Het voordeel was nog duidelijker bij open eindtaken waarbij het doel wel werd beschreven maar de methode niet werd gespecificeerd; het gespecialiseerde model genereerde in 83% van de gevallen succesvol uitvoerbare code, terwijl de beste van de reusachtige modellen dit slechts in 65% van de gevallen wist.
Misschien wel het meest verrassend was dat de onderzoekers ontdekten dat deze gespecialiseerde training de AI niet deed "vergeten" hoe het andere dingen moest doen. Het model behield zijn algemene redeneer- en programmeervaardigheden, met slechts een minimale daling in prestaties op standaardtests voor wiskunde en logica. Dit suggereert dat het aanleren van een nieuwe, niche-vaardigheid aan een AI niet vereist dat de algemene intelligentie wordt opgeofferd. De studie toont aan dat voor zeer gespecialiseerde wetenschappelijke talen de sleutel tot succes niet de enorme omvang van het model is, maar de kwaliteit en verificatie van de data waarvan het leert. Door de software zelf te gebruiken als leraar om elke les te verifiëren, creëerden de onderzoekers een hulpmiddel dat nu natuurkundigen kan assisteren bij het schrijven van de complexe code die nodig is om de fundamentele wetten van de natuur te verkennen, waardoor de drempel voor een taal die lang een knelpunt vormde in de hogere energiefysica, wordt verlaagd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.