Technisch Overzicht: LLM-gebaseerde ontdekking van wetenschappelijke vergelijkingen via fysica-geïnformeerde token-geregulariseerde beleidsoptimalisatie
1. Probleemstelling
Symbolische Regressie (SR) streeft naar het distilleren van interpreteerbare wiskundige vergelijkingen uit observationele data, wat dient als een hoeksteen voor het ontdekken van natuurkundige wetten. Hoewel recente benaderingen gebruikmaken van Large Language Models (LLMs) om hypothesen voor vergelijkingen te genereren door te profiteren van vooraf getrainde wetenschappelijke priors, lijden bestaande kaders onder twee kritieke beperkingen:
- Statische Generatie: Huidige methoden behandelen LLM's als statische generatoren, waarbij ze vertrouwen op prompting-niveau sturing (in-context learning) om evolutionaire zoektochten te leiden. Dit paradigma faalt in het updaten van de interne representaties van het model op basis van zoekfeedback, waardoor het model niet in staat is om evaluatiesignalen te internaliseren of zijn generatiestrategie aan te passen aan specifieke probleemstructuren.
- Fysica-agnostische Zoektocht: Bestaande kaders geven vaak prioriteit aan syntactische correctheid boven fysieke validiteit. Zonder strikte beperkingen produceren LLM's vaak vergelijkingen die numeriek goed passen bij de data, maar fundamentele fysieke principes schenden (bijv. dimensionale homogeniteit) of wiskundig redundante structuren bevatten, wat leidt tot overfitting en praktische onbruikbaarheid.
De uitdaging is om de LLM te transformeren van een statische voorsteller naar een adaptieve generator die de generatieve distributie dynamisch kan afstemmen op de structurele en fysieke kenmerken van het doelsysteem.
2. Methodologie: PiT-PO
De auteurs stellen PiT-PO (Physics-informed Token-Regularized Policy Optimization) voor, een verenigd framework dat LLM-gestuurde evolutionaire exploratie koppelt aan rigoureuze verificatie. Het framework werkt via een gesloten evolutionair proces dat wordt gedreven door twee synergetische mechanismen:
2.1 In-Search LLM Evolutie
In tegenstelling tot standaardbenaderingen waarbij de LLM bevroren blijft, gebruikt PiT-PO Group Relative Policy Optimization (GRPO) om de parameters van de LLM tijdens de evolutionaire zoektocht bij te werken.
- Mechanisme: De LLM wordt behandeld als een beleid πθ die token-sequenties genereert. GRPO bemonster een groep outputs, evalueert deze en werkt de beleidsparameters bij om een surrogaatverlies te maximaliseren.
- Voordeel: Deze "in-search" fine-tuning stelt het model in staat om effectieve symbolische patronen te consolideren en de daaropvolgende exploratie efficiënter te leiden, waardoor algemene wetenschappelijke priors worden getransformeerd in domeinspecifieke expertise on the fly.
2.2 Dual-Constraint Leersignalen
Om te waarborgen dat de gegenereerde vergelijkingen zowel wetenschappelijk geldig als structureel parsimonisch zijn, introduceert PiT-PO een dual-constraint mechanisme dat fijnmazige, token-niveau feedback genereert.
A. Hiërarchische Fysieke Beperkingen
Een beloningssysteem dwingt wetenschappelijke validiteit af via een hiërarchisch filter:
- Algemeen Niveau Beperkingen: Straffen voor Dimensionale Homogeniteit (Pdim) en Differentieerbaarheid (Pdiff) om fysiek onmogelijke structuren te elimineren (bijv. eenhedenmismatches).
- Domeinspecifieke Beperkingen: Expertkennis wordt geïnjecteerd als inductieve biases. Voor turbulentiemodellering omvat dit beperkingen op Realiseerbaarheid (positieve eigenwaarden van Reynolds-spanning), Consistentie van Randvoorwaarden (verval van spanning bij wanden), Asymptotische Schaling (kubische schaling in viskeuze sublagen) en Energieconsistentie.
- Gated Activatie: Fysieke straffen worden pas geactiveerd nadat een kandidaat-vergelijking een basis drempelwaarde voor passende nauwkeurigheid heeft bereikt, wat "gratis" exploratie in de vroege stadia toestaat voordat strikte naleving wordt afgedwongen.
B. Theorema-gestuurde Wiskundige Beperkingen
Om wiskundige redundantie aan te pakken, introduceren de auteurs het Support Exclusion Theorem.
- Theorie: Dit theorema biedt een theoretische garantie om valse ontdekkingen (redundante termen) te identificeren op basis van de grootte van de gefitte coëfficiënten ten opzichte van interne en externe interferentie van andere basisfuncties.
- Token-niveau Straf: Als een term wordt geïdentificeerd als redundant (de grootte van de coëfficiënt valt onder een afgeleide drempelwaarde), wordt een token-niveau straf (Ptok) toegepast op de specifieke tokens die die term constitueren. Deze straf is logaritmisch, waarbij sterkere straffen worden opgelegd aan termen met kleinere coëfficiënten.
2.3 Token-bewust Beleidsupdate
Standaard GRPO wijst een uniforme advantage toe aan alle tokens in een sequentie. PiT-PO verfijnt dit door de globale beloning te synthetiseren met de token-niveau straf.
- Token-Aware Advantage (A^i,k): De advantage voor de k-de token wordt berekend door de globale beloning te standaardiseren en de lokale token-straf af te trekken indien de token deel uitmaakt van een redundante term.
- Effect: Dit creëert een "dual-pressure" landschap waar globale beloningen het beleid leiden naar fysiek consistente vergelijkingen, terwijl lokale straffen redundantie chirurgisch verwijderen, waardoor het beleid leert om theoretisch redundante structuren expliciet te onderdrukken.
2.4 Trainingspipeline
Het framework maakt gebruik van een multi-island topologie om voortijdige convergentie te voorkomen:
- Island-Based Exploratie: Meerdere geïsoleerde eilanden evolueren verschillende lineages van vergelijkingen om de zoekdiversiteit te behouden.
- In-Search Evolutie: Trajecten van alle eilanden worden samengevoegd om beleidsoptimalisatie uit te voeren met behulp van LoRA (Low-Rank Adaptation) voor efficiëntie.
- Hiërarchische Selectie: Een survival-of-the-fittest mechanisme behoudt de best presterende kandidaten en reset onderpresterende eilanden met hoogwaardige fitness-seeds.
3. Belangrijkste Resultaten
3.1 Benchmark Prestaties
PiT-PO werd geëvalueerd op de LLM-SR Suite en LLM-SRBench tegen state-of-the-art baselines (inclusief GPlearn, PySR, uDSR, RAG-SR en LLM-SR).
- Nauwkeurigheid: PiT-PO behaalde state-of-the-art prestaties en herstelde het hoogste aantal grondwaarheid-vergelijkingen. Op de LLM-SR Suite behaalde het 100% nauwkeurigheid op Oscillation 1 en 99,99% op Oscillation 2 (met de 8B backbone). Het presteerde significant beter dan baselines op E. coli Growth en behaalde competitieve resultaten op Stress-Strain, hoewel het de 4o-mini baseline op dat laatste niet overtrof.
- Symbolische Nauwkeurigheid: Op LLM-SRBench (239 taken) behaalde PiT-PO de hoogste Symbolische Nauwkeurigheid (SA) over alle categorieën (Chemie, Biologie, Fysica, Materiaalkunde), wat een superieure bekwaamheid demonstreert in het herstellen van de correcte symbolische vorm in plaats van enkel numeriek te fitten.
- Efficiëntie: PiT-PO toonde snellere convergentie en het vermogen om stagnatie-regimes te ontsnappen waar baseline-methoden (zoals LLM-SR) plateau bereikten bij een lage MSE maar incorrecte structuren.
3.2 Empowerment van Kleine Modellen
Een belangrijke bevinding is dat PiT-PO kleine, open-source modellen in staat stelt om specifieke contexten te evenaren of te overtreffen van grote, closed-source modellen.
- Door een gekwantiseerde Llama-3.2-1B te gebruiken, behaalde PiT-PO prestaties die competitief waren met of superieur aan LLM-SR met Mixtral 8x7B en 4o-mini op de Oscillation-taken en E. coli Growth. Echter, op de Stress-Strain taak presteerde het 1B model (76,91% nauwkeurigheid) minder goed dan de 4o-mini baseline (85,33%), wat aangeeft dat hoewel het framework de capaciteitskloof aanzienlijk overbrugt, het niet universeel alle propriëtaire reuzen over elke metriek verslaat.
- Dit sugg_ereert dat de in-search beleidsoptimalisatie kleine modellen effectief versterkt, waardoor toegang tot hoogwaardige wetenschappelijke ontdekkingsinstrumenten wordt gedemocratiseerd op consumentenhardware, met name voor taken waar structurele ontdekking essentieel is.
3.3 Real-World Toepassing: Turbulentiemodellering
Het framework werd toegepast op het ontdekken van niet-lineaire constitutieve relaties voor Reynolds-spanning anisotropie in Flow over Periodic Hills.
- Prestaties: Het ontdekte model verbeterde de traditionele RANS-benaderingen (specifiek het k−ω SST model) door anisotrope Reynolds-spanningen te produceren die dichter bij Direct Numerical Simulation (DNS) referenties liggen.
- Fysische Getrouwheid: Het geleerde model vertoonde een verbeterde fysieke consistentie, waarbij niet-fysische extremen werden verminderd en nauwkeurigere voorspellingen van stromingsscheidingsbellen en huidwrijvingscoëfficiënten werden geleverd vergeleken met standaard RANS en andere SR-gebaseerde methoden.
3.4 Ablatie-studies
Ablatie-studies bevestigden de noodzaak van beide componenten:
- Het verwijderen van fysieke beperkingen (w/o Phy) leidde tot een substantiële verslechtering in NMSE en generalisatie.
- Het verwijderen van token-regularisatie (w/o TokenReg) resulteerde in het voortbestaan van redundante termen en een grotere generalisatiekloof tussen In-Distribution (ID) en Out-Of-Distribution (OOD) data.
4. Betekenis en Claims
Het artikel claimt dat PiT-PO de rol van LLM's in wetenschappelijke ontdekking fundamenteel verschuift van statische voorstellers naar adaptieve, fysica-bewuste generatoren.
- Wetenschappelijke Consistentie: Door hiërarchische fysieke beperkingen en theorema-gestuurde token-regularisatie te integreren, stemt PiT-PO de generatie tegelijkert als numerieke fitness, wetenschappelijke consistentie en parsimonie.
- Democratisering: Het vermogen van PiT-PO om kleine modellen (bijv. 1 miljard parameters) in staat te stellen om closed-source giganten te evenaren op belangrijke ontdekkingstaken, vestigt een praktische methodologie voor geautomatiseerde wetenschappelijke ontdekking die niet afhankelijk is van enorme rekenkracht of propriëtaire API's, hoewel de prestaties variëren per taakcomplexiteit.
- Praktisch Nut: De succesvolle toepassing op turbulentiemodellering laat zien dat de ontdekte symbolische correcties tastbare waarde hebben in real-world engineering workflows, waarbij stromingsveld-voorspellingen worden verbeterd ten opzichte van wat mogelijk is met standaard lineaire modellen.
De auteurs concluderen dat deze aanpak een nieuwe state-of-the-art vestigt voor SR-benchmarks en een robuust pad biedt voor het integreren van domeinspecifieke fysieke kennis in de leerdynamiek van LLM's.