Technische Samenvatting: Probabilistische Symbolische Regressie voor Vergelkingsontdekking via Operator-geïnduceerde en Geregulariseerde Symbolische Bossen
1. Probleemstelling
Symbolische Regressie (SR) heeft als doel interpreteerbare analytische expressies te ontdekken die de relaties tussen input en output direct uit data sturen, een centrale taak in wetenschappelijke machine learning. Hoewel bestaande SR-methoden (bijv. genetische programmering, deep symbolic regression en compressed sensing-benaderingen) veelbelovend zijn gebleken, kampen ze met aanzienlijke statistische en computationele uitdagingen:
- Heuristische Afhankelijkheid: Veel methoden vertrouwen op stochastische zoekheuristieken die moeite hebben met het balanceren van voorspellende nauwkeurigheid versus expressiecomplexiteit, met name in ruisgevoelige, kleine wetenschappelijke datasets.
- Onzekerheidskarakterisering: Huidige benaderingen bieden beperkte karakterisering van symbolische onzekerheid, waarbij vaak slechts één "beste" expressie wordt geretourneerd zonder de plausibiliteit van alternatieve structurele verklaringen te kwantificeren.
- Theoretische Gaten: Er is een gebrek aan theoretische behandelingen met betrekking tot de posterieure concentratiesnelheden voor symbolische regressie, met name onder condities van mis-specificatie of niet-identificeerbaarheid (waarbij algebraisch verschillende expressies identieke voorspellingen opleveren).
Dit artikel adresseert deze gaten door een verenigd probabilistisch kader voor te stellen dat symbolische expressies behandelt als ensembles van bomen, wat volledige onzekerheidspropagatie en rigoureuze theoretische garanties mogelijk maakt.
2. Methodologie: Het BayeSymX-framework
De auteurs introduceren BayeSymX (Bayesian Symbolic regression forests for eXpression discovery), een probabilistisch framework dat de onbekende regressieoppervlakte f modelleert als een affiene combinatie van symbolische bomen (een "symbolische bos").
2.1 Modèlestructuur
Het model gaat uit van observaties yi=f(xi)+ϵi, waarbij:
yi=β0+j=1∑Kg(xi;Tj)βj+ϵi
Hier vertegenwoordigt g(x;Tj) de evaluatie van de j-de symbolische boom Tj, en β zijn de externe regressiecoëfficiënten. De bomen worden recursief geconstrueerd vanuit een bibliotheek van primaire kenmerken en wiskundige operatoren (unair en binair).
2.2 Prior Specificaties
Het framework maakt gebruik van een hiërarchische Bayesiaanse specificatie die is ontworpen om complexiteit te reguleren en data-adaptieve voorkeuren te leren:
- Boomtopologie Prior: Een diepte-afhankelijke splitsingskans pm=α0(1+m)−δ0 straft diepe bomen af, wat een vorm van Occam's razor afdwingt die eenvoudige representaties bevoordeelt.
- Operator en Kenmerk Priors: In tegen tegenstelling tot fixed-weight benaderingen gebruikt BayeSymX Dirichlet-priors op boom-specifieke operator- en kenmerktoewijzigingsgewichten. Dit stelt het model in staat om te leren welke operatoren en kenmerken relevant zijn voor specifieke bomen op een data-adaptieve wijze.
- Regressiecoëfficiënten: Conjugaat Normal-Inverse-Gamma (NIG) priors worden geplaatst op de externe coëfficiënten β en de ruisvariantie σ2, wat volledige onzekerheidspropagatie over alle modelparameters garandeert.
2.3 Posterieure Inferentie
- Marginalisatie: De continue parameters (β,σ2) worden analytisch gemarginaliseerd met behulp van NIG-conjugaliteit, wat een gezamenlijke marginale posterieur (JMP) oplevert over de discrete ruimte van symbolische bossen.
- Sampling: Een Metropolis-within-partially-collapsed Gibbs sampler wordt gebruikt om de symbolische expressieruimte te verkennen. De sampler maakt gebruik van zeven lokale boombewegingen (groeien, snoeien, subtree vervanging, verwijderen, invoegen, kenmerk wijzigen, operator wijzigen) om door de discrete ruimte te navigeren.
- Modelselectie (Occam's Window): In plaats van één enkele beste boom te selecteren, maakt BayeSymX gebruik van een Occam's window benadering. Het behoudt een set van hoog-posterieure waarschijnlijkheidsbossen (Jr) om onzekerheid over meerdere plausibele symbolische modellen te vangen.
- Verfijning: Een post-MCMC verfijningsstap gebruikt het Bayesiaans Informatie Criterium (BIC) om redundante bomen te snoeien en de uiteindelijke expressies algebraïsch te vereenvoudigen.
3. Belangrijkste Bijdragen
3.1 Theoretische Garanties
Het artikel stelt nieuwe posterieure concentratie resultaten vast voor symbolische regressie, een veld dat voorheen een gebrek had aan rigoureuze theoretische behandeling:
- Benaderbare Realiseerbaarheid: Onder milde regulariteitsveronderstellingen bewijzen de auteurs dat de posterieur convergeert rond de ware data-genererende functie f0 met een snelheid die wordt bepaald door de afweging tussen empirische benaderingsfout en een nieuw afgeleide symbolische complexiteitsschaal (CK,S,n).
- Bijna-parametrische Snelheden: In het geval van exacte eindige symbolische representeerbaarheid bereikt het framework een bijna-parametrische concentratiesnelheid van O(n−1/2(lognloglogn)1/2).
- Mis-specificatie en Oracle Ongelijkheden: Onder symbolische mis-specificatie (waarbij f0 niet in de modelklasse zit), stelt het paper een scherpe oracle concentratie resultaat vast. De posterieur convergeert rond de optimale populatie benaderingsfout zonder dat er een eindige set Kullback-Leibler minimizers of gespecialiseerde testcondities nodig zijn die typisch zijn voor klassieke mis-specificatietheorie.
- Afhandeling van Niet-Identificeerbaarheid: De garanties zijn geformuleerd op het niveau van predictieve functies, waarbij wordt erkend dat meerdere verschillende symbolische structuren dezelfde functie kunnen representeren.
3.2 Methodologische Innovaties
- Operator-geïnduceerde Bossen: Het gebruik van bossen (ensembles) in plaats van enkele bomen maakt additieve wetenschappelijke structuren mogelijk terwijl de interpreteerbaarheid behouden blijft.
- Data-Adaptief Leren: De Dirichlet-priors op operator/kenmerk gewichten stellen het model in staat om adaptief structurele voorkeuren te leren, waardoor de rigide beperkingen van fixed-weight priors gevonden in eerdere Bayesiaanse SR-methoden (bijv. BSR) worden vermeden.
- Onzekerheid-bewuste Samenvatting: De Occam's window strategie biedt een principiële manier om meerdere concurrerende wetenschappelijke hypothesen te rapporteren in plaats van een enkele puntinschatting.
4. Empirische Resultaten
De auteurs evalueren BayeSymX tegen state-of-the-art concurrenten (inclusief gplearn, operon, PySR, DSR, QLattice, SISSO++, BMS, en BSR) op twee verschillende benchmarks:
4.1 Feynman Vergelijkingen (SRBench)
- Opzet: Herstel van 5 natuurwetten uit de Feynman Lectures onder variërende ruisniveaus en structurele complexiteiten.
- Bevindingen: BayeSymX bereikte consistent een superieure balans tussen voorspellende nauwkeurigheid (laagste test RMSE), symbolische parsimonie (compacte expressies) en exact structureel herstel. Concurrerende methoden faalden vaak in het herstellen van de correcte structuur of produceerden te complexe expressies om een vergelijkbare nauwkeurigheid te bereiken. BayeSymX toonde robuustheid bij toenemende ruisniveaus waar andere methoden significant verslechterden.
4.2 Ontdekking van Oxide Perovskiet Katalysator
- Opzet: Ontdekking van "materiaalgenen" (descriptors) die de katalysatorcompositie koppelen aan de zuurstofevolutiereactie (OER) activiteit.
- Bevindingen: BayeSymX identificeerde compacte, wetenschappelijk interpreteerbare descriptor-expressies (26–40 nodes) die bekende structuur-activiteitsrelaties herstelden (bijv. betrokkenheid van tolerantiefactor μ, elektronegativiteiten χA,χB). In tegen tegenstelling hiertoe produceerden hoog-nauwkeurige concurrenten zoals operon onhandelbare expressies (90–104 nodes), terwijl compacte methoden zoals PySR een lagere voorspellende prestatie lieten zien. BayeSymX bezette de Pareto-front van de nauwkeurigheid-complexiteit afweging.
5. Betekenis en Claims
Het artikel claimt dat BayeSymX een significante vooruitgang vertegenwoordigt in probabilistische symbolische regressie door:
- Structuur en Onzekerheid te Verenigen: Een framework te bieden dat gezamenlijk symbolische structuur leert, complexiteit controleert via regularisatie, en onzekerheid kwantificeert over meerdere plausibele modellen.
- Theoretische Rigor: Het bieden van de eerste posterieure concentratie garanties voor symbolische regressie die zowel exacte representeerbaarheid als mis-specificatie behandelen, waarbij bijna-parametrische snelheden en scherpe oracle ongelijkheden worden vastgesteld.
- Wetenschappelijke Bruikbaarheid: Aan te tonen dat probabilistische benaderingen beter kunnen presteren dan heuristische en deep learning-gebaseerde methoden bij het herstellen van interpreteerbare wetenschappelijke wetten, met name in ruisgevoelige, kleine-sample regimes die typerend zijn voor materiaalkundige ontdekking en natuurkunde.
De auteurs concluderen dat het framework bijzonder geschikt is voor wetenschappelijke ontdekkingssettings waar domeinkennis de feature selectie stuurt, maar de onderliggende functionele vorm onbekend blijft en een robuuste behandeling van structurele onzekerheid vereist.