← Nieuwste papers
🤖 machine learning

InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance

InsightSR is een nieuw symbolisch regressiekader dat de PySR genetic programming engine verbetert door gebruik te maken van Large Language Models om de zoekruimte iteratief te verfijnen door middel van semantische en structurele sturing, waarbij staat van de kunst nauwkeurigheid en generalisatie wordt bereikt door de constructie van diepe expressiebomen te transformeren naar de assemblage van ondiepe bomen over semantisch geïnformeerde kenmerken.

Oorspronkelijke auteurs: Yating Ling, Wenjing Cun, Zhitang Chen

Gepubliceerd 2026-08-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yating Ling, Wenjing Cun, Zhitang Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Wetenschap heeft altijd vertrouwd op een eenvoudig, krachtig idee: dat het complexe gedrag van de natuurlijke wereld beschreven kan worden door beknopte wiskundige wetten. Wanneer een natuurkundige naar een vallende appel of een planetaire baan kijkt, ziet hij niet alleen beweging; hij zoekt naar de verborgen vergelijking die deze beheerst. Deze zoektocht naar de onderliggende formule wordt symbolische regressie genoemd. In tegenstelling tot standaard computermodellen die patronen leren door miljoenen interne knoppen aan te passen om de data te laten passen, probeert symbolische regressie de werkelijke vergelijking zelf te formuleren, gebruikmakend van bekende wiskundige bouwstenen zoals optelling, vermenigvuldiging en trigonometrische functies. Het doel is om een regel te vinden die niet alleen nauwkeurig is, maar ook eenvoudig genoeg om door een mens gelezen en begrepen te worden. Het vinden van deze regels is echter ongelooflijk moeilijk. Het aantal mogelijke wiskundige combinaties groeit zo snel dat het een enorme, chaotische oceaan van mogelijkheden wordt. De meeste computercodes raken verdwaald in deze oceaan, waarbij ze formules produceren die perfect bij de data passen maar fysiek geen zin hebben, of ze falen simpelweg om de ware wet te vinden omdat de zoekruimte te groot is om volledig te verkennen.

Een team onderzoekers heeft een nieuwe aanpak ontwikkeld om deze chaos te navigeren, waarbij de ruwe zoekkracht van evolutionaire algoritmen wordt gecombineerd met het redeneervermogen van grote taalmodellen. Hun systeem, genaamd InsightSR, vraagt de computer niet om direct het uiteindelijke antwoord te raden. In plaats daarvan gebruikt het het taalmodel als een gids om de zoektocht zelf vorm te geven. Stel je een team ontdekkingsreizigers voor die probeert een specifiek pad door een dicht, onontgonnen bos te vinden. Bij de oude methode zouden de ontdekkingsreizigers willekeurig ronddwalen, in de hoop op een toevallige ontmoeting met het juiste pad. Bij deze nieuwe methode fungeert het taalmodel als een ervaren gids die het algemene terrein kent. Het loopt het pad niet voor hen, maar het vertelt hen welke richtingen fysiek onmogelijk zijn en suggereert welke hulpmiddelen nuttig kunnen zijn voor de reis.

Het systeem werkt door de begeleiding te splitsen in twee complementaire stromen. De eerste stroom richt zich op het "skelet" van de vergelijking. Het taalmodel kijkt naar de fysieke eenheden van de data — zoals of een variabele tijd, afstand of massa vertegenwoordigt — en stelt basisstructuren voor die dimensionaal consistent moeten zijn. Dit betekent dat het elke wiskundige combinatie uitsluit die de wetten van de fysica zou schenden, zoals het optellen van een tijdmeting bij een afstand. Door de zoektocht te voorzien van deze fysiek plausibele startpunten, vermijdt het systeem het verspillen van tijd aan miljarden onmogelijke formules. De tweede stroom richt zich op de ingrediënten zelf. Het taalmodel suggereert nieuwe manieren om de ruwe data te transformeren, zoals het kwadrateren van een variabele of het nemen van de sinus ervan, gebaseerd op patronen die het in eerdere pogingen heeft gezien. Deze nieuwe kenmerken worden toegevoegd aan de pool van ingrediënten die beschikbaar zijn voor de zoekmachine. Na verloop van tijd wordt de pool van ingrediënten rijker, waardoor het systeem complexe relaties kan opbouwen met behulp van eenvoudige, ondiepe combinaties in plaats van te proberen diepe, verstrengelde bomen van ruwe data te construeren.

Dit proces is geen eenmalige gok, maar een continue lus van verfijning. Nadat de computer een reeks kandidaat-vergelijkingen heeft gegenereerd, evalueert het taalmodel deze. Het controleert niet alleen hoe goed ze bij de cijfers passen, maar ook hoe nuttig de nieuwe kenmerken waren en of de structuur logisch is. Deze feedback wordt opgeslagen in een dynamische kennisbank die de volgende ronde van zoeken informeert. Het systeem leert van zijn eigen successen en mislukkingen, waardoor de zoektocht geleidelijk wordt vernauwd naar de meest veelbelovende oplossingen. Dit creëert een zelfcorrigerende cyclus waarbij de zoektocht met elke iteratie gerichter en efficiënter wordt.

De onderzoekers hebben deze methode getest op drie verschillende soorten uitdagingen. Eerst gebruikten ze een benchmark van 100 beroemde natuurkundige vergelijkingen, variërend van klassieke mechanica tot kwantumtheorie. In deze test slaagde het systeem erin om 95% van de tijd de exacte originele formule te herstellen, wat een significante verbetering is ten opzicht van eerdere methoden. Het presteerde ook uitzonderlijk goed op een bredere set wetenschappelijke problemen die chemie, biologie en materiaalkunde beslaan, waarbij een nauwkeurigheid van meer dan 80% werd behaald bij taken met complexe transformaties. Ten slotte testte het team het systeem op real-world data, zoals de trillingen van een oscillator en de groeipatronen van bacteriën. In deze scenario's vond het systeem niet alleen nauwkeurige formules, maar behield het ook zijn prestaties wanneer het werd getest op data die het nog nooit eerder had gezien, wat een sterk vermogen tot generalisatie aantoont.

De resultaten suggeren dat door een taalmodel als een begeleidende laag rond een traditionele zoekmachine te plaatsen, het mogelijk is om de dubbele uitdagingen van de enorme zoekruimte en de noodzaak voor fysieke consistentie te overwinnen. Het systeem vervangt de evolutionaire zoektocht niet; het verfijnt deze, waardoor een blinde, willekeurige exploratie wordt omgezet in een doelgerichte, geleide ontdekking. Door de last te verschuiven van het construeren van diepe, complexe bomen van ruwe variabelen naar het assembleren van eenvoudige combinaties uit een rijke, vooraf verrijkte set kenmerken, maakt de methode de ontdekking van wetenschappelijke wetten efficiënter en betrouwbaarder. Deze aanpak biedt een praktisch pad voorwaarts voor geautomatiseerde wetenschappelijke ontdekking, waarbij wordt aangetoond dat de combinatie van mensachtige redenering en machinegestuurd zoeken de verborgen wiskundige wetten kan onthullen die onze wereld beheersen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →