Smooth multi-function evolutionary algorithm
Dit artikel stelt een nieuw evolutionair algoritme voor voor symbolische regressie dat een universele functietemplate gebruikt met vloeiende, enkelvoudige geparametriseerde translaties tussen functieparen om de functieset te reduceren en afgeleide continuïteit te waarborgen, waarbij de effectiviteit ervan op standaard benchmarks wordt aangetoond.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van de informatica bestaat er een hardnekkige uitdaging die bekend staat als symbolische regressie. Stel je een wetenschapper voor die een enorme hoeveelheid datapunten heeft verzameld—misschien metingen van windsnelheid, pollenconcentraties of professoren-salarissen—en die een enkele wiskundige zin wil vinden die verklaart hoe deze getallen met elkaar samenhangen. Het doel is om de verborgen regel te ontdekken, de vergelijking, die de invoergegevens omzet in de juiste uitvoer. Om dit te doen, gebruiken computers vaak een methode die is geïnspireerd door natuurlijke selectie, waarbij ze duizenden willekeurige wiskundige zinnen genereren, testen hoe goed ze bij de gegevens passen, en vervolgens de beste versies van deze zinnen mengen en muteren om nog betere versies te creëren. Echter, dit proces is vaak onhandig. De computer behandelt de bouwstenen van deze zinnen—zoals optellen, aftrekken of vermenigvuldigen—als rigide, afzonderlijke instrumenten. Wisselen van het ene naar het andere instrument is als een plotselinge sprong in het landschap van mogelijkheden, wat het voor de computer moeilijk maakt om het vloeiende pad naar het perfecte antwoord te vinden. Het is een beetje alsof je een berg probeert te beklimmen waar het terrein plotseling verandert van een flauwe helling naar een verticale klif; de klimmer worstelt om de juiste richting te vinden.
Onderzoekers Peter Michalicek en Tomas Brandejsky van de Universiteit van Pardubice in Tsjechië hebben een nieuwe manier voorgesteld om dit grillige landschap glad te strijken. Ze ontwikkelden een systeem waarbij de computer niet hoeft te kiezen tussen verschillende wiskundige instrumenten alsof het afzonderlijke, discrete opties zijn. In plaats daarvan creëerden ze één enkel, flexibel instrument dat vloeiend van de ene operatie naar de andere kan morphen. In hun nieuwe aanpak gebruikt de computer een speciale controle-variabele, een enkele draaiknop die gedraaid kan worden om het gedrag van de functie geleidelijk te veranderen. Als de knop in één positie staat, werkt het instrument als optellen; als hij naar een andere positie wordt gedraaid, werkt het als vermenigvuldigen; en in het midden voert het een mengeling van beide uit. Dit stelt de computer in staat om continu tussen verschillende wiskundige gedragingen te glijden in plaats van abrupte, schokkerige sprongen te maken. Door dit te doen, veranderden de onderzoekers een moeilijke zoektocht naar een complexe boomstructuur in een eenvoudigere taak van het afstemmen van een reeks getallen, waardoor het evolutionaire proces efficiënter werd en minder snel vastliep in doodlopende wegen.
De onderzoekers testten dit idee door een systeem te bouwen dat ze een "smooth multi-function evolutionary algorithm" noemen. In plaats van de computer willekeurig een boom van verschillende wiskundige operaties te laten assembleren, dwongen ze de computer om een perfecte, symmetrische boom te gebruiken waarin elke interne knoop deze zelfde flexibele, vormveranderende tool is. De enige dingen die veranderen tijdens het leerproces zijn de waarden van de controleknoppen bij elke knoop en de specifieke getallen of variabelen aan de onderkant van de boom. Dit ontwerp vereenvoudigt het probleem aanzienlijk. Omdat de structuur van de boom vaststaat en de overgangen tussen operaties vloeiend zijn, kan de computer standaard optimalisatietechnieken gebruiken om de beste instellingen te vinden, in plaats van te vertrouwen op de meer chaotische en onvoorspelbare methoden die gewoonlijk voor dit type probleem nodig zijn. De onderzoekers stelden vast dat deze aanpak hen in staat stelde om complexe relaties te representeren met behulp van een enkele controle-variabele voor een aantal basisfuncties, wat de complexiteit van de zoekruimte verminderde.
Om te zien of deze methode daadwerkelijk werkte, draaide het team hun algoritme op een verscheidenheid aan standaard datasets die worden gebruikt om symbolische regressie te testen, inclusief gegevens over windpatronen, pollenconcentraties en professoren-salarissen aan universiteiten. Ze vergeleken hun resultaten met verschillende andere bekende methoden, waaronder systemen die traditionele genetische programmering gebruiken en systemen die evolutie combineren met andere optimalisatietechnieken. De resultaten lieten zien dat hoewel hun methode soms langer nodig had om te draaien op een standaard computerprocessor, het zeer effectief was in het vinden van nauwkeurige modellen. In sommige gevallen, met name wanneer ze voldoende tijd kregen om door vele generaties van testen te gaan, vonden hun algoritme oplossingen die even goed waren als, of beter dan, de gevestigde methoden. Bijvoorbeeld, op één dataset met betrekking tot professoren-salarissen bereikte hun methode een hoog niveau van nauwkeurigheid dat overeenkwam met de top presterende methoden. Op een andere dataset met betrekking tot winddata produceerde het resultaten die vergelijkbaar waren met de beste bestaande tools.
Een van de meest significante bevindingen had betrekking op hoe goed de modellen generaliseerden naar nieuwe, ongeziene data. In machine learning is overfitting een veelvoorkomend probleem, waarbij een model de trainingsdata zo perfect onthoudt dat het geen nauwkeurige voorspellingen meer kan doen voor nieuwe informatie. De onderzoekers maten dit door de foutmarge op de trainingsdata te vergelijken met de foutmarge op de testdata. Hun "smooth multi-function" aanpak vertoonde een zeer kleine toename in fout bij de overgang van training naar testen, wat suggereert dat de modellen die het creëerde stabiel en robuust waren. Dit geeft aan dat de vloeiende overgangen tussen wiskundige operaties het algoritme hielpen om oplossingen te vinden die de werkelijke onderliggende patronen van de data vastlegden, in plaats van alleen de ruis aan te passen. De onderzoekers merkten op dat hun huidige implementatie op een manier was geschreven die niet volledig geoptimaliseerd was voor snelheid, wat beperkte hoeveelheid tests ze in een vaste tijd konden uitvoeren. Ze suggereerden dat als de code zou worden herschreven om sneller te draaien, bijvoorbeeld door gebruik te maken van gespecialiseerde computerhardware, de prestaties nog verder verbeterd zouden kunnen worden.
De studie concludeert dat door de rigide, op sprongen gebaseerde overgangen van traditionele evolutionaire algoritmen te vervangen door vloeiende, continue overgangen, het mogelijk is om de zoektocht naar wiskundige modellen efficiënter en betrouwbaarder te maken. De onderzoekers hebben aangetoond dat een enkele controle-variabele effectief de overgang tussen meerdere verschillende wiskundige functies kan beheren, waardoor de complexiteit van het probleem wordt verminderd zonder de nauwkeurigheid op te offeren. Hoewel de methode geen wondermiddel is dat elk probleem direct oplost, biedt het een veelbelovend alternatief voor het vinden van de verborgen regels in data. Het werk suggereert dat de manier waarop we de bouwstenen van onze modellen representeren net zo belangrijk is als de algoritmen die we gebruiken om ernaar te zoeken. Door het landschap glad te strijken, hebben de onderzoekers een duidelijker pad geboden dat computers kunnen volgen, wat potentieel kan leiden tot nauwkeurigere en betrouwbaardere modellen in velden variërend van milieukunde tot economie. De code en de resultaten van deze studie zijn beschikbaar voor anderen om te bestuderen en op voort te bouwen, wat uitnodigt tot verdere verkenning van deze vloeiendere manier van het evolueren van wiskundige oplossingen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.