← Nieuwste papers
🤖 machine learning

TopoFE: topology-aware LLM-guided Automated Feature Engineering

TOPOFE is een topologiebewust multi-eiland evolutionair framework dat LLM-gestuurde geautomatiseerde feature engineering verbetert door familie-gespecialiseerde exploratie, adaptief promptgeheugen en topologie-gestuurde kennisoverdracht te integreren om de beperkingen van staatloze generatie en homogene zoektocht te overwinnen, waardoor diverse en hoogpresterende feature-programma's over 29 tabulaire datasets worden ontdekt.

Oorspronkelijke auteurs: Sha Li, Naren Ramakrishnan

Gepubliceerd 2026-07-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sha Li, Naren Ramakrishnan

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een computer probeert te leren om slimme beslissingen te nemen, zoals het voorspellen of een leningaanvrager zijn geld zal terugbetalen of of een patiënt een specifieke ziekte heeft. De computer begint niet met de antwoorden; hij moet naar een spreadsheet met ruwe gegevens kijken—getallen, categorieën en datums—en ontdekken welke patronen er toe doen. Dit proces wordt machine learning genoemd. Maar hier zit de crux: de ruwe gegevens zijn vaak rommelig en moeilijk te begrijpen. Net zoals een chef geen heerlijke soep kan maken met alleen maar ongesneden groenten, kan een computer vaak geen de beste patronen vinden tenzij de gegevens eerst worden getransformeerd. Deze transformatiestap wordt feature engineering genoemd. Het is de kunst van het nemen van ruwe getallen en deze bij elkaar te mengen om nieuwe, slimmere aanwijzingen te creëren die de computer helpen de waarheid te zien. Lange tijd moesten mensen dit handmatig doen, waarbij ze gokten welke combinaties van getallen nuttig zouden kunnen zijn. Recentelijk zijn we begonnen met het gebruiken van superintelligente computerprogramma's genaamd Large Language Models (LLMs) om te helpen. Denk aan deze LLM's als briljante, erudiete assistenten die veel weten over wiskunde en wetenschap en nieuwe manieren kunnen voorstellen om de data te mengen. Echter, zelfs deze briljante assistenten hebben een probleem: ze raken soms in een sleur, waarbij ze steeds dezelfde soorten mengsels voorstellen, of ze vergeten wat ze eerder hebben geprobeerd, waardoor ze tijd verspillen aan doodlopende wegen.

Dit is waar een nieuw framework genaamd TOPOFE in beeld komt. De onderzoekers, Sha Li en Naren Ramakrishnan van Virginia Tech, realiseerden zich dat de ruimte van mogelijke datamengsels zo groot en gevarieerd is dat een enkele, uniforme zoekstrategie niet voldoende is. Ze stelden een systeem voor dat de zoektocht naar de beste dataclues behandelt als een team van gespecialiseerde ontdekkingsreizigers die in verschillende gebieden werken, in plaats van één grote menigte.

In plaats van één grote groep computerprogramma's die allemaal tegelijkertijd aan het probleem tegelijkertijd proberen te werken, verdeelt TOPOFE het werk in vijf afzonderlijke "eilanden". Elk eiland is een specialistisch team dat zich richt op een specifiek type wiskundige truc. Eén eiland kijkt alleen naar eenvoudige rekenkunde, zoals optellen of vermenigvuldigen van getallen. Een ander richt zich op statistiek, zoals gemiddelden en tellingen. Een derde kijkt naar tijdgebaseerde patronen, zoals hoe de verkopen de afgelopen week zijn veranderd. De laatste handelt relaties tussen verschillende groepen af, en de laatste houdt zich bezig met gebogen, niet-lineaire vormen. Door deze specialisten gescheiden te houden, zorgt het systeem ervoor dat geen enkel type wiskundige truc de overhand krijgt en de ontdekking van de anderen blokkeert.

Maar de echte magie gebeurt wanneer deze eilanden met elkaar communiceren. In oudere systemen, als een team vastliep, wisselden ze misschien willekeurig ideeën uit met een ander team, wat vaak niet hielp. TOPOFE is slimmer. Het gebruikt een "topologiegrafiek", wat een dynamische kaart is die leert welke teams het beste bij elkaar kunnen helpen. Als het "Tijd"-eiland vastloopt, controleert het systeem de kaart en ziet dat het "Rekenkunde"-eiland de beste ideeën heeft om hen te helpen. Het activeert dan een speciale gebeurtenis waarbij de twee teams hun beste ideeën combineren om iets totaal nieuws te creëren—een "hybride" feature die geen van beide teams alleen had kunnen uitvinden. Het kan bijvoorbeeld een tijdgebaseerd gemiddelde combineren met een delingoperatie om een gloednieuwe, zeer voorspellende aanwijzing te creëren.

Het systeem heeft ook een "geheugen" dat leert van zijn eigen fouten. Als een bepaalde wiskundige truc herhaaldelijk faalt op een specifieke dataset, onthoudt het systeem dit en stopt het met het voorstellen ervan, terwijl het de trucs die wel werken, versterkt. Dit gebeurt zonder dat de hoofdcomputer-hersenen opnieuw getraind hoeven te worden, wat de zoektocht ongelooflijk efficiënt maakt.

De onderzoekers testten dit idee op 29 verschillende real-world datasets, variërend van het voorspellen van hartziekten tot het voorspellen van de huur van fietsen. Ze ontdekten dat TOPOFE consequent beter presteerde dan de beste bestaande methoden. Het vond niet alleen betere antwoorden; het vond diversere antwoorden. Terwijl andere methoden vaak eindigden met een stapel zeer vergelijkbare aanwijzingen (redundantie), produceerden de gespecialiseerde eilanden en de slimme teamwork van TOFE een set aanwijzingen die meer terrein besloegen en goed werkten met verschillende soorten voorspellingsmodellen. De studie suggereert dat door de zoektocht te organiseren in gespecialiseerde, communicerende groepen en ze te laten leren wanneer ze ideeën moeten uitwisselen, we veel krachtigere manieren kunnen ontsluiten om computers te leren onze data te begrijpen. De resultaten laten zien dat deze aanpak robuust is, goed werkt zelfs wanneer de onderliggende computer-"hersenen" veranderen, wat bewijst dat het geheime ingrediënt in de structuur van de zoektocht zelf zit, en niet alleen in de intelligentie van het model.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →