LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary Optimizers
Dieser Beitrag stellt LLM-FE vor, ein neuartiges Framework, das evolutionäre Suche mit Large Language Models kombiniert, um für tabellarische Daten iterativ effektive Programmierungen von Merkmals Transformationen zu entdecken und dadurch bestehende Methoden zur automatisierten Merkmalskonstruktion durch eine bessere Nutzung von Domänenwissen und datengesteuertem Feedback zu übertreffen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Detektiv, der versucht, ein Rätsel mit Hilfe eines Haufens an Hinweisen (Daten) zu lösen. Normalerweise müssen Sie diese Hinweise manuell durchsuchen, auf clevere Weise kombinieren und neue „Super-Hinweise" erstellen, um den Fall schneller aufzuklären. Dieser Prozess wird Feature Engineering genannt. In der Welt des maschinellen Lernens ist das manuelle Durchführen dieses Prozesses langsam, langweilig und erfordert einen menschlichen Experten, der genau weiß, welche Kombinationen von Hinweisen funktionieren könnten.
Die Arbeit stellt ein neues Werkzeug namens LLM-FE vor, das diese Detektivarbeit automatisiert, indem es eine „superintelligente" KI (ein Large Language Model) als kreativen Partner einsetzt.
Hier ist die Funktionsweise, aufgeschlüsselt in einfache Konzepte:
1. Das Problem: Das „Raten-Spiel"
Traditionelle automatisierte Werkzeuge versuchen dies zu lösen, indem sie blind Zahlen mischen und kombinieren (wie das Hinzufügen von Spalte A zu Spalte B), basierend auf einer festen Liste von Regeln. Sie sind wie ein Roboter, der nur weiß, wie man nach links oder rechts abbiegt, und nie erkennt, dass man manchmal über einen Zaun springen muss. Oft verpassen sie die „Aha!"-Momente, die aus dem Verständnis der Geschichte hinter den Daten entstehen (wie das Wissen, dass „Insulin" und „Glukose" mit Diabetes zusammenhängen).
2. Die Lösung: Der „evolutionäre Koch"
Die Autoren schlagen LLM-FE vor, das Feature Engineering wie ein Kochwettbewerb behandelt, bei dem die KI der Koch ist. Anstatt nur einem Rezept zu folgen, erhält die KI:
- Die Zutaten: Die Rohdaten (z. B. Patientenalther, Blutzuckerspiegel).
- Die Speisekarte: Das spezifische zu lösende Problem (z. B. „Vorhersagen, ob ein Patient Diabetes hat").
- Das Kochbuch: Das eigene interne Weltwissen der KI (z. B. „Ich weiß, dass hoher Zucker und niedriger Insulinspiegel schlecht für die Gesundheit sind").
3. Funktionsweise: Die Vier-Schritte-Schleife
Die Arbeit beschreibt einen Zyklus, der sich immer wieder wiederholt, ähnlich wie die Natur Arten entwickelt, um besser zu überleben:
Schritt A: Der kreative Funke (Generierung)
Die KI betrachtet die Daten und das Problem. Sie sagt: „Hmm, wenn ich den Insulinspiegel durch den Glukosespiegel teile, könnte das uns etwas darüber verraten, wie der Körper Zucker verarbeitet." Sie schreibt ein kleines Computerprogramm (ein Rezept), um diesen neuen „Super-Hinweis" zu erstellen.- Analogie: Der Koch erfindet eine neue Sauce basierend auf den Zutaten und dem Gericht, das er zubereiten möchte.
Schritt B: Der Geschmackstest (Evaluation)
Das neue Rezept wird auf die Daten angewendet. Dann versucht ein Vorhersagemodell (ein einfacher Test), das Problem mit diesen neuen Daten zu lösen.- Analogie: Der Koch serviert die neue Sauce einem Richter. Wenn der Richter sie mag (der Score steigt), ist das Rezept gut. Wenn nicht, wird es verworfen.
Schritt C: Die Gedächtnisbank (Erfahrungsmanagement)
Dies ist das Geheimnis von LLM-FE. Das System vergisst die gescheiterten Rezepte nicht einfach. Es führt eine „Hall of Fame" der besten Rezepte, die es je erstellt hat.- Analogie: Stellen Sie sich einen Koch vor, der ein Notizbuch mit seinen 10 besten Gerichten führt. Wenn er ein neues Gericht erfinden muss, beginnt er nicht bei Null; er schaut sich seine besten vergangenen Gerichte an und sagt: „Was wäre, wenn ich den besten Teil von Gericht Nr. 3 mit dem besten Teil von Gericht Nr. 7 mischen würde?"
Schritt D: Die Evolution (Verfeinerung)
Die KI nutzt die „Hall of Fame", um noch bessere Versionen der Rezepte zu erstellen. Sie versucht, die besten Rezepte zu „mutieren" (leicht zu verändern), um zu sehen, ob sie noch besser werden können.- Analogie: Dies ist wie die natürliche Selektion. Die stärksten, schmackhaftesten Rezepte überleben und entwickeln sich weiter, während die schwachen aussterben.
4. Warum es besser ist als der Rest
Die Arbeit vergleicht LLM-FE mit anderen Methoden und stellt fest, dass es aus drei Hauptgründen gewinnt:
- Es kennt den Kontext: Im Gegensatz zu anderen Robotern, die nur Mathematik betreiben, versteht diese KI, was die Daten bedeuten. Sie weiß, dass „Alter" und „BMI" mit der Gesundheit zusammenhängen, und erstellt daher Merkmale, die für Menschen Sinn ergeben, nicht nur Zahlen.
- Es bleibt nicht stecken: Andere Methoden bleiben oft stecken, wenn sie versuchen, eine einzelne Idee zu verbessern. LLM-FE führt gleichzeitig mehrere „Inseln" von Ideen aus. Wenn eine Insel in einer Sackgasse steckt, findet eine andere Insel vielleicht einen Abkürzungsweg.
- Es lernt aus Fehlern: Indem es eine Erinnerung daran behält, was zuvor funktioniert hat, wird es mit jedem Versuch schlauer, anstatt nur zufällig zu raten.
5. Die Ergebnisse
Die Forscher testeten dies an vielen verschiedenen Datensätzen (wie der Vorhersage von Herzerkrankungen, Immobilienpreisen und Autoverkäufen). Sie stellten fest, dass LLM-FE die Vorhersagemodelle konsistent genauer machte als die alten Methoden. Es funktionierte nicht nur mit einem Typ von KI; es half verschiedenen Modelltypen, ihre Arbeit besser zu erledigen.
Kurz gesagt: LLM-FE ist ein System, das eine intelligente KI nutzt, um neue, sinnvolle Wege zu erfinden, Daten zu betrachten. Es agiert wie ein kreativer Koch, der von seinen besten vergangenen Gerichten lernt, sein Weltwissen nutzt und ständig experimentiert, bis er das perfekte Rezept findet, um ein Problem zu lösen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.