← Neueste Arbeiten
🤖 machine learning

SemPiper: Interactive Code Synthesis for Semantic Operators in Machine Learning Pipelines

Dieses Paper stellt SemPiper vor, ein interaktives System, das große Sprachmodelle in Machine-Learning-Pipelines integriert, indem es Entwicklern ermöglicht, hochgradig abstrakte natürliche Sprach-Datenoperationen als deklarative semantische Operatoren zu definieren, die dann automatisch zusammen mit Standard-Python-Code synthetisiert und optimiert werden, um kontrollierbare und effiziente ML-Workflows zu erstellen.

Ursprüngliche Autoren: Olga Ovcharenko, Luciano Duarte, Sebastian Schelter

Veröffentlicht 2026-06-15
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Olga Ovcharenko, Luciano Duarte, Sebastian Schelter

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bauen eine komplexe Maschine, um einen riesigen Haufen gemischter, durcheinandergeratener Daten zu sortieren, zu bereinigen und zu analysieren. In der Welt des Maschinellen Lernens (ML) wird diese Maschine als Pipeline bezeichnet. Normalerweise ist der Bau dieser Maschine wie die Arbeit eines Meisterschreiners: Sie müssen jedes einzelne Gelenk von Hand fertigen, jedes Stück Holz schleifen und tausende Zeilen Code schreiben, nur um die Maschine zum Laufen zu bringen. Es ist mühsam, fehleranfällig und wenn Sie ändern wollen, wie die Maschine arbeitet, müssen Sie sie oft von Grund auf neu bauen.

In letzter Zeit haben Menschen angefangen, „KI-Assistenten“ (Large Language Models, oder LLMs) einzusetzen, damit diese den Code für uns schreiben. Aber das ist so, als würde man einen Chatbot bitten, Ihre Maschine für Sie zu bauen. Sie geben eine Anfrage ein, er spuckt einen Block Code aus, und Sie hoffen, dass es funktioniert. Das Problem? Sie haben sehr wenig Kontrolle. Wenn die Maschine Probleme macht, ist es schwer, den Output der KI anzupassen, und der Code, den sie schreibt, ist oft unordentlich und schwer für den realen Einsatz zu optimieren.

Hier kommt SemPiper (und seine Engine, SemPipes) ins Spiel.

Betrachten Sie SemPipes nicht als einen Chatbot, der den Code für Sie schreibt, sondern als einen intelligenten Vorarbeiter, der Ihnen hilft, Ihre Maschine zu bauen. Anstatt die KI zu bitten, die ganze Arbeit zu erledigen, geben Sie dem Vorarbeiter spezifische, hochgradig abstrakte Anweisungen in natürlicher Sprache (wie „bereinige diese unordentliche Liste von Ländern“ oder „finde heraus, ob dieses Produkt luxuriös wirkt“).

So funktioniert es, unter Verwendung einiger Analogien:

1. Der „Intelligente Vorarbeiter“-Ansatz (Deklarative Operatoren)

In einer normalen Pipeline schreiben Sie den Code selbst. In SemPipes fügen Sie Ihrer Maschine spezielle „Semantische Operatoren“ hinzu. Diese sind wie magische Werkzeuge auf Ihrer Werkbank.

  • Sie sagen dem Werkzeug nicht, wie es das Holz schneiden soll; Sie sagen ihm nur, was es schneiden soll.
  • Sie sagen: „Nimm diese Produktbilder und sag mir, ob sie teuer aussehen“, und das Werkzeug versteht die Anweisung.
  • Das System nutzt die KI dann nur in der Konstruktionsphase (Trainingszeit), um herauszufinden, wie es das spezifische Werkzeug für Ihr spezielles Stück Holz (Daten) am besten baut. Sobald das Werkzeug gebaut ist, wird es zu einem standardisierten, schnellen Stück Code, das ohne die KI läuft.

2. Die „Evolutionäre Suche“ (Der Coach durch Versuch und Irrtum)

Wie macht man die Maschine besser, sobald sie gebaut ist? Normalerweise muss ein Mensch raten, was geändert werden muss. SemPipes besitzt einen integrierten Evolutionären Coach.

  • Stellen Sie sich vor, der Coach führt tausend winzige Simulationen Ihrer Maschine durch.
  • Er nimmt die „magischen Werkzeuge“ und passt deren Anweisungen leicht an (indem er die KI beispielsweise bittet, einen anderen Weg zur Bereinigung der Daten auszuprobieren).
  • Er testet diese modifizierten Versionen, um zu sehen, welche Version die finale Maschine besser vorhersagen lässt.
  • Er behält die besten Versionen und wirft die schlechten weg, wodurch die Maschine langsam zu einer super-effizienten Version „evolviert“. Er visualisiert diesen Prozess wie einen Stammbaum aus Code und zeigt Ihnen genau, welche Änderungen zum Erfolg geführt haben.

3. Die drei realen Szenarien

Das Paper demonstriert dieses System anhand von drei verschiedenen „Bauprojekten“:

  • Der Betrugsdetektiv: Stellen Sie sich ein Geschäft vor, das versucht, gefälschte Warenkörbe zu entdecken. Das System nutzt ein semantisches Werkzeug, um Produktnamen und -beschreibungen zu analysen, um zu erraten, ob eine Marke „riskant“ oder „luxuriös“ ist, und ein weiteres Werkzeug, um fehlende Herstellerangaben basierend auf dem Kontext zu ergänzen. Es kombiniert all diese Informationen, um die Betrüger zu überführen.
  • Der Museumskurator: Stellen Sie sich ein Museum mit unordentlichen Aufzeichnungen von Kunstwerken vor. Einige Daten sind als „18. Jahrhundert“ geschrieben, andere als „1750–1760“. Das System nutzt ein semantisches Werkzeug, um all diese unordentlichen Daten in ein sauberes, strukturiertes Format zu bringen. Es nutzt zudem ein weiteres Werkzeug, um die chaotischen Namen der Kunstwerke so zu organisieren, dass ein Computer sie verstehen kann.
  • Der Immobilien-Gutachter: Stellen Sie sich die Vorhersage von Hauspreisen vor, die sowohl Zahlen (Quadratmeterzahl) als auch Fotos verwendet. Das System nutzt ein Werkzeug, um die Hausfotos zu betrachten und das Äußere zu beschreiben (z. B. „hat es eine Garage?“). Es nutzt dann ein weiteres Werkzeug, um seltsame Fehler in den Quadratmeterzahlen zu korrigieren. Schließlich kombiniert es all dies, um den Preis zu schätzen.

Das große Ganze

Die SemPiper-Schnittstelle ist der „Showroom“, in dem Sie all dies erleben können. Sie ermöglicht es Ihnen:

  1. Den Bauplan zu sehen: Visualisieren Sie den Fluss der Maschine (den computationalen Graphen).
  2. Unter die Motorhaube zu schauen: Betrachten Sie den tatsächlichen Code, den die KI für Ihre spezifischen Anweisungen generiert hat.
  3. Anzupassen und zuzusehen: Ändern Sie Ihre englischen Anweisungen und sehen Sie zu, wie die KI den Code sofort umschreibt.
  4. Die Evolution zu beobachten: Sehen Sie dem „Coach“ bei seinen Simulationen zu und beobachten Sie, wie die Maschine Schritt für Schritt besser wird.

Kurz gesagt: SemPipes schließt die Lücke zwischen der unordentlichen, kreativen Kraft der KI und den strengen, zuverlässigen Anforderungen des Engineerings. Es lässt Sie in einfacher Sprache mit Ihren Daten kommunizieren, stellt aber sicher, dass das Endergebnis eine robuste, optimierte und kontrollierbare Maschine ist, die nicht jeden Tag auf die KI angewiesen ist, um zu funktionieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →