← Neueste Arbeiten
🤖 AI

FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

FAPO ist ein vollautonomes Framework, das mehrstufige LLM-Pipelines durch iteratives Evaluieren, Diagnostizieren und Verfeinern sowohl von Prompts als auch von Kettenstrukturen optimiert und dabei durch die Übertreffung der GEPA-Baseline eine State-of-the-Art-Leistung über allgemeine sowie sicherheitsfokussierte Benchmarks hinweg erzielt.

Ursprüngliche Autoren: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

Veröffentlicht 2026-06-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben ein Team von Robotern, die zusammenarbeiten, um ein komplexes Rätsel zu lösen. Jeder Roboter hat eine spezifische Aufgabe: Einer findet Hinweise, einer denkt über diese nach und ein dritter schreibt die endgültige Antwort auf. Manchmal scheitert das gesamte Team, aber es ist schwer zu sagen, welcher Roboter den Fehler gemacht hat. Hat der erste einen Hinweis übersehen? Ist der zweite verwirrt worden? Oder hat der dritte die Antwort im falschen Format aufgeschrieben?

Dies ist das Problem mit Multi-Step-LLM-Pipelines (komplexen Ketten von KI-Aufgaben). Traditionelle Methoden versuchen, das gesamte Team zu reparieren, indem sie einfach nur die Anweisungen an den „Chef“-Roboter umschreiben (den Prompt). Aber wenn das Problem darin besteht, dass dem Team ein Schritt fehlt oder die Roboter mit den falschen Leuten kommunizieren, wird es nicht helfen, nur die Anweisungen zu ändern.

Hier kommt FAPO (Fully Autonomous Prompt Optimization) ins Spiel. Betrachten Sie FAPos wie einen hochintelligenten, autonomen Projektmanager (angetrieben durch eine KI namens Claude Code), der nicht nur Anweisungen umschreibt; er beobachtet das gesamte Team bei der Arbeit, findet genau den Engpass und behebt ihn.

So funktioniert FAPO, erklärt anhand einfacher Analogien:

1. Die Detektiv-Phase (Inspektion)

Anstatt zu raten, beobachtet FAPO das Team beim Lösen eines Übungsrätsels. Es zeichnet jede Bewegung, jeden gefundenen Hinweis und jeden Gedankengang auf. Wenn das Team die Antwort falsch berechnet, agiert FAPO wie ein Detektiv:

  • „Sind wir gescheitert, weil wir den richtigen Hinweis nicht gefunden haben?“ (Retrieval-Fehler)
  • „Haben wir den Hinweis gefunden, ihn aber missverstanden?“ (Reasoning-Fehler)
  • „Haben wir ihn verstanden, aber die Antwort im falschen Format aufgeschrieben?“ (Formatierungs-Fehler)

2. Die „Erst-Reparieren-Regel“ (Prompt-Edits)

FAPO folgt einer strengen Regel: Beginne klein.
Wenn der Detektiv feststellt, dass das Team lediglich klarere Anweisungen benötigt, schreibt FAPO den Prompt (die Anweisungen) um. Es ist, als würde man den Robotern sagen: „Hey, sucht nach der roten Box, nicht nach der blauen.“ FAPO versucht dies zuerst, da es die einfachste Lösung ist.

3. Die „Redesign“-Phase (Strukturelle Änderungen)

Wenn FAPO versucht, die Anweisungen immer wieder umzuschreiben, das Team aber immer noch scheitert, weil ihm ein entscheidender Schritt fehlt (wie etwa die Notwendigkeit eines vierten Roboters, der die Mathematik überprüft), erhält FAPO die Erlaubnis, die Teamstruktur zu ändern.

  • Es könnte einen neuen Roboter zum Team hinzufügen.
  • Es könnte die Reihenfolge ändern, in der die Roboter miteinander kommunizieren.
  • Es könnte einen „Sicherheitscheck“-Schritt hinzufügen, der das Team dazu zwingt, bestimmte Regeln zu befolgen, bevor die endgültige Antwort geschrieben wird.

Dies ist der entscheidende Unterschied: FAPO ändert die Struktur der Pipeline nur dann, wenn es beweist, dass das bloße Ändern der Worte (Prompts) nicht ausreicht.

4. Der Sicherheitsinspektor (Guardrails)

Bevor FAPO eine Änderung vornimmt, prüft ein „Sicherheitsinspektor“ (ein anderer KI-Agent) den Plan. Dies stellt sicher, dass FAPO nicht versehentlich wichtige Regeln löscht, private Daten preisgibt oder das Bewertungssystem beschädigt. Es ist wie ein Bauinspektor, der einen Renovierungsplan prüft, bevor die Bauarbeiter beginnen.

Die Ergebnisse: Wie gut hat es funktioniert?

Das Paper testete FAPO gegen ein anderes Tool namens GEPA (das wie ein sehr guter Editor ist, der lediglich Anweisungen umschreibt) in sechs verschiedenen Arten von Herausforderungen, von mathematischen Problemen bis hin zu Sicherheitsaufgaben.

  • Die Bestenliste: FAPO gewann 15 von 18 Mal.
  • Die großen Erfolge: Bei den schwierigsten Aufgaben (wie der Faktenprüfung komplexer Geschichten oder dem Befolgen strenger Formatierungsregeln) hat FAPO nicht nur die Anweisungen angepasst, sondern erkannt, dass das Team eine neue Struktur benötigt. In diesen Fällen stiegen die Werte von FAPO massiv an (um bis zu +33,8 Prozentpunkte besser als der Wettbewerber).
  • Sicherheitsaufgaben: FAPO verbesserte auch die Fähigkeit von KI-Modellen, Sicherheitslücken zu identifizieren (wie das Zuordnen von Softwarefehlern zu deren Ursachen), was beweist, dass es auch für ernsthafte, hochkarätige Aufgaben geeignet ist.

Die eine Ausnahme

Es gab einen Mathematikwettbewerb (AIME), bei dem FAPO nicht gewann. Die Autoren vermuten, dass dies daran liegen könnte, dass die mathematischen Probleme so schwierig waren und die Stichprobengröße so klein war, dass die KI „verwirrt“ wurde oder sich zu sehr auf die Übungsprobleme spezialisiert hat (Overfitting), anstatt die Mathematik tatsächlich besser zu lernen.

Zusammenfassung

FAPO ist wie ein kluger Manager, der den Arbeitern nicht einfach nur zuruft: „Macht es besser!“. Stattdessen beobachtet es den Arbeitsablauf, diagnostiziert genau, wo der Prozess unterbrochen wird, behebt zuerst die Anweisungen und, falls das fehlschlägt, entwirft es den gesamten Workflow neu, um das Team effektiver zu machen. Es verwandelt eine chaotische, fehlerhafte Kette von KI-Schritten in eine zuverlässige, hochleistungsfähige Maschine.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →