← Nieuwste papers
🤖 AI

FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

FAPO is een volledig autonoom framework dat meerstaps LLM-pipelines optimaliseert door iteratief zowel prompts als ketenstructuren te evalueren, te diagnosticeren en te verfijnen, waarbij het de state-of-the-art prestaties bereikt over algemene en beveiligingsgerichte benchmarks door de GEPA-baseline te overtreffen.

Oorspronkelijke auteurs: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

Gepubliceerd 2026-06-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van robots hebt die samenwerken om een complexe puzzel op te lossen. Elke robot heeft een specifieke taak: de één vindt aanwijzingen, een ander denkt erover na, en een derde schrijft het uiteindelijke antwoord op. Soms faalt het hele team, maar is het moeilijk te zeggen welke robot de fout in ging. Heeft de eerste een aanwijzing gemist? Is de tweede in de war geraakt? Of heeft de derde het antwoord in het verkeerde formaat opgeschreven?

Dit is het probleem met Multi-step LLM pipelines (complexe ketens van AI-taken). Traditionele methoden proberen het hele team te repareren door simpelweg de instructies aan de "baas"-robot te herschrijven (de prompt). Maar als het probleem is dat het team een stap mist of met de verkeerde mensen praat, helpt het veranderen van de instructies niet.

Maak kennis met FAPO (Fully Autonomous Prompt Optimization). Zie FAPO als een super-slimme, autonome projectmanager (aangedreven door een AI genaamd Claude Code) die niet alleen instructies herschrijft; het observeert hoe het hele team werkt, vindt de exacte bottleneck en lost het op.

Zo werkt FAP perfect, met behulp van eenvoudige analogieën:

1. De Detectivefase (Inspectie)

In plaats van te gokken, observeert FAPO hoe het team een oefenpuzzel oplost. Het legt elke beweging, elke gevonden aanwijzing en elk denkproces vast. Als het team het antwoord fout heeft, treedt FAP de detective af:

  • "Faalden we omdat we de juiste aanwijzing niet vonden?" (Retrieval failure)
  • "Vonden we de aanwijzing wel, maar begrepen we hem verkeerd?" (Reasoning failure)
  • "Begrepen we het wel, maar schreven we het antwoord in het verkeerde formaat op?" (Formatting failure)

2. De "Eerst Fixen"-regel (Prompt Edits)

FAP volgt een strikte regel: Begin klein.
Als de detective ontdekt dat het team alleen duidelijkere instructies nodig heeft, herschrijft FAP de prompt (de instructies). Het is alsof je tegen de robots zegt: "Hey, zoek naar de rode doos, niet de blauwe." Het probeert dit eerst, omdat het de makkelijkste oplossing is.

3. De "Redesign"-fase (Structurele Veranderingen)

Als FAP probeert de instructies steeds opnieuw te herschrijven, maar het team nog steeds faalt omdat er een cruciale stap ontbreekt (zoals het nodig hebben van een vierde robot om de wiskunde te controleren), krijgt FAP toestemming om de teamstructuur te veranderen.

  • Het kan een nieuwe robot aan het team toevoegen.
  • Het kan de volgorde veranderen waarin de robots met elkaar communiceren.
  • Het kan een "veiligheidscontrole"-stap toevoegen die het team dwingt specifieke regels te volgen voordat ze het definitieve antwoord opschrijven.

Dit is het cruciale verschil: FAP verandert de structuur van de pipeline alleen als het bewezen is dat het enkel veranderen van de woorden (prompts) niet genoeg is.

4. De Veiligheidsinspecteur (Guardrails)

Voordat FAP een wijziging doorvoert, controleert een "Veiligheidsinspecteur" (een andere AI-agent) het plan. Dit zorgt ervoor dat FAP niet per ongeluk belangrijke regels verwijdert, privégegevens lekt of het scoringssysteem breekt. Het is als een bouwinspecteur die een renovatieplan controleert voordat de bouwploeg begint.

De Resultaten: Hoe goed werkte het?

Het paper testte FAPO tegen een ander hulpmiddel genaamd GEPA (dat een zeer goede editor is die alleen instructies herschrijft) over zes verschillende soorten uitdagingen, van wiskundige problemen tot beveiligingstaken.

  • De Scorebord: FAPO won 15 van de 18 keer.
  • De Grote Overwinningen: Bij de moeilijkste taken (zoals het controleren van feiten in complexe verhalen of het volgen van strikte formatteringregels) paste FAP niet alleen de instructies aan; het realiseerde zich dat het team een nieuwe structuur nodig had. In deze gevallen schoten de scores van FAP om enorme marges omhoog (tot wel +33,8 procentpunt beter dan de concurrentie).
  • Beveiligingstaken: FAP verbeterde ook de prestaties van AI-modellen bij het identificeren van beveiligingskwetsbaarheden (zoals het koppelen van softwarebugs aan hun oorzaken), wat bewijst dat het werkt voor serieuze, hoogwaardige taken.

De Enkele Uitzondering

Er was één wiskundecompetitie (AIME) waar FAP niet won. De auteurs suggereren dat dit komt doordat de wiskundeproblemen zo moeilijk waren en de steekproef zo klein was, dat de AI "in de war" raakte of overfitte op de oefenproblemen, in plaats van daadwerkelijk de wiskunde beter te leren.

Samenvatting

FAPO is als een slimme manager die niet alleen tegen de werknemers roept om "het beter te doen". In plaats daarvan observeert het de workflow, diagnosticeert exact waar het proces breekt, repareert eerst de instructies, en als dat faalt, ontwerpt het de volledige workflow opnieuw om het team effectiever te maken. Het verandert een rommelige, falende keten van AI-stappen in een betrouwbare, hoogpresterende machine.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →