← Nieuwste papers
💬 NLP

PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows

PROTEA is een geïntegreerde interface voor offline, testgedreven verfijning van multi-agent LLM-workflows die knelpunten lokaliseert via grafgebaseerde scoring en terugwaartse evaluatie, waardoor ontwikkelaars promptherzieningen iteratief kunnen bewerken en valideren om de systeemprestaties aanzienlijk te verbeteren.

Oorspronkelijke auteurs: Kazuki Kawamura, Satoshi Waki, Kei Tateno

Gepubliceerd 2026-05-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Kazuki Kawamura, Satoshi Waki, Kei Tateno

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je regisseur bent van een toneelstuk waarvan de cast volledig bestaat uit AI-robots. Elke robot heeft een specifieke taak: één leest het script, een andere controleert de feiten, een derde schrijft de dialogen en een vierde levert de uiteindelijke uitvoering. Dit noemen ontwikkelaars een "multi-agent LLM-workflow".

Meestal werken deze robotteams beter dan een enkele robot die probeert alles tegelijk te doen. Maar hier zit het probleem: als de uiteindelijke uitvoering slecht is, is het een nachtmerrie om uit te zoeken welke robot het heeft verprutst. Heeft de feitencontroleur de verkeerde informatie gekregen? Begreep de schrijver de toon verkeerd? Of struikelde de laatste acteur gewoon?

Op dit moment moeten ontwikkelaars uren aan video (de "trace") van het hele stuk bekijken en raden waar de fout begon. Het is alsof je probeert een enkele typefout te vinden in een boek van 500 pagina's door elk woord opnieuw te lezen.

Maak kennis met PROTEA.

Stel je PROTEA voor als een slimme, interactieve "repetitieruimte met een magische schijnwerper". Het helpt ontwikkelaars deze robotteams te debuggen en te verbeteren zonder dat ze de hele film keer op keer hoeven te bekijken.

Hieronder wordt uitgelegd hoe het werkt, met eenvoudige analogieën:

1. De magische schijnwerper (Diagnose op knooppuntniveau)

In plaats van naar het hele stuk te kijken, plaatst PROTEA een verkeerslicht op het station van elke afzonderlijke robot.

  • 🟢 Groen: Deze robot heeft zijn werk perfect gedaan.
  • 🟡 Geel: Deze robot was oké, maar misschien een beetje slordig.
  • 🔴 Rood: Deze robot heeft het verprutst.

Wanneer het uiteindelijke antwoord verkeerd is, zegt PROTEA niet zomaar "Het stuk is mislukt". Het markeert direct de rode robot en zegt: "Hé, kijk hier! Deze robot gaf de volgende robot de verkeerde informatie." Het bespaart de ontwikkelaar het zoeken door het hele script.

2. De "reverse engineer" (Terugwaartse inferentie)

Soms weten ontwikkelaars alleen wat het uiteindelijke antwoord moet zijn (bijvoorbeeld: "Het stuk moet eindigen met een gelukkig gelach"), maar hebben ze geen specifiek script voor wat de middelste robots moeten zeggen.

PROTEA gebruikt een truc genaamd terugwaartse inferentie. Stel je voor dat je de bestemming van een roadtrip kent, maar niet de bochten onderweg. PROTEA werkt terug vanuit het "Gelukkig gelach" om te vragen: "Om ervoor te zorgen dat de laatste robot lacht, wat moest de schrijver-robot dan zeggen? En om ervoor te zorgen dat de schrijver dat zegt, wat moest de feitencontroleur dan leveren?"

Het genereert een "spookscript" voor de tussenstappen op basis van het uiteindelijke doel. Vervolgens vergelijkt het wat de robots daadwerkelijk zeiden met dit "spookscript" om de zwakke schakels te vinden.

3. De "bewerk-knop" (Prompt-verfijning)

Zodra PROTEA de rode robot heeft gevonden, wijst het niet alleen naar haar; het biedt een voorgesteld oplossing aan.

  • Het toont de huidige instructies van de robot (de "Prompt").
  • Het stelt een nieuwe, verbeterde versie van die instructies voor.
  • Het toont een "Voor vs. Na"-vergelijking, net als een fotobewerkingsprogramma dat het origineel en de bewerkte versie naast elkaar laat zien.

De ontwikkelaar kan de suggestie accepteren, aanpassen of negeren.

4. De "directe herhaling" (Automatische heruitvoering)

Het beste deel? Zodra de ontwikkelaar op "Opslaan" klikt, herhaalt PROTEA het hele stuk direct met de nieuwe instructies. Het toont vervolgens een grafiek met de scores: "Zie je? Voorheen was de score 64%. Na je bewerking is het nu 84%!"

Dit creëert een snelle cyclus: Vind het probleem → Stel een oplossing voor → Test het → Zie het resultaat. Geen wachten van dagen meer om te zien of een verandering werkte.

Wat hebben ze eigenlijk bereikt?

Het artikel testte dit systeem in twee realistische scenario's (hoewel ze de specifieke bedrijfsnamen geheim hielden):

  1. Documentcontrole: Een systeem dat documenten controleert op strikte regels. PROTEA hielp de nauwkeurigheid te verbeteren van 64,3% naar 83,9%.
  2. Aanbevelingssysteem: Een chatbot die items voorstelt (zoals films of producten). PROTEA hielp het om vaker de juiste aanbeveling in de top 5 te krijgen, met een verbetering van de score van 0,30 naar 0,38.

Ze testten het ook op een groep van zes ervaren AI-ontwikkelaars. Deze ontwikkelaars waren dol op het systeem omdat het hen stopte met staren naar eindeloze logs en hen in staat stelde zich te focussen op het repareren van de specifieke robot die de problemen veroorzaakte.

De kernboodschap

PROTEA is een tool die de verwarrende, rommelige taak van het debuggen van een team van AI-robots omzet in een schoon, visueel proces. Het fungeert als een coach met een samenvatting van hoogtepunten, die je precies laat zien welke speler de bal liet vallen en je een spelplan geeft om het te repareren, allemaal op één plek.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →