← Nieuwste papers
💬 NLP

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

Het artikel stelt SePO voor, een zelfreferentieel framework dat zowel de systeemprompts van de taakagenten als die van de promptagent optimaliseert via een tweestaps evolutionaire zoektocht, waarmee een superieure generalisatie en prestatie over diverse benchmarks wordt aangetoond vergeleken met bestaande methoden.

Oorspronkelijke auteurs: Wangcheng Tao, Han Wu, Weng-Fai Wong

Gepubliceerd 2026-06-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wangcheng Tao, Han Wu, Weng-Fai Wong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar eigenwijze robotassistent hebt (de Task Agent) die moeilijke puzzels moet oplossen, code moet schrijven of wiskunde moet doen. Om deze robot beter te laten werken, geef je hem een set instructies die een "system prompt" worden genoemd.

Lange tijd waren het mensen die deze instructies schreven. Als de robot faalde, schreef een mens de instructies opnieuw, probeerde het opnieuw en hoopte op het beste. Sommige nieuwere methoden gebruiken een "Coach" (de Prompt Agent) om deze instructies automatisch te herschrijven voor de robot. Maar hier zit de crux: de instructies van de Coach zelf waren nog steeds geschreven door een mens en veranderden nooit. De Coach zat vast aan een vaststaand, handgeschreven handboek, ongeacht hoe vaak hij probeerde te helpen.

SePO (Self-Evolving Prompt Optimization) verandert de regels van het spel door de Coach zichzelf te laten coachen.

Het Grote Idee: De Coach Coacht de Coach

Denk aan SePO als een sportschool voor AI-instructiehandleidingen.

  • De Oude Manier: Je huurt een personal trainer (de Coach) in om een cliënt (de Robot) te helpen fit te worden. Maar het eigen trainingsplan van de trainer werd door een mens geschreven en werd nooit bijgewerkt. De trainer wordt beter in het helpen van de cliënt, maar de trainer zelf wordt nooit fitter.
  • De SePO-Manier: De trainer is ook een cliënt. De trainer helpt de cliënt fit te worden, maar de trainer gebruikt ook dezelfde trainingsmethoden om zijn eigen trainingsplan te verbeteren. De trainer wordt slimmer en sterker, niet alleen de cliënt.

Hoe het Werkt: Twee Fasen van Training

Het artikel beschrijft een tweetrapsproces, vergelijkbaar met hoe mensen een nieuwe vaardigheid leren:

Fase 1: De "Boot Camp" (Pre-training)
Voordat de Coach een specifieke robot helpt, gaat hij naar een "boot camp" met een enorme variëteit aan uitdagingen (wiskunde, logische puzzels, programmeren, wetenschap).

  • In deze fase probeert de Coach deze problemen op te lossen.
  • Wanneer hij faalt, bekritiseert hij zijn eigen instructies, herschrijft hij ze en probeert hij het opnieuw.
  • Hij houdt een "scrapbook" (archief) bij van zijn beste instructies. Als een nieuwe instructie beter werkt dan een oude, bewaart hij de nieuwe.
  • Het Resultaat: De Coach evolueert tot een meesterinstructeur met een algemene "vaardigheid" voor het repareren van instructies, in plaats van slechts één specifieke truc te onthouden.

Fase 2: De "Specialistische Klus" (Fine-tuning)
Nu wordt de Coach ingehuurd om een specifieke robot te helpen met een specifieke taak (bijv. het oplossen van Sudoku).

  • De Coach gebruikt zijn geëvolueerde, superintelligente instructies om de robot te helpen.
  • Hij past de instructies van de robot aan om deze op de specifieke puzzel af te stemmen.
  • Omdat de Coach in Fase 1 heeft geleerd hoe hij moet leren, kan hij zich snel aanpassen aan nieuwe taken zonder dat er eerst een mens zijn eigen handboek hoeft te herschrijven.

Waarom Dit Belangrijk Is (De Resultaten)

De onderzoekers hebben dit getest op vijf zeer verschillende soorten uitdagingen:

  1. Wiskunde (Moeilijke competitieproblemen)
  2. Abstract Redeneren (Visuele patroonpuzzels)
  3. Wetenschap (Vragen op graduate-niveau)
  4. Coderen (Python-programma's schrijven)
  5. Logica (Sudoku-puzzels)

Ze vergeleken SePO met:

  • Manual-CoT: Een mens die de instructies schrijft.
  • TextGrad: Een methode die instructies aanpast, maar gebruikmaakt van een vaste, door mensen geschreven "critic".
  • MetaSPO: Een methode die een globale regel leert, maar nog steeds vertrouwt op een vaste, door mensen geschreven optimizer.

De Uitkomst:
SePO won op elke opdracht. Gemiddeld verbeterde het de nauwkeurigheid met 4,49 punten vergeleken met de door mensen geschreven baseline.

  • Het leerde niet alleen antwoorden uit het hoofd; het leerde een algemene "vaardigheid" hoe je betere instructies schrijft.
  • Zelfs toen het werd getest op een puzzel (Sudoku) die het nooit had gezien tijdens zijn boot camp, presteerde het nog steeds beter dan de andere methoden. Dit bewijst dat het een overdraagbare vaardigheid heeft geleerd, en niet slechts een specifieke truc.

De Analogie van de "Evolutionaire Tuin"

Stel je voor dat de instructies planten zijn in een tuin.

  • Oude methoden: Je plant zaden (instructies) en geeft ze water. Als een plant doodgaat, pak je een nieuw zaadje uit een zak en probeer je het opnieuw. De tuinier (de Coach) verandert nooit.
  • SePO: De tuinier is ook een plant. De tuinier groeit, evolueert en wordt beter in tuinieren terwijl hij voor de andere planten zorgt. De tuin houdt een verslag bij van de beste planten (het archief) en gebruikt deze als opstapjes om nog betere planten te laten groeien. Uiteindelijk produceert de tuin een tuinier die zo vaardig is dat hij alles kan laten groeien, zelfs planten die hij nog nooit heeft gezien.

Samenvatting

SePO sluit de cirkel. In plaats van dat een mens een vaststaand handboek schrijft voor een AI-coach, laat SePO de AI-coach zijn eigen handboek schrijven en verbeteren. Dit verandert de coach van een statisch hulpmiddel in een lerende partner die slimmer wordt met ervaring, wat leidt tot betere prestaties in wiskunde, wetenschap, coderen en logische puzzels.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →