← Ultimi articoli
💬 NLP

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

Il documento propone SePO, un framework autoriferito che ottimizza sia i prompt di sistema degli agenti di task sia quelli del prompt agent attraverso una ricerca evolutiva a due stadi, dimostrando una generalizzazione e una prestazione superiori su diversi benchmark rispetto ai metodi esistenti.

Autori originali: Wangcheng Tao, Han Wu, Weng-Fai Wong

Pubblicato 2026-06-04
📖 5 min di lettura🧠 Approfondimento

Autori originali: Wangcheng Tao, Han Wu, Weng-Fai Wong

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un assistente robotico brillante ma testardo (l'Agente di Task) che deve risolvere enigmi difficili, scrivere codice o fare matematica. Per far sì che questo robot lavori meglio, gli fornisci un insieme di istruzioni chiamato "prompt di sistema".

Per molto tempo, sono stati gli esseri umani a scrivere queste istruzioni. Se il robot falliva, un umano riscriveva le istruzioni, riprovava e sperava nel meglio. Alcuni metodi più recenti utilizzano un "Coach" (l'Agente di Prompt) per riscrivere automaticamente queste istruzioni per il robot. Ma c'è un problema: le istruzioni del Coach stesso erano ancora scritte da un essere umano e non cambiavano mai. Il Coach era bloccato con un manuale fisso, scritto a mano, indipendentemente da quante volte cercava di aiutare il robot.

SePO (Self-Evolving Prompt Optimization) cambia le regole del gioco permettendo al Coach di allenare se stesso.

La Grande Idea: Il Coach Allena il Coach

Pensa a SePO come a una palestra per manuali di istruzioni AI.

  • Il Vecchio Modo: Assumi un personal trainer (il Coach) per aiutare un cliente (il Robot) a rimettersi in forma. Ma il piano di allenamento del trainer stesso è stato scritto da un essere umano e non viene mai aggiornato. Il trainer diventa bravo ad aiutare il cliente, ma il trainer non migliora mai la propria forma fisica.
  • Il Modo SePO: Il trainer è anche un cliente. Il trainer aiuta il cliente a rimettersi in forma, ma il trainer usa anche gli stessi metodi di allenamento per migliorare il proprio piano di allenamento. Il trainer diventa più intelligente e forte nel tempo, non solo il cliente.

Come Funziona: Due Fasi di Addestramento

Il documento descrive un processo in due fasi, simile a come gli umani imparano una nuova abilità:

Fase 1: Il "Boot Camp" (Pre-addestramento)
Prima che il Coach aiuti un robot specifico, frequenta un "boot camp" con una vasta gamma di sfide (matematica, enigmi logici, programmazione, scienza).

  • In questa fase, il Coach prova a risolvere questi problemi.
  • Quando fallisce, critica le proprie istruzioni, le riscrive e riprova.
  • Tiene un "album dei ricordi" (un archivio) delle sue migliori istruzioni. Se una nuova istruzione funziona meglio di una vecchia, conserva la nuova.
  • Il Risultato: Il Coach evolve in un maestro istruttore con una "abilità" generale nel correggere le istruzioni, piuttosto che nel memorizzare un singolo trucco specifico.

Fase 2: Il "Lavoro Specializzato" (Fine-tuning)
Ora, il Coach viene assunto per aiutare un robot specifico con un lavoro specifico (ad esempio, risolvere il Sudoku).

  • Il Coach utilizza le sue istruzioni evolute e super intelligenti per aiutare il robot.
  • Apporta modifiche alle istruzioni del robot per adattarle al puzzle specifico.
  • Poiché il Coach ha imparato come imparare nella Fase 1, può adattarsi rapidamente a nuovi lavori senza che un essere umano debba riscrivere prima il suo manuale.

Perché Questo è Importante (I Risultati)

I ricercatori hanno testato questo metodo su cinque tipi di sfide molto diverse:

  1. Matematica (Problemi competitivi difficili)
  2. Ragionamento Astratto (Puzzle di pattern visivi)
  3. Scienza (Domande di livello universitario/post-laurea)
  4. Coding (Scrittura di programmi Python)
  5. Logica (Puzzle di Sudoku)

Hanno confrontato SePO con:

  • Manual-CoT: Un essere umano che scrive le istruzioni.
  • TextGrad: Un metodo che modifica le istruzioni ma utilizza un "critico" fisso, scritto da un umano.
  • MetaSPO: Un metodo che apprende una regola globale ma dipende ancora da un ottimizzatore fisso scritto da un umano.

L'Esito:
SePO ha vinto su ogni singolo compito. In media, ha migliorato l'accuratezza di 4,49 punti rispetto alla base umana.

  • Non si è limitato a memorizzare le risposte; ha imparato una "abilità" generale di come scrivere istruzioni migliori.
  • Anche quando è stato testato su un puzzle (Sudoku) che non aveva mai visto durante il suo boot camp, ha comunque performato meglio degli altri metodi. Questo dimostra che ha appreso una competenza trasferibile, non solo un trucco specifico.

L'Analogia del "Giardino Evolutivo"

Immagina che le istruzioni siano piante in un giardino.

  • Vecchi metodi: Pianti semi (istruzioni) e li innaffi. Se una pianta muore, ne scegli un altro sacchetto di semi e riprovi. Il giardiniere (il Coach) non cambia mai.
  • SePO: Il giardiniere è anche una pianta. Il giardiniere cresce, evolve e migliora nel giardinaggio mentre si prende cura delle altre piante. Il giardino tiene un registro delle piante migliori (l'archivio) e le usa come gradini per far crescere piante ancora migliori. Alla fine, il giardino produce un giardiniere così esperto da poter far crescere qualsiasi cosa, anche piante che non ha mai visto prima.

Riassunto

SePO chiude il cerchio. Inveve di far scrivere a un essere umano un manuale fisso per un coach AI, SePO permette al coach AI di scrivere e migliorare il proprio manuale. Questo trasforma il coach da uno strumento statico a un partner di apprendimento che diventa più intelligente con l'esperienza, portando a prestazioni migliori in matematica, scienza, programmazione e logica.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →