SePO: Self-Evolving Prompt Agent for System Prompt Optimization
Le papier propose SePO, un cadre autoréférentiel qui optimise à la fois les prompts système des agents de tâches et celui de l'agent de prompt via une recherche évolutive en deux étapes, démontrant une généralisation et des performances supérieures sur divers benchmarks par rapport aux méthodes existantes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un assistant robotique brillant mais têtu (l'Agent de Tâche) qui doit résoudre des énigmes difficiles, écrire du code ou faire des mathématiques. Pour faire mieux travailler ce robot, vous lui donnez un ensemble d'instructions appelé « prompt système ».
Pendant longtemps, les humains ont été ceux qui écrivaient ces instructions. Si le robot échouait, un humain réécrivait les instructions, essayait à nouveau, et espérait que cela fonctionnerait. Certaines méthodes plus récentes utilisent un « Coach » (l'Agent de Prompt) pour réécrire automatiquement ces instructions pour le robot. Mais il y a un pièat : les propres instructions du Coach étaient toujours écrites par un humain et ne changeaient jamais. Le Coach était coincé avec un manuel fixe, écrit à la main, peu importe le nombre de fois où il essayait d'aider le robot.
SePO (Self-Evolving Prompt Optimization) change la donne en laissant le Coach s'entraîner lui-même.
La Grande Idée : Le Coach entraîne le Coach
Considérez SePO comme une salle de sport pour les manuels d'instructions d'IA.
- L'ancienne méthode : Vous engagez un entraîneur personnel (le Coach) pour aider un client (le Robot) à se mettre en forme. Mais le propre programme d'entraînement de l'entraîneur a été écrit par un humain et n'est jamais mis à jour. L'entraîneur devient meilleur pour aider le client, mais l'entraîneur ne devient jamais plus en forme lui-même.
- La méthode SePO : L'entraîneur est aussi un client. L'entraîneur aide le client à se mettre en forme, mais l'entraîneur utilise également ces mêmes méthodes d'entraînement pour améliorer son propre programme d'entraînement. L'entraîneur devient plus intelligent et plus fort au fil du temps, pas seulement le client.
Comment ça marche : Deux étapes d'entraînement
Le document décrit un processus en deux étapes, similaire à la façon dont les humains apprennent une nouvelle compétence :
Étape 1 : Le « Camp d'entraînement » (Pré-entraînement)
Avant que le Coach n'aide un robot spécifique, il suit un « camp d'entraînement » avec une immense variété de défis (mathématiques, énigmes logiques, codage, sciences).
- Dans cette étape, le Coach essaie de résoudre ces problèmes.
- Lorsqu'il échoue, il critique ses propres instructions, les réécrit et essaie à nouveau.
- Il conserve un « album de souvenirs » (une archive) de ses meilleures instructions. Si une nouvelle instruction fonctionne mieux qu'une ancienne, il garde la nouvelle.
- Le Résultat : Le Coach évolue pour devenir un instructeur maître possédant une « compétence » générale pour corriger les instructions, plutôt que de simplement mémoriser un tour spécifique.
Étape 2 : Le « Travail de Spécialiste » (Affinage/Fine-tuning)
Maintenant, le Coach est engagé pour aider un robot spécifique dans un travail spécifique (par exemple, résoudre un Sudoku).
- Le Coach utilise ses instructions évoluées et super-intelligentes pour aider le robot.
- Il ajuste les instructions du robot pour qu'elles correspondent au puzzle spécifique.
- Parce que le Coach a appris comment apprendre lors de l'Étape 1, il peut s'adapter rapidement à de nouveaux travaux sans avoir besoin qu'un humain réécrive son propre manuel au préalable.
Pourquoi cela compte (Les Résultats)
Les chercheurs ont testé cela sur cinq types de défis très différents :
- Mathématiques (Problèmes de compétition difficiles)
- Raisonnement Abstrait (Énigmes de motifs visuels)
- Sciences (Questions de niveau master/doctorat)
- Codage (Écriture de programmes Python)
- Logique (Puzzles de Sudoku)
Ils ont comparé SePO à :
- Manual-CoT : Un humain écrivant les instructions.
- TextGrad : Une méthode qui ajuste les instructions mais utilise un « critique » fixe écrit par un humain.
- MetaSPO : Une méthode qui apprend une règle globale mais repose toujours sur un optimiseur fixe écrit par un humain.
Le Résultat :
SePO a gagné sur chaque tâche. En moyenne, il a amélioré la précision de 4,49 points par rapport à la base de référence écrite par l'humain.
- Il n'a pas seulement mémorisé des réponses ; il a appris une « compétence » générale de la rédaction de meilleures instructions.
- Même lorsqu'il a été testé sur un puzzle (Sudoku) qu'il n'avait jamais vu pendant son camp d'entraînement, il a tout de même obtenu de meilleurs résultats que les autres méthodes. Cela prouve qu'il a appris une compétence transférable, et non un simple tour spécifique.
L'analogie du « Jardin Évolutif »
Imaginez que les instructions sont des plantes dans un jardin.
- Les anciennes méthodes : Vous plantez des graines (instructions) et vous les arrosez. Si une plante meurt, vous choisissez une nouvelle graine dans un sac et vous réessayez. Le jardinier (le Coach) ne change jamais.
- SePO : Le jardinier est aussi une plante. Le jardinier grandit, évolue et devient meilleur en jardinage pendant qu'il prend soin des autres plantes. Le jardin garde une trace des meilleures plantes (l'archive) et les utilise comme des tremplins pour faire pousser de meilleures plantes. Finalement, le jardin produit un jardinier si qualifié qu'il peut faire pousser n'importe quoi, même des plantes qu'il n'a jamais vues auparavant.
Résumé
SePO boucle la boucle. Au lieu qu'un humain écrive un manuel fixe pour un coach d'IA, SePO permet au coach d'IA d'écrire et d'améliorer son propre manuel. Cela transforme le coach d'un outil statique en un partenaire d'apprentissage qui devient plus intelligent avec l'expérience, menant à de meilleures performances dans les domaines des mathématiques, des sciences, du codage et de la logique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.