Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizers
Cet article introduit OPTS, un cadre d'optimisation de prompts qui améliore les performances des optimiseurs existants comme EvoPrompt en implémentant des mécanismes explicites, basés sur les bandits (spécifiquement l'échantillonnage de Thompson), pour sélectionner et appliquer efficacement des stratégies de conception de prompts, surpassant ainsi les méthodes qui reposent sur une sélection de stratégies implicite.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot très intelligent mais parfois têtu (un grand modèle de langage) comment résoudre un casse-tête difficile. Vous donnez au robot des instructions, appelées « prompt ». Si les instructions sont vagues, le robot est confus. Si elles sont parfaites, le robot résout le casse-tête instantanément.
Pendant longtemps, les humains ont essayé d'écrire ces instructions parfaites à la main, ou ils ont utilisé des programmes informatiques pour ajuster automatiquement les instructions jusqu'à ce qu'elles fonctionnent mieux. C'est ce qu'on appelle l'Optimisation de Prompt.
Cependant, il y a un problème : ces programmes automatiques créent souvent des instructions qui sont fonctionnelles mais qui manquent de la « recette secrète » que les experts humains utilisent. Ils passent à côté d'astuces éprouvées comme « réfléchis étape par étape » ou « agis comme un expert ».
Le Problème : Le jeu de devinettes du robot
Récemment, un outil appelé APET a tenté de corriger cela. Il a donné au robot un menu de « stratégies de conception » (comme un menu de techniques de cuisine : ajouter du sel, hacher finement, mijoter doucement). Le robot était censé regarder le menu et décider quels trucs utiliser pour le casse-tête spécifique.
Mais l'article soutient que demander au robot de faire ce choix, c'est comme demander à un chef fatigué de deviner quelle épice sauvera une soupe brûlée. Le robot se trompe souvent en devinant, choisissant des stratégies qui rendent en réalité les instructions pires. C'est un choix implicite (le robot a juste l'« impression » qu'il devrait utiliser un truc), et il n'est pas très doué pour cela.
La Solution : OPTS (Le Sommelier Intelligent)
Les auteurs de cet article présentent une nouvelle méthode appelée OPTS (Optimizing Prompts with sTrategy Selection).
Au lieu de laisser le robot deviner, OPTS agit comme un sommelier intelligent (un expert en vin) ou un directeur de casino gérant un jeu de hasard. Voici comment cela fonctionne en utilisant une analogie simple :
Imaginez que vous avez une rangée de machines à sous (les chercheurs les appellent des « bras »).
- Machine 1 : Ajoute « Réfléchis étape par étape » aux instructions.
- Machine 2 : Dit au robot de « Relire la question ».
- Machine 3 : Dit au robot d'« Agir comme un expert en mathématiques ».
- Machine K+1 : Ne fait rien (garde les instructions exactement telles quelles).
Dans l'ancienne méthode (APET), le robot tirait simplement un levier au hasard ou selon une intuition.
Dans la nouvelle méthode OPTS, le système utilise une stratégie mathématique appelée Échantillonnage de Thompson (Thompson Sampling). Voyez cela comme un joueur de casino intelligent qui garde une fiche de score :
- Il essaie une machine (une stratégie).
- Si le robot résout mieux le casse-tête, le système donne un « pouce levé » à cette machine et la rend plus susceptible d'être choisie la prochaine fois.
- S'il échoue, le système donne un « pouce baissé » à cette machine et arrête de la choisir.
- Crucialement, il garde aussi une machine « Ne rien faire ». Si tous les trucs rendent les choses pires, le système apprend à laisser les instructions telles quelles.
Ce qu'ils ont trouvé
Les chercheurs ont testé cela sur deux robots différents (LLM) en utilisant un ensemble de casse-têtes de logique et de raisonnement très difficiles (appelés BIG-Bench Hard).
- Le Résultat : En utilisant cette approche de « joueur intelligent » pour choisir la bonne stratégie, le système a créé de bien meilleures instructions que ce que les robots pourraient faire par eux-mêmes.
- Le Champion : La méthode de l'Échantillonnage de Thompson (le joueur intelligent) a été la grande gagnante. Elle a amélioré les performances de l'optimiseur de prompt jusqu'à 50 % sur certaines tâches.
- La Comparaison : L'ancienne méthode (APET), où le robot devine, a en fait obtenu de moins bons résultats que si l'on choisissait les stratégies de manière aléatoire. Cela prouve que le robot est mauvais pour deviner quels trucs utiliser, mais qu'il est excellent pour suivre des instructions si nous lui disons quel truc utiliser.
La Conclusion
Cet article ne prétend pas avoir résolu tous les problèmes de l'IA ou être prêt pour le diagnostic médical. Il montre simplement que lorsque nous essayons d'apprendre à l'IA comment mieux parler, nous ne devrions pas laisser l'IA deviner quelle méthode d'enseignement utiliser. Au lieu de cela, nous devrions utiliser un système intelligent et basé sur les données (comme l'Échantillonnage de Thompson) pour choisir explicitement les meilleures astuces d'enseignement, tout comme un entraîneur choisissant la bonne tactique pour une situation de jeu spécifique.
Le code de ce « coach intelligent » est désormais disponible pour que d'autres puissent l'utiliser.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.