CAPO: Constraint-Aware Prompt Optimization for LLM Agents
Cet article introduit CAPO, une méthode d'optimisation de prompts sensible aux contraintes qui utilise une approche primal-dual avec pondération adaptative des contraintes pour optimiser efficacement les prompts de systèmes d'agents LLM pour la performance des tâches tout en respectant les contraintes opérationnelles telles que la sécurité et le formatage, ainsi qu'une variante dynamique (DCAPO) qui entraîne un réécrivain spécialisé pour obtenir des prompts réalisables et performants à travers divers domaines sans modifier l'agent de tâche sous-jacent.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les modèles de langage étendu sont de plus en plus déployés non plus seulement pour discuter, mais pour agir. Ces agents numériques reçoivent un ensemble d'instructions, appelé « prompt système », qui leur indique comment utiliser des outils, résoudre des problèmes et interagir avec les utilisateurs. Imaginez un agent de voyage capable de réserver des vols, de vérifier des assurances et d'annuler des réservations, mais uniquement s'il suit un ensemble strict de règles d'entreprise. Le défi pour les développeurs est qu'un modèle peut être incroyablement doué pour accomplir une tâche tout en échouant à respecter les exigences opérationnelles spécifiques d'un emploi réel. Il peut utiliser trop d'outils, demander l'aide d'un humain quand il ne le devrait pas, rédiger des réponses trop longues ou violer accidentellement des politiques de sécurité. Pour qu'une entreprise puisse déployer un tel agent, elle ne peut pas simplement accepter un modèle qui est « plutôt bon » ; elle doit s'assurer que l'agent respecte strictement chaque exigence tout en accomplissant sa mission.
La difficulté fondamentale réside dans le fait que ces exigences tirent souvent dans des directions opposées. Un prompt qui rend un agent très précis peut aussi le rendre verbeux ou enclin à utiliser trop d'outils. Traditionnellement, les développeurs ont tenté de résoudre ce problème en ajustant manuellement l'importance de chaque règle, en essayant essentiellement de deviner quelles contraintes importaient le plus. Cependant, cette approche est fragile. Un réglage qui fonctionne pour un type de tâche ou un modèle spécifique échoue souvent lorsque la situation change. Si les règles sont fixées à l'avance, le système peut satisfaire une exigence en en brisant une autre, rendant l'agent inutilisable pour le déploiement. La question à laquelle les chercheurs ont été confrontés était de savoir s'ils pouvaient construire un système capable de trouver automatiquement l'équilibre parfait, en ajustant le poids de chaque règle en temps réel à mesure qu'il apprend ce qui fonctionne et ce qui ne fonctionne pas.
Une équipe de chercheurs a introduit une nouvelle méthode appelée CAPO, qui signifie Constraint-Aware Prompt Optimization (Optimisation de Prompt Sensible aux Contraintes), pour s'attaquer à ce problème. Au lieu de deviner le bon équilibre des règles, CAPO traite le processus d'optimisation comme une négociation où les règles elles-mêmes prennent la parole. Le système commence avec une collection de prompts candidats et les teste contre un ensemble de tâches. À mesure que les agents s'exécutent, ils génèrent des données sur la qualité de leur performance et, surtout, sur le degré de violation de contraintes spécifiques, telles que le nombre d'appels d'outils ou la longueur de la réponse. Si un prompt viole une règle, le système augmente automatiquement la « pénalité » pour cette règle spécifique lors du cycle de test suivant. Si un prompt dispose d'une marge de manœuvre sous une règle, la pénalité pour cette règle diminue. Cet ajustement dynamique permet au système de concentrer sa recherche sur les problèmes spécifiques qui bloquent actuellement le déploiement de l'agent, plutôt que de traiter toutes les règles comme étant également importantes dès le départ.
Les chercheurs ont testé cette approche dans plusieurs domaines différents, notamment le service client aérien, le support de vente au détail et les télécommunications. Dans ces tests, les agents devaient accomplir des tâches tout en respectant des limites strictes sur le nombre de fois qu'ils pouvaient appeler un agent humain, le nombre d'outils qu'ils pouvaient utiliser et la longueur de leurs instructions système. Les résultats étaient clairs : CAPO trouvait systématiquement des prompts qui satisfaisaient chaque contrainte tout en maintenant une performance de tâche élevée. En revanche, d'autres méthodes utilisant des poids fixes ou des règles statiques ont échoué à trouver une solution fonctionnant pour tous les besoins simultanément. Par exemple, dans le domaine aérien, alors que d'autres méthodes parvenaient à satisfaire les règles dans un seul scénario de test sur six, CAPO a trouvé une solution réalisable dans chacun d'eux. La méthode s'est avérée assez robuste pour fonctionner avec différentes tailles de modèles de langage et s'est même étendue au-delà des agents utilisant des outils pour gérer les contraintes de sécurité et de formatage dans les scénarios de chatbot.
Pour rendre le processus encore plus efficace, les chercheurs ont développé une seconde version appelée DCAPO. Alors que la première version utilise un modèle de langage distinct et figé pour réécrire les prompts, DCAPO entraîne un réécrivain spécialisé pour apprendre du processus lui-même. Ce réécrivain observe le comportement de l'agent et le retour d'information des contraintes, apprenant à générer de meilleurs prompts au fil du temps sans jamais modifier l'agent de tâche sous-jacent. Dans leurs expériences, ce réécrivain appris a été capable de produire des prompts réalisables dans tous les domaines testés, égalant ou améliorant la précision des meilleures méthodes de référence. L'étude comprenait également une analyse mathématique pour montrer comment le système gère le fait qu'il travaille avec un nombre limité d'exemples et de changements de texte discrets, confirmant que les erreurs introduites par ces limitations n'empêchent pas le système de converger vers une bonne solution.
La portée de ce travail réside dans sa capacité à transformer les exigences de déploiement en une force directrice pour le processus de recherche. En laissant les violations mesurées des règles déterminer quels échecs doivent recevoir l'attention, le système évite le piège consistant à corriger un problème pour en créer un autre. Les chercheurs ont constaté que cette approche adaptative est essentielle car la contrainte la plus critique change selon la tâche spécifique et le modèle utilisé. Ce qui importe le plus dans un scénario aérien peut être non pertinent dans un contexte de vente au détail, et un modèle capable de résoudre un problème peut tout de même nécessiter des directives différentes pour rester dans le budget. L'étude démontre qu'en ajustant continuellement l'accent de l'optimisation sur la base d'un retour d'information en temps réel, il est possible de trouver des points de fonctionnement qui sont à la fois efficaces et conformes. Cela suggère un changement dans notre façon de concevoir l'ingénierie de prompt : plutôt qu'une configuration statique, cela peut être un processus dynamique où les exigences elles-mêmes aident à guider le système vers une solution prête pour le monde réel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.