← Derniers articles
🤖 AI

FAPO: Fully Autonomous Prompt Optimization of Multi-Step LLM Pipelines

FAPO est un cadre entièrement autonome qui optimise les pipelines de LLM multi-étapes en évaluant, diagnostiquant et affinant de manière itérative à la fois les prompts et les structures de chaînes, atteignant des performances de pointe sur les benchmarks généraux et axés sur la sécurité en surpassant la base de référence GEPA.

Auteurs originaux : Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

Publié 2026-06-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez une équipe de robots travaillant ensemble pour résoudre un puzzle complexe. Chaque robot a une tâche spécifique : l'un trouve des indices, un autre réfléchit à ces indices, et un troisième écrit la réponse finale. Parfois, toute l'équipe échoue, mais il est difficile de savoir quel robot a fait une erreur. Est-ce le premier qui a manqué un indice ? Le deuxième qui s'est emmêlé les pinceaux ? Ou le troisième qui a écrit la réponse dans un mauvais format ?

C'est le problème des pipelines de LLM multi-étapes (des chaînes complexes de tâches d'IA). Les méthodes traditionnelles tentent de réparer toute l'équipe en réécrivant simplement les instructions données au robot « chef » (le prompt). Mais si le problème est que l'équipe manque une étape ou que les robots ne parlent pas aux bonnes personnes, changer simplement les instructions ne servira à rien.

Entrez en scène FAPO (Fully Autonomous Prompt Optimization). Considérez FAPO comme un chef de projet super intelligent et autonome (propulsé par une IA appelée Claude Code) qui ne se contente pas de réécrire les instructions ; il observe toute l'équipe travailler, trouve le goulot d'étranglement exact et le corrige.

Voici comment fonctionne FAPO, en utilisant des analogies simples :

1. La phase de détective (Inspection)

Au lieu de deviner, FAPO observe l'équipe résoudre un puzzle d'entraînement. Il enregistre chaque mouvement, chaque indice trouvé et chaque processus de réflexion. Si l'équipe obtient une mauvaise réponse, FAPO agit comme un détective :

  • « Avons-nous échoué parce que nous n'avons pas trouvé le bon indice ? » (Échec de récupération/Retrieval)
  • « Avons-nous trouvé l'indice mais mal compris ? » (Échec de raisonnement/Reasoning)
  • « Avons-nous compris mais écrit la réponse dans un mauvais format ? » (Échec de formatage/Formatting)

2. La règle du « Réparer d'abord » (Modifications de prompts)

FAPO suit une règle stricte : Commencer petit.
Si le détective trouve que l'équipe a juste besoin d'instructions plus claires, FAPO réécrit le prompt (les instructions). C'est comme dire aux robots : « Hé, cherchez la boîte rouge, pas la bleue. » Il essaie cela en premier car c'est la solution la plus simple.

3. La phase de « Redesign » (Changements structurels)

Si FAPO essaie de réécrire les instructions encore et encore, mais que l'équipe échoue toujours parce qu'il manque une étape cruciale (comme avoir besoin d'un quatrième robot pour vérifier les calculs), FAPO obtient la permission de changer la structure de l'équipe.

  • Il peut ajouter un nouveau robot à l'équipe.
  • Il peut changer l'ordre dans lequel les robots se parlent.
  • Il peut ajouter une étape de « contrôle de sécurité » qui force l'équipe à suivre des règles spécifiques avant d'écrire la réponse finale.

C'est la différence clé : FAPO ne change la structure du pipeline que s'il prouve que le simple changement des mots (prompts) ne suffit pas.

4. L'inspecteur de sécurité (Garde-fous)

Avant que FAPO n'effectue un changement, un « Inspecteur de sécurité » (un autre agent IA) vérifie le plan. Cela garantit que FAPO ne supprime pas accidentellement des règles importantes, ne divulgue pas de données privées ou ne casse pas le système de notation. C'est comme un inspecteur du bâtiment qui vérifie un plan de rénovation avant que l'équipe de construction ne commence.

Les résultats : À quel point cela a-t-il fonctionné ?

L'article a testé FAPO contre un autre outil appelé GEPA (qui est comme un très bon éditeur qui ne fait que réécrire les instructions) à travers six types de défis différents, allant des problèmes mathématiques aux tâches de sécurité.

  • Le tableau des scores : FAPO a gagné 15 fois sur 18.
  • Les grandes victoires : Sur les tâches les plus difficiles (comme la vérification de faits sur des histoires complexes ou le respect de règles de formatage strictes), FAPO ne s'est pas contenté de peaufiner les instructions ; il a réalisé que l'équipe avait besoin d'une nouvelle structure. Dans ces cas, les scores de FAPO ont bondi de marges énormes (jusqu'à +33,8 points de pourcentage de mieux que la concurrence).
  • Tâches de sécurité : FAPO a également amélioré la capacité des modèles d'IA à identifier les vulnérabilités de sécurité (comme la cartographie des bugs logiciels vers leurs causes), prouvant qu'il fonctionne aussi pour des tâches sérieuses et à enjeux élevés.

La seule exception

Il y a eu une compétition de mathématiques (AIME) où FAPO n'a pas gagné. Les auteurs suggèrent que cela pourrait être dû au fait que les problèmes mathématiques étaient si difficiles et l'échantillon si petit que l'IA s'est « emmêlé les pinceaux » ou s'est sur-ajustée (over-fitted) aux problèmes d'entraînement, plutôt que d'apprendre réellement mieux les mathématiques.

Résumé

FAPO est comme un gestionnaire intelligent qui ne se contente pas de crier aux travailleurs de « faire mieux ». Au lieu de cela, il observe le flux de travail, diagnostique précisément où le processus se brise, répare d'abord les instructions, et si cela échoue, il redessine l'ensemble du flux de travail pour rendre l'équipe plus efficace. Il transforme une chaîne d'étapes d'IA désordonnée et défaillante en une machine fiable et performante.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →