PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
PROTEA est une interface unifiée pour le raffinement hors ligne et piloté par des tests des flux de travail d'agents multiples basés sur les LLM, qui localise les goulots d'étranglement grâce à un score basé sur les graphes et une évaluation rétroactive, permettant aux développeurs d'éditer et de valider de manière itérative les révisions de prompts pour améliorer significativement les performances du système.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez le metteur en scène d'une pièce dont la distribution est entièrement composée de robots IA. Chaque robot a un rôle précis : l'un lit le scénario, un autre vérifie les faits, un troisième écrit les dialogues, et un quatrième assure la performance finale. C'est ce que les développeurs appellent un "flux de travail multi-agents LLM".
Habituellement, ces équipes de robots fonctionnent mieux qu'un seul robot essayant de tout faire à la fois. Mais voici le problème : si la performance finale est mauvaise, c'est un cauchemar de déterminer quel robot a fait une erreur. Est-ce que le vérificateur de faits a obtenu de mauvaises informations ? Est-ce que l'auteur a mal compris le ton ? Ou est-ce que le dernier acteur a simplement trébuché ?
Actuellement, les développeurs doivent regarder des heures de vidéo (la "trace") de toute la pièce, en devinant où l'erreur a commencé. C'est comme essayer de trouver une seule faute de frappe dans un livre de 500 pages en relisant chaque mot.
Voici PROTEA.
Pensez à PROTEA comme à une "salle de répétition" intelligente et interactive avec un projecteur magique. Il aide les développeurs à déboguer et à améliorer ces équipes de robots sans avoir à revoir le film entier encore et encore.
Voici comment cela fonctionne, en utilisant des analogies simples :
1. Le Projecteur Magique (Diagnostic au niveau du nœud)
Au lieu d'examiner toute la pièce, PROTEA place un feu de circulation sur la station de chaque robot individuel.
- 🟢 Vert : Ce robot a parfaitement fait son travail.
- 🟡 Jaune : Ce robot était correct, mais peut-être un peu négligent.
- 🔴 Rouge : Ce robot a fait une erreur.
Lorsque la réponse finale est incorrecte, PROTEA ne se contente pas de dire "La pièce a échoué". Il met immédiatement en évidence le robot Rouge et dit : "Hé, regardez ici ! Ce robot a donné la mauvaise information au robot suivant." Il évite au développeur de parcourir tout le scénario.
2. Le "Reverse Engineer" (Inférence inverse)
Parfois, les développeurs ne connaissent que la réponse finale attendue (par exemple, "La pièce doit se terminer par un rire heureux"), mais ils n'ont pas de scénario spécifique pour ce que les robots du milieu doivent dire.
PROTEA utilise une astuce appelée Inférence Inverse. Imaginez que vous connaissez la destination d'un voyage routier mais pas les virages le long du chemin. PROTEA remonte le chemin depuis le "Rire Heureux" pour demander : "Pour que le robot final rie, que le robot auteur devait-il dire ? Et pour que l'auteur dise cela, que le vérificateur de faits devait-il fournir ?"
Il génère un "scénario fantôme" pour les étapes intermédiaires basé sur l'objectif final. Ensuite, il compare ce que les robots ont réellement dit à ce "scénario fantôme" pour identifier les maillons faibles.
3. Le "Bouton Modifier" (Raffinement des invites)
Une fois que PROTEA a trouvé le robot Rouge, il ne se contente pas de le pointer du doigt ; il propose une correction suggérée.
- Il affiche les instructions actuelles du robot (l'"Invite" ou "Prompt").
- Il suggère une nouvelle version améliorée de ces instructions.
- Il montre une comparaison "Avant vs Après", comme un outil de retouche photo montrant l'original et la version modifiée côte à côte.
Le développeur peut accepter la suggestion, l'ajuster, ou l'ignorer.
4. Le "Replay Instantané" (Nouvelle exécution automatique)
La meilleure partie ? Dès que le développeur clique sur "Enregistrer", PROTEA relance instantanément toute la pièce avec les nouvelles instructions. Il affiche ensuite un graphique des scores : "Voyez ? Avant, le score était de 64 %. Après votre modification, il est maintenant de 84 % !"
Cela crée une boucle rapide : Trouver le problème → Suggérer une correction → Tester → Voir le résultat. Fini d'attendre des jours pour savoir si un changement a fonctionné.
Qu'ont-ils réellement accompli ?
L'article a testé ce système dans deux scénarios réels (bien qu'ils aient gardé les noms spécifiques des entreprises secrets) :
- Inspection de documents : Un système qui vérifie les documents selon des règles strictes. PROTEA a aidé à améliorer sa précision de 64,3 % à 83,9 %.
- Système de recommandation : Un chatbot qui suggère des articles (comme des films ou des produits). PROTEA l'a aidé à placer la bonne recommandation dans le top 5 plus souvent, améliorant un score de 0,30 à 0,38.
Ils l'ont également testé sur un groupe de six développeurs IA expérimentés. Ces développeurs ont adoré le système car il les a empêchés de fixer des logs interminables et leur a permis de se concentrer sur la réparation du robot spécifique qui causait le problème.
La Conclusion
PROTEA est un outil qui transforme le travail confus et désordonné du débogage d'une équipe de robots IA en un processus propre et visuel. Il agit comme un entraîneur avec un film des meilleurs moments, vous montrant exactement quel joueur a laissé tomber le ballon et vous donnant un manuel pour le réparer, le tout au même endroit.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.