← Derniers articles
💻 computer science

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval est un nouveau cadre d'évaluation structuré sous forme de graphes orientés acycliques (DAG) qui permet de détecter précisément les erreurs intermédiaires et d'automatiser l'attribution des causes racines dans les flux de travail d'agents IA, surpassant nettement les méthodes d'évaluation de bout en bout.

Auteurs originaux : Dongxin Guo, Jikun Wu, Siu Ming Yiu

Publié 2026-04-28
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Dongxin Guo, Jikun Wu, Siu Ming Yiu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Problème : L'effet "Domino" des IA

Imaginez que vous commandez un repas complexe dans un grand restaurant. Le serveur prend la commande, le chef prépare les ingrédients, le cuisinier cuit le plat, et le dressage est fait en cuisine avant que le serveur ne vous l'apporte.

Si, à la fin, votre plat est immangeable, vous renvoyez l'assiette. C'est ce que font les systèmes d'IA actuels : ils regardent juste le résultat final (le plat). Si c'est raté, ils disent : "C'est mauvais". Mais ils ne savent pas pourquoi. Est-ce le serveur qui a mal noté la commande ? Le chef qui a pris les mauvais légumes ? Ou le cuisinier qui a brûlé la viande ?

Pour les entreprises qui utilisent des "Agents IA" (des IA qui enchaînent plusieurs étapes pour accomplir une mission), c'est un cauchemar. Si l'IA échoue à la 10ème étape, on sait qu'elle a échoué, mais on ne sait pas si c'est parce qu'elle a fait une erreur de calcul au début ou si elle a simplement mal utilisé un outil à la fin. L'erreur se propage comme une réaction en chaîne.

La Solution : AgentEval (Le "Détective de Cuisine")

Les chercheurs ont créé AgentEval. Au lieu de simplement goûter le plat final, AgentEval agit comme un inspecteur de cuisine ultra-perfectionné qui surveille chaque geste, chaque étape, de la commande jusqu'au service.

Voici ses trois super-pouvoirs :

1. Le Plan de Vol (Le DAG)

Au lieu de voir l'IA comme une boîte noire qui donne un résultat, AgentEval dessine une carte précise de tout le voyage de l'IA (ce qu'ils appellent un "DAG"). C'est comme un arbre généalogique des actions : "L'étape B dépend de l'étape A". Si l'étape B est ratée, AgentEval regarde l'arbre pour voir si c'est la faute de B ou si c'est l'étape A qui a envoyé de mauvaises informations.

2. Le Catalogue des Erreurs (La Taxonomie)

AgentEval ne se contente pas de dire "c'est faux". Il a un dictionnaire très précis de toutes les bêtises possibles. Il peut dire :

  • "C'est une erreur de planification" (Le serveur a mal compris le menu).
  • "C'est une erreur d'outil" (Le cuisinier a utilisé un mixeur au lieu d'un fouet).
  • "C'est une perte de contexte" (Le chef a oublié que le client était allergique aux noix en plein milieu de la recette).

3. Le Détecteur de Régression (Le Contrôle Qualité)

Imaginez que vous changiez de fournisseur de farine. AgentEval va immédiatement vérifier si cela change la qualité de vos gâteaux. Pour les ingénieurs, cela signifie que dès qu'ils modifient un petit détail de l'IA, AgentEval leur dit tout de suite : "Attention ! Ce changement a cassé l'étape de calcul de la TVA, même si le résultat final semble correct pour l'instant !"

Les Résultats : Un gain de temps phénoménal

Les chercheurs ont testé cela dans de vraies entreprises. Les résultats sont impressionnants :

  • Détection : Ils repèrent les erreurs 2 fois plus vite que les méthodes classiques.
  • Rapidité : Avant, un ingénieur passait en moyenne 4 heures à chercher l'origine d'un bug. Avec AgentEval, il ne lui faut plus que 22 minutes. C'est comme passer de la recherche d'une aiguille dans une botte de foin à l'utilisation d'un aimant géant.

En résumé

AgentEval, c'est passer d'un juge qui dit "Tu as perdu le match" à un entraîneur vidéo qui vous montre exactement à la 12ème minute que vous avez mal placé votre pied, ce qui a causé votre chute à la 15ème minute. C'est l'outil qui permet de rendre les IA non seulement intelligentes, mais surtout fiables et réparables.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →