← Derniers articles
🤖 AI

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Cet article présente Counsel, le premier ensemble de données public de méta-évaluations vérifiées par des humains pour les critiques de type « LLM-as-a-judge » sur des tâches agentiques, ce qui permet le calibrage et l'amélioration des évaluateurs automatisés en analysant leur alignement avec les jugements humains sur la localisation des erreurs et la qualité du raisonnement.

Auteurs originaux : Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

Publié 2026-06-23
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez en train de constituer une équipe d'assistants IA (des agents) pour gérer des tâches complexes, comme la gestion de la commande de parfum d'un client ou l'écriture de code informatique. À mesure que ces tâches deviennent difficiles, vérifier si l'IA fait du bon travail devient un véritable casse-tête.

Le Problème : Le « Goulot d'Étranglement Humain »
Considérez un agent IA comme un étudiant passant un examen long et composé de plusieurs étapes. Pour noter l'examen parfaitement, un enseignant humain devait auparavant lire chaque étape franchie par l'étudiant.

  • La Réalité : Pour des tâches complexes, cela prend des heures. Si vous avez 1 000 examens, il vous faut une petite armée d'enseignants travaillant pendant des semaines.
  • Le Raccourci : Pour gagner du temps, les entreprises ont commencé à utiliser des « Enseignants IA » (appelés LLM-as-a-Judge) pour noter les examens automatiquement. Ces Enseignants IA écrivent des commentaires du type : « Vous avez oublié de vérifier l'identité de l'utilisateur d'abord ! » ou « Bon travail, vous avez trouvé le fichier ! ».

Le Nouveau Problème : Les Enseignants IA sont-ils fiables ?
Le hic, c'est que nous avons commencé à faire confiance à ces Enseignants IA sans vérifier s'ils étaient réellement bons pour leur travail de notation.

  • Parfois, un Enseignant IA repère une véritable erreur et l'explique parfaitement.
  • Parfois, il repère une erreur qui n'en est pas une (une fausse alerte).
  • Parfois, il repère une véritable erreur mais donne une explication confuse ou erronée sur le pourquoi de cette erreur.

Jusqu'à présent, nous n'avions pas de moyen de mesurer si ces Enseignants IA étaient bons dans leur tâche spécifique consistant à rédiger des critiques. Nous savions seulement s'ils obtenaient le résultat final « Réussite/Échec » correct, mais pas si leur raisonnement était cohérent.

La Solution : « Counsel »
Les auteurs ont créé un nouveau jeu de données appelé Counsel. Considérez cela comme un jeu de données de type « L'Enseignant de l'Enseignant ».

  1. La Configuration : Ils ont pris deux scénarios du monde réel :
    • Service Client : Une IA essayant d'aider un client à échanger un parfum.
    • Codage : Une IA essayant d'analyser des fichiers de données financières.
  2. Les Acteurs :
    • L'Étudiant : Un agent IA essayant de réaliser la tâche.
    • L'Enseignant IA (Juge) : Une IA qui observe l'étudiant et rédige une critique (ex : « Erreur ! Vous avez sauté une étape »).
    • L'Expert Humain (Méta-évaluateur) : Un véritable humain qui lit la critique de l'Enseignant IA et décide :
      • « Pile dans le mille » : Vous avez trouvé la bonne erreur et l'avez expliquée parfaitement. ✅
      • « Emplacement correct, raisonnement médiocre » : Vous avez trouvé la bonne erreur, mais votre explication est faible ou erronée. ⚠️
      • « N'aurait pas dû signaler » : Vous avez pensé qu'il y avait une erreur, mais l'étudiant était en fait correct. ❌

Ce Qu'Ils Ont Découvert
En faisant noter les Enseignants IA par des humains, ils ont découvert :

  • Plus c'est intelligent, mieux c'est : Des modèles d'IA plus puissants font de meilleurs Enseignants.
  • Réfléchir davantage aide : Lorsque l'Enseignant IA est forcé de « réfléchir » plus longtemps et plus profondément avant de noter, il commet moins d'erreurs.
  • Le Meilleur Enseignant : Le plus fort Enseignant IA testé était d'accord avec les experts humains 88 % du temps sur l'emplacement de l'erreur, et 65 % du temps sur le raisonnement.

Pourquoi Cela Importe
Ce jeu de données est comme un « manuel d'instruction » pour construire de meilleurs Enseignants IA. Au lieu de simplement espérer qu'une IA soit bonne pour noter, nous pouvons maintenant utiliser ces données pour :

  1. Tester si un nouvel Enseignant IA est performant.
  2. Entraîner les Enseignants IA pour qu'ils rédigent des critiques meilleures et plus précises.
  3. Filtrer les mauvaises critiques afin que les développeurs ne voient que les critiques de haute qualité.

En Résumé
Ce papier introduit un moyen de noter les correcteurs. Tout comme vous ne recruteriez pas un enseignant incapable d'expliquer pourquoi un élève a raté une question, la communauté de l'IA a besoin d'un moyen de garantir que ses évaluateurs automatisés fournissent des commentaires réellement utiles. Counsel fournit la première bibliothèque publique de ces « notes sur les notes » pour aider à construire des systèmes d'IA plus fiables.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →