Anchor: Mitigating Artifact Drift in Agent Benchmark Generation
Ce papier présente Anchor, un pipeline de génération de tâches qui atténue la dérive des artefacts en formalisant les flux de travail métier en programmes d'optimisation sous contraintes pour produire des environnements d'évaluation auditable, vérifiable et évolutif, démontré par la publication d'ERP-Bench, une référence de 300 tâches à long horizon dans un système ERP de niveau production.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'enseigner à un robot comment gérer une usine. Vous souhaitez lui soumettre un test pour déterminer s'il est assez intelligent pour gérer de véritables tâches commerciales telles que commander des fournitures, fabriquer des produits et envoyer des factures.
Le problème, selon ce document, est que la plupart de ces tests sont défectueux. Ils souffrent de ce que les auteurs appellent la « Dérive des Artéfacts ».
Le Problème : La « Recette Défectueuse »
Pensez à la création d'un test pour un agent IA comme à la rédaction d'une recette pour un gâteau. Pour établir un test équitable, quatre éléments doivent correspondre parfaitement :
- Les Instructions : « Faites un gâteau au chocolat. »
- La Cuisine (Environnement) : Le four, les bols et les ingrédients que vous donnez au robot.
- La Corrigé (Oracle) : Le gâteau parfait que vous attendez à la fin.
- Le Juge (Vérificateur) : La personne qui goûte le gâteau et décide s'il est bon.
Dans la plupart des tests d'IA actuels, ces quatre éléments sont rédigés par des personnes différentes ou générés par des outils distincts qui ne communiquent pas entre eux.
- Les Instructions peuvent indiquer : « Utilisez 2 tasses de sucre. »
- Mais la Cuisine ne contient que 1 tasse de sucre.
- Le Corrigé suppose que le robot a utilisé 3 tasses.
- Le Juge pourrait attribuer une note de passage même si le gâteau est brûlé, simplement parce qu'il ressemble à un gâteau.
Lorsque ces quatre éléments ne s'accordent pas, le test est injuste. Le robot peut échouer parce que le test était impossible, ou il peut « tricher » (pirater la récompense) en trouvant une faille que le créateur du test n'avait pas prévue. Les auteurs appellent ce désordre la « Dérive des Artéfacts ».
La Solution : « Anchor »
Les auteurs ont conçu un nouveau système appelé Anchor pour résoudre ce problème.
Imaginez qu'au lieu de rédiger quatre documents séparés, vous écriviez un seul et unique plan mathématique parfait (un « programme de contraintes »). Ce plan est comme une recette maîtresse qui définit exactement comment le gâteau doit être préparé, quels ingrédients sont disponibles et quelles sont les règles.
Lorsque vous souhaitez créer un test :
- Vous modifiez légèrement le plan (par exemple : « Rendez-le plus difficile en ajoutant plus de clients » ou « Rendez-le plus facile en donnant plus de stock »).
- Un solveur informatique lit ce plan et déclare : « D'accord, voici la façon exacte et parfaite de résoudre cette version spécifique. »
- Anchor traduit ensuite automatiquement cette seule solution parfaite en toutes les quatre composantes du test :
- Il rédige les Instructions en anglais courant.
- Il configure la Cuisine avec les bons ingrédients.
- Il crée le Corrigé basé sur les mathématiques du solveur.
- Il programme le Juge pour qu'il vérifie selon ces mêmes règles exactes.
Puisque tout découle de ce plan unique, ils ne peuvent jamais entrer en contradiction. Les instructions, l'environnement, la réponse et le juge sont tous parfaitement alignés.
Le Résultat : ERP-Bench
En utilisant ce système, les auteurs ont créé une nouvelle suite de tests appelée ERP-Bench.
- Qu'est-ce que c'est ? C'est un ensemble de 300 tâches commerciales réalistes impliquant l'achat de pièces, la fabrication de produits et la gestion des stocks, le tout au sein d'un véritable système logiciel d'entreprise appelé Odoo.
- Pourquoi est-il spécial ? Il est « vérifiable ». Le système connaît la réponse mathématiquement parfaite pour chaque tâche individuelle. Il peut vous indiquer exactement à quel point l'IA s'est rapprochée de la solution parfaite, et non pas simplement si elle « semblait » correcte.
Ce Qu'ils Ont Découvert
Ils ont testé cinq des modèles d'IA les plus intelligents disponibles aujourd'hui sur ces 300 tâches. Voici ce qui s'est produit :
- L'Échelle de Difficulté Fonctionne : Ils pouvaient rendre les tâches « Faciles », « Moyennes » ou « Difficiles » simplement en modifiant des chiffres dans leur plan. Les modèles d'IA ont obtenu de moins bons résultats à mesure que les tâches devenaient plus difficiles, exactement comme prévu.
- L'Écart entre « Assez Bien » et « Parfait » : Les modèles d'IA étaient corrects pour suivre les règles de base (comme « ne pas manquer de stock »). Ils respectaient les contraintes de base environ 26 % du temps. Cependant, ils étaient terribles pour trouver la meilleure solution possible (comme dépenser le moins d'argent possible). Ils ne trouvaient la solution parfaite et optimale que 17 % du temps.
- L'Interface Compte : Les modèles d'IA ont beaucoup mieux performé lorsqu'ils pouvaient « parler » directement au logiciel (comme un programmeur utilisant du code) par rapport au moment où ils devaient « cliquer » sur des boutons à l'écran comme un humain (en utilisant une souris ou un navigateur). Les méthodes de « clic » étaient beaucoup plus lentes et entraînaient davantage d'erreurs.
La Conclusion
L'article soutient que pour construire une IA capable d'accomplir réellement des travaux commerciaux, nous devons cesser de construire des tests avec des éléments incompatibles. En utilisant une « source unique de vérité » (le système Anchor), nous pouvons créer des tests équitables, auditable et réalistes qui nous indiquent exactement à quel point un agent d'IA est réellement compétent pour résoudre des problèmes commerciaux complexes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.