OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
OmniaBench est un benchmark complet conçu pour évaluer les agents d'IA généraux à travers divers scénarios ToC, ToB et ToE en exploitant une taxonomie hiérarchique dérivée de ressources du monde réel afin de créer 1 431 tâches exécutables avec des espaces d'états explicites, révélant des limitations significatives des modèles frontières actuels concernant la planification, le maintien des contraintes et la correction adaptative.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : OmniaBench
Problématique
Les grands modèles de langage (LLM) évoluent rapidement, passant de générateurs de texte statiques à des agents généraux capables de comprendre les intentions des utilisateurs, d'invoquer des outils externes et de réaliser des tâches complexes par l'interaction. Cependant, les benchmarks existants pour évaluer ces agents souffrent de limitations significatives : ils se concentrent souvent sur des scénarios étroits, des écosystèmes d'outils restreints ou des formats d'interaction isolés. Ce manque de diversité rend difficile la caractérisation systématique des capacités des modèles à travers les contextes d'application hétérogènes que l'on trouve dans le monde réel. Il existe un écart critique entre la couverture des benchmarks actuels et la nature diversifiée, multi-tours, avec état (stateful) et riche en contraintes, des cas d'utilisation réels des agents.
Méthodologie
1. Taxonomie et Construction de Scénarios
OmniaBench comble cette lacune en construisant une taxonomie hiérarchique fondée sur les écosystèmes d'applications du monde réel. Les auteurs dérivent les connaissances des scénarios à partir des magasins d'applications, des documents d'exigences de produits (PRD), des ressources industrielles, de la recherche web et du raffinement humain. Cela aboutit à une taxonomie couvrant trois contextes principaux :
- ToC (Consommateur) : 22 domaines de Niveau 1 et 101 de Niveau 2.
- ToB (Business) : 38 domaines de Niveau 1 et 186 de Niveau 2.
- ToE (Employé) : 30 domaines de Niveau 1 et 67 de Niveau 2.
L'étendue totale couvre 90 domaines de Niveau 1 et 354 de Niveau 2, offrant un espace de domaine nettement plus large que les benchmarks centrés sur un seul écosystème d'outils.
2. Synthèse d'Environnement et de Tâches
Pour chaque domaine, l'équipe construit des environnements exécutables contenant des entités, des variables d'état, des outils et des configurations d'initialisation. Ceux-ci sont instanciés sous forme de classes Python avec des environnements sandbox contrôlés pour les opérations de fichiers et de code. Les tâches sont synthétisées via quatre voies complémentaires pour assurer des formes d'interaction diverses :
- DAG (Graphe Orienté Acyclique) : Se concentre sur l'interaction multi-tours avec état et l'exécution de chaînes d'outils.
- DAG-S : Dérive des tâches à tour unique à partir de tâches basées sur des DAG via l'affinement de requêtes.
- Solver (Solveur) : Cible les scénarios de sélection, de planification, d'allocation et d'optimisation en utilisant une synthèse guidée par un solveur implicite ou explicite.
- Program (Programme) : Se concentre sur le raisonnement procédural complexe impliquant des embranchements, l'itération, la synthèse tâche-programme et le débogage.
Le jeu de données résultant contient 1 431 tâches, avec un « ensemble de défi » (challenging set) de 644 tâches conçu pour réduire les coûts d'évaluation et atténuer la contamination des données.
3. Cadre d'Évaluation
OmniaBench emploie un cadre d'évaluation unifié basé sur les trajectoires au sein d'une formulation de Processus de Décision Markovien Partiellement Observable (POMDP).
- Métriques : La métrique principale est le Pass@1.
- Notation : Les tâches sont évaluées selon une taxonomie de capacité à dix dimensions (Compréhension de la tâche, Collecte d'informations, Planification et Prise de décision, Gestion de l'état, Utilisation d'outils, Opérations de code et programmatiques, Analyse de données, Manipulation de bureau et de documents, Collaboration interactive, Fiabilité et Sécurité).
- Vérification : Des critères basés sur des rubriques sont utilisés pour les tâches générales, tandis que VerifyCode est employé pour les tâches basées sur des programmes afin de déterminer les résultats binaires succès/échec basés sur les trajectoires et les observations finales.
- Simulation : Les interactions multi-tours utilisent des simulateurs d'utilisateurs ancrés dans des personas pour contrôler la difficulté via les préférences, les styles de communication et la divulgation d'informations.
Contributions Clés
L'article présente quatre contributions principales :
- Benchmark OmniaBench : Un benchmark riche en scénarios, intégrant les magasins d'applications, les PRD et la recherche web pour construire une taxonomie large (ToC/ToB/ToE) instanciée en tâches d'agents exécutables et évaluables.
- Taxonomie de Capacité Multidimensionnelle : Un cadre caractérisant les capacités des modèles à travers dix dimensions distinctes, permettant une analyse diagnostique fine au-delà des taux de réussite agrégés.
- Cadre de Difficulté Atomique Compositionnelle : Une conception organisant les défis des tâches autour de l'intention de l'utilisateur, des contraintes de persona, des états d'environnement, de l'exécution d'outils, de l'interaction multi-tours, de la récupération d'erreurs et de la vérification des résultats.
- Évaluation Systématique : Une évaluation complète des modèles fermés et ouverts, fournissant des preuves sur les limites de capacité, la spécialisation des domaines et les schémas d'erreurs.
Résultats
Le benchmark présente des défis substantiels pour les modèles de pointe actuels :
- Plafond de Performance : Même les modèles les plus avancés testés, Claude-Sonnet-5 et GPT-5.6-Sol, ont atteint des scores Overall Pass@1 de seulement 58,54 % et 57,14 %, respectivement.
- Variance de Capacité : La performance est hautement non uniforme à travers les dix dimensions de capacité. Les modèles ayant des scores globaux similaires présentent des forces nettement différentes (par exemple, en Compréhension de la tâche vs Gestion de l'état).
- Variance de Domaine : Des différences de performance significatives existent entre les divisions ToB, ToC et ToE. Par exemple, alors que certains modèles excellent en ToB, leur performance peut chuter en ToE, indiquant qu'une métrique globale unique ne peut pleinement caractériser l'applicabilité pratique.
- Efficacité : Les modèles ayant des taux de réussite comparables diffèrent souvent considérablement en termes d'efficacité d'utilisation des outils. Certains nécessitent une exploration redondante et des interactions détournées, tandis que d'autres atteignent les résultats avec des séquences d'outils compactes et ciblées.
- Analyse d'Erreur : Les échecs liés au raisonnement représentent 53,8 % des erreurs, la planification/décomposition (36,7 %) et les violations de contraintes (16,5 %) étant les contributeurs majeurs. Les erreurs directes d'utilisation d'outils (ex: formatage) constituent une proportion plus faible, suggérant que les goulots d'étranglement résident dans la planification à long terme et la correction adaptative plutôt que dans l'invocation de base.
Signification
OmniaBench fournit un benchmark large et diagnostique pour caractériser les limites de capacité des agents généraux. Les auteurs soutiennent qu'à mesure que les taux de réussite globaux des tâches s'améliorent, un score agrégé unique devient insuffisant. Au lieu de cela, le benchmark offre une fondation systématique pour analyser les capacités spécifiques, les spécialisations de domaine et les schémas d'échec. En révélant les limitations persistantes en matière de planification, de maintien des contraintes et de correction adaptative, OmniaBench sert d'outil critique pour guider le développement d'agents d'IA généraux plus robustes, efficaces et fiables, capables d'opérer dans des scénarios réels diversifiés.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.