← Derniers articles
💬 NLP

APEX-Accounting

APEX-Accounting est un nouveau benchmark développé par Mercor et Ramp pour évaluer les modèles de pointe sur des tâches comptables réelles, révélant que les modèles actuels les plus performants atteignent des taux de réussite modestes et présentent un paradoxe de Simpson où l'augmentation des budgets de jetons est corrélée à des scores globaux plus élevés mais à une performance moindre sur des tâches spécifiques à coût élevé.

Auteurs originaux : Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens, Rene Sultan, Charis Ching, Hayley Popiel, Vaibhav Mittal, Felix Mercier, Brendan Foody, Bertie Vidgen

Publié 2026-07-30
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens, Rene Sultan, Charis Ching, Hayley Popiel, Vaibhav Mittal, Felix Mercier, Brendan Foody, Bertie Vidgen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : APEX–Accounting

Énoncé du Problème

Bien que les grands modèles de langage (LLM) aient démontré leur capacité à réussir des examens de certification professionnelle (ex. : CPA, CMA) et à améliorer la qualité générale du travail, il existe un manque de benchmarks évaluant leur aptitude à accomplir le travail quotidien et effectif des comptables. Les benchmarks existants comme AuditBench, FinMaster et AccountingBench reposent souvent sur des transactions synthétiques, des simulateurs uniquement textuels ou des études de cas sur une seule entreprise, ce qui ne parvient pas à capturer la nature répétitive, procédurale et gourmande en documents de la clôture mensuelle et de la tenue de livres. Les auteurs soutiennent que les évaluations actuelles ne testent pas suffisamment le « vrai travail » des comptables, qui consiste à réconcilier des comptes, provisionner des charges, enregistrer des transactions et produire des rapports à travers divers contextes commerciaux complexes.

Méthodologie

Conception du Benchmark (APEX–Accounting)

APEX–Accounting est un benchmark fermé développé par Mercor en partenariat avec Ramp, comprenant 160 tâches réparties sur 10 mondes d'entreprises générés synthétiquement.

  • Construction des Mondes : Chaque monde représente une entreprise autonome figée à la clôture mensuelle, respectant les principes comptables de la méthode de la comptabilité d'exercice selon les normes US GAAP. Les mondes ont été construits en quatre étapes : délimitation du périmètre (scoping), spécification détaillée (incluant des « registres pièges » pour les contradictions introduites), dérivation du guide de style et génération de fichiers. Tous les fichiers (feuilles de calcul, PDF, exports de logiciels comptables) sont inédits et contrôlés par rapport aux sources publiques pour éviter la mémorisation.
  • Catégories de Tâches : Les 160 tâches sont divisées en quatre catégories :
    1. Réconciliation (61 tâches) : Lier deux sources ensemble, identifier les écarts et les expliquer ou les corriger.
    2. Saisie de Données (26 tâches) : Passer des transactions, des écritures de journal et des factures.
    3. Analyse d'Écarts (28 tâches) : Comparer les résultats réels par rapport aux budgets ou aux attentes.
    4. Calendriers et Provisions (45 tâches) : Construire des calendriers, calculer des provisions et reporter des soldes.
  • Implication d'Experts : 42 experts en comptabilité (médiane de 11 ans d'expérience, 52 % provenant de cabinets du « Big Four ») ont rédigé les tâches, les ont résolues pour créer des « réponses de référence » (golden responses), et ont écrit des rubriques de notation binaires basées sur les résultats. Chaque tâche comprend un prompt, les fichiers d'entrée requis, une réponse de référence et une rubrique comportant une moyenne de 13,7 critères.

Configuration Expérimentale

  • Modèles Évalués : Neuf modèles de pointe ont été testés, incluant Claude-Fable-5, Muse-Spark-1.1, GPT-5.6-Sol, et d'autres. Chaque modèle a exécuté chaque tâche 8 fois, générant 11 520 trajectoires.
  • Harnais (Harnesses) : Deux harnais d'agents ont été utilisés :
    • Harnais de Boucle (Loop Harness) : Une architecture standard de type boucle « tant que » avec outils (while-loop-with-tools).
    • Harnais Ramp : Un harnais spécialisé construit avec Ramp, doté d'une conscience de la tentative de réessai (retry-awareness), de listes d'autorisation d'outils, de validation et de délégation de sous-agents pour refléter les contraintes du monde réel de la comptabilité.
  • Notation : Un modèle DeepSeek-v4-Flash, optimisé avec un prompt GEPA, a servi de juge. Il a été validé par rapport à la vérité terrain d'experts humains (1 687 critères), atteignant une précision de 97,1 % (F1 = 0,970). Le juge évalue la sortie finale par rapport aux critères de la rubrique binaire sans accès au journal de la trajectoire intermédiaire.
  • Métriques :
    • Mean Criteria@3 : La métrique principale, faisant la moyenne du pourcentage de critères de la rubrique respectés sur 3 exécutions choisies au hasard par tâche.
    • Pass@k / Pass^k : Mesure le plafond de capacité (Pass@8 : réussir au moins une fois en 8 tentatives) et la cohérence (Pass^8 : réussir les 8 tentatives).
    • Ablation du Coût : Des expériences variant le budget de jetons (tokens) de 1 aˋ50 à 50 par tâche pour analyser la relation entre la dépense et la performance.

Résultats Clés

Performance du Classement (Leaderboard)

  • Meilleur Performeur : Claude-Fable-5 (Max) a obtenu le score Mean Criteria@3 le plus élevé de 56,4 %, suivi de Muse-Spark-1.1 (52,6 %) et GPT-5.6-Sol (51,5 %).
  • Écart de Cohérence : Malgré des scores Mean Criteria@3 élevés, la cohérence reste extrêmement faible. Aucun modèle n'a atteint un score Pass^8 supérieur à 2,6 % (GPT-5.6-Sol). Le Pass@8 le plus élevé était de 21,5 % (Muse-Spark-1.1), indiquant que si les modèles peuvent occasionnellement résoudre une tâche, ils ne peuvent pas le faire de manière fiable de bout en bout.
  • Difficulté par Catégorie : « Calendriers et Provisions » s'est avéré être la catégorie la plus difficile, tous les modèles affichant des scores inférieurs de 7 à 21 points de pourcentage par rapport aux autres catégories, reflétant sa nature multi-étapes et exigeant du jugement.

Analyse du Coût et du Budget

  • Impact du Budget de Jetons : Augmenter le budget de 1 aˋ50 à 50 a considérablement amélioré les scores pour les modèles coûteux (ex. : Claude-Fable-5 a gagné +43,4 points de pourcentage), tandis que les modèles moins chers (ex. : Muse-Spark-1.1) ont vu des gains minimes.
  • Paradoxe de Simpson : L'étude a observé un cas de paradoxe de Simpson : bien que l'augmentation du budget total ait fait monter les scores, au sein d'un budget fixe, les tâches où les modèles consommaient plus de jetons étaient corrélées à des scores plus bas. Cela est attribué à la difficulté des tâches : les tâches plus difficiles consomment plus de jetons mais restent plus difficiles à résoudre.
  • Impact du Harnais : Passer du Loop Harness standard au harnais spécialisé Ramp a entraîné un changement moyen négligeable (+1,2 point de pourcentage), suggérant que la capacité du modèle est un moteur de performance plus fort que l'architecture d'agent spécifique pour ces tâches.

Analyse des Échecs

L'analyse des trajectoires à faible score des trois meilleurs modèles a révélé un profil d'échec frappant de similitude :

  • Dominance du Raisonnement : Les échecs de raisonnement représentaient 59 à 79 % de toutes les erreurs annotées.
  • Modes d'Échec Spécifiques : Les sous-échecs les plus courants étaient le raisonnement non numérique (appliquer une logique erronée à des données non numériques) et les erreurs de manipulation de données (filtrage, jointure ou agrégation incorrects).
  • Information vs Logique : Les modèles trouvent les bons fichiers d'entrée de manière fiable (les échecs de collecte d'informations sont rares). Le principal mode de défaillance est la mauvaise gestion du raisonnement multi-étapes sur ces entrées : substitution d'une logique d'autorisation erronée, perte de résultats intermédiaires corrects ou incapacité à porter les conclusions jusqu'à la réponse finale.
  • Utilisation des Outils : Aucun échec annoté n'impliquait d'erreurs d'utilisation d'outils, suggérant que les architectures d'agents actuelles sont suffisantes pour l'interaction avec les outils, mais que la capacité de raisonnement sous-jacente est le goulot d'étranglement.

Signification et Revendications

L'article affirme qu'APEX–Accounting fournit la première évaluation rigoureuse des modèles de pointe sur les flux de travail comptables réels, allant au-delà des examens de certification pour atteindre l'application pratique.

  • Limitations Actuelles : Les résultats indiquent que bien que les modèles de pointe puissent récupérer des informations et effectuer des étapes isolées, ils ne sont pas encore capables de clôturer les comptes de manière autonome et fiable. Les faibles scores Pass^8 (max 2,6 %) soulignent un écart important entre le « plafond de capacité » et le « déploiement fiable ».
  • Direction Future : Les auteurs soutiennent que le progrès viendra moins de l'amélioration des harnais d'agents (qui ont montré un impact minimal) que de l'amélioration des modèles eux-mêmes. Plus précisément, ils suggèrent la nécessité d'un entraînement spécifique à la comptabilité pour instaurer la discipline requise pour porter les résultats multi-étapes, détecter les contradictions dans les documents et refuser de passer des écritures sans preuves suffisantes.
  • Utilité du Benchmark : En tant que benchmark fermé, APEX–Accounting permet l'évaluation de tout modèle de pointe sur demande, offrant une métrique standardisée à l'industrie pour suivre les progrès de l'automatisation du travail intellectuel qualifié.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →