WorkstreamBench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance
Cet article présente WorkstreamBench, un nouveau benchmark évaluant les agents LLM sur des tâches complètes de feuilles de calcul financières à l'aide d'une taxonomie multidimensionnelle de Précision, Formule et Format, révélant que, bien que les meilleurs modèles comme Claude produisent des résultats d'apparence professionnelle, les agents actuels peinent encore à gérer de manière fiable la complexité et les normes de qualité requises pour les flux de travail financiers réels.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous embauchiez un nouvel assistant pour construire un modèle financier complexe pour votre entreprise. Vous ne voulez pas simplement qu'il résolve un seul problème mathématique ; vous voulez qu'il crée, à partir de zéro, un classeur complet de qualité professionnelle que vous pourrez remettre à votre patron, à vos investisseurs et à vos auditeurs.
Ce document, WorkstreamBench, est essentiellement un « examen final » pour les agents IA (des programmes informatiques intelligents) afin de voir s'ils peuvent réellement effectuer ce travail.
Voici le détail de ce que les auteurs ont réalisé, en utilisant des analogies simples :
1. Le Problème : La « Brique Lego » contre le « Château »
Les tests précédents pour l'IA consistaient à demander à un constructeur de « poser une brique Lego sur une autre » ou de « trouver la brique rouge ». Ce sont des tâches simples et isolées (comme répondre à une question ou modifier un seul chiffre).
Mais dans le monde réel de la finance, les professionnels ne se contentent pas de déplacer une seule brique. Ils construisent des châteaux entiers. Ils ont besoin d'un classeur qui :
- Relie trois rapports différents (Compte de résultat, Bilan, Tableau de flux de trésorerie) de sorte que si vous modifiez un chiffre, tout se mette à jour automatiquement.
- Gère des scénarios « et si » (par exemple : « Que se passe-t-il si les ventes baissent de 10 % ? »).
- A une apparence professionnelle, soit facile à lire et facile à modifier ultérieurement par un humain.
Les auteurs ont réalisé que les tests existants étaient trop faciles. Ils ne vérifiaient pas si une IA pouvait construire le château entier, mais seulement si elle pouvait poser quelques briques.
2. La Solution : Une Nouvelle « Salle de Sport » pour l'IA
Les auteurs ont créé WorkstreamBench, un nouveau terrain d'essai rempli de défis financiers réels tirés de compétitions professionnelles et de cours de formation.
Au lieu de simplement vérifier si le chiffre final est correct (comme un professeur de mathématiques vérifiant une clé de réponses), ils ont créé une grille d'évaluation en trois parties pour juger de la qualité du travail de l'IA, de la même manière qu'un patron humain examinerait un rapport :
- Précision (Les Mathématiques) : Le chiffre final est-il correct ? L'IA a-t-elle réellement effectué l'analyse de scénario demandée ?
- Formule (La Logique) : Le « moteur » sous le capot est-il bien construit ?
- Analogie : Imaginez une voiture. Un mauvais constructeur pourrait coller les pièces du moteur avec de la supercolle (des chiffres en dur). Si vous devez modifier le moteur plus tard, vous devez démonter la voiture. Un bon constructeur utilise des boulons et des vis (des formules dynamiques) afin que la voiture soit facile à réparer et à améliorer. L'IA doit utiliser des boulons, pas de la colle.
- Ils vérifient également si la logique est lisible. Une formule géante et confuse est comme une pelote de laine emmêlée ; une formule étape par étape est comme un manuel d'instructions clair.
- Format (La Présentation) : L'ensemble a-t-il une apparence professionnelle ?
- Les chiffres sont-ils alignés ? Les nombres négatifs sont-ils entre parenthèses (une norme financière) plutôt qu'avec un signe moins ? La police est-elle cohérente ? Si un classeur semble désordonné, un patron humain pourrait le rejeter même si les mathématiques sont justes.
3. Le Test : Qui a passé l'examen ?
Les auteurs ont testé de nombreux agents IA les plus intelligents disponibles aujourd'hui, y compris des versions de Claude, ChatGPT, Gemini et d'autres. Certains étaient des versions « Web » (discussion dans un navigateur) et d'autres des versions « Excel » (extensions qui vivent à l'intérieur du logiciel de tableur).
4. Les Résultats : La « Carte de Notes » « Honnête »
Les résultats ont été un mélange de « prometteur » et de « pas encore prêt pour le grand public ».
- Le Leader : L'agent Claude Web a obtenu les meilleurs résultats. Il a construit les classeurs les plus professionnels, les plus faciles à lire et à modifier pour les humains.
- L'Écart : Même la meilleure IA n'a obtenu qu'environ 69 sur 100.
- La Difficulté : À mesure que les tâches devenaient plus difficiles (nécessitant des chaînes de calcul plus longues), les performances de l'IA chutaient brutalement.
- Analogie : C'est comme un élève qui peut résoudre parfaitement un problème d'addition simple mais qui se perd et fait des erreurs lorsqu'on lui demande de résoudre un problème d'algèbre complexe.
- Erreurs Courantes :
- Chiffres en dur : Au lieu d'écrire une formule qui calcule un nombre, l'IA écrivait parfois directement le nombre. C'est comme écrire « 100 » sur un chèque plutôt que d'écrire « 100 » dans la case et de laisser la banque le calculer. Si l'entrée change, la réponse de l'IA devient fausse.
- Mise en forme désordonnée : L'IA oubliait souvent d'aligner les chiffres ou utilisait les mauvaises couleurs, rendant le classeur peu professionnel.
- Abandon : Sur des tâches très difficiles, certaines IA laissaient des sections entières du classeur vides ou inventaient simplement des chiffres.
5. Le Verdict
Le document conclut que, bien que les agents IA deviennent bons dans les tâches simples, ils ne sont pas encore prêts à construire de manière fiable des modèles financiers de qualité professionnelle de manière autonome.
Ils sont comme un stagiaire très talentueux qui peut faire les calculs mais qui a encore besoin d'un superviseur humain pour vérifier la mise en forme, corriger les erreurs de logique et s'assurer que le produit final est quelque chose qu'un client pourrait réellement faire confiance. La technologie est là, mais elle a besoin de plus de travail avant de pouvoir remplacer un analyste financier humain.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.