← Derniers articles
💬 NLP

Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics

Cet article introduit MARKET-BENCH, un benchmark qui évalue les grands modèles de langage sur des tâches de trading quantitatif d'introduction en exigeant qu'ils génèrent des backtesters exécutables à partir de descriptions en langage naturel, révélant que si les modèles actuels peuvent construire de manière fiable des infrastructures de trading basiques, ils éprouvent encore des difficultés avec le raisonnement robuste concernant les prix, l'inventaire et le risque.

Auteurs originaux : Abhay Srivastava, Sam Jung, Spencer Mateega

Publié 2026-01-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Abhay Srivastava, Sam Jung, Spencer Mateega

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez une équipe de robots très intelligents et très rapides. Ces robots sont excellents pour lire des livres, écrire des histoires et répondre à des questions de culture générale. Mais maintenant, vous voulez voir s'ils peuvent faire quelque chose de bien plus difficile : gérer un stand de limonade où le prix des citrons change chaque seconde, et vous devez gagner de l'argent sans y laisser votre chemise.

Ce document présente un nouveau test appelé MARKET-BENCH pour voir si ces « cerveaux de robots » (appelés Modèles de Langage de Grande Taille ou LLM) peuvent réellement effectuer les calculs et la logique nécessaires pour gérer une simple entreprise de trading.

Voici comment le test fonctionne, décomposé en termes de la vie quotidienne :

1. Le Test : « Construisez la machine, ne vous contentez pas d'en parler »

La plupart des tests demandent à ces robots de décrire comment trader. « Si le prix monte, achetez ! », pourraient-ils dire.
MARKET-BENCH est différent. Il dit : « Voici une recette et une liste d'ingrédients. Écrivez le code informatique qui fait réellement fonctionner l'entreprise. »

Les robots devaient écrire du code qui :

  • Suit l'argent qu'ils possèdent.
  • Achète et vend des actions (comme Microsoft, Coca et Pepsi) en fonction de règles spécifiques.
  • Calcule exactement les profits ou les pertes qu'ils ont réalisés.
  • Crucialement : Le calcul du robot devait correspondre exactement à une réponse « étalon de référence ». Si le robot disait qu'il avait gagné 100 $, mais que l'étalon de référence disait qu'il avait gagné 95 $, le robot avait échoué.

2. Les Trois Défis (Les « Niveaux »)

Le test comportait trois niveaux de difficulté, comme dans un jeu vidéo :

  • Niveau 1 : L'Emploi du Temps Simple (Microsoft)

    • La mission : Acheter ou vendre l'action Microsoft à des moments précis, comme un bras robotisé sur une chaîne de montage.
    • Le piège : Vous devez suivre chaque centime et chaque action parfaitement.
    • Résultat : La plupart des robots ont pu construire la machine (le code s'est exécuté), mais beaucoup ont commis de petites erreurs de calcul qui se sont accumulées pour devenir de grosses erreurs. Certains robots étaient parfaits ; d'autres étaient complètement à côté de la plaque.
  • Niveau 2 : Le Partenaire de Danse (Coke contre Pepsi)

    • La mission : C'est un jeu de « Pairs Trading ». Vous pariez sur la différence entre Coca et Pepsi. Si Coca devient trop cher par rapport à Pepsi, vous achetez du Pepsi et vendez du Coca, en espérant qu'ils reviennent à la normale.
    • Le piège : Vous devez jongler avec deux actions à la fois, calculer un « spread » (l'écart) complexe, et gérer votre argent total sur les deux.
    • Résultat : C'était beaucoup plus difficile. Plusieurs robots ont complètement cassé la machine (le code ne s'est pas exécuté). Un robot (Qwen3 Max) a construit une machine qui fonctionnait parfaitement mais qui calculait les profits à hauteur de 400 millions de dollars alors qu'il aurait dû s'agir de quelques centaines. C'était comme un robot qui aurait construit une voiture qui roule parfaitement, mais qui croirait rouler sur la Lune.
  • Niveau 3 : La Marche sur la Corde Raide (Couverture d'Options)

    • La mission : C'est le niveau le plus difficile. Vous avez une police d'assurance complexe (une option) sur l'action Microsoft, et vous devez constamment acheter ou vendre l'action pour maintenir un risque neutre. C'est comme marcher sur une corde raide tout en jonglant.
    • Le piège : Le timing est primordial. Si vous attendez une fraction de seconde de trop, vous perdez de l'argent.
    • Résultat : C'était le plus difficile. Beaucoup de robots n'ont même pas réussi à démarrer la machine. Ceux qui l'ont fait présentaient souvent d'énormes erreurs de calcul.

3. Les Grandes Conclusions

L'étude a révélé trois points principaux :

  • Fiabilité vs Précision : Certains robots sont bons pour suivre les instructions afin de construire le code (la machine démarre), mais sont mauvais pour effectuer les calculs à l'intérieur de celui-ci. D'autres sont bons en calcul mais ne parviennent même pas à construire la machine.
  • Le Problème de l'« Hallucination » : Dans le monde réel, si un robot pense qu'il a gagné un million de dollars alors qu'il a perdu de l'argent, vous faites faillite. L'étude montre que ces robots « hallucinent » (inventent) souvent des chiffres qui ont l'air corrects mais qui sont totalement faux.
  • Pas encore prêts pour le terrain : Les auteurs concluent qu'actuellement, ces robots ne sont pas sûrs pour servir de cerveau principal au trading. Ils sont comme un stagiaire très intelligent capable de rédiger un brouillon de rapport, mais qui nécessite qu'un humain vérifie chaque chiffre avant de l'envoyer au patron.

Le Mot de la Fin

Considérez ces Modèles de Langage de Grande Taille comme des apprentis très talentueux mais inexpérimentés. Ils peuvent écrire le code pour lancer une entreprise de trading, mais ils font souvent des erreurs de comptabilité. Tant qu'ils ne s'amélioreront pas en mathématiques et en logique, vous ne pouvez pas leur confier votre argent de manière autonome.

Les auteurs ont publié ce test (MARKET-BENCH) ainsi qu'un tableau de bord public afin que d'autres scientifiques puissent essayer de construire de meilleurs robots et voir qui progresse réellement en mathématiques.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →