← Derniers articles
💻 computer science

An Ensemble PPO Trading Agent Across Real Limit Order Book and Long-Horizon OHLCV Data: Diagnosis, Correction, and Honest Evaluation

Cet article présente une étude empirique transparente d'un agent de trading de Bitcoin basé sur le PPO qui diagnostique et corrige des échecs d'entraînement critiques pour atteindre une modeste surperformance à long terme par rapport à la stratégie Buy-and-Hold, tout en démontrant simultanément que les données de carnet d'ordres en temps réel engendrent souvent une politique rationnelle de « non-trading » en raison de coûts de transaction dépassant les mouvements de micro-prix, plaidant ainsi pour la valeur de la publication de résultats négatifs reproductibles plutôt que pour des récits de succès lissés.

Auteurs originaux : william darryl towa

Publié 2026-07-03
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : william darryl towa

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot à trader le Bitcoin. Vous voulez qu'il soit plus intelligent que le simple achat et conservation (buy and hold), mais vous voulez aussi éviter qu'il ne perde tout son argent. Ce document est un documentaire « dans les coulisses » de ce processus, où l'auteur, William Darryl Towa, décide d'être brutalement honnête sur tout ce qui s'est mal passé, ce qui s'est bien passé, et pourquoi le robot décide parfois de rester assis sur le canapé à ne rien faire.

Voici l'histoire de la recherche, décomposée en concepts simples :

1. Les deux camps d'entraînement différents

L'auteur n'a pas utilisé un seul ensemble de données. Il a entraîné son robot dans deux « gymnases » très différents :

  • Gym A (Le microscope haute vitesse) : Ceci utilisait une vue ultra-détaillée, seconde par seconde, du carnet d'ordres de Bitcoin (la liste des personnes attendant d'acheter ou de vendre) provenant d'une semaine spécifique de 2021. C'est comme regarder un pilote de course de Formule 1 au ralenti, en voyant chaque infime mouvement du volant.
  • Gym B (L'autoroute longue distance) : Ceci utilisait 2,4 années de graphiques de prix horaires. C'est comme regarder le même pilote sur plusieurs années, en voyant comment il gère différentes conditions météorologiques, le trafic et l'état de la route.

2. Le premier grand crash : « Le robot gelé »

Lorsque l'auteur a essayé d'entraîner le robot pour la première fois, celui-ci s'est immédiatement brisé. Le robot a effectué un seul trade, puis pendant 195 000 étapes, il est resté figé. Il a cessé d'apprendre et de bouger.

Le diagnostic : L'auteur a trouvé deux raisons à cet état de « gel » :

  1. Des chiffres déroutants : Le robot recevait des nombres dont les tailles étaient radicalement différentes. Imaginez essayer de comparer le poids d'une plume (0,001) au poids d'une baleine bleue (85 000). Le robot était confus parce que la baleine étouffait la plume. L'auteur a corrigé cela en « normalisant » les données (en mettant tout à la même échelle).
  2. Une fiche d'évaluation défectueuse : Le robot était évalué sur un test mathématiquement erroné. Parfois, le test lui donnait un score de « 1 000 » et parfois « -1 000 » pour la même action, simplement à cause d'une petite erreur mathématique. Cela faisait croire au robot que le monde était chaotique et imprévisible, alors il abandonnait. L'auteur a corrigé les mathématiques pour que les scores soient cohérents.

3. Le robot « paresseux » : Quand ne rien faire est le choix le plus intelligent

Après avoir réparé le crash, l'auteur a entraîné le robot sur les données du Microscope haute vitesse (Gym A). Il a appris une leçon très étrange : Ne jamais trader.

Au début, l'auteur a pensé que le robot était cassé ou qu'il n'avait pas assez de données pour apprendre. Mais il a ensuite réalisé la vérité : le robot était en fait intelligent.

  • L'analogie : Imaginez que vous êtes dans un marché aux puces. Chaque fois que vous achetez quelque chose et que vous essayez de le revendre 10 secondes plus tard, le marché vous facture des frais de 30 %. Même si le prix de l'objet augmente de 1 %, vous perdez quand même de l'argent à cause des frais.
  • La réalité : Dans les données à haute vitesse, le prix du Bitcoin bougeait à peine en une seconde (souvent 0,00000 %). Mais les frais de transaction étaient énormes (0,30 %).
  • La conclusion : Le robot a compris que n'importe quel trade lui ferait perdre de l'argent. Ainsi, la stratégie la plus rentable était de rester immobile et de ne rien faire. L'auteur appelle cela une « inaction économiquement rationnelle ». Ce n'était pas un échec ; c'était le robot qui comprenait correctement que le jeu était truqué contre le trading.

4. Le succès de la longue distance : Une victoire modeste

Lorsque le robot a été entraîné sur les données de l'Autoroute longue distance (Gym B) (les 2,4 années de graphiques horaires), il a fait quelque chose de différent. Il a appris à trader, mais très prudemment.

  • Le résultat : Le marché a chuté d'environ 21 % pendant la période de test.
    • Si vous aviez simplement détenu du Bitcoin (Achat et conservation), vous auriez perdu 20,82 %.
    • Le robot a perdu 19,42 %.
  • La leçon à retenir : Il n'a pas fait fortune. Il n'a pas battu le marché par une marge énorme. Mais il a perdu moins d'argent que la personne qui s'est contentée de conserver ses actifs. C'est une petite victoire constante, comme un coureur qui termine un marathon légèrement devant le peloton lors d'une très mauvaise course.

5. Le filtre « Ensemble » : Un gardien qui n'a rien fait

L'auteur a tenté de combiner les deux robots. Il a construit un « gardien » (un filtre d'ensemble) qui ne laisserait le robot de longue distance trader que si le robot de haute vitesse voyait une bonne opportunité.

  • Le test : Il a testé cela sur la seule semaine où les deux ensembles de données se chevauchaient.
  • Le résultat : Le gardien a bloqué 64 trades potentiels, mais cela n'a pas changé le résultat final. Pourquoi ? Parce que le robot de longue distance était déjà en train de rester les bras croisés, ne faisant rien la plupart du temps. Le gardien était comme un videur à l'entrée d'un club qui est déjà vide ; il empêche les gens d'entrer, mais comme personne n'essayait d'entrer de toute façon, le club est resté vide.
  • L'honnêteté : Au lieu de cacher ce « résultat nul », l'auteur l'a publié. Il soutient que admettre « cette partie n'a pas fonctionné » est plus précieux que de simuler un succès.

6. La grande leçon : « L'échec honnête » est préférable aux « mensonges polis »

La partie la plus importante de ce document n'est pas la stratégie de trading ; c'est l'attitude.

Dans le monde de l'IA et de la finance, les chercheurs ne publient souvent que les « fins heureuses » où le robot gagne des millions. Ce document est différent. Il dit :

  • « Voici exactement pourquoi notre première tentative a planté. »
  • « Voici pourquoi notre deuxième robot a décidé de ne rien faire (et pourquoi c'était correct). »
  • « Voici une partie de notre système qui n'a pas fonctionné, et voici la preuve. »

L'auteur estime que partager ces « résultats négatifs » et ces « diagnostics » aide l'ensemble de la communauté à apprendre plus vite que de partager une histoire parfaite et polie qui pourrait cacher des failles invisibles. Il a publié tout son code et ses notes afin que quiconque puisse vérifier son travail, prouvant que la transparence est le meilleur moyen de faire progresser la science.

En bref : Le document est l'histoire d'un robot qui a appris à trader le Bitcoin, qui a planté à cause de mauvaises mathématiques, qui a appris que parfois, le meilleur trade est de ne pas trader, et qui a finalement appris à perdre un peu moins d'argent que tout le monde — tout en promettant à l'auteur de dire toute la vérité, même les parties embarrassantes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →