← Ultimi articoli
💻 computer science

An Ensemble PPO Trading Agent Across Real Limit Order Book and Long-Horizon OHLCV Data: Diagnosis, Correction, and Honest Evaluation

Questo articolo presenta uno studio empirico trasparente di un agente di trading di Bitcoin basato su PPO che diagnostica e corregge critici fallimenti nell'addestramento per ottenere un modesto sovraperformance di lungo periodo rispetto al Buy-and-Hold, dimostrando simultaneamente che i dati del limit order book in tempo reale spesso generano una politica razionale di "non-trading" poiché i costi di transazione superano i movimenti del micro-prezzo, sostenendo infine il valore della segnalazione riproducibile di risultati negativi rispetto alle narrazioni di successo levigate.

Autori originali: william darryl towa

Pubblicato 2026-07-03
📖 6 min di lettura🧠 Approfondimento

Autori originali: william darryl towa

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di cercare di insegnare a un robot come fare trading su Bitcoin. Vuoi che sia più intelligente del semplice comprare e detenere la moneta, ma vuoi anche evitare che perda tutti i suoi soldi. Questo articolo è un documentario "dietro le quinte" di questo processo, in cui l'autore, William Darryl Towa, decide di essere brutalmente onesto su tutto ciò che è andato storto, su ciò che è andato bene e sul perché il robot a volte decide semplicemente di sedersi sul divano e non fare nulla.

Ecco la storia della ricerca, suddivisa in concetti semplici:

1. I due diversi campi di addestramento

L'autore non ha usato un solo set di dati. Ha addestrato il suo robot in due "palestre" molto diverse:

  • Palestra A (Il microscopio ad alta velocità): Questa utilizzava una visione estremamente dettagliata, secondo per secondo, del libro ordini di Bitcoin (l'elenco di persone che aspettano di comprare o vendere) da una specifica settimana del 2021. È come guardare un pilota di auto da corsa al rallentatore, vedendo ogni minimo movimento dello sterzo.
  • Palestra B (L'autostrada a lungo raggio): Questa utilizzava 2,4 anni di grafici dei prezzi orari. È come guardare lo stesso pilota nell'arco di diversi anni, vedendo come gestisce diverse condizioni meteorologiche, traffico e condizioni stradali.

2. Il primo grande crash: "Il robot congelato"

Quando l'autore ha provato ad addestrare il robot per la prima volta, questo si è immediatamente rotto. Il robot ha effettuato un unico scambio e poi, per 195.000 step, è rimasto congelato. Ha smesso di imparare e di muoversi.

La diagnosi: L'autore ha scoperto due ragioni per questo stato di "congelamento":

  1. Numeri confondenti: Al robot venivano forniti numeri con dimensioni estremamente diverse. Immagina di cercare di confrontare il peso di una piuma (0,001) con il peso di una balena blu (85.000). Il robot si è confuso perché la balena ha oscurato la piuma. L'autore ha risolto questo problema "normalizzando" i dati (mettendo tutto sulla stessa scala).
  2. Un punteggio difettoso: Il robot veniva valutato con un test matematicamente rotto. A volte, il test gli dava un punteggio di "1.000" e altre volte "-1.000" per la stessa identica azione, solo a causa di un piccolo errore matematico. Questo ha fatto pensare al robot che il mondo fosse caotico e imprevedibile, portandolo ad arrendersi. L'autore ha sistemato la matematica in modo che i punteggi avessero senso.

3. Il robot "pigro": Quando non fare nulla è la mossa più intelligente

Dopo aver risolto il crash, l'autore ha addestrato il robot sui dati della Palestra A (Il microscopio ad alta velocità). Il robot ha imparato una lezione molto strana: Non fare mai trading.

All'inizio, l'autore ha pensato che il robot fosse rotto o che non avesse abbastanza dati per imparare. Ma poi ha capito la verità: il robot stava in realtà essendo intelligente.

  • L'analogia: Immagina di essere a un mercato delle pulci. Ogni volta che compri qualcosa e cerchi di rivenderla 10 secondi dopo, il mercato ti addebita una commissione del 30%. Anche se il prezzo dell'oggetto sale dell'1%, perdi comunque soldi a causa della commissione.
  • La realtà: Nei dati ad alta velocità, il prezzo di Bitcoin si muoveva appena in un secondo (spesso 0,00000%). Ma la commissione per fare trading era enorme (0,30%).
  • La conclusione: Il robot ha capito che qualsiasi operazione avrebbe comportato una perdita di denaro. Quindi, la strategia più redditizia era stare fermi e non fare nulla. L'autore chiama questo "inazione economicamente razionale". Non era un fallimento; era il robot che capiva correttamente che il gioco era truccato contro il trading.

4. Il successo a lungo raggio: Una modesta vittoria

Quando l'autore ha addestrato il robot sui dati della Palestra B (L'autostrada a lungo raggio) (i grafici orari di 2,4 anni), il robot ha fatto qualcosa di diverso. Ha imparato a fare trading, ma con molta cautela.

  • Il risultato: Il mercato è sceso di circa il 21% durante il periodo di test.
    • Se avessi solo detenuto Bitcoin (Buy-and-Hold), avresti perso il 20,82%.
    • Il robot ha perso il 19,42%.
  • La lezione: Non ha fatto una fortuna. Non ha battuto il mercato con un margine enorme. Ma ha perso meno soldi di una persona che si fosse limitata a detenere la posizione. È stata una piccola, costante vittoria, come un corridore che finisce una maratona leggermente davanti al resto del gruppo in una gara molto difficile.

5. Il filtro "Ensemble": Un guardiano che non ha fatto nulla

L'autore ha cercato di combinare i due robot. Ha costruito un "guardiano" (un filtro ensemble) che avrebbe permesso al robot a lungo raggio di fare trading solo se il robot ad alta velocità vedeva una buona opportunità.

  • Il test: Ha testato questo sistema sulla singola settimana in cui entrambi i set di dati si sovrapponevano.
  • Il risultato: Il guardiano ha bloccato 64 potenziali operazioni, ma non ha cambiato il risultato finale. Perché? Perché il robot a lungo raggio stava già tenendo le mani in tasca, non facendo nulla la maggior parte del tempo. Il guardiano era come un buttafuori all'ingresso di un club che è già vuoto; ha impedito alla gente di entrare, ma poiché nessuno stava cercando di entrare, il club è rimasto vuoto.
  • L'onestà: Inveve di nascondere questo "risultato nullo", l'autore lo ha pubblicato. Ha sostenuto che ammettere "questa parte non ha funzionato" è più prezioso che inventare un successo.

6. La grande lezione: Il "fallimento onesto" è meglio delle "bugie lucidate"

La parte più importante di questo articolo non è la strategia di trading; è l'atteggiamento.

Nel mondo dell'IA e della finanza, i ricercatori pubblicano spesso solo i "finali felici" in cui il robot guadagna milioni. Questo articolo è diverso. Dice:

  • "Ecco esattamente perché il nostro primo tentativo è andato in crash."
  • "Ecco perché il nostro secondo robot ha deciso di non fare nulla (e perché questo era in realtà corretto)."
  • "Ecco una parte del nostro sistema che non ha funzionato, ed ecco la prova."

L'autore ritiene che condividere questi "risultati negativi" e le "diagnosi" aiuti l'intera comunità a imparare più velocemente rispetto alla condivisione di una storia perfetta e lucida che potrebbe nascondere difetti occulti. Ha rilasciato tutto il suo codice e le sue note in modo che chiunque possa verificare il suo lavoro, dimostrando che la trasparenza è il modo migliore per far progredire la scienza.

In breve: L'articolo è la storia di un robot che ha imparato a fare trading su Bitcoin, è andato in crash a causa di una cattiva matematica, ha imparato che a volte la mossa migliore è non fare trading, e infine ha imparato a perdere un po' meno soldi di tutti gli altri — il tutto mentre l'autore prometteva di dire tutta la verità, comprese le parti imbarazzanti.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →