← Ultimi articoli
💬 NLP

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

Questo articolo introduce BacktestBench, il primo benchmark su larga scala per il backtesting quantitativo automatizzato, comprendente oltre 18.000 task annotati derivati da 6 milioni di dati di mercato, insieme ad AutoBacktest, un framework multi-agente progettato per tradurre strategie in linguaggio naturale in backtest riproducibili e valutare le capacità di 23 LLM mainstream.

Autori originali: Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

Pubblicato 2026-05-19
📖 5 min di lettura🧠 Approfondimento

Autori originali: Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di essere uno chef che vuole creare una nuova ricetta per un piatto che ti renderà ricco. Nel mondo della finanza, questo "piatto" è una strategia di trading. Prima di servirla al mondo (o investire il tuo denaro), devi backtestarla. Questo significa prendere la tua ricetta e cucinarla utilizzando un enorme pentolone di dati storici (ciò che è accaduto nel mercato azionario negli ultimi anni) per vedere se avrebbe effettivamente generato profitti o se avrebbe incendiato la cucina.

Tradizionalmente, fare questo backtesting è come cercare di costruire un robot complesso da zero ogni volta che vuoi testare una nuova ricetta. Devi essere un meccanico maestro (programmatore), un bibliotecario di dati (per trovare gli ingredienti storici giusti) e un mago finanziario, tutto in una volta. È lento, costoso e solo pochi esperti possono farlo.

BacktestBench è un nuovo progetto che si chiede: "L'Intelligenza Artificiale (AI) può imparare a essere quel meccanico maestro, bibliotecario e mago tutto in una volta?"

Ecco una semplice spiegazione di ciò che fa il paper:

1. Il Problema: La "Scatola Nera" della Finanza

Gli autori sostengono che, sebbene l'AI (in particolare i Modelli Linguistici di Grande Dimensione o LLM) sia eccellente nel scrivere codice e conversare, nessuno ha realmente testato se possa gestire il compito specifico e ad alto rischio del backtesting quantitativo automatizzato.

  • La Sfida: Non si tratta solo di scrivere codice. L'AI deve comprendere una richiesta umana vaga come, "Compra quando il prezzo sale per 5 giorni", e poi:
    1. Trovare i dati azionari esatti e corretti da un database.
    2. Scrivere un programma che calcoli la regola "5 giorni di rialzo" senza barare (usando dati futuri).
    3. Eseguire la simulazione.
    4. Calcolare il punteggio finale (come il "Rapporto di Sharpe", che è un modo elegante per dire "quanto profitto abbiamo ottenuto per il rischio che abbiamo corso?").

Se l'AI commette un errore minuscolo nel passaggio 2, l'intero risultato è spazzatura.

2. La Soluzione: Un Enorme "Esame di Pratica" (BacktestBench)

Per testare se l'AI può farlo, i ricercatori hanno costruito BacktestBench. Pensate a questo come a un massiccio, standardizzato esame per la patente di guida per l'AI, ma invece di guidare un'auto, l'AI guida una strategia di trading.

  • I Dati: Hanno utilizzato oltre 6 milioni di registrazioni di mercato reali dai mercati azionari cinesi (come una gigantesca biblioteca di storia).
  • Le Domande: Hanno creato 18.246 domande di test specifiche. Queste non sono semplici problemi matematici; sono scenari complessi come:
    • "Calcola il profitto per questa strategia specifica su questo titolo specifico."
    • "Quale titolo ha performato meglio con questa strategia?"
    • "Quale impostazione (parametro) funziona meglio?"
  • La Verità Fondamentale (Ground Truth): Poiché hanno costruito le domande partendo da codice reale scritto da loro stessi, conoscono la risposta esatta. Questo permette loro di valutare l'AI rigorosamente: Giusto o Sbagliato.

3. Il Soggetto del Test: "AutoBacktest" (Il Team AI)

I ricercatori non hanno chiesto a una sola AI di fare tutto. Hanno costruito un team di tre agenti AI specializzati chiamati AutoBacktest, che lavorano insieme come un equipaggio di cucina:

  1. Il Riassuntore (Il Traduttore): Gli dai una frase umana disordinata. Traduce quella in un elenco preciso di "ingredienti" finanziari (indicatori) di cui il sistema ha bisogno.
  2. Il Recuperatore (Il Bibliotecario): Prende quell'elenco e va al database per recuperare i dati grezzi esatti (come "Prezzo di Apertura" e "Volume") necessari. Scrive una query (SQL) per ottenere i dati.
  3. Il Programmatore (Lo Chef): Prende i dati e le istruzioni, scrive il codice Python per eseguire la simulazione, lo esegue e fornisce il numero finale.

4. I Risultati: Chi Ha Superato il Test?

Hanno testato 23 diversi modelli AI (sia open-source che a pagamento "closed-source") su questo esame.

  • I Vincitori: I migliori modelli closed-source (come Gemini 3 Pro) hanno ottenuto i risultati migliori, ma anche loro hanno risposto correttamente solo circa il 67%. Questo significa che anche l'AI più intelligente attualmente fatica con la logica complessa della finanza.
  • Il "Vuoto Logico": Hanno scoperto che molte AI sono brave a scrivere codice che sembra corretto (sintassi) ma fallisce nella logica. Ad esempio, un'AI potrebbe scrivere codice che calcola la "Volatilità" (una misura del rischio) ma sbaglia il calcolo matematico perché non comprende la definizione finanziaria.
  • La Lotta dei "Modelli Piccoli": I modelli AI più piccoli (con meno "cellule cerebrali" o parametri) erano terribili nelle parti ricche di matematica. Se la domanda richiedeva un ragionamento statistico complesso, i modelli piccoli fallivano spesso completamente, mentre i modelli più grandi se la cavavano meglio.
  • Il Segreto: Hanno scoperto che fornire all'AI un "foglio di trucchi" di codici brevi standardizzati (come un dizionario che dice "Volatilità = questa formula specifica") ha aiutato l'AI a scrivere codice molto migliore.

5. La Conclusione

Il paper conclude che, sebbene l'AI stia migliorando nell'automatizzare la ricerca finanziaria, non siamo ancora arrivati.

  • I modelli AI attuali sono come studenti brillanti che possono scrivere un ottimo saggio ma spesso falliscono l'esame di matematica.
  • Il dataset BacktestBench è ora disponibile per tutti per addestrare e testare i propri modelli AI, assicurando che la futura AI finanziaria sia effettivamente affidabile e non stia solo "allucinando" numeri.

In breve: Il paper ha costruito un rigoroso "esame finale" per l'AI per dimostrare che può gestire il mondo complesso e soggetto a errori del backtesting del mercato azionario. I risultati mostrano che, sebbene l'AI sia promettente, deve ancora imparare a fare la matematica perfettamente prima che possiamo affidarle denaro reale.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →