← Ultimi articoli
💬 NLP

Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics

Questo articolo introduce MARKET-BENCH, un benchmark che valuta i grandi modelli linguistici su compiti introduttivi di trading quantitativo richiedendo loro di generare backtester eseguibili a partire da descrizioni in linguaggio naturale, rivelando che, sebbene gli attuali modelli possano strutturare in modo affidabile le infrastrutture di trading di base, essi incontrano ancora difficoltà nel ragionamento robusto su prezzi, inventario e rischio.

Autori originali: Abhay Srivastava, Sam Jung, Spencer Mateega

Pubblicato 2026-01-22
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Abhay Srivastava, Sam Jung, Spencer Mateega

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere una squadra di robot molto intelligenti e veloci. Questi robot sono bravissimi a leggere libri, scrivere storie e rispondere a domande di cultura generale. Ma ora, vuoi vedere se riescono a fare qualcosa di molto più difficile: gestire un banco di limonata dove il prezzo dei limoni cambia ogni secondo, e devi guadagnare denaro senza rimetterci la pelle.

Questo articolo presenta un nuovo test chiamato MARKET-BENCH per vedere se questi "cervelli robotici" (chiamati Large Language Models o LLM) siano effettivamente in grado di fare la matematica e la logica necessarie per gestire un semplice business di trading.

Ecco come funziona il test, suddiviso in termini quotidiani:

1. Il Test: "Costruisci la macchina, non limitarti a parlarne"

La maggior parte dei test chiede a questi robot di descrivere come fare trading. "Se il prezzo sale, compra!" potrebbero dire.
MARKET-BENCH è diverso. Dice: "Ecco una ricetta e una lista di ingredienti. Scrivi il codice informatico che faccia effettivamente funzionare l'attività."

I robot dovevano scrivere del codice che:

  • Tracci quanto denaro hanno a disposizione.
  • Compri e venda azioni (come Microsoft, Coca-Cola e Pepsi) basandosi su regole specifiche.
  • Calcoli esattamente il profitto o la perdita che hanno ottenuto.
  • Fondamentale: La matematica del robot doveva corrispondere esattamente a una risposta "gold standard". Se il robot diceva di aver guadagnato 100 dollari, ma lo standard d'oro diceva che ne aveva guadagnati 95, il robot falliva.

2. Le Tre Sfide (I "Livelli")

Il test aveva tre livelli di difficoltà, come i livelli di un videogioco:

  • Livello 1: Il Programma Semplice (Microsoft)

    • Il Lavoro: Comprare o vendere azioni Microsoft a orari specifici, come un braccio robotico su una linea di montaggio.
    • L'Ostacolo: Devi tenere traccia di ogni singolo centesimo e di ogni singola azione perfettamente.
    • Risultato: La maggior parte dei robot riusciva a costruire la macchina (il codice girava), ma molti commettevano piccoli errori matematici che si accumulavano in grandi errori. Alcuni robot erano perfetti; altri erano completamente fuori strada.
  • Livello 2: Il Partner di Ballo (Coke vs. Pepsi)

    • Il Lavoro: Questo è un gioco di "Pairs Trading". Scommetti sulla differenza tra Coca-Cola e Pepsi. Se la Coca-Cola diventa troppo costosa rispetto alla Pepsi, compri Pepsi e vendi Coca-Cola, sperando che tornino alla normalità.
    • L'Ostacolo: Devi gestire due titoli contemporaneamente, calcolare uno "spread" (il divario) complesso e gestire il tuo denaro totale tra entrambi.
    • Risultato: Questo era molto più difficile. Diversi robot hanno completamente rotto la macchina (il codice non girava). Un robot (Qwen3 Max) ha costruito una macchina che girava perfettamente, ma calcolava i profitti come 400 milioni di dollari quando invece dovevano essere poche centinaia. Era come un robot che costruiva un'auto che guidava perfettamente, ma pensava di guidare sulla luna.
  • Livello 3: Il Cammino sul Filo (Hedging di Opzioni)

    • Il Lavoro: Questo è il livello più difficile. Hai una complessa polizza assicurativa (un'opzione) sulle azioni Microsoft e devi continuamente comprare o vendere le azioni per mantenere il rischio neutro. È come camminare su un filo teso mentre fai giocoleria.
    • Limento: Il tempismo è tutto. Se aspetti anche solo un istante di troppo, perdi soldi.
    • Risultato: Questo è stato il livello più difficile. Molti robot non riuscivano nemmeno a far partire la macchina. Quelli che riuscivano a farla partire spesso presentavano enormi errori nei calcoli.

3. Le Grandi Conclusioni

L'articolo ha evidenziato tre punti principali:

  • Affidabilità vs. Accuratezza: Alcuni robot sono bravi a seguire le istruzioni per costruire il codice (la macchina parte), ma sono terribili nel fare la matematica all'interno di esso. Altri sono bravi nella matematica ma non riescono nemmeno a far partire la macchina.
  • Il Problema delle "Allucinazioni": Nel mondo reale, se un robot pensa di aver guadagnato un milione di dollari quando in realtà ha perso soldi, tu fallisci. L'articolo mostra che questi robot spesso "allucinano" (inventano) numeri che sembrano buoni ma sono completamente sbagliati.
  • Non sono pronti per il mercato: Gli autori concludono che, al momento, questi robot non sono sicuri da usare come cervello principale per il trading. Sono come un tirocinante molto intelligente che può scrivere una bozza di un rapporto, ma ha bisogno di un essere umano che controlli ogni singolo numero prima di inviarlo al capo.

In Breve

Pensa a questi Large Language Models come a apprendisti molto talentuosi ma inesperti. Possono scrivere il codice per avviare un'attività di trading, ma spesso sbagliano la contabilità. Finché non miglioreranno nella matematica e nella logica, non puoi fidarti di loro per gestire i tuoi soldi da soli.

Gli autori hanno rilasciato questo test (MARKET-BENCH) e una classifica pubblica in modo che altri scienziati possano provare a costruire robot migliori e vedere chi sta effettivamente diventando bravo nella matematica.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →