← Ultimi articoli
💻 computer science

An Inter-variable Relationship-Aware Mixture-of-Experts Model for Stock Closing-Price Prediction

Il documento propone IR-MoE, un Transformer Mixture-of-Experts consapevole delle relazioni inter-variabili che modella esplicitamente le dipendenze dinamiche tra le variabili di trading e impiega un routing sparso con una strategia di addestramento rimescolata per singola azione al fine di ottenere una precisione di previsione superiore e una generalizzazione zero-shot attraverso diversi mercati azionari globali.

Autori originali: Zhenjiang Chen, Bin Liu, Pei-Gen Ye, Yang Lv, Jun Zheng

Pubblicato 2026-09-23
📖 7 min di lettura🧠 Approfondimento

Autori originali: Zhenjiang Chen, Bin Liu, Pei-Gen Ye, Yang Lv, Jun Zheng

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Prevedere il prezzo futuro di un'azione è una delle sfide più persistenti della finanza. Il mercato è un luogo caotico, influenzato da tutto, dalle notizie globali alle politiche governative, fino all'umore collettivo di milioni di investitori. Per questo motivo, i prezzi delle azioni non si muovono in linee semplici e rette; sono rumorosi, erratici e in costante mutamento. Per decenni, gli esperti hanno cercato di trovare schemi in questo caos, guardando spesso a un set standard di cinque numeri giornalieri: il prezzo all'apertura del mercato, il punto più alto raggiunto, il punto più basso, il prezzo alla chiusura e il volume totale di azioni scambiate. La difficoltà non risiede solo nel tracciare questi numeri nel tempo, ma nel comprendere come essi dialoghino tra loro. Un aumento di prezzo accompagnato da un forte volume di scambi racconta una storia diversa rispetto a un aumento con scarso volume, eppure molti modelli informatici trattano questi cinque numeri come flussi di dati separati e non correlati.

La domanda centrale che i ricercatori si pongono è se un singolo programma informatico possa apprendere le regole complesse e mutevoli del mercato azionario abbastanza bene da applicarle a nuovi titoli non ancora visti senza dover essere riaddestrato da zero. I metodi tradizionali spesso faticano in questo ambito, o non riescono a catturare le sottili relazioni tra prezzo e volume, o diventano così specializzati su una specifica società da non riuscire ad adattarsi a un'altra. Questa limitazione rende difficile la costruzione di uno strumento universale per l'analisi degli investimenti che funzioni in diversi paesi e condizioni di mercato.

In uno studio recente, un team di ricercatori del Beijing Institute of Technology ha proposto un nuovo approccio per risolvere questo problema. Hanno sviluppato un sistema chiamato IR-MoE, che sta per Inter-variable Relationship-Aware Mixture-of-Experts. Il nome descrive esattamente ciò che fa il sistema: è progettato per essere consapevole di come le diverse variabili di trading si relazionino tra loro e utilizza una "miscela di esperti" (mixture of experts) per effettuare le previsioni. Invece di costringere il computer a imparare una regola singola e rigida per tutti i titoli, questo sistema permette a diverse parti del modello di specializzarsi in diverse condizioni di mercato. Si basa sull'idea che, sebbene ogni azione sia unica, il modo in cui prezzo e volume interagiscono segue spesso schemi riconoscibili che possono essere appresi e trasferiti.

I ricercatori hanno iniziato raccogliendo una enorme quantità di dati storici da quattro mercati finanziari distinti: il mercato A-share cinese, gli Stati Uniti, Hong Kong e il Giappone. Hanno selezionato centinaia di titoli rappresentativi da queste regioni, coprendo una vasta gamma di settori e comportamenti di mercato. Piuttosto che addestrare un modello separato per ciascuno di questi centinaia di titoli, hanno inserito tutti i dati in un unico sistema unificato. Questa strategia di "addestramento unione" (union training) ha permesso al modello di apprendere le dinamiche di mercato condivise, come il fatto che un aumento del volume di scambi spesso segnala un cambiamento nella direzione del prezzo, indipendentemente dal fatto che il titolo abbia sede a Shanghai o a New York.

Il cuore del loro sistema è un'architettura in due parti. La prima parte si concentra sulla comprensione delle relazioni tra i cinque numeri giornalieri. I ricercatori hanno trattato ciascun numero — apertura, massimo, minimo, chiusura e volume — come un pezzo distinto di informazione, o "token", e hanno utilizzato un meccanismo ispirato ai moderni modelli linguistici per permettere loro di interagire. Ciò ha permesso al sistema di apprendere esplicitamente, ad esempio, che il prezzo di chiusura è pesantemente influenzato dal volume di scambi di quel giorno. Visualizzando queste interazioni, i ricercatori hanno scoperto che il modello prestava costantemente attenzione al volume quando cercava di comprendere i movimenti dei prezzi. Questa attenzione non era casuale; era più forte durante i periodi di alta volatilità, suggerendo che il modello avesse appreso che il volume diventa un indizio più critico quando il mercato è turbolento.

La seconda parte del sistema è la "miscela di esperti". Immaginate un team di specialisti, ognuno esperto in un tipo specifico di comportamento di mercato, come un trend ascendente costante, un crollo improvviso o un movimento laterale tranquillo. Quando il sistema riceve i dati per un nuovo titolo, non chiede a tutti gli specialisti di esprimersi. Invece, un meccanismo di instradamento (routing) osserva le attuali condizioni di mercato e seleziona solo alcuni degli esperti più rilevanti per effettuare la previsione. Ciò consente al sistema di adattarsi istantaneamente a diverse situazioni. Se il mercato si comporta in modo erratico, potrebbe chiamare esperti addestrati su schemi di alta volatilità; se il mercato è calmo, potrebbe fare affidamento su quelli addestrati su trend stabili. Questa flessibilità è ciò che permette al modello di gestire la natura diversificata e mutevole dei mercati azionari globali.

I risultati dello studio sono stati testati in tutti e quattro i mercati, incluso un test rigoroso in cui il modello è stato chiamato a prevedere i prezzi per titoli che non aveva mai visto prima, senza ulteriore addestramento. In questi test "zero-shot", il nuovo sistema ha superato diversi metodi esistenti, inclusi modelli complessi che frammentano i dati in parti più piccole e altri sistemi avanzati di intelligenza artificiale progettati per la previsione di serie temporali. Sul mercato A-share cinese, il modello ha raggiunto un tasso di errore di previsione di circa l'1,10%, mentre sul mercato statunitense ha raggiunto un tasso di errore di circa l'1,32%. Queste cifre sono state costantemente migliori rispetto alle migliori alternative dello studio.

Forse più significativamente, il modello ha dimostrato di poter trasferire la propria conoscenza oltre i confini. Quando il sistema, addestrato sui dati delle azioni cinesi, è stato applicato direttamente a titoli non visti negli Stati Uniti, a Hong Kong e in Giappone, ha mantenuto un'alta precisione. Ciò suggerisce che le relazioni fondamentali tra prezzo e volume sono abbastanza universali da poter essere apprese una volta sola e applicate ovunque. I ricercatori hanno anche scoperto che il sistema funzionava meglio quando veniva addestrato su un numero di titoli diversificato ma gestibile. L'aggiunta di più dati aiutava inizialmente, ma oltre un certo punto, i benefici diminuivano, indicando che la chiave era coprire una vasta gamma di comportamenti di mercato piuttosto che semplicemente alimentare il sistema con più numeri.

Per garantire che il sistema funzionasse correttamente, i ricercatori hanno anche esaminato come venivano utilizzati gli "esperti". Hanno scoperto che, senza un meccanismo di bilanciamento specifico, il sistema tendeva a fare troppo affidamento su pochi esperti, lasciandone altri inattivi. Aggiungendo una regola che costringesse il sistema a distribuire il lavoro in modo più uniforme, hanno garantito che tutte le parti specializzate del modello fossero attive e in fase di apprendimento. Questa attenzione ai dettagli nel processo di addestramento è stata cruciale per la stabilità e le prestazioni del sistema.

Lo studio conclude che, modellando esplicitamente come le variabili di trading interagiscono e utilizzando un team flessibile di predittori specializzati, è possibile costruire uno strumento più robusto e adattabile per la previsione azionaria. I ricercatori suggeriscono che il loro approccio offre una strada promettente per l'analisi finanziaria, una che si allontana dai modelli rigidi e a scopo singolo verso sistemi che possano comprendere il linguaggio complesso e mutevole del mercato. Sebbene lo studio non sostenga di aver risolto il mistero del mercato azionario, dimostra che una comprensione più profonda delle relazioni tra i dati di trading giornalieri può portare a previsioni più accurate e generalizzabili. Il lavoro apre la porta a ricerche future che potrebbero incorporare altri tipi di dati, come i report sulle notizie o i dettagli del trading intraday, per affinare ulteriormente la nostra capacità di navigare nel mondo finanziario.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →