An Inter-variable Relationship-Aware Mixture-of-Experts Model for Stock Closing-Price Prediction
Het artikel stelt IR-MoE voor, een Inter-variable Relationship-Aware Mixture-of-Experts Transformer die expliciet dynamische afhankelijkheden tussen handelsvariabelen modelleert en gebruikmaakt van sparse routing met een stock-wise shuffled trainingsstrategie om superieure voorspellingsnauwkeurigheid en zero-shot generalisatie over diverse wereldwijde aandelenmarkten te bereiken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het voorspellen van de toekomstige koers van een aandeel is een van de meest hardnekkige uitdagingen in de financiële wereld. De markt is een chaotische plek, beïnvloed door alles van wereldnieuws en overheidsbeleid tot de collectieve stemming van miljoenen beleggers. Vanwege deze reden bewegen aandelenkoersen niet in eenvoudige, rechte lijnen; ze zijn ruizig, grillig en voortdurend in beweging. Decennialang hebben experts geprobeerd patronen te vinden in deze chaos, waarbij ze vaak kijken naar een standaardset van vijf dagelijkse getallen: de prijs bij de opening van de markt, het hoogste punt, het laagste punt, de prijs bij de sluiting en het totale handelsvolume van de verhandelde aandelen. De moeilijkheid ligt niet alleen in het volgen van deze getallen door de tijd heen, maar in het begrijpen van hoe ze met elkaar communiceren. Een stijging van de prijs vergezeld door een hoog handelsvolume vertelt een ander verhaal dan een stijging met een laag volume, maar veel computermodellen behandelen deze vijf getallen als afzonderlijke, ongerelateerde datastromen.
De kernvraag waar onderzoekers voor staan, is of één enkel computerprogramma de complexe, verschuivende regels van de aandelenmarkt goed genoeg kan leren om deze toe te passen op nieuwe, onbekende aandelen zonder dat het vanaf nul opnieuw getraind moet worden. Traditionele methoden worstelen hier vaak mee, of ze slagen er niet in de subtiele relaties tussen prijs en volume te vangen, of ze worden zo gespecialiseerd in één specifiek bedrijf dat ze zich niet kunnen aanpassen aan een ander. Deze beperking maakt het moeilijk om een universele tool voor beleggingsanalyse te bouwen die werkt in verschillende landen en marktomstandigheden.
In een recente studie heeft een team onderzoekers van het Beijing Institute of Technology een nieuwe aanpak voorgesteld om dit probleem op te lossen. Ze ontwikkelden een systeem genaamd IR-MoE, wat staat voor Inter-variable Relationship-Aware Mixture-of-Experts. De naam beschrijft precies wat het systeem doet: het is ontworpen om zich bewust te zijn van hoe de verschillende handelsvariabelen met elkaar samenhangen, en het gebruikt een "mixture of experts" om voorspellingen te doen. In plaats van de computer te dwingen om één rigide regel voor alle aandelen te leren, staat dit systeem verschillende delen van het model toe om te specialiseren in verschillende marktomstandigheden. Het is gebouwd op het idee dat hoewel elk aandeel uniek is, de manier waarop prijs en volume interageren vaak herkenbare patronen volgt die geleerd en overgedragen kunnen worden.
De onderzoekers begonnen met het verzamelen van een enorme hoeveelheid historische data uit vier verschillende financiële markten: de Chinese A-share markt, de Verenigde Staten, Hongkong en Japan. Ze selecteerden honderden representatieve aandelen uit deze regio's, die een breed scala aan industrieën en marktgedragingen beslaan. In plaats van een apart model voor elk van deze honderden aandelen te trainen, voedden ze alle data aan één enkel, verenigd systeem. Deze "union training"-strategie stelde het model in staat om gedeelde marktdynamiek te leren, zoals hoe een plotselinge stijging in handelsvolume vaak een verschuiving in de prijsrichting signaleert, ongeacht of het aandeel nu in Shanghai of New York is gevestigd.
Het hart van hun systeem is een tweeledige architectuur. Het eerste deel richt zich op het begrijpen van de relaties tussen de vijf dagelijkse getallen. De onderzoekers behandelden elk getal — open, hoog, laag, slot en volume — als een afzonderlijk stuk informatie, of 'token', en gebruikten een mechanisme geïnspireerd door moderne taalmodellen om ze met elkaar te laten interageren. Dit stelde het systeem in staat om expliciet te leren dat bijvoorbeeld de slotkoers sterk wordt beïnvloed door het handelsvolume van die dag. Door deze interacties te visualiseren, ontdekten de onderzoekers dat het model consequent aandacht besteedde aan het volume wanneer het probeerde prijsbewegingen te begrijpen. Deze aandacht was niet willekeurig; deze was sterker tijdens perioden van hoge volatiliteit, wat suggereert dat het model had geleerd dat volume een cruciaalere aanwijzing wordt wanneer de markt turbulent is.
Het tweede deel van het systeem is de "mixture of experts". Stel je een team van specialisten voor, elk een expert in een specifiek type marktgedrag, zoals een gestage opwaartse trend, een plotselinge crash of een rustige, zijwaartse beweging. Wanneer het systeem data ontvangt voor een nieuw aandeel, vraagt het niet aan elke specialist om een mening te geven. In plaats daarvan kijkt een routeringsmechanisme naar de huidige marktomstandigheden en selecteert het slechts enkele van de meest relevante experts om de voorspelling te doen. Dit stelt het systeem in staat om zich direct aan te passen aan verschillende situaties. Als de markt grillig gedrag vertoont, kan het een beroep doen op experts die getraind zijn op hoogvolatiele patronen; als de markt kalm is, kan het vertrouwen op diegenen die getraind zijn op gestage trends. Deze flexibiliteit is wat het model in staat stelt om de diverse en veranderende aard van wereldwijde aandelenmarkten aan te kunnen.
De resultaten van de studie werden getest over alle vier de markten, inclusclusief een rigoureuze test waarbij het model werd gevraagd de prijzen te voorspellen voor aandelen die het nog nooit eerder had gezien, zonder extra training. In deze "zero-shot" tests presteerde het nieuwe systeem beter dan verschillende bestaande methoden, waaronder complexe modellen die data in kleinere stukjes opdelen en andere geavanceerde kunstmatige intelligentiesystemen die ontworpen zijn voor tijdreeksvoorspellingen. Op de Chinese A-share markt bereikte het model een foutpercentage van ongeveer 1,10 procent, terwijl het op de Amerikaanse markt een foutpercentage van ongeveer 1,32 procent bereikte. Deze cijfers waren consistent beter dan de best presterende alternatieven in de studie.
Misschien wel het meest significant is dat het model bewees zijn kennis over grenzen heen te kunnen overdragen. Wanneer het systeem, getraind op data van Chinese aandelen, direct werd toegepast op onbekende aandelen in de Verenigde Staten, Hongkong en Japan, behield het een hoge nauwkeurigheid. Dit suggereert dat de fundamentele relaties tussen prijs en volume universeel genoeg zijn om eenmaal geleerd te worden en overal toegepast te kunnen worden. De onderzoekers ontdekten ook dat het systeem het beste werkte wanneer het werd getraind op een diverse maar beheersbare hoeveelheid aandelen. Het toevoegen van meer data hielp in het begin, maar voorbij een bepaald punt namen de voordelen af, wat aangeeft dat de sleutel lag in het dekken van een breed scala aan marktgedragingen in plaats van simpelweg het systeem met meer getallen te voeden.
Om te waarborgen dat het systeem correct functioneerde, onderzochten de onderzoekers ook hoe de "experts" werden gebruikt. Ze ontdekten dat het systeem zonder een specifiek balanceringsmechanisme de neiging had om te zwaar op een paar experts te leunen, waardoor anderen ongebruikt bleven. Door een regel toe te voegen die het systeem dwong het werk gelijkmatiger te verdelen, zorgden ze ervoor dat alle gespecialiseerde delen van het model actief waren en leerden. Deze aandacht voor detail in het trainingsproces was cruciaal voor de stabiliteit en prestaties van het systeem.
De studie concludeert dat door expliciet te modelleren hoe handelsvariabelen interageren en door een flexibel team van gespecialiseerde voorspellers te gebruiken, het mogelijk is om een robuustere en aanpasbaardere tool voor aandelenvoorspelling te bouwen. De onderzoekers suggereren dat hun aanpak een veelbelovend pad biedt voor financiële analyse, een pad dat wegbeweegt van rigide, enkeldoelige modellen naar systemen die de complexe, verschuivende taal van de markt kunnen begrijpen. Hoewel de studie niet beweert het mysterie van de aandelenmarkt te hebben opgelost, demonstreert het dat een dieper begrip van de relaties tussen dagelijkse handelsdata kan leiden tot nauwkeurigere en meer generaliseerbare voorspellingen. Het werk opent de deur voor toekomstig onderzoek dat zelfs meer soorten data kan integreren, zoals nieuwsberichten of intraday-handeldetails, om ons vermogen om de financiële wereld te navigeren verder te verfijnen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.