Learning Stock Trading Policies via Barycenter-Based Adversarial Inverse Reinforcement Learning
Dit artikel introduceert BRaG, een op barycentra gebaseerd framework voor adversariële inverse reinforcement learning dat heterogene expertstrategieën aggregeert via Wasserstein-barycentra en control barrier functions incorporeert om stabiele, risico-bewuste aandelenhandelbeleid te leren die klassieke regels en deep reinforcement learning-methoden overtreffen in wereldwijde aandelenmarkten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De wereld van de aandelenhandel is een enorme, luidruchtige machine waar geld beweegt op basis van voorspellingen, patronen en het constante gezoem van menselijke angst en hebzucht. Decennialang hebben beleggers geprobeerd machines te bouwen die deze chaos beter kunnen navigeren dan een mens ooit zou kunnen. De uitdaging ligt in de aard van de markt zelf: deze geeft geen duidelijke instructies of onmiddellijke feedback. Een handelaar kan vandaag een beslissing nemen, maar het werkelijke resultaat van die keuze — of het nu een briljante zet of een kostbare fout was — is misschien pas dagen, weken of zelfs maanden later bekend. Deze vertraging maakt het ongelooflijk moeilijk om een computer te leren hoe hij moet handelen, omdat de machine moeite heeft om zijn acties te koppelen aan de gevolgen die veel later arriveren. Bovendien is de markt onvoorspelbaar en verandert zij voortdurend haar regels, wat betekent dat een strategie die vandaag perfect werkt, morgen kan falen. Terwijl traditionele methoden vertrouwen op vaste door mensen geschreven regels, en nieuwere methoden gebruikmaken van kunstmatige intelligentie om van data te leren, struikelen beide vaak wanneer ze worden geconfronteerd met de rommelige realiteit van de echte financiële wereld, met name als het gaat om risicobeheer en het vermijden van catastrofale verliezen.
In een recente studie hebben onderzoekers van het Indian Institute of Technology Mandi een nieuwe manier voorgesteld om computers te leren hoe ze moeten handelen, een methode die put uit de wijsheid van vele verschillende experts in plaats van te proberen vanaf nul te leren. Ze noemen hun systeem BRaG. In plaats van de computer te vragen om de beste manier van handelen te ontdekken door te gokken en te controleren, wat vaak leidt tot wilde schommelingen en gevaarlijke fouten, besloten de onderzoekers om de computer te laten leren door te kijken naar een diverse groep succesvolle handelsstrategieën. Stel je een student voor die probeert een complexe vaardigheid te leren; die zou het beter doen door een panel van verschillende meesters te observeren — sommigen die agressief zijn, sommigen die voorzichtig zijn, sommigen die trends volgen, en sommigen die wedden op omkeringen — in plaats van slechts één persoon na te doen. De onderzoekers verzamelden gegevens van vijf verschillende handelsstijlen, variërend van eenvoudige voortschrijdende gemiddelden tot complexere momentum-gebaseerde benaderingen. Echter, het simpelweg mengen van al deze verschillende stijlen zou een verwarrende bende creëren. Om dit op te lossen, ontwikkelde het team een wiskundige methode om een "centraal punt" te vinden dat de beste, meest stabiele delen van alle experts gecombineerd vertegenwoordigt. Dit centrale punt fungeert als een betrouwbare gids, die de computer een veilige en effectieve weg laat volgen voordat hij ooit echt geld aanraakt.
Het proces werkt in twee afzonderlijke fasen. Eerst wordt de computer voorgetraind om dit stabiele, gecombineerde expertgedrag na te bootsen. Tijdens deze fase leert de machine beslissingen te nemen die lijken op de slimste delen van de expertstrategieën, zonder dat zij de complexe redenen erachter hoeft te begrijpen of hoeft te wachten op vertraagde beloningen. Deze stap is cruciaal omdat het de computer een solide fundament geeft, waardoor voorkomt dat hij doelloos ronddwaalt of roekeloze weddenschappen afsluit terwijl hij nog aan het leren is. Zodra de computer deze goede gewoonten heeft geïnternaliseerd, begint de tweede fase. De onderzoekers laten de computer vervolgens handelen in een gesimuleerde markt met echte financiële beloningen. Nu, in plaats van alleen de experts te kopiëren, verfijnt de computer zijn eigen strategie, waarbij hij leert zich aan te passen aan de specifieke ups en downs van de markt terwijl hij toch vasthoudt aan de veilige gedragingen die hij eerder heeft geleerd. Om ervoor te zorgen dat de computer niet te hebzuchtig wordt en te veel risico neemt, bevat het systeem een strikt veiligheidsmechanisme. Dit mechanisme werkt als een vangrail, die de waarde van de portefeuille van de computer constant controleert. Als een transactie de waarde van de portefeuille te ver van het hoogste punt dreigt te drukken, blokkeert het systeem de transactie automatisch of past het deze aan om binnen veilige grenzen te blijven. Dit zorgt ervoor dat zelfs wanneer de computer leert om agressiever te zijn om meer geld te verdienen, hij nooit de lijn overschrijdt naar gevaarlijk terrein.
De onderzoekers testten deze nieuwe aanpak op vier belangrijke aandelenmarkten over de hele wereld: de Verenigde Staten, het Verenigd Koninkrijk, India en Taiwan. Ze vergeleken hun systeem met een breed scala aan concurrenten, inclus\u00zaand bij oude handelsregels, willekeurig gokken en andere geavanceerde modellen van kunstmatige intelligentie die de afgelopen jaren zijn ontwikkeld. De resultaten waren duidelijk en consistent over alle vier de markten. Het nieuwe systeem, BRaG, presteerde consequent beter dan de andere methoden en genereerde over een langere periode hogere totale rendementen. Belangrijker nog, het deed dit met grotere stabiliteit. Terwijl andere modellen van kunstmatige intelligentie vaak wilde schommelingen in hun prestaties vertoonden, met perioden van enorme winsten gevolgd door scherpe dalingen, behield BRaG een gladdere, meer betrouwbare groeicurve. Het bereikte een hogere ratio van winst ten opzichte van risico, wat betekent dat het meer geld verdiende voor elke eenheid risico die het nam. Het leed ook minder onder zware verliezen, waardoor de waarde van de portefeuille tijdens moeilijke marktomstandigheden minder diep daalde dan die van de anderen. De studie toonde aan dat het systeem niet toevallig was; het was robuust en presteerde goed, zelfs wanneer het werd getest op data die het nog nooit eerder had gezien.
Het succes van deze aanpak benadrukt een verschuiving in hoe we financiële instrumenten kunnen bouwen. In plaats van te proberen een perfect pakket aan regels te ontwerpen of te hopen dat een enkel algoritme alles uit zichzelf kan uitzoeken, ontdekten de onderzoekers dat het combineren van de sterke punten van vele verschillende strategieën een krachtiger en veiliger resultaat oplevert. Door eerst te leren van een gebalanceerde mix van expertgedrag en vervolgens die kennis te verfijnen met echte markservaring, leert de computer zowel winstgevend als voorzichtig te zijn. De studie suggereert dat de sleutel tot effectieve geautomatiseerde handel niet alleen in de intelligentie van de machine ligt, maar in de kwaliteit van de begeleiding die zij ontvangt en de striktheid van de veiligheidslimieten die zij volgt. Deze methode biedt een veelbelovend pad voor het creëren van handelsystemen die de complexe, volatiele wereld van de financiën kunnen navigeren zonder hun weg kwijt te raken of alles te riskeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.