A Reinforcement Learning Supervisor with Dynamic Performance-Metric Weighting for Cryptocurrency Portfolio Management
Dit artikel stelt een reinforcement learning supervisor-framework voor dat meerdere prestatie-indicatoren dynamisch weegt om de optimale handelsstrategie te selecteren uit een heterogene set van agenten, waarmee superieure risico-gecorrigeerde rendementen in niet-stationaire cryptomarkten wordt aangetoond in vergelijking met individuele agenten en vaste strategieën.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Investeren in financiële markten is een voortdurend spel van aanpassing. De regels van het spel veranderen naarmate de economie verschuift van een bloeiende groeiperiode naar een trage, zijwaartse beweging, of een plotselinge, scherpe daling. In deze omgevingen faalt een enkele strategie die perfect werkt tijdens een boom vaak jammerlijk wanneer de markt omdraait. Dit is de kernuitdaging van portefeuillebeheer: beslissen hoe je geld verdeelt over verschillende activa wanneer de toekomst onzeker is en het verleden geen betrouwbare kaart is. Decennialang hebben beleggers vertrouwd op wiskundige formules om risico en rendement te balanceren, maar deze statische modellen worstelen vaak wanneer de marktomstandigheden snel veranderen. Recentelijk hebben computerwetenschappers zich gericht op een type kunstmatige intelligentie genaamd reinforcement learning (versterkend leren). In plaats van specifieke regels aangeleerd te krijgen, leren deze computerprogramma's door middel van trial-and-error, waarbij ze interageren met een gesimuleerde markt om te ontdekken welke acties leiden tot de beste resultaten op de lange termijn. Hoewel deze programma's kunnen leren handelen, raken ze vaak gestikt in één manier van denken, waardoor ze niet kunnen schakelen wanneer het marktregieme verandert.
Een team onderzoekers aan de Korea National University of Transportation heeft een nieuwe manier voorgesteld om dit probleem op te lossen. In plaats van te proberen één perfecte handelsrobot te bouwen, creëerden zij een systeem dat fungeert als een supervisor die een team van vijf verschillende handelsrobots beheert, die elk zijn getraind met een iets andere leermethode. De supervisor voert de transacties zelf niet uit. In plaats daarvan houdt de supervisor in de gaten hoe elke robot onlangs heeft gepresteerd en beslist welke op dat moment de leiding heeft. De onderzoekers testten dit systeem met echte, hoogfrequente data uit de cryptomarkten, een plek die bekend staat om zijn extreme volatiliteit en snelle veranderingen. Ze ontdekten dat dit supervisorsysteem consequent beter presteerde dan elke individuele robot, evenals traditionele beleggingsstrategieën, door dynamisch over te schakelen naar de agent die het best geschikt is voor de huidige marktomstandigheden.
De onderzoekers begonnen met het bouwen van een team van vijf verschillende agents. Elke agent is een computerprogramma dat ontworpen is om investeringsbeslissingen te nemen, maar ze werden getraind met verschillende wiskundige benaderingen. Hoewel alle agents in dezelfde portefeuille-omgeving met dezelfde beloningsfunctie werden getraind, zorgden hun verschillende leermechanismen ervoor dat elke agent een unieke persoonlijkheid ontwikkelde. De een kan zeer agressief zijn en op zoek naar hoge winsten maar grote risico's neemt, terwijl een ander meer voorzichtig kan zijn en prioriteit geeft aan stabiliteit boven snelle winsten. In een stabiele markt kan de agressieve agent uitblinken. In een turbulente markt kan de voorzichtige agent de enige zijn die overleeft. Het probleem is dat geen enkele agent overal en altijd de beste in is. Als een belegger slechts één agent kiest en zich daaraan houdt, zal hij waarschijnlijk lijden wanneer de markt verschuift op een manier die die agent niet leuk vindt.
Om dit op te lossen, introduceerden de onderzoekers een supervisor-agent. Deze supervisor kent de interne code van de vijf beheerde agents niet. In plaats daarvan fungeert het als een coach die een wedstrijd observeert en alleen naar het scorebord kijkt. Het houdt zeven verschillende prestatie-indicatoren bij voor elke agent, zoals hoeveel winst ze hebben gemaakt, hoeveel risico ze namen om die winst te behalen, en het aandeel perioden met positieve rendementen. Het bekijkt deze cijfers over verschillende tijdsperioden, van de afgelopen uren tot de afgelopen dagen. De taak van de supervisor is om te achterhalen welke van deze indicatoren op dit moment het belangrijkst is. In een rustige markt kan de supervisor besluiten dat gestage, consistente winsten het belangrijkste teken zijn van een goede agent. In een chaotische markt kan het besluiten dat het vermijden van grote verliezen het enige is dat telt.
De supervisor leert dit wegingsysteem via zijn eigen trainingsproces. Het observeert de markt en de recente geschiedenis van de agents, en leert vervolgens belang scores toe te kennen aan de verschillende prestatie-indicatoren. Het kiest niet simpelweg de agent met de hoogste recente winst. In plaats daarvan berekent het een score voor elke agent door hun prestatiegegevens te combineren met de belang weights die de supervisor heeft geleerd voor dat specifieke moment. De agent met de hoogste totale score wordt geselecteerd om de portefeuille voor de volgende handelsperiode te beheren. Dit creëert een systeem dat voortdurend zijn keuzes herëvalueert en zijn vertrouwen verschuift van de ene naar de andere agent naarmate het marktmilieu verandert.
De onderzoekers testten dit systeem met dertig minuten durende prijsdata van de Binance cryptocurrency exchange, die de periode van 1 januari 20 ever 2021 tot 31 december 2025 beslaat. Ze stelden twee verschillende scenario's op: één met vier populaire cryptocurrencies en één met vijf, waarbij een vijfde actief werd toegevoegd om te zien of het systeem een iets grotere groep investeringen kon afhandelen. Ze vergeleken hun supervisorsysteem met de vijf individuele agents, een eenvoudige strategie van het gelijkmatig kopen en aanhouden van alle activa, en verschillende traditionele beleggingsformules. De resultaten waren duidelijk. Het supervisorsysteem genereerde aanzienlijk hogere uiteindelijke portefeuillewaarden dan welke van de individuele agents of traditionele strategieën ook. In het scenario met vier activa groeide de waarde van de portefeuille door de supervisor naar 2,349 keer het beginbedrag, terwijl de beste individuele agent slechts 1,652 bereikte. In het scenario met vijf activa bereikte de supervisor 3,044 keer de beginwaarde, vergeleken met 2,554 voor de beste individuele agent.
Cruciaal was dat deze extra groei niet ten koste ging van een hoger risico. Het supervisorsysteem ervoer ook kleinere maximale verliezen, ook wel drawdowns genoemd, dan de individuele agents. Dit suggereert dat het systeem niet alleen grotere gokken nam voor hogere rendementen, maar dat het het risico eigenlijk beter beheerde door te weten wanneer het naar een veiligere agent moest overschakelen. De onderzoekers vergeleken hun systeem ook met een eenvoudigere versie die slechts één vaste regel gebruikte om tussen agents te wisselen, zoals altijd de agent kiezen met de hoogste recente winst. Het supervisorsysteem presteerde veel beter dan deze strategieën met één regel. Dit bewees dat het succes van het systeem voortkwam uit het vermogen om meerdere factoren tegelijkertijd te wegen, in plaats van te vertrouwen op één enkel, rigide criterium.
Om precies te begrijpen wat het systeem werkzaam maakte, voerden de onderzoekers een reeks tests uit waarbij ze onderdelen van het systeem verwijderden om te zien wat er gebeurde. Ze ontdekten dat het systeem alle zeven prestatie-indicatoren en alle vier de tijdsvensters nodig had om optimaal te functioneren. Het verwijderen van de winstgerelateerde indicatoren schaadde het vermogen van het systeem om rijkdom te creëren, terwijl het verwijderen van de risicogerelateerde indicatoren het vermogen van het systeem om tegen verliezen te beschermen schaadde. Op dezelfde manier had het systeem zowel de korte- als de langetermijnprestatiegeschiedenis nodig. In de test met vier activa was de langetermijngeschiedenis het belangrijkst, terwijl in de test met vijf activa de kortetermijngeschiedenis belangrijker was. Deze variatie toonde aan dat het systeem geen vaste regel gebruikte, maar werkelijk aanpaste aan de specifieende behoeften van de huidige portefeuille en de marktomstandigheden.
De studie concludeert dat het beheren van een portefeuille niet alleen gaat over het vinden van het ene beste handelsalgoritme. Het gaat om het creëren van een structuur die de juiste tool voor de klus kan kiezen naarmate de klus verandert. Door een supervisor te gebruiken om verschillende prestatiesignalen dynamisch te wegen, kan het systeem de onvoorspelbare aard van de cryptomarkten effectiever navigeren dan een enkele agent of een statische strategie. De onderzoekers merken op dat hun huidige systeem een specifieke set van vijf agents en een specifieke set marktdata gebruikt. Toekomstig werk zou dit kunnen uitbreiden door agents met verschillende risicoprofielen op te nemen of het systeem op andere soorten activa te testen. De kernbevinding blijft echter robuust: een hiërarchische aanpak die leert om beleid te selecteren op basis van een flexibel, veelzijdig beeld van prestaties biedt een krachtige manier om de onzekerheid van financiële markten aan te pakken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.