← Nieuwste papers
💰 quantitative finance

Self-Supervised Auxiliary Task Discovery for Stable Reinforcement Learning in Stock Trading

Dit artikel stelt een zelfsuperviserend raamwerk voor dat automatisch General Value Function-gebaseerde hulptaken ontdekt via een meta-gradiëntmechanisme om representatieleer te verbeteren en reinforcement learning-beleid voor aandelenhandel over diverse marktregimes heen te stabiliseren.

Oorspronkelijke auteurs: Arishi Orra, Himanshu Choudhary, Manoj Thakur

Gepubliceerd 2026-08-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Arishi Orra, Himanshu Choudhary, Manoj Thakur

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De wereld van de aandelenhandel is al lang een domein waar menselijke intuïtie strijdt tegen chaotische, verschuivende markten. Decennialang hebben handelaren vertrouwd op algoritmen om door bergen data te zeven, in de hoop patronen te vinden die voorspellen of een prijs zal stijgen of dalen. In de afgelopen jaren is een krachtig type kunstmatige intelligentie, bekend als reinforcement learning (versterkingsleren), opgekomen als een leidend instrument voor deze taak. Stel je een digitale agent voor die leert handelen, niet door verteld te krijgen wat het juiste antwoord is, maar door acties uit te voeren, fouten te maken en langzaam te leren van de winsten en verliezen die het ervaart. Deze aanpak is veelbelovend omdat het kan aanpassen aan veranderende omstandigheden, in tegenstelling tot oudere methoden die ervan uitgaan dat de markt zich vandaag op dezelfde manier gedraagt als gisteren. Het is echter ongelooflijk moeilijk om deze agenten zowel winstgevend als stabiel te leren zijn. De financiële markt is ruisachtig en onvoorspelbaar, en geeft de agent vaak pas veel later feedback over of een specifieke beslissing goed of slecht was. Zonder duidelijke begeleiding kan de agent moeite hebben met leren, waardoor hij grillig wordt of er niet in slaagt zijn vaardigheden te generaliseren naar nieuwe marktomstandigheden.

Om deze agenten sneller en betrouwbaarder te laten leren, geven onderzoekers hen vaak extra, kleinere taken om op te lossen naast het hoofddoel om geld te verdienen. Dit zijn zogenaamde hulpstaken (auxiliary tasks). Traditioneel moeten experts deze extra taken handmatig ontwerpen, waarbij ze raden wat zou kunnen helpen om de agent de markt beter te laten begrijpen, zoals het voorspellen van de volgende prijsverandering of het inschatten van hoe volatiel de markt zou kunnen zijn. Maar het probleem met deze handmatige aanpak is dat de markt constant verandert. Een taak die goed werkt tijdens een rustige periode, kan nutteloos of zelfs schadelijk zijn tijdens een turbulente periode. Als de hulpstaken in steen gebeiteld zijn, kunnen ze niet aanpassen aan het verschuivende landschap van de aandelenmarkt, waardoor de handelsagent wordt achtergelaten met verouderde of irrelevante informatie.

Een team van onderzoekers aan het Indian Institute of Technology Mandi heeft een nieuwe manier ontwikkeld om dit probleem op te lossen. In plaats van een mens te vragen te raden welke extra taken zouden kunnen helpen, hebben zij een systeem gecreëerd dat deze taken automatisch ontdekt. Ze noemen hun nieuwe framework QUESTrader. Het kernidee is om de kunstmatige intelligentie zelf te laten uitzoeken wat het moet leren. Het systeem maakt gebruik van een dual-network ontwerp. Eén netwerk, de hoofdhandelaar, leert hoe het aandelen moet kopen en verkopen om winst te maximalen. Het tweede netwerk fungeert als een vraaggenerator. Het stelt voortdurend nieuwe, eenvoudige vragen voor om door de hoofdhandelaar te laten beantwoorden, zoals: "wat gaat de prijs in de komende paar dagen doen?" of "hoeveel zal de markt bewegen?", gebaseerd op de dagelijkse slotkoersgegevens en technische indicatoren die in de studie werden gebruikt. Deze vragen zijn niet vaststaand; ze worden dynamisch gegenereerd op basis van wat het systeem op dat moment ervaart. Het systeem traint vervolgens de hoofdhandelaar om deze vragen te beantwoorden terwijl het handelt.

De genialiteit van deze aanpak ligt in de manier waarop het systeem beslist welke vragen het waard zijn om gesteld te worden. De onderzoekers gebruiken een geavanceerd leermechanisme dat kijkt naar de resultaten op de lange termijn. Het vraagt: "Heeft het beantwoorden van deze specifieke vraag de handelaar er later toe gebracht om betere beslissingen te nemen?" Als een vraag leidt tot een betere handelsprestatie, past het systeem zijn parameters aan om de vraag te blijven stellen. Als een vraag een afleiding blijkt te zijn, verfijnt het systeem zijn parameters om de generatie ervan te stoppen. Dit proces zorgt ervoor dat de hulpstaken altijd relevant zijn voor de huidige marktomstandigheden. De onderzoekers testten deze methode op vier grote wereldwijde aandelenmarkten: de Dow Jones Industrial Average in de Verenigde Staten, de FTSE 100 in het Verenigd Koninkrijk, de Sensex in India en de TAIEX in Taiwan. Ze vergeleken hun nieuwe systeem met een breed scala aan bestaande strategieën, inclusief traditionele beleggingsmethoden, standaard modellen voor kunstmatige intelligentie en andere systemen die gebruikmaken van handmatig ontworpen hulpstaken.

De resultaten waren opmerkelijk. Over alle vier de markten heen presteerde het QUESTrader-systeem consequent beter dan de andere methoden. In de Amerikaanse markt behaalde het een jaarlijnd rendement van 21,785 procent, aanzienlijk hoger dan de op één na beste methode, die 18,176 procent behaalde. Belangrijker nog was dat het systeem niet alleen meer geld verdiende; het deed dit met grotere stabiliteit. Het behaalde de hoogste risico-gecorrigeerde scores, wat betekent dat het meer winst genereerde voor elke eenheid risico die het nam. Wanneer de markt daalde, verloor de QUESTrader-agent minder geld dan zijn concurrenten. In de Indiase markt bijvoorbeeld, hield het een maximaal verlies aan van 10,584 procent, wat veel lager was dan het verlies van 17,783 procent bij andere geavanceerde modellen. Het systeem bewees ook effectief te zijn in de zeer volatiele Taiwanese markt, waar het een jaarlijnd rendement van 30,279 procent leverde, waarmee het alle andere benaderingen ver overtrof.

De onderzoekers ontdekten dat de sleutel tot dit succes het vermogen van het systeem was om zijn hulpstaken in realtime aan te passen. Door automatisch de juiste vragen te ontdekken, bouwde de handelsagent een rijker en nauwkeuriger begrip van de markt op. Het leerde patronen te herkennen die door menselijk ontworpen taken mogelijk over het hoofd zouden worden gezien. De studie onderzocht ook hoeveel vragen het systeem tegelijkertijd zou moeten stellen en hoe ver in de toekomst het zou moeten kijken om de waarde van een vraag te beoordelen. Ze vonden dat een gemiddeld aantal vragen, rond de zestien tot zesentwintig, het beste werkte, en dat het vooruitkijken over ongeveer tien stappen in het leerproces het systeem in staat stelde om de juiste vragen correct te koppelen aan toekomstig succes. Deze balans voorkwam dat het systeem werd overweldigd door te veel informatie of in de war raakte door te ver in de toekomst te kijken.

Dit werk suggereert dat de toekomst van de geautomatiseerde handel misschien niet ligt in slimme mensen die betere regels ontwerpen, maar in slimme machines die zichzelf kunnen leren waar ze op moeten letten. Door het systeem zichzelf de leerdoelen te laten ontdekken, creëerden de onderzoekers een handelsagent die robuuster, aanpasbaarder en uiteindelijk winstgevender is dan diegene die vertrouwt op statische, door mensen gemaakte instructies. De bevindingen wijzen erop dat in de complexe, verschuivende wereld van de financiën het vermogen om te leren wat men moet leren, net zo belangrijk is als het vermogen om te leren hoe men moet handelen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →