← Nieuwste papers
🤖 machine learning

CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach

Dit artikel presenteert een sentiment-geaugmenteerd deep reinforcement learning-systeem voor de CLaC@FinMMEval 2026 Task 3, waarmee wordt aangetoond dat een DDPG-agent die gebruikmaakt van LLaMA 3.2 nieuws-sentiment en alpha-gebaseerde beloningen aanzienlijk beter presteert dan buy-and-hold-strategieën op TSLA en BTC, terwijl het tegelijkertijd de uitdagingen benadrukt van het generaliseren van beleid van bull- naar bear-marktregimes.

Oorspronkelijke auteurs: Andrei Neagu, Eeham Khan, Leila Kosseim

Gepubliceerd 2026-07-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andrei Neagu, Eeham Khan, Leila Kosseim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren een heel lastig computerspelletje te spelen: de aandelenmarkt. Het doel van dit spel is namelijk niet alleen om punten te scoren; het doel is om de score te verslaan van een speler die nooit stopt met spelen, nooit van strategie verandert en zijn personage de hele tijd vasthoudt (een strategie die bekend staat als "buy-and-hold"). Het spel is chaotisch, vol met lawaaierige geluidseffecten, plotselinge plotwendingen en een constante stroom aan nieuwsberichten die de regels kunnen veranderen. Om te winnen heb je een slimme agent nodig die naar het scherm kan kijken, het nieuws kan lezen, het ritme van het spel kan voelen en kan beslissen of hij vooruit moet bewegen, stil moet staan of achteruit moet bewegen. Dit is de wereld van Deep Reinforcement Learning (DRL). Denk aan DRL als een methode waarbij een AI leert door middel van vallen en opstaan, waarbij het een "high-five" (beloning) krijgt als het een goede zet doet en een "boze blik" (straf) wanneer het een fout maakt. De wetenschappelijke paper die je nu gaat lezen, onderzoekt hoe je de ultieme handelsrobot kunt bouwen voor twee heel verschillende personages: het technologiebedrijf Tesla (TSLA) en de digitale munt Bitcoin (BTC).

De onderzoekers van Concordia University zetten zich in om een handelssysteem te bouwen dat niet simpelweg gokt, maar echt leert. Ze behandelden de aandelenmarkt als een complex level in een computerspel waarbij de speler (de AI) dagelijks een keuze moet maken: Long gaan (wedden dat de prijs stijgt), Flat gaan (aan de zijlijn blijven staan) of Short gaan (wedden dat de prijs daalt). Om de AI te helpen bij deze keuzes, voedden ze het met drie soorten informatie: Technische Indicatoren (zoals snelheidsmeters en trendlijnen afgeleid van eerdere prijzen), Kalendercycli (weten of het maandag is of het einde van de maand, omdat markten soms anders reageren op die dagen) en Sentiment Scores (een "mood ring" voor het nieuws, berekend door een superintelligente AI die artikelen leest om te zien of mensen blij of bang zijn over een activum).

Het team trainde vier verschillende soorten AI-"hersenen" om dit spel te spelen: Policy Gradient (PG), Proximal Policy Optimization (PPO), Deep Q-Learning (DQL) en Deep Deterministic Policy Gradient (DDPG). Maar hier komt het slimme gedeelte: in plaats van de AI alleen te belonen voor het maken van winst, gaven ze het een speciale "Alpha Reward". Stel je voor dat je tegen een vriend racet; in plaats van je alleen te belonen als je hard rent, krijg je alleen punten als je sneller rent dan je vriend. Dit dwong de AI om zich te concentreren op het verslaan van de "buy-and-hold" baseline, in plaats van alleen maar geluk te hebben omdat de hele markt omhoog ging. Ze zorgden er ook voor dat de trainingssessies op willekeurige momenten begonnen, zodat de AI niet gewoon het script van één specifief spel uit het hoofd zou leren, maar zou leren om elke situatie aan te kunnen.

Toen ze hun robots testten op echte data uit 2025, waren de resultaten een mix van triomf en een harde les over de toekomst. Voor Tesla was de DDPG-robot de ster; deze behaalde een enorm rendement van 54,96%, terwijl de DQL-robot met 52,62% een nauwe tweede werd. Beiden verpletterden de "buy-and-hold"-strategie, die slechts 16,45% maakte. De DDPG-robot was met name goed in het vermijden van problemen, waarbij het verliezen (drawdown) veel lager hield dan de anderen.

Echter, de Bitcoin-test was een veel moeilijker level. De markt veranderde in een "bear market", waarbij de prijzen instortten en de "buy-and-hold"-strategie een enorme klap kreeg met een verlies van 34,27%. In deze storm was de DDPG-robot de enige die het hoofd boven water kon houden, met een kleine maar positieve winst van 1,58%. De andere robots, waaronder de DQL die tijdens de training fantastisch had gepresteerd, hadden moeite om zich aan te passen aan de plotselinge verschuiving van een stijgende markt naar een dalende markt.

De paper suggereert dat hoewel deze AI-agenten effectief kunnen leren handelen, ze nog steeds gevoelig zijn voor het "weer" van de markt. Het DDPG-algoritme bleek de meest robuuste te zijn; het kon zowel de zonnige dagen van Tesla als de stormachtige dagen van Bitcoin beter aan dan de anderen. De onderzoekers ontdekten echter een verraderlijke kloof: de robot die er tijdens de training het beste uitzag (DQL), won niet altijd in de echte test, vooral wanneer het marktregieme veranderde van een bull-markt naar een bear-markt. Dit vertelt ons dat hoewel AI kan leren om de financiële zeeën te bevaren, het nog steeds voorzichtig moet zijn om niet te veel aan de rustige wateren te wennen, want de volgende golf kan een tsunami zijn. Uiteindelijk laat de studie zien dat het combineren van nieuws-sentiment met slimme leeralgoritmen kan helpen om de markt te verslaan, maar dat de "beste" robot sterk afhangt van het soort markt waar hij voor staat.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →