← Nieuwste papers
💰 quantitative finance

Decomposable Reward Modeling and Realistic Environment Design for Reinforcement Learning-Based Forex Trading

Dit artikel introduceert een modulair versterkingsleerframework voor forex-handel dat realistische marktomstandigheden, een gedecomponeerde beloningsstructuur en een uitgebreide actie-ruimte integreert om de interpretatie en prestaties te verbeteren, waarbij empirische resultaten aantonen dat de volledige configuratie de hoogste Sharpe-ratio en cumulatieve rendementen bereikt ondanks een afweging tussen rendement en omloopsnelheid.

Oorspronkelijke auteurs: Nabeel Ahmad Saidd

Gepubliceerd 2026-04-02
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nabeel Ahmad Saidd

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een jonge, ambitieuze handelaar bent die probeert geld te verdienen op de wereldwijde valutamarkt (Forex). Je wilt een slimme robot (een kunstmatige intelligentie) bouwen die dit voor je doet. Maar hier is het probleem: als je die robot in een virtuele wereld traint, leert hij vaak slechte gewoontes aan die in de echte wereld hem failliet laten gaan.

Dit artikel van Nabeel Ahmad Saidd is als een bouwplan voor een eerlijke en realistische trainingschool voor die robot. De auteur zegt: "Laten we stoppen met het spelen van simplistische spelletjes en de robot echt voorbereiden op de ruwe realiteit."

Hier is de uitleg in drie simpele onderdelen, met wat creatieve vergelijkingen:

1. De Eerlijke Trainer: Geen "Cheaten" Toegestaan

In veel oude studies mocht de robot "kijken" in de toekomst voordat hij een beslissing nam. Dat is alsof je een examen doet waarbij je de antwoorden al op je bureau hebt liggen. Dat werkt niet in de echte wereld.

  • De oplossing: De auteur bouwt een simulator die strikte regels heeft. De robot ziet de prijs op het moment dat de markt sluit (bijvoorbeeld 12:00 uur), maar zijn order wordt pas uitgevoerd bij de opening van de volgende sessie (13:00 uur).
  • De analogie: Het is alsof je een kok bent die een recept schrijft op basis van de ingrediënten die je nu in de koelkast hebt, maar je mag pas gaan koken als de leverancier de volgende dag arriveert. Je kunt niet de ingrediënten van morgen gebruiken om je gerecht van vandaag te maken. Dit voorkomt dat de robot "cheat" door de toekomst te voorspellen.
  • Extra realisme: De simulator rekent ook echte kosten mee: transactiekosten, kleine prijsverschillen (slippage) en zelfs rente die je betaalt als je leningen hebt (rollover). Het is alsof je niet alleen de prijs van een auto betaalt, maar ook de brandstof, de verzekering en de parkeergeld.

2. De Scorebord-Coach: Geen Eén Getal, Maar Veel Kleurtjes

Vaak krijgen robots in training maar één cijfer als beloning: "Hoeveel geld heb je verdiend?" (bijvoorbeeld +100 euro). Dit is als een trainer die alleen naar de uitslag van een voetbalwedstrijd kijkt en niet naar hoe goed de spelers hebben gelopen of gepasseerd. De robot leert dan misschien wel winnen, maar door gevaarlijke, riskante moves die op de lange termijn fataal zijn.

  • De oplossing: De auteur maakt een opgebroken scorebord met 11 verschillende onderdelen.
    • Punt voor winst: Goed, maar...
    • Minpunt voor te veel risico: Als je te veel leent, krijg je straf.
    • Minpunt voor te vaak handelen: Als je te veel transacties doet, kosten de kosten je winst.
    • Minpunt voor "Martingale": Dit is een gevaarlijke strategie waarbij je steeds meer inzet als je verliest (een beetje zoals een gokker die zijn laatste geld inzet om zijn verlies terug te winnen). Dit wordt zwaar gestraft.
  • De analogie: Stel je voor dat je een student traint voor een examen. In plaats van alleen te kijken naar het eindcijfer (6 of 10), kijkt de leraar naar 11 verschillende vaardigheden: "Heeft hij goed samengewerkt?", "Heeft hij niet te veel tijd verspild?", "Heeft hij de regels gevolgd?". Door deze onderdelen apart te meten, kunnen de onderzoekers precies zien welke "straf" of "beloning" de robot het slimst maakt. Ze ontdekten dat meer straffen niet altijd beter zijn; het is een kunst om de juiste mix te vinden.

3. De Handige Hand: Meer dan Alleen "Kopen" en "Verkopen"

Oude robots hadden vaak maar drie knoppen: "Kopen", "Verkopen" of "Niets doen". Dit is alsof je een auto bestuurt met alleen een gaspedaal, een rem en een stopknop. Je kunt niet sturen of schakelen.

  • De oplossing: De nieuwe robot heeft 10 verschillende knoppen.
    • Hij kan niet alleen kopen of verkopen, maar ook:
      • Pyramideren: Als je al winst maakt, mag je voorzichtig meer bijsteken (zoals een klimmer die een extra steunpunt zoekt).
      • Martingale: (Wat hij probeert te vermijden) Als je verliest, mag hij niet paniekachtig meer inzetten.
      • Terugdraaien: Als je een fout hebt gemaakt, kan hij zijn positie direct omdraaien.
    • De Veiligheidsdeur: De robot kan geen onmogelijke knoppen indrukken. Als hij geen geld meer heeft om te lenen, wordt de knop "Kopen" grijs en onbruikbaar.
  • De analogie: Het is het verschil tussen een kind dat alleen mag rennen (oude robots) en een ervaren rallyrijder die ook mag sturen, schakelen en remmen (nieuwe robots). De rallyrijder kan sneller en slimmer door de bochten, maar moet wel opletten dat hij niet van de weg afrijdt (de veiligheidsdeur).

Wat hebben ze ontdekt?

Toen ze deze robot lieten trainen op de Euro vs. Dollar (EUR/USD), zagen ze drie belangrijke dingen:

  1. Meer straffen is niet altijd beter: Als je de robot te veel straft voor elk klein foutje, wordt hij angstig en leert hij niets. De perfecte mix van beloningen en straffen gaf het beste resultaat.
  2. Meer opties = Meer winst, maar ook meer beweging: De robot met de 10 knoppen verdiende meer geld dan de robot met 3 knoppen, maar hij maakte ook veel meer transacties. Het is een afweging: meer winst, maar meer "ruis" en activiteit.
  3. Slimme strategieën werken: Robots die leerden om voorzichtig meer te investeren als ze al winst maakten (pyramideren), deden het veel beter dan robots die dat niet deden. Maar robots die probeerden om hun verliezen te "redden" door steeds meer in te zetten (martingale), werden zwaar gestraft en leerden dit snel te vermijden.

Conclusie

Kortom, dit artikel zegt: "Als we kunstmatige intelligentie willen gebruiken om geld te verdienen in de financiële wereld, moeten we stoppen met het spelen van simplistische spelletjes."

Ze hebben een eerlijke, realistische en transparante trainingsomgeving gebouwd. Het is alsof ze van een kind dat alleen in een zwembadje heeft geoefend, een zwemmer hebben gemaakt die klaar is voor de open zee, met een coach die precies weet welke beweging goed is en welke gevaarlijk is. Het is geen garantie dat de robot morgen rijk is, maar het is wel de eerste stap naar een robot die niet failliet gaat door een simpele rekenfout in de simulatie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →