← Nieuwste papers
💰 quantitative finance

Reinforcement Learning for Execution under Dynamic Fees in a Closed-Loop DEX Simulator

Dit artikel introduceert een closed-loop DEX-simulator om aan te tonen dat een kleine Deep Q-Network (DQN) agent de implementation shortfall aanzienlijk vermindert vergeleken met afgestemde benchmarks, specifiek in omgevingen met dynamische vergoedingen, wat model-geconditioneerd contrafactisch bewijs levert voor executiecontrole in automated market makers.

Oorspronkelijke auteurs: Wen-Ting Wang

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wen-Ting Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een handelaar bent die probeert een enorme stapel digitale koekjes te verkopen op een gedecentraliseerde exchange (DEX). In de oude dagen was de "fee" om koekjes te verkopen een vast tarief, zoals een vaste prijs op een reep chocolade. Maar onlangs zijn deze exchanges begonnen met het gebruiken van dynamische fees. Denk aan dit als een algoritme voor prijsopdrijving (surge pricing) bij een taxi: als de weg druk wordt of het weer slecht is, gaat de prijs om te rijden direct omhoog.

De grote vraag die onderzoekers wilden beantwoorden was: Kan een slimme computeragent beter navigeren door deze veranderende fees dan een mens die een simpele regel volgt?

Het Probleem: De "Geest" in de Machine

Meestal bestuderen wetenschappers handel door naar oude gegevens (historische data) te kijken. Maar er is een addertje onder het gras: in het verleden veranderden fees niet veel, en we weten niet precies waarom handelaren de keuzes maakten die ze maakten. Het is alsof je probeert te leren hoe je schaak speelt door naar een film te kijken waarin de stukken nooit bewegen. Je kunt niet leren hoe het spel reageert op jouw zetten als het spel niet daadwerkelijk van gedachten verandert op basis van wat jij doet.

Om dit op te lossen, bouwden de auteurs een videogamesimulator. Het is een "closed-loop" wereld waar:

  1. Jij (de agent) probeert je koekjes te verkopen.
  2. De Markt reageert op jouw verkoop, waardoor de prijs en de fee veranderen.
  3. Andere Spelers (noise traders en arbitrageurs) bewegen zich ook rond, reagerend op de markt.

Cruciaal is dat in dit spel de fee-regel zo is ontworig dat deze "slim" is. Deze verandert op basis van de staat van de markt, net zoals een echt dynamisch fee-systeem dat zou doen. Dit stelt de computeragent in staat om daadwerkelijk te leren hoe de markt terugvecht.

De Wedstrijd: De Ladder van Strategieën

De auteurs zetten hun AI niet alleen af tegen een willekeurige gokker. Ze bouwden een "ladder" van tegenstanders, elk slimmer dan de vorige:

  • De Schedule: Gewoon koekjes verkopen in een constant tempo, zoals een robot die een timer volgt.
  • De One-Step Lookahead: Een slim mens die naar de volgende seconde kijkt, de beste zet berekent, en dan stopt met denken.
  • De Planners: Agents die proberen een paar stappen in de toekomst te simuleren om te zien wat er gebeurt.
  • De DQN (Deep Q-Network): De "held" van het verhaal. Dit is een kleine, model-vrije AI die leert door trial-and-error, waarbij hij probeert de langetermijn-beste strategie te achterhalen zonder de regels van het universum te kennen.

De Grote Onthulling

De auteurs draaiden de simulatie 1.000 keer met verschillende willekeurige marktscenario's (seeds) om te zien wie er won.

De Resultaat: De kleine DQN AI versloeg de slimme "one-step lookahead" mens.

  • Hoeveel beter? Het bespaarde ongeveer 13,3 basispunten (een minuscuul fractie van een procent, maar enorm in de handel) op de kosten van de transactie.
  • Waar kwam de winst vandaan? De AI leerde om zijn transacties perfect te timen om "lage fee"-vensters te raken. Het wachtte tot de markt tot rust kwam en de fees daalden voordat het verkocht.
  • De Catch: Dit voordeel bestond alleen in de dynamische fee-omgeving. Wanneer de onderzoekers de dynamische fees uitzetten en ze constant (plat) maakten, presteerden de AI en de simpele mens precies hetzelfde. De AI werd niet simpelweg gelukkig; het leerde specifiek om de veranderende fees uit te buiten.

Wat de AI deed (en niet deed)

De AI werd geen magische geldprinter. Het voorspelde de toekomst niet, en het vond geen "perfecte" oplossing.

  • Het versloeg de "Planners" niet op een duidelijke manier: Verrassend genoeg presteerden de agents die probeerden 2 of 3 stappen vooruit te plannen niet significant beter of slechter dan de simpele one-step mens. De markt was te luidruchtig voor hen om duidelijk te zien, waardoor ze statistisch gezien gelijk speelden met de baseline. De DQN was de enige leerling die erin slaagde de baseline met statistische zekerheid te verslaan.
  • Het werkte niet in een vacuüm: Als de AI werd getraind om te handelen voordat de markt bewoog, deed het het geweldig. Maar als de onderzoekers het dwongen om te handelen nadat de markt bewoog (een andere "volgorde"), daalde de prestatie. Echter, als ze de AI specifiek voor die nieuwe regel her-trainden, herstelde het zich en won het weer. Dit bewijst dat de AI de specifieke ritmiek van het spel leerde, en niet alleen een trucje uit het hoofd leerde.

Wat dit papier NIET zegt

Het is erg belangrijk om te weten wat dit papier uitsluit:

  • Het is geen geschiedenisles: De resultaten zijn volledig gebaseerd op een simulatie. De auteurs geven expliciet aan dat dit geen bewijs is over hoe echte handelaren zich in het verleden gedroegen.
  • Het is geen winstgarantie: Het papier beweert niet dat het inzetten van deze AI op een echte exchange je rijk zal maken. Het is een bewijs van concept over controle, niet een bedrijfsplan.
  • Het is geen "opgelost" probleem: De AI vond niet de absoluut beste mogelijke strategie (de "hindsight" perfecte strategie was nog steeds beter dan de AI). De AI vond alleen een manier om beter te zijn dan de standaard slimme regels die we vandaag de dag gebruiken.

De Kern van het Verhaal

In deze specifieke, gesimuleerde wereld kan een kleine, lerende AI leren om beter met dynamische fees te dansen dan een slim mens die een simpele regel volgt. Het leerde te wachten op het juiste moment wanneer de fees laag waren, wat ongeveer 13,3 basispunten op de transactie bespaarde. Maar deze vaardigheid is specifiek voor markten waar fees veranderen; als de fees vlak zijn, is de AI net zo goed als de simpele regels die we al hebben.

Het papier suggereert dat in de complexe, verschuivende wereld van gedecentraliseerde financiën, leren aanpassen misschien wel de enige manier is om voorop te blijven lopen bij de fees.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →