← Nieuwste papers
💬 NLP

Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics

Dit artikel introduceert MARKET-BENCH, een benchmark die grote taalmodellen evalueert op introductieve kwantitatieve handelsopdrachten door hen te verplichten uitvoerbare backtesters te genereren op basis van natuurlijke taalbeschrijvingen, wat onthult dat hoewel huidige modellen betrouwbaar de basisinfrastructuur voor handel kunnen opzetten, ze nog steeds moeite hebben met robuuste redenering over prijzen, inventaris en risico.

Oorspronkelijke auteurs: Abhay Srivastava, Sam Jung, Spencer Mateega

Gepubliceerd 2026-01-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Abhay Srivastava, Sam Jung, Spencer Mateega

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team hebt van zeer slimme, zeer snelle robots. Deze robots zijn geweldig in het lezen van boeken, het schrijven van verhalen en het beantwoorden van trivia-vragen. Maar nu wil je zien of ze iets veel moeilijkers kunnen doen: een limonadekraam beheren waarbij de prijs van citroenen elke seconde verandert, en je moet geld verdienen zonder je broek uit te trekken.

Dit artikel introduceert een nieuwe test genaamd MARKET-BENCH om te zien of deze "robotbreinen" (Large Language Models of LLM's genoemd) daadwerkelijk de wiskunde en logica kunnen beheersen die nodig is om een eenvoudige handelsonderneming te runnen.

Zo werkt de test, onderverdeeld in alledaagse termen:

1. De Test: "Bouw de machine, praat er niet alleen over"

De meeste tests vragen deze robots om te beschrijven hoe je handelt. "Als de prijs stijgt, kopen!" zouden ze kunnen zeggen.
MARKET-BENCH is anders. Het zegt: "Hier is een recept en een lijst met ingrediënten. Schrijf de computercode die het bedrijf daadwerkelijk aanstuurt."

De robots moesten code schrijven die:

  • Bijhoudt hoeveel geld ze hebben.
  • Aandelen koopt en verkoopt (zoals Microsoft, Coke en Pepsi) op basis van specifieke regels.
  • Precies berekent hoeveel winst of verlies ze hebben gemaakt.
  • Cruciaal: De wiskunde van de robot moest exact overeenkomen met een "gouden standaard"-antwoord. Als de robot zei dat ze $100 hadden verdiend, maar de gouden standaard zei dat ze $95 hadden verdiend, dan was de robot afgekeurd.

2. De Drie Uitdagingen (De "Levels")

De test had drie niveaus van moeilijkheidsgraad, zoals in een videogame:

  • Level 1: Het Simpele Schema (Microsoft)

    • De Taak: Microsoft-aandelen kopen of verkopen op specifieke tijden, zoals een robotarm in een assemblagelijn.
    • De Addertjes onder het gras: Je moet elke cent en elk aandeel perfect bijhouden.
    • Resultaat: De meeste robots konden de machine bouwen (de code draaide), maar velen maakten kleine rekenfouten die optelden tot grote fouten. Sommige robots waren perfect; anderen zaten er enorm naast.
  • Level 2: De Danspartner (Coke vs. Pepsi)

    • De Taak: Dit is een "Pairs Trading"-spel. Je wedt op het verschil tussen Coke en Pepsi. Als Coke te duur wordt vergeleken met Pepsi, koop je Pepsi en verkoop je Coke, in de hoop dat ze weer normaal worden.
    • De Addertjes onder het gras: Je moet twee aandelen tegelijkertijd managen, een complexe "spread" (het gat tussen hen) berekenen en je totale geld over beide verdelen.
    • Resultaat: Dit was veel moeilijker. Verschillende robots braken de machine volledig (de code draaide niet). Eén robot (Qwen3 Max) bouwde een machine die perfect draaide, maar de winsten berekende als 400 miljoen dollar, terwijl het een paar honderd dollar had moeten zijn. Het was alsof een robot een auto bouwde die perfect reed, maar dacht dat hij op de maan reed.
  • Level 3: De Koorddans (Options Hedging)

    • De Taak: Dit is het moeilijkste niveau. Je hebt een complexe verzekeringspolis (een optie) op Microsoft-aandelen, en je moet constant aandelen kopen of verkopen om je risico neutraal te houden. Het is alsof je op een koord danst terwijl je jongleert.
    • De Addertjes onder het gras: Timing is alles. Als je een fractie van een seconde te laat bent, verlies je geld.
    • Resultaat: Dit was het moeilijkst. Veel robots kregen de machine niet eens aan de gang. Degenen die wel draaiden, hadden vaak enorme fouten in hun wiskunde.

3. De Belangrijkste Conclusies

Het papier kwam tot drie hoofdzaken:

  • Betrouwbaarheid vs. Nauwkeurigheid: Sommige robots zijn goed in het opvolgen van instructies om de code te bouwen (de machine start), maar zijn slecht in de wiskunde binnenin die code. Anderen zijn goed in de wiskunde, maar krijgen de machine niet eens aan de gang.
  • Het "Hallucinatie"-probleem: In de echte wereld, als een robot denkt dat hij een miljoen dollar heeft verdiend terwijl hij eigenlijk geld heeft verloren, ga je failliet. Het paper laat zien dat deze robots vaak "hallucineren" (getallen verzinnen) die er goed uitzien, maar volledig onjuist zijn.
  • Nog niet klaar voor de praktijk: De auteurs concluderen dat deze robots op dit moment niet veilig zijn om als het belangrijkste brein voor handel te gebruiken. Ze zijn als een zeer intelligente stagiair die een conceptversie van een rapport kan schrijven, maar waarbij een mens elke enkele cijfer moet controleren voordat je het naar de baas stuurt.

De Kernboodschap

Beschouw deze Large Language Models als zeer getalenteerde maar onervaren leerlingen. Ze kunnen de code schrijven om een handelsonderneming te starten, maar ze maken vaak fouten in de boekhouding. Totdat ze beter worden in de wiskunde en de logica, kun je hen niet vertrouwen om zelfstandig met je geld te handelen.

De auteurs hebben deze test (MARKET-BENCH) en een openbare scorelijst uitgebracht, zodat andere wetenschappers deze test kunnen gebruiken om betere robots te bous en te zien wie er daadwerkelijk beter wordt in de wiskunde.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →