QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies
Dit paper introduceert QuantCode-Bench, een benchmark die de prestaties van grote taalmodellen evalueert bij het genereren van uitvoerbare algoritmische handelsstrategieën voor het Backtrader-framework en aantoont dat de belangrijkste beperkingen liggen in het correct vertalen van financiële logica en API-gebruik in plaats van in syntactische juistheid.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, digitale kok hebt die alles over koken kan vertellen. Hij kent duizenden recepten uit zijn hoofd. Maar nu vraag je hem niet om een simpele omelet te maken, maar om een compleet, automatisch kooksysteem te ontwerpen dat:
- De ingrediënten (de data) correct begrijpt.
- Het vuur aan- en uitzet op het juiste moment (de handel).
- En precies doet wat jij in je recept hebt beschreven, zonder dat het brandt of dat hij per ongeluk een steen in de soep doet.
Dit is precies wat dit onderzoek, QuantCode-Bench, test. Het gaat over het vermogen van kunstmatige intelligentie (AI) om niet zomaar code te schrijven, maar automatische handelsstrategieën te bouwen die echt werken.
Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:
1. Het Probleem: "Klinkt goed, werkt niet"
Tot nu toe waren tests voor AI vooral gericht op: "Schrijf je een zinnetje dat grammaticaal correct is?" of "Werkt deze code wel?"
Maar in de financiële wereld is dat niet genoeg.
- De Analogie: Stel je voor dat je een robot vraagt om een auto te bouwen die van A naar B rijdt. De robot bouwt een auto die perfect lijkt, de motor start, en de wielen draaien. Maar de auto rijdt alleen maar in kringen op de oprit.
- De Realiteit: Een AI kan perfect code schrijven die geen fouten geeft (de motor start), maar als de strategie geen enkele koop- of verkooporder genereert, is het nutteloos. Of nog erger: de AI bouwt een auto die rijdt, maar in de verkeerde richting (het doet iets anders dan jij vroeg).
2. De Oplossing: QuantCode-Bench
De onderzoekers hebben een nieuwe "proefbaan" bedacht, genaamd QuantCode-Bench. Ze hebben 400 verschillende "recepten" (handelsideeën) verzameld, variërend van simpele tot zeer complexe.
Ze hebben een vier-stappen test bedacht om te zien of de AI echt slim is:
- De Grammatica-test: Is de code foutloos? (Kan de computer het lezen?)
- De Proefrit: Draait de code zonder crashen op historische data? (Rijdt de auto wel?)
- De Actie-test: Doet de auto iets? (Koopt of verkoopt de strategie wel eens?)
- De Recept-check: Doet de auto precies wat er in het recept stond? (Is het een Ferrari of een fiets?)
3. Wat hebben ze ontdekt?
Ze hebben de slimste AI-modellen van vandaag de dag getest in twee scenario's:
Scenario A: De "Eén-Kans" Test (Single-turn)
De AI krijgt één kans om het recept te maken.- Resultaat: De AI is een meester in de grammatica (99% slaagt). Maar zodra het om het werken gaat, zakken de scores. Slechts ongeveer 70-76% van de AI's haalt de eindstreep.
- De Les: Ze kunnen de auto bouwen, maar ze vergeten vaak de remmen te installeren of rijden de verkeerde kant op. Het probleem is niet het schrijven van code, maar het begrijpen van de logica.
Scenario B: De "Leer-uit-Fouten" Test (Agentic multi-turn)
De AI krijgt een foutmelding als het misgaat, en mag het opnieuw proberen (tot 10 keer).- Resultaat: Opeens zijn ze bijna perfect! 95-98% slaagt.
- De Les: De AI's zijn niet dom; ze zijn gewoon snel gefrustreerd. Als je ze vertelt: "Je hebt de remmen verkeerd gemonteerd", kunnen ze het vaak direct repareren. Ze zijn goede "reparateurs", maar soms slechte "ontwerpers" op de eerste poging.
4. Waarom is dit belangrijk?
De onderzoekers concluderen dat het bouwen van handelsstrategieën een heel andere soort taak is dan gewoon code schrijven.
- Het is alsof je een architect vraagt om een huis te bouwen. De AI kan de muren perfect zetten (de code), maar vergeet vaak dat het huis ook een dak moet hebben (de handelslogica) of dat deuren naar de tuin moeten leiden (de specifieke instructies).
- De grootste fouten zijn niet dat de AI "stelt" of "werk" vergeten is (grammatica), maar dat ze de bedoeling niet snappen. Ze bouwen een huis dat er mooi uitziet, maar waar je niet in kunt wonen.
Conclusie
De boodschap van dit papier is: AI wordt steeds beter in het schrijven van code, maar is nog niet perfect in het begrijpen van complexe, echte wereldtaken.
Als je een AI wilt gebruiken om geld te verdienen of strategieën te bouwen, moet je niet alleen kijken of de code werkt, maar ook of de AI echt begrijpt wat je bedoelt. En als je de AI de kans geeft om te leren van zijn fouten (zoals in Scenario B), dan wordt het een veel krachtiger hulpmiddel.
Kortom: De AI is een briljante ambachtsman die de gereedschappen perfect hanteert, maar soms nog een beetje hulp nodig heeft om te begrijpen waarom we het huis eigenlijk bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.