BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
Dit artikel introduceert BacktestBench, de eerste grootschalige benchmark voor geautomatiseerde kwantitatieve backtesting die meer dan 18.000 geannoteerde taken omvat, afgeleid van 6 miljoen marktrecords, samen met AutoBacktest, een multi-agent framework dat is ontworpen om strategieën in natuurlijke taal te vertalen naar reproduceerbare backtests en de prestaties van 23 gangbare LLM's te evalueren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een chef-kok bent die een nieuw recept wil creëren voor een gerecht dat je rijk zal maken. In de wereld van de financiën is dit "gerecht" een handelsstrategie. Voordat je het aan de wereld serveert (of je eigen geld investeert), moet je het backtesten. Dit betekent dat je je recept bereidt met een enorme pot historische data (wat er de afgelopen jaren in de aandelenmarkt is gebeurd) om te zien of het daadwerkelijk geld had opgeleverd of dat het de keuken in brand had gestoken.
Traditioneel is het doen van deze backtests alsof je elke keer dat je een nieuw recept wilt testen, een complexe robot van scratch moet bouwen. Je moet tegelijkertijd een meester-monteur (programmeur), een data-bibliothecaris (om de juiste historische ingrediënten te vinden) en een financieel tovenaar zijn. Het is traag, duur en slechts een paar experts kunnen het.
BacktestBench is een nieuw project dat de vraag stelt: "Kan Kunstmatige Intelligentie (AI) leren die meester-monteur, bibliothecaris en tovenaar tegelijkertijd te zijn?"
Hier is een eenvoudige uiteenzetting van wat het paper doet:
1. Het Probleem: De "Black Box" van de Financiën
De auteurs betogen dat hoewel AI (specifiek Large Language Models of LLM's) geweldig is in het schrijven van code en chatten, niemand echt heeft getest of het de specifieke, hoge-stakes taak van geautomatiseerde kwantitatieve backtesting aankan.
- De Uitdaging: Het gaat niet alleen om het schrijven van code. De AI moet een vaag menselijk verzoek begrijpen, zoals "Koop wanneer de prijs 5 dagen stijgt", en vervolgens:
- De exacte juiste aandelen data uit een database vinden.
- Een programma schrijven dat de "5 dagen stijgt"-regel berekent zonder te valsspelen (het gebruik van toekomstige data).
- De simulatie uitvoeren.
- De eindscore berekenen (zoals een "Sharpe Ratio", wat een chique manier is om te zeggen "hoeveel winst hebben we behaald voor het risico dat we namen?").
Als de AI een klein foutje maakt in stap 2, is het hele resultaat waardeloos.
2. De Oplossing: Een Enorme "Oefentoets" (BacktestBench)
Om te testen of AI dit kan, bouwden de onderzoekers BacktestBench. Denk hierbij aan een enorme, gestandaardiseerde rijbewijstest voor AI, maar in plaats van een auto te besturen, bestuurt de AI een handelsstrategie.
- De Data: Ze gebruikten meer dan 6 miljoen echte marktrecords uit Chinese aandelenmarkten (zoals een gigantische bibliotheek van geschiedenis).
- De Vragen: Ze creëerden 18.246 specifieke testvragen. Dit zijn geen simpele rekenproblemen; het zijn complexe scenario's zoals:
- "Bereken de winst voor deze specifieke strategie op dit specifieke aandeel."
- "Welk aandeel presteerde het beste met deze strategie?"
- "Welke instelling (parameter) werkt het beste?"
- De Waarheid: Omdat ze de vragen bouwden op basis van echte code die ze zelf schreven, weten ze het exacte juiste antwoord. Dit stelt hen in staat de AI streng te beoordelen: Goed of Slecht.
3. Het Testonderwerp: "AutoBacktest" (Het AI-team)
De onderzoekers vroegen niet zomaar één AI om alles te doen. Ze bouwden een team van drie gespecialiseerde AI-agenten genaamd AutoBacktest, die samenwerken als een keukenpersoneel:
- De Samenvatter (De Vertaler): Je geeft het een rommelige menselijke zin. Het vertaalt dat naar een precieze lijst van financiële "ingrediënten" (indicatoren) die het systeem nodig heeft.
- De Zoeker (De Bibliothecaris): Het neemt die lijst en gaat naar de database om de exacte ruwe data (zoals "Open Prijs" en "Volume") op te halen die nodig is. Het schrijft een query (SQL) om de data op te halen.
- De Codeur (De Chef): Het neemt de data en de instructies, schrijft de Python-code om de simulatie te draaien, voert deze uit en geeft het eindgetal.
4. De Resultaten: Wie Bestond de Test?
Ze testten 23 verschillende AI-modellen (zowel open-source als betaalde "closed-source" modellen) op dit examen.
- De Winnaars: De top closed-source modellen (zoals Gemini 3 Pro) deden het het beste, maar zelfs zij haalden slechts ongeveer 67% correct. Dit betekent dat zelfs de slimste AI momenteel worstelt met de complexe logica van financiën.
- De "Logica-Gap": Ze ontdekten dat veel AI's goed zijn in het schrijven van code die er eruit ziet alsof het klopt (syntaxis), maar faalt in de logica. Bijvoorbeeld, een AI kan code schrijven die "Volatiliteit" (een maat voor risico) berekent, maar de wiskunde verkeerd doen omdat het de financiële definitie niet begrijpt.
- De "Klein Model"-Strijd: Kleinere AI-modellen (met minder "hersencellen" of parameters) waren verschrikkelijk in de reken-heavy delen. Als de vraag complexe statistische redenering vereiste, faalden kleine modellen vaak volledig, terwijl grotere modellen het beter deden.
- Het Geheim: Ze ontdekten dat het geven van een "spiekbriefje" met gestandaardiseerde korte codes (zoals een woordenboek dat zegt "Volatiliteit = dit specifieke formule") de AI hielp veel betere code te schrijven.
5. De Conclusie
Het paper concludeert dat hoewel AI steeds beter wordt in het automatiseren van financieel onderzoek, we er nog niet zijn.
- Huidige AI-modellen zijn als briljante studenten die een geweldig essay kunnen schrijven, maar vaak zakken voor het rekenexamen.
- De BacktestBench-dataset is nu beschikbaar voor iedereen om hun eigen AI-modellen te trainen en te testen, zodat toekomstige financiële AI betrouwbaar is en niet alleen "hallucinerende" nummers produceert.
Kortom: Het paper bouwde een strenge "eindexamen" voor AI om te bewijzen dat het de complexe, foutgevoelige wereld van aandelenmarkt backtesting aankan. De resultaten tonen aan dat hoewel AI veelbelovend is, het nog moet leren hoe het de wiskunde perfect moet doen voordat we het met echt geld kunnen vertrouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.