Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs
Het artikel introduceert Backtrader-Bench, een nieuw raamwerk voor het evalueren van LLM-coderingsagenten in algoritmische handel via zelf gegenereerde, door code geverifieerde meerkeuzevragen, waarbij wordt aangetoond dat met tools versterkte agenten aanzienlijk beter presteren dan niet-tool gebaseerde baselines, terwijl tegelijkertijd een schaalbare infrastructuur wordt opgezet voor toekomstige reinforcement learning-training.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers niet alleen met je chatten, maar ook echt dingen doen: ze schrijven code, draaien programma's en lossen complexe problemen zelfstandig op. Dit zijn "AI-agenten". Denk aan hen als superintelligente digitale stagiairs die een terminal kunnen openen, commando's kunnen typen en software kunnen uitvoeren om een klus te klaren. In de wereld van de financiële sector worden deze agenten getraind om te fungeren als kwantitatieve handelaren — mensen die wiskunde en computers gebruiken om te beslissen wanneer ze aandelen kopen of verkopen. De grote vraag is: kunnen deze AI-stagiairs het werk echt aan, of zijn ze alleen maar goed in doen alsof?
Om dit te ontdekken, moeten we ze testen. Maar het testen van een handelaar is lastig. Je kunt ze niet simpelweg vragen: "Wat is de winst?", want ze kunnen het juiste getal raden zonder de wiskunde daadwerkelijk te hebben uitgevoerd. Het is alsof je een kok vraagt een taart te beschrijven die hij nog nooit heeft gebakken; hij kan zeggen: "hij is zoet en luchtig," maar dat betekent niet dat hij weet hoe hij de ingrediënten moet mengen. In de financiële wereld is het fout krijgen van cijfers niet alleen een slecht cijfer; het betekent echt geld verliezen. Daarom hebben wetenschappers een manier nodig om te testen of een AI daadwerkelijk de handelssoftware kan draaien, de cijfers kan berekenen en de waarheid kan vertellen over hoe een strategie heeft gepresteerd.
Dit is precies waar het artikel "Backtrader-Bench" zich mee bezighoudt. De onderzoekers hebben een enorme, geautomatiseerde testomgeving gebouwd om te zien of AI-agenten de rommelige, wiskundig zware realiteit van algoritmische handel aankunnen. Ze hebben een systeem gecreëerd dat duizenden lastige vragen genereert over simulaties van de aandelenmarkt en vervolgens observeert of de AI deze kan oplossen door code te schrijven en uit te voeren, of dat de AI slechts probeert het antwoord uit zijn geheugen te raden.
De "Backtest" Videogame
Laten we eerst de speeltuin begrijpen. De onderzoekers gebruikten een tool genaamd Backtrader, wat een soort videogame-simulator is voor aandelenhandel. Je geeft het een reeks regels (een "strategie"), zoals: "Koop wanneer het 10-daagse gemiddelde van de prijs boven het 30-daagse gemiddelde komt," en het voert een simulatie uit met historische aandelengegevens. Het vertelt je hoeveel geld je zou hebben verdiend of verloren.
Het probleem is dat deze simulaties vol zitten met kleine, verraderlijke details. Een kleine fout in de code — zoals het vergeten van een kleine transactiekost of het verkeerd tellen van het aantal aandelen dat je kunt betalen — kan een winnende strategie veranderen in een verliezende strategie. Als een AI-agent aan het "hallucineren" is (dingen verzint die plausibel klinken), kan hij je een perfect uitziend winstcijfer geven dat volledig nep is.
De Tweeledige Test: De Quiz en de Filter
Om deze neppe antwoorden te vangen, bouwden de auteurs Backtrader-Bench, een framework met twee slimme onderdelen.
Deel 1: De Deterministische Quiz
Stel je een leraar voor die een toets schrijft, deze zelf oplost en vervolgens de antwoorden controleert tegen zijn eigen werk om er zeker van te zijn dat het 100% correct is. Dat is wat het eerste deel van het systeem doet. Het neemt een handelsstrategie, draait de simulatie en genereert automatisch meerkeuzevragen.
- Makkelijke vragen: "Wat was de aandelenprijs op 1 januari?" (Alleen een getal opzoeken).
- Gemiddelde vragen: "Hoeveel transacties waren winstgevend?" (Tellen en filteren).
- Moeilijke vragen: "Wat was het maximale bedrag dat het portfolio op enig moment verloor?" (Dit vereist complexe wiskunde en het bijhouden van de hoogste en laagste punten in de tijd).
Cruciaal is dat het systeem een "checker"-robot heeft die exact dezelfde simulatie opnieuw draait om de antwoordenlijst te verifiëren. Als de antwoordenlijst niet overeenkomt met de nieuwe uitvoering, wordt de vraag eruit gefilterd. Dit zorgt ervoor dat de test eerlijk is en de antwoorden onbetwistbaar waar zijn.
Deel 2: De "Hard Mode" Filter
Het eerste deel is geweldig, maar wat als de AI te slim is en de antwoorden gewoon uit het hoofd leert? Om dit op te lossen, voegden de onderzoekers een tweede, agressiever proces toe. Ze gebruikten een AI "Generator" om ter plekke gloednieuwe, vreemde vragen te verzinnen.
Vervolgens lieten ze een "No-Tool Solver" (een AI die geen computer mag gebruiken) proberen deze vragen te beantwoorden.
- Als de No-Tool Solver het goed heeft, is de vraag te makkelijk. Deze wordt weggegooid omdat de AI het gewoon geraden heeft of het uit de trainingsdata kende.
- Als de No-Tool Solver faalt, maar een "Tool-Augmented Solver" (een AI die de ruimte krijgt om code te schrijven en uit te voeren) het wel goed heeft, wordt de vraag behouden.
Dit creëert een speciale set "Hard Mode" vragen die vereisen dat de AI de wiskunde doet en de code uitvoert. Je kunt deze niet raden; je moet het programma uitvoeren.
De Resultaten: Gokken versus Doen
De onderzoekers legden 11 verschillende AI-modellen op de proef. Sommigen mochten tools gebruiken (code schrijven, simulaties draaien), en sommige werden gedwongen om zonder deze tools te antwoorden (alleen hun "brein" gebruiken).
De "With-Tools" Kampioenen:
Wanneer de AI-agenten de ruimte kregen om code uit te voeren, waren ze fantastisch. De beste modellen (GPT-5.5 en Opus 4.7) kregen 90,0% van de vragen in één poging goed. Ze schreven de code, draaiden de simulatie en lazen het resultaat. Ze waren als een chef die de taart daadwerkelijk bakt en proeft.
De "No-Tools" Strijd:
Wanneer de AI-agenten verboden werden om code te gebruiken en vanuit hun geheugen moesten gokken, daalden de scores. De beste onder hen haalden gemiddeld slechts 73,0% goed. Maar hier komt het engere deel: toen de onderzoekers hen testten op de "Hard Mode" vragen (de vragen die de filter hield omdat ze te moeilijk waren om te raden), stortten de scores in.
- De helft van de modellen zakte naar een nauwkeurigheid van rond de 25%.
- Omdat er vier opties zijn bij een meerkeuzevraag, is 25% exact wat je krijgt als je met je ogen dicht een letter aanwijst.
Dit suggereert dat veel van deze AI-agenten, zonder de mogelijkheid om code uit te voeren, in essentie gokken op complexe financiële taken. Ze kunnen heel zelfverzekerd klinken, maar ze verzinnen eigenlijk alleen maar getallen.
Waarom dit ertoe doet
Het artikel laat zien dat voor AI nuttig te zijn in de echte financiële wereld, het niet alleen een chatbot kan zijn die financiële termen kent. Het moet een agent zijn die daadwerkelijk het werk kan doen. Het "Backtrader-Bench" framework bewijst dat hoewel AI steeds beter wordt, het nog steeds gevaarlijke fouten maakt als het probeert te handelen zonder eerst de berekeningen uit te voeren.
De auteurs suggereren dat dit testsysteem niet alleen bedoeld is voor het beoordelen van AI; het is een trainingsgrond. Door deze geverifieerde, moeilijke vragen terug te voeren naar de AI, hopen zij een gespecialiseerde "quant agent" te trainen die betrouwbaar de complexe, wiskundig zware wereld van algoritmische handel kan afhandelen zonder stille, kostbare fouten te maken. Tot die tijd suggereert het artikel dat we zeer voorzichtig moeten zijn met het vertrouwen op het handelsadvies van een AI, tenzij deze kan bewijzen dat de simulatie daadwerkelijk is gedraaid.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.