← Nieuwste papers
💰 quantitative finance

Leakage-Aware Benchmarking of LLM Forecasting: Real-Time Nowcasts as the Decision-Time Input for Macro Factor Ranking

Dit artikel introduceert een lekgevoelig benchmarkingsframework voor retrieval-augmented LLM's bij het rangschikken van aandelefactoren, waarbij wordt aangetoond dat hoewel real-time inflatie-nowcasting en macro-gelijke retrieval de mediaanprestaties vergelijkbaar maken met non-LLM baselines, LLM's marginale waarde bieden door het verbeteren van de gemiddelde rendementen en de nauwkeurigheid van extreme rangschikkingen die essentieel zijn voor long-short portefeuilleformatie.

Oorspronkelijke auteurs: Mao Guan, Qian Chen

Gepubliceerd 2026-06-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mao Guan, Qian Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een financiële coach bent die de beste zeven sportteams (die verschillende beleggingsstijlen vertegenwoordigen) probeert te kiezen om op te wedden voor de komende maand. Je wilt eerlijk, nauwkeurig en, het belangrijkste, je wilt niet valsspelen door de einduitslag te bekijken voordat de wedstrijd begint.

Dit artikel gaat over het bouwen van een "coach" met behulp van een slimme computerhersenen (een Large Language Model, of LLM) om deze voorspellingen te doen, maar met een zeer strikte regel: Je mag alleen informatie gebruiken die op de dag dat je de weddenschap moest plaatsen, daadwerkelijk beschikbaar was.

Hier is de uitsplitsing van wat ze hebben gedaan en wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Tijdreiziger-valsspeler"

In veel financiële studies bedriegen onderzoekers zichzelf per ongeluk. Ze gebruiken bijvoorbeeld een rapport (zoals het maandelijkse inflatiecijfer) dat als "januari" wordt gelabeld, maar in werkelijkheid pas halverwege februari wordt gepubliceerd. Als een computermodel dat januari-cijfer gebruikt om in januari een weddenschap te plaatsen, is dat alsof een tijdreiziger op een paardenrace wedt nadat hij heeft gezien wie er gewonnen heeft.

De auteurs zeggen: "Stop daarmee." Ze bouwten een systeem waarbij de computer strikt verboden is om iets te zien dat nog niet is gebeurd.

2. De Oplossing: De "Lekkage-vrije" Coach

Om het probleem van valsspelen op te lossen, creëerden ze een speciale trainingsgrond voor hun AI-coach:

  • De Inputs: In plaats van het officiële, laat uitgebrachte inflatierapport, gebruikten ze een "voorspelling" van de inflatie die op de dag van de beslissing beschikbaar was (zoals de dagelijkse weersverwachting van een weerman voordat het officiële stormrapport wordt uitgebracht).
  • Het Geheugen: De AI kijkt terug in de geschiedenis om maanden te vinden die op vandaag lijken (bijv. "Deze maand voelt als 1990, toen de werkloosheid steeg").
  • Het Team: Ze gebruikten een AI-team uit twee delen:
    • De Criticus: Een slimme AI die naar de historische "gelijkaardige maanden" kijkt en één simpele regel voor de maand opschrijft (bijv. "Wanneer de inflatie laag is en banen schaars zijn, wed op Team A").
    • De Acteur: Een andere AI die de gegevens van vandaag, de "regel van de Criticus" en recente nieuwsberichten neemt om de definitieve scores voor de zeven teams te kiezen.

3. Het Experiment: De 36-Maanden Test

Ze lieten deze coach een test van 3 jaar (36 maanden) doorlopen van 2023 tot 2026. Elke maand moest de coach de zeven teams rangschikken van best naar slechtst.

De Resultaten:

  • Werkte het? Ja, maar niet perfect. De coach kreeg de rangschikkingen vaker goed dan een willekeurige gok. Als je naar de "middelste" prestatie kijkt (de mediaan), deed de coach het behoorlijk goed.
  • Was het magie? Niet echt. Wanneer ze de hippe AI-coach vergeleken met een veel simpelere, niet-AI methode (een basis wiskundig model dat alleen naar vergelijkbare afgelopen maanden keek), deed het simpele model bijna net zo goed in het juist krijgen van de "middelste" rangschikkingen.
  • Waar scheen de AI? De AI was iets beter in de "extremen". De AI was beter in het zelfverzekerd zeggen van: "Dit team is absoluut de beste" of "Dit team is absoluut de slechtste". Dit is belangrijk omdat je bij beleggen vaak zwaar wilt inzetten op de allerbeste en de aller slechtste opties.

4. De Grote Conclusie

De paper concludeert dat het "geheime ingrediënt" niet de hippe AI-hersenen zelf waren, maar het hebben van de juiste informatie op het juiste moment.

  • De "Nowcast" is essentieel: De grootste boost aan de prestaties van de coach kwam door het gebruik van de realtime inflatievoorspelling (de "nowcast") in plaats van het vertraagde officiële cijfer. Dit herstelde de "tijdreiziger-valsspeler".
  • De Rol van de AI: De AI heeft niet op een nieuwe manier de toekomst uitgevonden. In plaats daarvan fungeerde het als een bekwame redacteur die een heleboel historische feiten en recent nieuws kon nemen, een duidelijke strategie kon schrijven en deze iets beter kon toepassen op de huidige situatie dan een simpele rekenmachine kan—vooral bij het maken van gedurfde keuzes voor de top en de bodem van de lijst.

Samenvatting in een Notendop

De auteurs hebben een financieel voorspellingssysteem gebouwd dat weigert te valsspelen door in de toekomst te kijken. Ze kwamen tot de conclusie dat als je een slimme AI de juiste realtime informatie geeft (en niet de vertraagde, "perfecte" data), het behoorlijk goede voorspellingen kan doen. Echter, veel van dat succes komt simpelweg door het hebben van de juiste data, en niet alleen door de AI "slim" te laten zijn. De echte waarde van de AI lag in het maken van sterkere, meer zelfverzekerde weddenschappen op de allerbeste en aller slechtste opties, in plaats van alleen maar het gemiddelde te raden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →