← Nieuwste papers
💬 NLP

Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

Dit artikel introduceert "Hindcast", een rigoureus evaluatiekader dat datalekken bij LLM-voorspellingen voorkomt door voorspellingsmarkten te herhalen tegen een bevroren, op een tijdstip gebaseerde snapshot van publieke informatie om te waarborgen dat modellen worden beoordeeld op werkelijke vooruitziendheid in plaats van op kennis achteraf.

Oorspronkelijke auteurs: Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

Gepubliceerd 2026-07-16
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je wilt testen hoe goed een detective is in het oplossen van een mysterie. Je geeft hem een dossier en vraagt: "Wie heeft de koek gestolen?" Als de detective simpelweg het dossier opent en het antwoord leest dat onderaan staat geschreven, laat hij niet echt zijn detectievaardigheden zien, maar slechts zijn vermogen om te lezen. Dit is het lastige probleem waar wetenschappers voor staan bij het testen van AI-modellen op het voorspellen van de toekomst.

Om te zien of een AI echt slim is, vragen onderzoekers de AI meestal om dingen te voorspellen die al zijn gebeurd, zoals: "Wie won de Wereldbeker 2022?" Het probleem is dat de huidige AI-modellen zijn getraind op het hele internet, inclusief artikelen die zijn geschreven na de wedstrijd. Dus wanneer de AI zegt: "Argentinië won," is dat misschien niet omdat de AI de aanwijzingen vooraf heeft ontrafeld; het kan simpelweg zijn dat de AI de einduitslag uit de trainingsdata onthoudt. Het is als een student die een geschiedenisexamen maakt die stiekem het antwoordenformulier heeft uit het hoofd geleerd. Om dit op te lossen, hebben wetenschappers een manier nodig om de "vooruitziendheid" (het raden wat er gaat gebeuren) van de AI te testen zonder dat de AI kan valsspelen door in het "antwoordenformulier" (wat er daadwerkelijk gebeurde) te kijken.

Hier komt een nieuwe studie genaamd HINDCAST om de hoek kijken. De onderzoekers wilden zien of een AI daadwerkelijk de toekomst kan voorspellen als we de AI dwingen in het verleden te staan, zonder kennis van wat er daarna gebeurde. Ze zetten een tijdreis-simulatie op met behulp van voorspellingsmarkten (plekken waar mensen wedden op uitkomsten) en een bevroren archief van het internet. Ze ontdekten dat wanneer je de AI stopt met valsspelen, de AI nog steeds beter kan worden in het raden, maar alleen als dat oude nieuws daadwerkelijk nuttige feiten bevatte. Als het oude nieuws alleen maar bestond uit mensen die speculeerden en hun mening uitsloegen, maakte het lezen ervan de AI daadwerkelijk slechter in het voorspellen van de waarheid.

De Tijdreis-test

De onderzoekers bouwden een systeem dat ze HINDCAST noemen (een woordspeling op "forecast", maar dan terugkijkend). Stel je een tijdmachine voor die een specifiek moment in de geschiedenis bevriest, bijvoorbeeld één maand voordat een grote sportcompetitie begint. Op dit bevroren moment mag de AI een bibliotheek van nieuwsartikelen en forumberichten bekijken, maar alleen de berichten die vóór die datum zijn geschreven. De AI kan niets zien dat na dat moment is geschreven, zelfs niet als dat vandaag de dag in de bibliotheek staat.

Om de AI te testen, gebruikten de onderzoekers echte wedmarkten genaamd Polymarket. Dit zijn digitale casino's waar mensen wedden op of iets zal gebeuren (zoals "Zal Team X winnen?"). Omdat deze markten al zijn afgerond, weten de onderzoekers het ware antwoord. Ze weten ook wat de "marktprijs" was op dat exacte bevroren moment in het verleden, wat vertegenwoordigt wat een menigte mensen destijds dacht dat de kansen waren.

De opzet werkt als volgt:

  1. Bevries de tijd: Kies een datum in het verleden (t0t_0) vóórdat een markt wordt afgerond.
  2. Sluit de bibliotheek op: De AI mag alleen zoeken in een bevroren snapshot van Reddit (een populair internetforum) van vóór die datum.
  3. De voorspelling: De AI leest de beschikbare berichten en raadt de uitkomst.
  4. De score: De AI wordt op twee punten beoordeeld: hoe dicht hij bij het werkelijke eindresultaat kwam, en hoe dicht hij bij wat de menselijke wedders in dat exacte moment dachten.

De Grote Ontdekking: Feiten versus Hype

Het team testte negen verschillende AI-modellen om te zien of toegang tot deze "bevroren bibliotheek" hen hielp beter te voorspellen dan alleen vanuit hun eigen geheugen te gokken.

Het goede nieuws: Voor de meeste AI-modellen hielp het lezen van de oude berichten wel degelijk bij het voorspellen. Sterker nog, voor acht van de negen modellen maakte de AI minder fouten wanneer hij toegang had tot het archief. De grootste verbetering werd gezien bij een model genaamd Qwen3-32B, dat de foutmarge met 23% verminderde. Dit suggereert dat wanneer er in het verleden echte feiten beschikbaar waren, de AI deze kan gebruiken om slimmere voorspellingen te doen.

Het slechte nieuws (en de addertjes onder het gras): De hulp was niet universeel. Het hing volledig af van wat de AI aan het lezen was.

  • Waar het werkte: Bij onderwerpen zoals Sport, Awards (onderscheidingen) en Trading (handel) waren de internetberichten vóór de gebeurtenis vol met concrete feiten (bijv. "De sterspeler van het team is geblesseerd" of "De goudprijs stijgt"). In deze gevallen las de AI de feiten en werd hij beter in het voorspellen van de winnaar.
  • Waar het faalde: In onderwerpen zoals Entertainment (zoals het raden welke song nummer 1 wordt) of Politiek was het internet vol met luidruchtige meningen, fan-hype en speculaties. Wanneer de AI deze berichten las, raakte hij in de war. Hij begon te geloven dat de "hype" een feit was. Bijvoorbeeld, als fans schreeuwden dat een nieuw nummer nummer 1 zou worden, wedde de AI daarop, ook al halen de meeste nummers de top nooit. In deze gevallen maakte het lezen van het archief de AI juist slechter dan wanneer hij de internetberichten gewoon had genegeerd en op zijn eigen logica had vertrouwd.

Het "Over-lezen" Probleem

De studie vond een grappig patroon: hoe langer een markt open bleef, hoe groter de kans dat de AI in de war raakte door de ruis. Als een wedmarkt lang openstond, vulde het internet zich met eindeloos geklets en tegenstrijdige meningen. De AI, die probeerde behulpzaam te zijn, las alles en begon te veel na te denken, waardoor hij uiteindelijk slechte voorspellingen deed op basis van luide meningen in plaats van solide feiten.

Een specifiek model, R1-Distill-Qwen-7B, werd zelfs slechter in zijn algemene prestaties wanneer het werd toegestaan om te lezen. De onderzoekers denken dat dit kwam omdat het model zo verstrikt raakte in lange, verwarrende ketens van redeneringen dat het de werkelijke bewijzen uit het oog verlozen. Het is als een student die zoveel verschillende meningen over een onderwerp leest, dat hij de simpele feiten vergeet en uiteindelijk een verkeerde gok doet.

Wat dit betekent voor de toekomst

De belangrijkste les van HINDCAST is dat het vermogen van een AI om de toekomst te voorspellen slechts zo goed is als de kwaliteit van de informatie die het kan vinden voordat de gebeurtenis plaatsvindt. Als het internet vol staat met feiten, kan de AI een geweldige voorspeller zijn. Als het internet vol staat met ruis en hype, kan de AI simpelweg een zelfverzekerde dwaas worden die de luidste stem gelooft in plaats van de waarheid.

De onderzoekers toonden ook aan dat deze "tijdreis"-testmethode een krachtig instrument is. Omdat de bibliotheek bevroren is, kun je nieuwe AI-modellen testen tegen dezelfde oude vragen zonder dat ze kunnen valsspelen. Dit betekent dat we onze tests kunnen blijven verbeteren naarmate AI slimmer wordt, zodat we echt meten hoe goed ze denken, en niet alleen hoe goed ze onthouden.

Kortom, HINDCAST bewijst dat hoewel het geven van een bibliotheek met feiten een AI helpt om de toekomst te zien, het geven van een bibliotheek met geruchten hem juist blind kan maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →