← Nieuwste papers
🤖 machine learning

A Later Test Set Is Not a New Domain: Pretraining Familiarity Survives a Contamination-Free Hold-Out

Dit artikel toont aan dat temporele hold-out-tests er niet in slagen het prestatievoordeel van tijdreeks-fundamentele modellen volledig te elimineren omdat hun succes primair voortkomt uit de vertrouwdheid tijdens de pretraining met specifieke datadomeinen in plaats van algemeen voorspellend vermogen, wat domein-specifieke hold-outs noodzakelijk maakt voor een eerlijke evaluatie.

Oorspronkelijke auteurs: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

Gepubliceerd 2026-09-10
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van data science groeit het geloof dat één enkel, massief computerprogramma kan leren om de toekomst van bijna elk herhalend patroon te voorspellen, van elektriciteitsverbruik tot aandelenkoersen, zonder dat het specifiek over dat specifieke patroon is onderwezen. Deze programma's, bekend als foundation models, worden getraind op enorme bibliotheken van historische data, waarbij ze de algemene "vorm" leren van hoe de tijd beweegt. De belofte is dat ze, eenmaal getraind, naar een nieuwe reeks getallen kunnen kijken en kunnen voorspellen wat er volgt, beter dan traditionele methoden, die meestal voor elke specifieke taak vanaf nul moeten worden gebouwd. Er hangt echter een schaduw over deze claims. Omdat de tests die deze modellen meten steunen op oude, publieke records, was het onmogelijk om vast te stellen of een model werkelijk goed is in het voorspellen van de toekomst, of dat het simpelweg het verleden heeft onthouden. Als een model wordt getest op data die bestond voordat het werd gebouwd, kan het feiten herinneren die het tijdens zijn training heeft gezien, in plaats van een werkelijk vermogen tot voorspelling te tonen.

Om dit puzzelstuk op te lossen, bouwden onderzoekers een nieuw soort test die geen enkel model mogelijk had kunnen zien voordat het bestond. Ze verzamelden dertien verschillende voorspellingsinstrumenten — sommige oud en eenvoudig, andere nieuw en complex — en vroegen hen om data te voorspellen die werd gepubliceerd nadat het nieuwste model al was uitgebracht. De data kwam uit vijf verschillende gebieden van menselijke activiteit: hoeveel mensen Wikipedia-pagina's bekeken, uurlijkse weerpatronen, uurlijkse luchtkwaliteitsmetingen, elektriciteitsverbruik op het Deense elektriciteitsnet en dagelijkse wisselkoersen tussen valuta. Elke observatie die voor de test werd gebruikt, werd opgenomen in 2026, een tijd die nog niet was aangebroken toen de modellen werden getraind. Dit verzekerde dat geen enkel model de specifieke getallen die het van zichzelf werd gevraagd te voorspellen, had kunnen onthouden. Het doel was om te zien of deze krachtige, vooraf getrainde reuzen nog steeds de eenvoudige, ouderwetse instrumenten konden overtreffen wanneer ze geconfronteerd werden met een echt verse uitdaging.

De resultaten onthulden een verhaal dat genuanceerder was dan de koppen suggereerden. De vooraf getrainde modellen wonnen niet overal. Op de dagelijkse wisselkoersen presteerde elke geteste methode, van de meest geavanceerde kunstmatige intelligentie tot de eenvoudigste gok, exact hetzelfde, en niemand kon een basisvoorspelling verslaan die ervan uitgaat dat morgen er hetzelfde uit zal zien als vandaag. Op de uurlijkse elektriciteitsnetdata nam een klassieke, niet-machine learning methode genaamd Theta de toppositie in, waarbij de chique vooraf getrainde modellen zich niet van haar konden onderscheiden. In deze gevallen bood de nieuwe technologie geen voordeel. Echter, de modellen blonken uit in andere gebieden. Ze presteerden aanzienlijk beter op de Wikipedia-paginaweergaven, waar ze verkeerspieken veel nauwkeuriger voorspelden dan de klassieke methoden. Het verschil was groot: op de wekelijkse Wikipedia-weergaven maakte het beste vooraf getrainde model fouten die 28 procent kleiner waren dan die van de beste klassieke methode.

De onderzoekers vroegen zich vervolgens af waarom de modellen in sommige gevallen slaagden en in andere faalden. Ze vermoedden aanvankelijk dat de aard van de data zelf de sleutel was. Ze vroegen zich af of de modellen beter werkten op data die zeer ruisachtig was of complexe, herhalende cycli had die moeilijk te ontdekken waren. Ze maten de kracht van deze cycli en de hoeveelheid willekeur in de data, maar deze factoren verklaarden het patroon niet. De modellen deden het niet beter omdat de data rommelig of hoogst seizoensgebonden was. In plaats daarvan lag het antwoord in de trainingsgeschiedenis van de modellen zelf. Het domein waarin de modellen het best presteerden, was de Wikipedia-paginaweergaven. Dit is exact hetzelfde type data dat de makers van een van de leidende modellen, TimesFM, beschreven als de kern van de bibliotheek waarop het getraind was. Het model had jarenlang miljoenen Wikipedia-verkeerspatronen gelezen. Hoewel het de specifieke cijfers van 2026 nog nooit had gezien, had het het algemene gedrag van Wikipedia-verkeer zo goed geleerd dat het de toekomst van dat specifieke domein met gemak kon voorspellen.

Deze bevinding suggereert dat het voordeel van deze modellen minder komt door een universele vaardigheid om alles te voorspellen, en meer door een diepe vertrouwdheid met de specifieke soorten data waarop ze zijn opgevoed. Wanneer de onderzoekers de verschillende vooraf getrainde modellen met elkaar vergeleken op dezelfde Wikipedia-data, presteerde de familie van modellen die op Wikipedia-data was getraind consequent beter dan de anderen. Op andere datatypen, zoals weer of luchtkwaliteit, verdween datzelfde voordeel. De modellen waren geen magie; ze waren specialisten die een specifieke bibliotheek aan boeken hadden gelezen en de verhalen daarin konden herinneren, zelfs als de hoofdstukken nieuw waren.

De studie bracht ook een verborgen fout aan het licht in de manier waarop deze modellen hun vertrouwen uitdrukken. Hoewel de vooraf getrainde modellen vaak accuraat waren in hun puntvoorspellingen, waren ze systematisch overmoedig. Wanneer ze een bereik van mogelijke uitkomsten boden, beweerden ze voor 80 procent zeker te zijn, maar hun werkelijke voorspellingen bevatten de ware uitkomst slechts ongeveer 70 procent van de tijd. In tegenstelling hiertoe waren de oudere, klassieke methoden voorzichtiger en boden ze vaak bredere bereiken die de ware uitkomst vaker vastlegden. Voor een persoon die deze voorspellingen gebruikt om een elektriciteitsnet of een toeleveringsketen te beheren, zou deze overmoed gevaarlijk kunnen zijn, wat leidt tot reserves die te klein zijn. De onderzoekers merkten op dat hoewel de vooraf getrainde modellen sneller en vaak nauwkeuriger waren, hun gebrek aan kalibratie betekende dat ze niet altijd het veiligere instrument waren voor kritieke beslissingen.

Uiteindelijk concludeert het artikel dat het simpelweg naar de toekomst te verplaatsen van de testdatum niet genoeg is om te bewijzen dat een model werkelijk generaliseert. Een model kan een test op toekomstige data passeren als het simpelweg de "smaak" van een specifiek domein tijdens zijn training heeft geleerd. Om het vermogen van een model om te generaliseren werkelijk te meten, moeten toekomstige benchmarks volledige domeinen uitsluiten die niet deel uitmaakten van de training, en niet alleen toekomstige data. Voor de praktijkman is de les duidelijk: voordat men een model kiest, moet men zich niet alleen afvragen welk instrument het krachtigst is, maar ook of de data die men probeert te voorspellen lijkt op de data waarop het instrument is opgegroeid. Als de data anders is, kan de schijnbare genialiteit van het model verdwijnen, waardoor de eenvoudigere, meer voorzichtige instrumenten de meer betrouwbare keuze blijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →