← Neueste Arbeiten
🤖 machine learning

A Later Test Set Is Not a New Domain: Pretraining Familiarity Survives a Contamination-Free Hold-Out

Diese Arbeit zeigt auf, dass zeitliche Hold-out-Tests den Leistungsvorteil von Zeitreihen-Foundation-Modellen nicht vollständig eliminieren können, da ihr Erfolg primär auf der durch das Pretraining erlangten Vertrautheit mit spezifischen Datendomänen beruht und nicht auf einer allgemeinen Prognosefähigkeit, was Domain-Level-Hold-outs für eine faire Evaluierung notwendig macht.

Ursprüngliche Autoren: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

Veröffentlicht 2026-09-10
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der Datenwissenschaft wächst der Glaube, dass ein einziges, massives Computerprogramm lernen kann, die Zukunft fast jedes sich wiederholenden Musters vorherzusagen – von der Stromnutzung bis hin zu Aktienkursen –, ohne jemals spezifisch über dieses spezielle Muster unterrichtet worden zu sein. Diese Programme, bekannt als Foundation-Modelle, werden auf riesigen Bibliotheken historischer Daten trainiert und lernen die allgemeine „Form“, wie die Zeit verläuft. Das Versprechen ist, dass diese Modelle, sobald sie trainiert sind, einen neuen Datensatz von Zahlen betrachten und das Kommende besser vorhersagen können als traditionelle Methoden, die meist für jede spezifische Aufgabe von Grund auf neu aufgebaut werden müssen. Ein Schatten liegt jedoch über diesen Behauptungen. Da die zur Messung dieser Modelle verwendeten Tests auf alten, öffentlichen Datensätzen basieren, war es unmöglich festzustellen, ob ein Modell wirklich gut darin ist, die Zukunft vorherzusagen, oder ob es lediglich die Vergangenheit auswendig gelernt hat. Wenn ein Modell auf Daten getestet wird, die vor seiner Erstellung existierten, könnte es Fakten abrufen, die es während seines Trainings gesehen hat, anstatt eine echte Fähigkeit zur Prognose zu demonstrieren.

Um dieses Rätsel zu lösen, entwickelten Forscher eine neue Art von Test, den kein Modell unmöglich schon einmal gesehen haben konnte. Sie versammelten dreizehn verschiedene Prognosewerkzeuge – einige alt und einfach, andere neu und komplex – und baten sie, Daten vorherzusagen, die erst nach der Veröffentlichung des neuesten Modells veröffentlicht wurden. Die Daten stammten aus fünf verschiedenen Bereichen menschlicher Aktivität: wie viele Menschen Wikipedia-Seiten aufgerufen haben, stündliche Wettermuster, stündliche Luftqualitätsmessungen, die Stromnutzung im dänischen Stromnetz und tägliche Wechselkurse zwischen Währungen. Jede einzelne Beobachtung, die für den Test verwendet wurde, wurde im Jahr 2026 aufgezeichnet, einer Zeit, die zum Zeitpunkt der Modell-Veröffentlichung noch nicht eingetreten war. Dies stellte sicher, dass kein Modell die spezifischen Zahlen, die es vorhersagen sollte, auswendig lernen konnte. Das Ziel war es zu sehen, ob diese mächtigen, vortrainierten Giganten immer noch in der Lage sind, die bescheidenen, altmodischen Werkzeuge vor einer wirklich frischen Herausforderung zu übertreffen.

Die Ergebnisse zeichneten ein differenzierteres Bild, als es die Schlagzeilen vermuten ließen. Die vortrainierten Modelle gewannen nicht überall. Bei den täglichen Wechselkursen verhielten sich alle getesteten Methoden, von der fortschrittlichsten künstlichen Intelligenz bis hin zur einfachsten Vermutung, exakt gleich, und keine konnte eine einfache Prognose schlagen, die davon ausgeht, dass das Morgen dem Heute gleicht. Bei den stündlichen Daten des Stromnetzes belegte eine klassische, nicht-maschinelle Lernmethode namens Theta den ersten Platz, wobei die schicken vortrainierten Modelle sich nicht von ihr abheben konnten. In diesen Fällen bot die neue Technologie keinen Vorteil. Dennoch glänzten die Modelle in anderen Bereichen. Sie schnitten bei den Wikipedia-Seitenaufrufen deutlich besser ab, wo sie Verkehrsspitzen weita viel genauer vorhersagten als die klassischen Methoden. Der Unterschied war eklatant: Bei den wöchentlichen Wikipedia-Aufrufen machten die besten vortrainierten Modelle Fehler, die um 28 Prozent kleiner waren als die des besten klassischen Verfahrens.

Die Forscher fragten sich dann, warum die Modelle an manchen Stellen erfolgreich waren und an anderen scheiterten. Zunächst vermuteten sie, dass die Natur der Daten selbst der Schlüssel sei. Sie fragten sich, ob die Modelle besser bei Daten arbeiteten, die sehr verrauscht waren oder komplexe, sich wiederholende Zyklen aufwiesen, die schwer zu erkennen waren. Sie maßen die Stärke dieser Zyklen und den Grad der Zufälligkeit in den Daten, aber diese Faktoren konnten das Muster nicht erklären. Die Modelle waren nicht deshalb besser, weil die Daten unordentlich oder hochgradig saisonal waren. Stattdessen lag die Antwort in der Trainingshistorie der Modelle selbst. Der Bereich, in dem die Modelle am besten abschnitten, war der Wikipedia-Seitenaufruf. Dies ist exakt die Art von Daten, die die Schöpfer eines der führenden Modelle, TimesFM, als Hauptbestandteil seiner Trainingsbibliothek beschrieben haben. Das Modell hatte jahrelang Millionen von Wikipedia-Traffic-Mustern gelesen. Obwohl es die spezifischen Zahlen von 2026 noch nie gesehen hatte, hatte es das allgemeine Verhalten des Wikipedia-Traffics so gut gelernt, dass es die Zukunft dieser spezifischen Domäne mit Leichtigkeit vorhersagen konnte.

Dieser Befund legt nahe, dass der Vorteil dieser Modelle weniger in einer universellen Fähigkeit zur Vorhersage von allem liegt, sondern vielmehr in einer tiefen Vertrautheit mit der Art der Daten, mit denen sie aufgewachsen sind. Als die Forscher die verschiedenen vortrainierten Modelle auf denselben Wikipedia-Daten miteinander verglichen, schnitt die Familie der Modelle, die auf Wikipedia-Daten trainiert worden war, konsistent besser ab als die anderen. Bei anderen Datentypen, wie Wetter oder Luftqualität, verschwand dieser Vorteil. Die Modelle waren keine Magier; sie waren Spezialisten, die eine bestimmte Bibliothek von Büchern gelesen hatten und die Geschichten darin abrufen konnten, selbst wenn die Kapitel neu waren.

Die Studie deckte auch einen verborgenen Fehler in der Art und Weise auf, wie diese Modelle ihre Zuversicht ausdrücken. Während die vortrainierten Modelle oft bei ihren Punktprognosen genau waren, waren sie systematisch übermäßig selbstbewusst. Wenn sie einen Bereich möglicher Ergebnisse angaben, behaupteten sie, zu 80 Prozent sicher zu sein, doch ihre tatsächlichen Vorhersagen deckten das wahre Ergebnis nur etwa 70 Prozent der Zeit ab. Im Gegensatz dazu waren die älteren, klassischen Methoden vorsichtiger und lieferten oft breitere Bereiche, die das wahre Ergebnis häufiger erfassten. Für eine Person, die diese Prognosen zur Steuerung eines Stromnetzes oder einer Lieferkette nutzt, könnte dieses Übermaß an Selbstvertrauen gefährlich sein und dazu führen, dass Reserven zu klein geplant werden. Die Forscher merkten an, dass die vortrainierten Modelle zwar schneller und oft genauer waren, ihr Mangel an Kalibrierung sie jedoch nicht immer zum sichereren Werkzeug für kritische Entscheidungen machte.

Letztlich kommt das Paper zu dem Schluss, dass es nicht ausreicht, einfach das Testdatum in die Zukunft zu verschieben, um zu beweisen, dass ein Modell wirklich generalisiert. Ein Modell kann einen Test auf zukünftigen Daten bestehen, wenn es einfach nur den „Geschmack“ einer bestimmten Domäne während seines Trainings erlernt hat. Um die Fähigkeit eines Modells zur Generalisierung wirklich zu messen, müssen zukünftige Benchmarks ganze Domänen ausschließen, die nicht Teil der Trainingsdaten waren, nicht nur zukünftige Daten. Für die Praktiker ist die Lektion klar: Bevor man ein Modell wählt, muss man sich nicht nur fragen, welches Werkzeug das leistungsfähigste ist, sondern auch, ob die Daten, die man vorhersagen möchte, den Daten ähneln, mit denen das Werkzeug aufgewachsen ist. Wenn die Daten anders sind, kann die scheinbare Brillanz des Modells verfliegen, wodurch die einfacheren, vorsichtigeren Werkzeuge zur zuverlässigeren Wahl werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →