← Neueste Arbeiten
💬 NLP

Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

Dieses Paper stellt „Hindcast“ vor, ein strenges Evaluierungsframework, das Data Leakage bei der LLM-Prognose verhindert, indem es Vorhersagemärkte gegen einen eingefrorenen Snapshot öffentlicher Informationen mit einem Zeitstempel abspielt, um sicherzustellen, dass Modelle auf echter Weitsicht und nicht auf dem Abruf von Ereignissen nach deren Eintritt bewertet werden.

Ursprüngliche Autoren: Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

Veröffentlicht 2026-07-16
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie möchten testen, wie gut ein Detektiv bei der Lösung eines Rätsels ist. Sie geben ihm eine Fallakte und fragen: „Wer hat den Keks gestohlen?“ Wenn der Detektiv die Akte einfach nur öffnet und die Antwort liest, die ganz unten steht, zeigt er nicht wirklich seine Detektivfähigkeiten, sondern nur seine Lesefähigkeit. Dies ist das knifflige Problem, vor dem Wissenschaftler stehen, wenn sie versuchen, die Vorhersagekraft von KI-Modellen zu testen.

Um zu sehen, ob eine KI wirklich intelligent ist, lassen Forscher sie normalerweise Dinge vorhersagen, die bereits geschehen sind, wie zum Beispiel: „Wer hat die Weltmeisterschaft 2022 gewonnen?“ Das Problem ist, dass heutige KI-Modelle mit dem gesamten Internet trainiert wurden, einschließlich Artikeln, die nach dem Spiel geschrieben wurden. Wenn die KI also sagt: „Argentinien hat gewonnen“, liegt das vielleicht nicht daran, dass sie die Hinweise im Voraus analysiert hat, sondern dass sie sich einfach an das Endergebnis aus ihren Trainingsdaten erinnert. Es ist wie ein Schüler, der eine Geschichtsprüfung schreibt, der aber heimlich den Lösungsschlüssel auswendig gelernt hat. Um dies zu beheben, müssen Wissenschaftler einen Weg finden, die „Voraussicht“ (das Erraten dessen, was passieren wird) einer KI zu testen, ohne ihr zu erlauben, durch den Blick in den „Lösungsschlüssel“ (was tatsächlich passiert ist) zu schummeln.

Hier kommt eine neue Studie namens HINDCAST ins Spiel. Die Forscher wollten sehen, ob eine KI tatsächlich die Zukunft vorhersagen kann, wenn man sie dazu zwingt, in der Vergangenheit zu stehen, ohne Wissen darüber, was als Nächstes geschah. Sie bauten eine Zeitreise-Simulation unter Verwendung von Prognosemärkten (Orte, an denen Menschen auf Ergebnisse wetten) und einem eingefrorenen Archiv des Internets. Sie fanden heraus, dass eine KI besser darin wird, die Zukunft zu erraten, wenn man sie dazu zwingt, in der Vergangenheit zu stehen und ihr kein Wissen darüber gibt, was danach geschah – aber nur, wenn diese Nachrichten tatsächlich nützliche Fakten enthielten. Wenn die alten Nachrichten nur aus Vermutungen und Meinungen bestanden, machte das Lesen dieser Nachrichten die KI tatsächlich schlechter darin, die Wahrheit vorherzusagen.

Der Zeitreise-Test

Die Forscher entwickelten ein System, das sie HINDCAST nennen (ein Wortspiel auf „Forecast“, aber rückwärts gerichtet). Stellen Sie sich eine Zeitmaschine vor, die einen bestimmten Moment in der Geschichte einfriert, sagen wir, einen Monat bevor ein großes Sportturnier beginnt. In diesem eingefrorenen Moment darf die KI eine Bibliothek von Nachrichtenartikeln und Forenbeiträgen durchsuchen, aber nur die, die vor diesem Datum geschrieben wurden. Sie kann nichts sehen, was nach diesem Zeitpunkt geschrieben wurde, selbst wenn es heute in der Bibliothek liegt.

Um die KI zu testen, verwendeten die Forscher reale Wettmärkte namens Polymarket. Dies sind wie digitale Casinos, in denen Menschen darauf wetten, ob etwas passieren wird (wie „Wird Team X gewinnen?“). Da diese Märkte bereits abgeschlossen sind, kennen die Forscher die wahre Antwort. Sie wissen auch, was der „Marktpreis“ in diesem exakten Moment in der Vergangenheit war, der repräsentiert, was eine Menge von Menschen damals als Wahrscheinlichkeit ansah.

Der Aufbau funktioniert so:

  1. Zeit einfrieren: Wählen Sie ein vergangenes Datum (t0t_0), bevor ein Markt abgeschlossen wurde.
  2. Die Bibliothek sperren: Die KI darf nur eine eingefrorene Momentaufnahme von Reddit (einem beliebten Internetforum) durchsuchen, die vor diesem Datum erstellt wurde.
  3. Die Vorhersage: Die KI liest die verfügbaren Beiträge und rät das Ergebnis.
  4. Die Bewertung: Die KI wird nach zwei Kriterien bewertet: wie nah sie am tatsächlichen Endergebnis war und wie nah sie an dem war, was die menschlichen Wettenden zu diesem exakten Zeitpunkt dachten.

Die große Entdeckung: Fakten vs. Hype

Das Team testete neun verschiedene KI-Modelle, um zu sehen, ob ihnen der Zugriff auf diese „eingefrorene Bibliothek“ half, besser vorherzusagen als nur aus ihrem Gedächtnis zu raten.

Die gute Nachricht: Für die meisten der KI-Modelle half das Lesen der alten Beiträge tatsächlich. Tatsächlich machten acht von neun Modellen weniger Fehler, wenn sie Zugriff auf das Archiv hatten. Die größte Verbesserung wurde bei einem Modell namens Qwen3-32B beobachtet, das seine Fehlerrate um 23 % senkte. Dies deutet darauf hin, dass KI in der Lage ist, klügere Vermutungen anzustellen, wenn in der Vergangenheit echte Fakten verfügbar sind.

Die schlechte Nachricht (und der Haken): Die Hilfe war nicht universell. Es hing völlig davon ab, was die KI las.

  • Wo es funktionierte: In Themen wie Sport, Auszeichnungen und Handel waren die Internetbeiträge vor dem Ereignis voll von konkreten Fakten (z. B. „Der Starspieler des Teams ist verletzt“ oder „Der Goldpreis steigt“). In diesen Fällen las die KI die Fakten und verbesserte ihre Vorhersage des Gewinners.
  • Wo es scheiterte: In Themen wie Unterhaltung (wie das Erraten, welches Lied die Nummer 1 wird) oder Politik war das Internet voll von lauten Meinungen, Fan-Hype und Spekulationen. Als die KI diese Beiträge las, wurde sie verwirrt. Sie begann zu glauben, dass der „Hype“ ein Fakt sei. Wenn Fans zum Beispiel lautstark behaupteten, dass ein neues Lied die Nummer 1 werden würde, wettete die KI darauf, obwohl die meisten Lieder es nie an die Spitze schaffen. In diesen Fällen machte das Lesen des Archivs die KI schlechter als wenn sie das Internet einfach ignoriert und ihrer eigenen Logik gefolgt wäre.

Das „Über-Lesen“-Problem

Die Studie fand ein interessantes Muster: Je länger ein Markt offen blieb, desto wahrscheinlicher war es, dass die KI durch das Rauschen verwirrt wurde. Wenn ein Wettmarkt lange lief, füllte sich das Internet mit endlosem Geplapper und widersprüchlichen Meinungen. Die KI, die versucht, hilfreich zu sein, las all das, fing an zu überdenken und traf schließlich schlechte Vorhersagen basierend auf lauten Meinungen statt auf soliden Fakten.

Ein spezielles Modell, R1-Distill-Qwen-7B, wurde insgesamt sogar schlechter, als es mit dem Lesen erlaubt wurde. Die Forscher glauben, dass dies geschah, weil das Modell so in langen, verwirrenden Argumentationsketten versank, dass es die eigentlichen Beweise vergaß. Es ist wie ein Schüler, der so viele verschiedene Meinungen zu einem Thema liest, dass er die einfachen Fakten vergisst und am Ende falsch rät.

Was dies für die Zukunft bedeutet

Die wichtigste Erkenntnis von HINDCAST ist, dass die Fähigkeit einer KI, die Zukunft vorherzusagen, nur so gut ist wie die Qualität der Informationen, die sie vor dem Ereignis finden kann. Wenn das Internet voll von Fakten ist, kann die KI ein großartiger Vorhersager sein. Wenn das Internet voll von Rauschen und Hype ist, könnte die KI lediglich zu einem selbstbewussten Narren werden, der der lautesten Stimme statt der Wahrheit glaubt.

Die Forscher zeigten auch, dass diese „Zeitreise“-Testmethode ein mächtiges Werkzeug ist. Da die Bibliothek eingefroren ist, können Sie neue KI-Modelle gegen dieselben alten Fragen testen, ohne dass diese schummeln können. Das bedeutet, dass wir unsere Tests verbessern können, während die KI immer klüger wird, um sicherzustellen, dass wir wirklich messen, wie gut sie denkt, und nicht nur, wie gut sie sich erinnert.

Kurz gesagt: HINDCAST beweist, dass das Geben einer Bibliothek voller Fakten einer KI hilft, die Zukunft zu sehen, während das Geben einer Bibliothek voller Gerüchte sie vielleicht nur blind macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →