← Neueste Arbeiten
📊 statistics

Enforcing tail calibration when training probabilistic forecast models

Dieser Artikel zeigt, dass die Anpassung von Verlustfunktionen durch gewichtete Scoring-Regeln und Regularisierung zur Korrektur von Fehlkalkulationen im Extrembereich die Kalibrierung probabilistischer Vorhersagen für Extremereignisse, wie etwa Windgeschwindigkeiten in Großbritannien, verbessern kann, wobei diese Verbesserung jedoch einen Zielkonflikt mit der Kalibrierung häufigerer Ergebnisse mit sich bringt.

Ursprüngliche Autoren: Jakob Benjamin Wessel, Maybritt Schillinger, Frank Kwasniok, Sam Allen

Veröffentlicht 2026-05-05
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jakob Benjamin Wessel, Maybritt Schillinger, Frank Kwasniok, Sam Allen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Wettervorhersager, aber anstatt nur zu sagen „Es wird regnen", sind Sie ein Koch, der eine Mahlzeit vorhersagt. Sie servieren nicht nur ein einzelnes Gericht; Sie servieren ein Wahrscheinlichkeitsmenü. Sie sagen Ihren Gästen: „Es gibt eine 70-prozentige Chance auf Spaghetti, eine 20-prozentige Chance auf Pizza und eine 10-prozentige Chance auf eine Überraschungssalat."

In der Welt der Datenwissenschaft nennt man dies eine probabilistische Vorhersage. Das Ziel ist es, sicherzustellen, dass Ihr Menü der Realität entspricht. Wenn Sie sagen, es gebe eine 10-prozentige Chance auf einen Salat, und über 100 Tage hinweg tatsächlich 10-mal Salat servieren, ist Ihre Vorhersage „kalibriert". Sie ist vertrauenswürdig.

Es gibt jedoch ein großes Problem: Extremereignisse.

Das Problem: Die „Überraschungssalat"-Katastrophe

Stellen Sie sich vor, Ihr Restaurant liegt in einem stürmischen Gebiet. An den meisten Tagen ist das Wetter mild (Spaghetti oder Pizza). Aber gelegentlich trifft ein massiver Hurrikan zu (der „Überraschungssalat", der tatsächlich ein Tornado ist).

Die Arbeit argumentiert, dass selbst die klügsten, hochtechnischsten Köche (Maschinenlernmodelle) hervorragend darin sind, die milden Tage vorherzusagen, aber schrecklich darin, die extremen Stürme vorherzusagen. Sie könnten sagen: „Oh, es gibt eine winzige 1-prozentige Chance auf einen Tornado", während in Wirklichkeit der Sturm kommt.

Warum? Weil diese Modelle darauf trainiert sind, „im Durchschnitt gut" zu sein. Sie konzentrieren sich darauf, die gewöhnlichen Tage richtig zu bekommen (die Spaghetti und Pizza), da diese 99 % der Zeit vorkommen. Sie ignorieren die seltenen, gefährlichen Tage, weil sie keine „Kalibrierungspunkte" für diese verschwenden wollen.

Die Autoren nennen dies einen Mangel an Tail-Kalibrierung (Schwanzkalibrierung). „Tail" bezieht sich auf das sehr Ende der Wahrscheinlichkeitskurve – die extremen, seltenen Ereignisse. Wenn Ihre Vorhersage nicht „tail-kalibriert" ist, könnten Sie ruhig sein, wenn Sie stattdessen schreien sollten: „Rettet eure Leben!"

Die Lösung: Änderung der „Punkteliste"

Im maschinellen Lernen lernen Modelle, indem sie versuchen, auf einem Test die höchste Punktzahl zu erzielen. Normalerweise ist der Test eine Standard-„Genauigkeitspunktzahl" (wie der CRPS oder der Log-Score). Diese Punkteliste belohnt Sie dafür, dass Sie bei den üblichen Dingen richtig liegen.

Die Arbeit schlägt vor, die Punkteliste zu ändern, um die Modelle zu zwingen, auf die Stürme zu achten. Sie schlagen zwei Hauptwege vor, dies zu tun:

1. Die „Gewichtete Punktzahl" (Der VIP-Pass)

Stellen Sie sich vor, der Standardtest gibt Ihnen 1 Punkt für eine richtige Spaghetti-Vorhersage, aber nur 0,1 Punkte für eine richtige Tornado-Vorhersage. Das Modell ignoriert den Tornado.

Die Autoren schlagen vor, der Tornado-Vorhersage einen VIP-Pass zu geben. Sie verwenden eine gewichtete Bewertungsregel. Jetzt ist eine richtige Tornado-Vorhersage 100 Punkte wert.

  • Die Metapher: Es ist, als würde man dem Koch sagen: „Wenn Sie das seltene, gefährliche Gericht richtig vorhersagen, erhalten Sie einen goldenen Stern. Wenn Sie das langweilige Nudelgericht richtig vorhersagen, erhalten Sie einen normalen Stern."
  • Das Ergebnis: Der Koch beginnt, auf den Tornado zu achten. Aber weil er sich so sehr auf den Tornado konzentriert, könnte er anfangen, die Spaghetti-Vorhersagen ein wenig zu vermasseln.

2. Die „Fehlkalibrierungs-Strafe" (Der strenge Inspektor)

Dies ist ein direkterer Ansatz. Anstatt nur die Punkte zu ändern, fügen die Autoren eine Strafe zur Punkteliste hinzu.

  • Die Metapher: Stellen Sie sich einen strengen Gesundheitsinspektor (den Regularisierungsterm) vor, dem nicht schmeckt, wie lecker das Essen ist, sondern der nur darauf achtet, ob das Menü mit der tatsächlichen Ausgabe der Küche übereinstimmt. Wenn das Menü „10-prozentige Chance auf Salat" sagt, die Küche aber 50 % der Zeit Salat serviert, verhängt der Inspektor eine hohe Geldstrafe gegen den Koch.
  • Die Wendung: Sie haben einen speziellen Inspektor für den Tail (die extremen Ereignisse) geschaffen. Dieser Inspektor überprüft nur die Tornado-Vorhersagen. Wenn das Modell über den Tornado lügt, wird es schwer bestraft.
  • Das Ergebnis: Der Koch hat Angst vor der Strafe und passt seine Tornado-Vorhersagen daher perfekt an.

Der Zielkonflikt: Man kann nicht alles haben

Das wichtigste Ergebnis der Arbeit ist ein Zielkonflikt.

Wenn Sie das Modell zwingen, perfekt darin zu sein, extreme Stürme vorherzusagen (unter Verwendung dieser neuen Punktelisten), wird es oft etwas schlechter darin, das ruhige, alltägliche Wetter vorherzusagen.

  • Analogie: Es ist wie ein Schüler, der nur für die schwierigsten Fragen der Abschlussprüfung lernt. Er könnte die schwierigen Kalkulusprobleme (die Stürme) meistern, aber die einfache Arithmetik (die sonnigen Tage) vergessen.
  • Die Behauptung der Arbeit: Die Autoren testeten dies an Windgeschwindigkeitsdaten aus Großbritannien unter Verwendung von drei verschiedenen Arten von „Köchen" (einfache mathematische Modelle, neuronale Netze und komplexe generative Modelle). Sie stellten fest, dass alle drei mit Standardmethoden versagten, extreme Winde genau vorherzusagen. Aber als sie ihre neuen „Tail-Kalibrierungs"-Strafen anwendeten, wurden die Modelle viel besser darin, die Stürme vorherzusagen, auch wenn sie bei der Vorhersage der sanften Brisen etwas schlechter abschnitten.

Zusammenfassung

  • Das Problem: KI-Wettermodelle sind hervorragend bei durchschnittlichen Tagen, aber schrecklich bei extremen Katastrophen, weil sie darauf trainiert sind, „durchschnittlich" zu sein.
  • Die Lösung: Die Autoren änderten die Trainingsregeln (die Verlustfunktion), um die Modelle schwer zu bestrafen, wenn sie die extremen Ereignisse falsch vorhersagen.
  • Das Ergebnis: Die Modelle wurden viel zuverlässiger für extreme Ereignisse (wie starke Winde), aber dies ging zu Lasten einer etwas geringeren Genauigkeit bei normalem, alltäglichem Wetter.
  • Die Erkenntnis: Wenn Sie Entscheidungen über lebensbedrohliche extreme Ereignisse treffen müssen, müssen Sie Ihre Modelle speziell für diese Ereignisse trainieren, auch wenn dies bedeutet, dass sie für den Rest der Zeit nicht perfekt sind.

Die Arbeit schließt damit, dass wir zwar nicht alles perfekt vorhersagen können, aber diese neuen „Punktelisten" verwenden können, um sicherzustellen, dass, wenn der Sturm zuschlägt, unsere Vorhersagen tatsächlich die Wahrheit sagen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →