← Neueste Arbeiten
🔢 mathematics

Automated Numerical Stability Analysis of Deep Learning Operators

Dieses Paper stellt ein einheitliches Software-Tool vor, das CESTAC integriert, um numerische Instabilitäten in Deep-Learning-Operatoren während eines einzigen Rechenschritts zu erkennen, zu validieren und zu überwachen und damit die Entwicklung stabilerer und effizienterer Trainings- und Inferenz-Kernel zu unterstützen.

Ursprüngliche Autoren: Xinye Chen

Veröffentlicht 2026-07-29
📖 9 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xinye Chen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bauen eine riesige, komplizierte Burg aus winzigen, leicht wackeligen Lego-Steinen. In der Welt der Informatik sind diese Steine Zahlen und die Burg ist ein „Deep-Learning“-Modell – ein superintelligentes Gehirn, das lernt, Katzen zu erkennen, Gedichte zu schreiben oder Autos zu steuern. Lange Zeit bauten Wissenschaftler diese Burgen aus großen, stabilen, doppelten Steinen (genannt „Double Precision“), die sehr genau, aber schwer und langsam zu bewegen waren. Um sie schneller und energieeffizienter zu machen, begannen Ingenieure, kleinere, leichtere Steine zu verwenden (genannt „Reduced Precision“). Es ist, als würde man schweren Stein gegen leichten Schaumstoff austauschen; die Burg geht viel schneller hoch, aber es gibt einen Haken: Die Schaumstoffsteine sind ein wenig schwammig. Wenn man sie falsch stapelt oder versucht, einen winzigen Kieselstein auf einem riesigen Schaumstoffblock zu balancieren, kann das ganze Gebilde wackeln, zusammenbrechen oder ein Ergebnis liefern, das zwar richtig aussieht, aber eigentlich ein wenig mit Fehlern „verunreinigt“ ist.

Dies ist das Problem der „numerischen Instabilität“. Es liegt nicht daran, dass der Computer defekt ist; es liegt daran, dass die Mathematik ungenau wird, wenn man sie mit weniger Ziffern durchführt. Manchmal subtrahiert ein Computer zwei riesige, fast identische Zahlen, um eine winzige Differenz zu finden, und wirft dabei versehentlich alle wichtigen Informationen weg, sodass nur noch Rauschen übrig bleibt. Lange Zeit war es, wie zu versuchen, einen einzelnen losen Stein in einer Burg zu finden, während die Burg gerade gebaut wird und es dunkel ist. Man weiß, dass die Burg wackelt, aber man kann nicht sehen, welcher Stein die Ursache dafür ist.

Hier kommt ein neues Werkzeug namens noisefloat ins Spiel, das Forscher der Sorbonne Université entwickelt haben. Stellen Sie sich dieses Werkzeug wie eine „Stresstest-Brille“ für Ihre Lego-Burg vor. Anstatt die Burg einfach nur einmal zu bauen, baut das Werkzeug gleichzeitig drei leicht unterschiedliche Versionen exakt derselbe Burg, indem es die Steine mit winzigen, zufälligen Stößen versetzt, um zu sehen, wie sie reagieren. Wenn die drei Versionen fast identisch aussehen, sind die Steine stabil. Aber wenn eine Version zusammenbricht oder völlig anders aussieht als die anderen, zeigt das Werkzeug sofort mit dem Finger auf den spezifischen Stein (oder „Operator“), der wackelig ist. Die Forscher nutzten dieses Werkzeug, um Deep-Learning-Modelle zu testen, und fanden heraus, dass es in der Lage ist, diese verborgenen, instabilen Steine erfolgreich aufzuspüren, selbst mitten in einem komplexen Trainingsprozess. Sie zeigten, dass einige mathematische Tricks sicher sind, andere jedoch – wie der Versuch, riesige Zahlen zu eliminieren, um eine winzige zu finden – gefährlich sind und die Genauigkeit des Modells ruinieren können, ohne dass es jemand bemerkt, bis es zu spät ist.

Die Magie der „verrauschten“ Zahlen

Deep Learning ist heute überall – von den Filtern auf Ihren Handyfotos bis hin zu den Chatbots, mit denen Sie sprechen. Aber um diese Systeme schnell genug zu machen, damit sie auf Ihrem Telefon oder in einem Rechenzentrum laufen können, verwenden Wissenschaftler „Reduced Precision“. Stellen Sie sich vor, Sie messen die Länge eines Raumes. Wenn Sie ein Lineal mit Markierungen alle Millimeter benutzen (hohe Präzision), erhalten Sie eine sehr exakte Zahl. Wenn Sie ein Lineal mit Markierungen nur alle Zentimeter benutzen (niedrige Präzision), sparen Sie Zeit, aber Ihre Messung ist etwas ungenauer. In Computern bedeutet dies, weniger „Bits“ (die winzigen 0en und 1en) zu verwenden, um Zahlen zu speichern. Dies macht Berechnungen schneller und verbraucht weniger Energie, führt aber zu „Rundungsfehlern“.

Normalerweise sind diese Fehler so klein, dass sie nicht ins Gewicht fallen. Aber manchmal summieren sie sich auf oder werden verstärkt, was zu „numerischer Instabilität“ führt. Das ist, als würde man versuchen, ein Kartenhaus in einem windigen Raum zu balancieren; ein kleiner Windstoß (ein Rundungsfehler) kann das Ganze zum Einsturz bringen. Das Problem ist, dass diese Fehler in Deep Learning lautlos auftreten können. Das Modell scheint vielleicht noch zu funktionieren, aber seine interne Mathematik ist tatsächlich „verunreinigt“, was später zu seltsamen Fehlern führen könnte.

Die Lösung: Ein Dreifach-Check-System

Das Paper stellt noisefloat vor, ein Software-Werkzeug, das wie ein Detektiv für diese verborgenen mathematischen Fehler fungiert. Der Kern der Idee stammt aus einer Methode namens CESTAC (Control and Estimation of Stochastic Arithmetic). So funktioniert es vereinfacht:

Anstatt eine Berechnung nur einmal durchzuführen, führt noisefloat sie drei Mal gleichzeitig aus. Aber hier ist der Trick: In jedem der drei Durchläufe fügt es den Zahlen einen winzigen, zufälligen „Stoß“ hinzu. Es ist, als würde man drei verschiedenen Personen denselben Tisch messen lassen, aber jeder gibt ihnen ein leicht anderes Lineal, das um einen mikroskopisch kleinen Betrag abweicht.

  • Wenn die drei Personen fast das exakt gleiche Ergebnis erhalten, ist die Messung stabil. Die winzigen Stöße haben das Ergebnis nicht verändert, was bedeutet, dass die Mathematik solide ist.
  • Wenn die drei Personen sehr unterschiedliche Antworten erhalten, ist die Messung instabil. Die Mathematik ist so empfindlich, dass ein winziger Stoß das Ergebnis komplett verändert hat.

Das Werkzeug berechnet dann, wie viele „signifikante Stellen“ (verlässliche Zahlen) im Ergebnis übrig bleiben. Wenn das Ergebnis „null verlässliche Stellen“ hat, bedeutet dies, dass das Ergebnis nur aus Rauschen besteht.

Was sie herausgefunden haben: Die „wackeligen Steine“

Die Forscher testeten dieses Werkzeug an verschiedenen Teilen von Deep-Learning-Modellen, die aus vielen kleinen mathematischen Operationen, sogenannten „Operatoren“ (wie das Addieren von Zahlen, das Multiplizieren von Matrizen oder das Normalisieren von Daten), bestehen. Sie erstellten „pathologische“ Fälle – mathematische Probleme, die absichtlich instabil gestaltet wurden –, um zu sehen, ob das Werkzeug sie finden konnte.

1. Die „Auslöschungsfalle“ (Cancellation Trap)
Eine der größten Gefahren ist die „katastrophale Auslöschung“. Dies geschieht, wenn man zwei riesige Zahlen subtrahiert, die fast gleich sind, um eine winzige Differenz zu finden.

  • Die Analogie: Stellen Sie sich vor, Sie haben zwei Stapel mit jeweils 1.000.000 Lego-Steinen. Sie nehmen von beiden Stapeln jeweils 999.999 weg. Ihnen bleibt 1 Stein übrig. Aber wenn Ihr Lineal ein wenig ungenau ist, zählen Sie bei einem Stapel vielleicht 999.999,5 als 999.999 und beim anderen als 1.000.000. Nun denken Sie, Sie hätten 0 Steine übrig, oder vielleicht sogar eine negative Zahl!
  • Das Ergebnis: Das Werkzeug fand heraus, dass Modelle, die diese Art der Subtraktion versuchen (wie in einigen linearen Schichten oder Attention-Mechanismen), die Anzahl der verlässlichen Stellen auf Null sinken lassen. Das Werkzeug markierte diese Operationen erfolgreich als „verunreinigt“.

2. Das „Overflow“-Desaster
Einige Operationen, wie die „Softmax“-Funktion (die verwendet wird, um Zahlen in Wahrscheinlichkeiten umzuwandeln), können explodieren, wenn die Zahlen zu groß werden.

  • Die Analogie: Es ist, als würde man versuchen, einen Eimer Wasser in einen Thimble (einen winzigen Becher) zu gießen. Wenn das Wasser (die Zahl) zu groß ist, läuft es über (Overflow) und der Becher zerbricht.
  • Das Ergebnis: Die Forscher testeten eine „naive“ Version von Softmax, die nicht gegen große Zahlen geschützt war. Das Werkzeug meldete sofort 0 signifikante Stellen und markierte sie als instabil. Eine jedoch „verschobene“ (shifted) Version von Softmax, die zuerst eine große Zahl subtrahiert, um die Werte klein zu halten, blieb stabil und behielt je nach verwendeter Präzision etwa 3 bis 12 signifikante Stellen.

3. Das „Fast-Gleichstand“-Problem (Near-Tie Problem)
In „Attention“-Mechanismen (die helfen, dass Modelle sich auf wichtige Wörter konzentrieren) berechnet das Modell Scores, um zu entscheiden, worauf es aufmerksam werden soll. Wenn zwei Scores fast identisch sind, wird die Mathematik sehr empfindlich.

  • Das Ergebnis: Als die Forscher ein Szenario schufen, in dem zwei Scores fast gleichauf lagen, detektierte das Werkzeug einen massiven Abfall der Zuverlässigkeit. Die „Entscheidung“ des Modells (auf welches Wort es sich konzentriert) wurde zufällig, weil die Mathematik zu wackelig war, um den Unterschied zu erkennen.

Bricht es das Modell?

Eine entscheidende Frage ist: Wenn die Mathematik im Inneren wackelig ist, funktioniert das Endergebnis (wie das Erkennen einer Katze) dann immer noch?
Die Forscher führten vollständige Trainingssimulationen auf Datensätzen wie Fashion-MNIST (Kleidungsbilder) und CIFAR-10 (farbige Objekte) durch. Sie fügten diese „wackeligen“ Operatoren in die Modelle ein und beobachteten, was passierte.

  • Lokal vs. Global: Sie fanden heraus, dass ein Operator manchmal alle seine verlässlichen Stellen verlieren kann (zu reinem Rauschen wird), aber die endgültige Genauigkeit des Modells nicht sofort sinkt. Es ist, als hätte ein Roboter ein wackeliges Bein, aber der Roboter kann trotzdem noch laufen, weil die anderen Beine stark genug sind, um dies zu kompensieren.
  • Das Warnsignal: Wenn die Instabilität jedoch schwerwiegend genug war (wie im Fall der „Near-Tie“-Attention), begannen die Vorhersagen des Modells voneinander abzuweichen. Das Werkzeug sagte erfolgreich voraus, dass das Modell kurz vor einem Scheitern stand, noch bevor es tatsächlich dazu kam.

Der Kompromiss: Geschwindigkeit vs. Sicherheit

Es gibt einen Preis für die Verwendung dieses Werkzeugs. Da es die Berechnung drei Mal (oder öfter) durchführt, um die Stabilität zu prüfen, ist es langsamer. Das Paper stellt fest, dass dies im Vergleich zum normalen Computing zu einer Verlangsamung von 3- bis 100-fach führen kann, je nachdem, wie detailliert die Prüfung ist.

  • Das Urteil: Die Autoren schlagen vor, dieses Werkzeug nicht bei jedem einzelnen Trainingsdatensatz jedes Mal anzuwenden (das würde zu lange dauern). Stattdessen empfehlen sie, es auf eine kleine „Kalibrierungssubmenge“ anzuwenden, um die gefährlichen Operatoren zu finden, und dann genau diese Teile des Modells zu korrigieren.

Fazbot

Das Paper behauptet nicht, alle mathematischen Probleme der Welt gelöst zu haben, aber es bietet eine leistungsstarke neue Taschenlampe. noisefloat ermöglicht es Entwicklern, die unsichtbaren Risse in ihren Deep-Learning-Modellen zu sehen. Es beweist, dass wir durch die Verwendung von stochastischer (zufälliger) Arithmetik automatisch erkennen können, welche Teile eines neuronalen Netzes numerisch instabil sind. Dies ist entscheidend für den Bau von KI, die nicht nur schnell, sondern auch zuverlässig und sicher ist – besonders wenn wir uns in Richtung noch kleinerer, schnellerer und energieeffizienterer Hardware bewegen. Das Werkzeug legt nahe, dass wir mit den richtigen Prüfungen Burgen aus Schaumstoffsteinen bauen können, die genauso stark sind wie jene aus Stein.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →