← Neueste Arbeiten
🤖 machine learning

Learning Dynamics of Zeroth-Order Optimization: A Kernel Perspective

Dieser Beitrag löst das Paradoxon des Erfolgs der Nullter-Ordnung-Optimierung beim Feinabstimmen großer Sprachmodelle, indem er nachweist, dass deren Lernverhalten von einem empirischen Neural Tangent Kernel gesteuert wird, dessen Approximationsfehler von der Ausgabegröße des Modells und nicht von der massiven Parametervariablen abhängt, wodurch seine Skalierbarkeit erklärt wird.

Ursprüngliche Autoren: Zhe Li, Bicheng Ying, Zidong Liu, Haibo Yang

Veröffentlicht 2026-05-06
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhe Li, Bicheng Ying, Zidong Liu, Haibo Yang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Rätsel: Der „Blinde" versus der „Sehende"

Stellen Sie sich vor, Sie versuchen, den tiefsten Punkt in einem riesigen, nebligen Tal zu finden (dies ist das Ziel beim Training eines KI-Modells).

  • First-Order (FO) Methoden: Diese sind wie ein Wanderer mit einem Kompass und einer Karte. Sie können genau sehen, welche Richtung „nach unten" führt (der Gradient), und gehen direkt dorthin. Dies ist schnell und effizient, erfordert aber das Tragen einer schweren Karte (Berechnung von Gradienten), was unmöglich ist, wenn das Tal zu riesig ist oder wenn Sie sich in einem „Black Box"-Szenario befinden, in dem Sie die Karte nicht sehen können.
  • Zeroth-Order (ZO) Methoden: Diese sind wie ein blinder Wanderer. Sie haben keinen Kompass. Stattdessen machen sie einen kleinen Schritt nach vorne, prüfen, ob sie tiefer liegen, machen einen Schritt zurück und prüfen erneut. Durch den Vergleich dieser beiden Punkte raten sie, welche Richtung nach unten führt. Dies ist „speichereffizient", da sie keine schwere Karte benötigen, aber die traditionelle Mathematik sagt voraus, dass dies unglaublich langsam sein sollte, insbesondere wenn das Tal riesig ist (hochdimensional).

Das Paradoxon:
Jahrelang lehrten uns Mathematik-Lehrbücher, dass der „blinde Wanderer" (ZO) ewig brauchen würde, um den Boden zu finden, wenn das Tal massiv wäre (wie moderne Large Language Models mit Milliarden von Parametern). Doch in der realen Welt haben Forscher diese „blinde" Methode erfolgreich eingesetzt, um diese massiven Modelle feinabzustimmen. Wie ist das möglich?

Die Lösung des Papers: Die „Schatten"-Analogie

Die Autoren lösen dieses Rätsel, indem sie das Problem nicht durch die Linse der „unternommenen Schritte", sondern durch die Linse der „Lern-Dynamik" (wie sich das Vertrauen des Modells verändert) betrachten.

Sie verwenden ein Werkzeug namens Neural Tangent Kernel (eNTK). Stellen Sie sich das eNTK als einen Schatten vor, den der Lernprozess des Modells wirft.

  • Der „sehende" Wanderer (FO) wirft einen perfekten, detaillierten Schatten des Geländes.
  • Der „blinde" Wanderer (ZO) wirft einen Schatten, der eine projizierte, leicht unscharfe Version des perfekten ist.

Das Paper argumentiert, dass die „blinde" Methode funktioniert, weil sie nicht das gesamte massive Tal sehen muss, um einen nützlichen Schatten zu werfen. Sie muss den Schatten nur auf einen zufälligen, niedrigdimensionalen Schnitt der Welt projizieren.

Der magische Trick: Das „Johnson-Lindenstrauss"-Lemma

Das Paper stützt sich auf ein mathematisches Konzept namens Johnson-Lindenstrauss (JL) Lemma. Hier ist die Analogie:

Stellen Sie sich vor, Sie haben eine riesige, komplexe 3D-Skulptur (das Modell mit Milliarden von Parametern). Sie möchten ein Foto davon machen, aber Ihre Kamera kann nur 2D-Bilder aufnehmen.

  • Alte Theorie: Man dachte, man benötige eine Kamera mit einem Sensor so groß wie die Skulptur, um ein gutes Bild zu erhalten. Wenn die Skulptur riesig ist, wäre das Foto unscharf und unbrauchbar.
  • Die Einsicht des Papers: Das JL Lemma besagt, dass Sie, wenn Sie aus einem zufälligen Winkel ein Foto machen, tatsächlich die wesentlichen Beziehungen der Skulptur perfekt einfangen können, selbst wenn das Foto viel kleiner ist als die Skulptur.

Die entscheidende Entdeckung:
Die Qualität dieses „blinden" Fotos (das ZO-Lernen) hängt davon ab, wie viele zufällige Winkel (Perturbationen) Sie einnehmen, nicht davon, wie groß die Skulptur ist.

  • Die „Perturbationen" (P): Dies ist die Anzahl der Male, die der blinde Wanderer den Boden stößt, um die Richtung zu erraten.
  • Die „Ausgangsgröße" (V): Dies ist die Größe der endgültigen Antwort, die das Modell gibt (z. B. die Vokabulargröße eines Sprachmodells).

Das Paper beweist, dass solange Sie den Boden oft genug stoßen (P erhöhen), der Pfad des „blinden" Wanderers fast identisch mit dem Pfad des „sehenden" Wanderers aussehen wird. Entscheidend ist, dass die Anzahl der benötigten Stöße von der Größe der Antwort (V) abhängt, nicht von der Größe des Modells (d).

Drei Haupterkenntnisse

  1. Zählen Sie die Stöße, nicht die Größe:
    Der Erfolg der „blinden" Methode hängt nicht von der massiven Größe des KI-Modells ab (das Milliarden von Parametern haben könnte). Es geht um die Anzahl der zufälligen Vermutungen (Perturbationen), die Sie machen. Wenn Sie genug Vermutungen anstellen, lernt das Modell genauso gut, als hätte es eine Karte.

  2. Die Form der Vermutung ist unwichtig:
    Macht es einen Unterschied, ob der „blinde Wanderer" den Boden in einem glatten, kontinuierlichen Kreis (Gauß-Verteilung) oder in scharfen, binären Sprüngen (Rademacher-Verteilung) stößt? Das Paper zeigt, dass es nicht viel ausmacht. Beide funktionieren fast gleich gut. Die „blinde" Methode ist robust; sie kümmert sich nicht um die spezifische Form des Rauschens, solange genug davon vorhanden ist.

  3. Warum es bei riesigen Modellen funktioniert:
    Dies erklärt, warum ZO bei Large Language Models (LLMs) funktioniert. Obwohl das Modell Milliarden von Parametern hat (ein riesiges d), ist die Ausgabevokabulargröße relativ klein (ein moderates V). Da die Genauigkeit der „blinden" Methode von V und nicht von d abhängt, bleibt sie auch für die größten Modelle effizient und effektiv.

Das Fazit

Dieses Paper ändert die Geschichte. Es besagt, dass der „Fluch der Dimensionalität" (die Idee, dass große Modelle für blinde Methoden zu schwierig sind) ein Mythos ist, wenn man den Lernprozess richtig betrachtet.

Indem sie den Lernprozess als geometrische Projektion betrachten, zeigen die Autoren, dass ein „blinder" Optimierer genauso effektiv lernen kann wie ein „sehender", sofern man ihm genügend zufällige Stichproben gibt. Es geht nicht um die Größe des Berges; es geht darum, wie oft man ihn aus verschiedenen Winkeln betrachtet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →