← Neueste Arbeiten
🤖 machine learning

A projection-based framework for gradient-free and parallel learning

Dieser Beitrag stellt PJAX vor, ein auf JAX basierendes Framework, das das Training neuronaler Netze als parallelisierbares, gradientenfreies Zulässigkeitsproblem unter Verwendung iterativer Projektionsoperatoren neu formuliert und eine überzeugende Alternative zur herkömmlichen gradientenbasierten Optimierung bietet, die Vorteile bei der Handhabung nicht-differenzierbarer Operationen und die Ermöglichung massiver Parallelisierung mit sich bringt.

Ursprüngliche Autoren: Andreas Bergmeister, Manish Krishan Lal, Stefanie Jegelka, Suvrit Sra

Veröffentlicht 2026-04-30
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Andreas Bergmeister, Manish Krishan Lal, Stefanie Jegelka, Suvrit Sra

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, ein riesiges, komplexes Puzzle zu lösen, wie ein riesiges 3D-Puzzle oder einen Zauberwürfel, aber Sie kennen das endgültige Bild nicht.

Der alte Weg (Gradientenbasiertes Lernen)
Derzeit lernen die meisten KI-Modelle mit einer Methode namens „Backpropagation". Stellen Sie sich dies wie einen Wanderer vor, der versucht, den Grund eines nebligen Tals (die beste Lösung) zu finden. Der Wanderer spürt die Steigung unter seinen Füßen (den Gradienten) und macht einen Schritt bergab. Er macht dies Schritt für Schritt weiter, bis er einen tiefen Punkt erreicht.

  • Das Problem: Manchmal bleibt der Wanderer in einer kleinen Mulde (einem lokalen Minimum) stecken, die nicht der wahre Grund ist. Manchmal ist der Pfad so steil oder flach, dass der Wanderer sich verirrt oder sich zu langsam bewegt. Außerdem muss der Wanderer, um zu wissen, welche Richtung „nach unten" zeigt, ein Signal all den Weg zurück vom Talgrund bis zum Gipfel senden, was langsam ist und einen sehr spezifischen, symmetrischen Pfad erfordert.

Der neue Weg (Projektionsbasiertes Lernen)
Die Autoren dieses Papiers schlagen eine völlig andere Strategie vor. Anstatt zu versuchen, den Grund eines Tals zu finden, betrachten sie das Training als ein Erfüllbarkeitsproblem.

Stellen Sie sich vor, Sie haben einen Raum voller Wände, jede mit einer spezifischen Regel.

  • Wand A sagt: „Der rote Block muss neben dem blauen Block sein."
  • Wand B sagt: „Der grüne Block muss über dem roten Block sein."
  • Wand C sagt: „Das Gesamtgewicht muss 50 kg betragen."

Ihr Ziel ist es nicht, einen Hügel hinabzugleiten; es ist, eine einzige Anordnung von Blöcken zu finden, bei der die Regel jeder einzelnen Wand gleichzeitig erfüllt ist.

Wie es funktioniert: Die „Projektions"-Metapher
Die Autoren nennen ihre Methode „Projektionsbasiert". So gehen sie vor:

  1. Aufteilung: Sie zerlegen das riesige Puzzle (das neuronale Netzwerk) in winzige, einfache Teile, sogenannte „primitive Funktionen" (wie einfache mathematische Operationen: Zahlen addieren, multiplizieren oder entscheiden, ob eine Zahl positiv ist).
  2. Die lokale Korrektur: Anstatt das gesamte Puzzle zu betrachten, schauen sie sich nur eine Wand (eine Regel) an. Wenn die Blöcke nicht zur Regel dieser Wand passen, „projizieren" sie die Blöcke auf die Wand. Stellen Sie sich vor, Sie werfen ein Licht auf die Blöcke; der Schatten, den sie auf die Wand werfen, ist die „korrekte" Position für diese spezifische Regel.
  3. Parallele Kraft: Dies ist der magische Teil. Da jede Wand nur ihre unmittelbaren Nachbarn betrifft, können Sie Wand A, Wand B und Wand C alle gleichzeitig reparieren. Sie müssen nicht warten, bis Wand A fertig ist, bevor Sie mit Wand B beginnen. Das ist wie ein Team von 100 Personen, die gleichzeitig verschiedene Teile eines Hauses reparieren, anstatt einer Person, die nacheinander das Dach, dann die Küche und dann das Badezimmer repariert.
  4. Wiederholung: Sie tun dies immer wieder. Jedes Mal schieben sie die Blöcke ein wenig, damit sie besser zu den lokalen Regeln passen. Schließlich setzen sich die Blöcke in einer Position fest, in der sie alle Regeln gleichzeitig erfüllen. Das ist Ihre trainierte KI.

Warum das cool ist (laut dem Papier)

  • Kein „Gefälle" nötig: Sie müssen kein „Gefälle" (Gradient) berechnen. Das bedeutet, Sie können Regeln verwenden, die „uneben" oder unterbrochen sind (nicht differenzierbar), wie einen Schalter, der entweder EIN oder AUS ist. Die alte Methode hat Schwierigkeiten mit diesen; diese neue Methode bewältigt sie mühelos.
  • Biologische Plausibilität: Im Gehirn senden Neuronen kein globales „Fehlersignal" all den Weg zurück vom Ende eines Gedankens zum Anfang. Sie passen sich einfach basierend darauf an, was ihre unmittelbaren Nachbarn tun. Diese neue Methode imitiert diese lokale, nachbar-zu-nachbar Anpassung.
  • Geschwindigkeit: Da alle parallel arbeiten, kann es auf modernen Computerchips (GPUs/TPUs), die dafür ausgelegt sind, viele Dinge gleichzeitig zu tun, viel schneller sein.

Der Kompromiss: Die „Speicher"-Kosten
Das Papier gibt zu, dass es einen Haken gibt. Um dies zu tun, muss der Computer die Position jedes einzelnen „Randes" im Puzzle bei jedem Schritt speichern.

  • Analogie: Bei der alten Methode merken Sie sich nur den aktuellen Standort des Wanderers. Bei dieser neuen Methode müssen Sie die Position jedes einzelnen Blocks im Raum und jede einzelne Verbindung zwischen ihnen für jede einzelne Person in Ihrem Team speichern.
  • Ergebnis: Dies verbraucht viel mehr Computerspeicher (RAM). Die Autoren mussten einige ihrer Testmodelle verkleinern, um sie in den Speicher ihres Computers zu passen, während die alte Methode größere Modelle leichter handhaben konnte.

Die Ergebnisse
Die Autoren entwickelten ein Software-Tool namens PJAX (Projection JAX), um dies zu testen. Sie probierten es bei verschiedenen Arten von Puzzles aus:

  • Einfache Muster (MLPs)
  • Bilderkennung (CNNs)
  • Sprachvorhersage (RNNs)

Sie stellten fest, dass die „alte Methode" (unter Verwendung von Adam- oder SGD-Optimierern) in vielen Fällen immer noch der Champion für reine Geschwindigkeit und endgültige Genauigkeit ist, aber diese neue „Projektions"-Methode überraschend gut funktioniert. Es ist eine gangbare Alternative, die:

  1. Lernt, ohne Gradienten zu benötigen.
  2. „Unebene" Regeln bewältigt, die andere Methoden verwirren.
  3. Auf paralleler Hardware sehr effizient lernt, insbesondere für Aufgaben wie Sprachmodellierung, bei denen die alte Methode mit „verschwindenden Gradienten" (Vergessen des Anfangs eines Satzes) zu kämpfen hat.

Zusammenfassung
Das Papier sagt: „Hören Sie auf, einen Hügel hinabzugleiten, um die Antwort zu finden. Behandeln Sie stattdessen das Problem als eine Reihe lokaler Regeln. Reparieren Sie jede Regel lokal und gleichzeitig, und schließlich wird das gesamte System in sich zusammenfallen." Es ist eine neue Art, KI zu trainieren, die paralleler ist, flexibler mit verschiedenen Arten von Mathematik umgeht, aber derzeit mehr Speicher benötigt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →