← Neueste Arbeiten
🤖 machine learning

Scaling the Memory of Balanced Adam

Dieser Beitrag schlägt vor, den Momentum-Parameter β\beta im balancierten Adam als eine Speicher-Skalenvariable und nicht als feste Konstante zu behandeln, wobei eine Aktualisierungsregel (Rβ1000R_\beta \approx 1000) eingeführt wird, die die Trainingsrobustheit über 11 Vision- und Sprachexperimente hinweg erheblich verbessert, indem der statistische Speicherhorizont des Optimierers mit dem effektiven Lernhorizont in Einklang gebracht wird.

Ursprüngliche Autoren: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

Veröffentlicht 2026-05-12
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Die „Erinnerung" eines lernenden Roboters justieren

Stellen Sie sich vor, Sie lehren einen Roboter, Katzen zu erkennen, Gedichte zu schreiben oder Matheaufgaben zu lösen. Um dies zu tun, verwendet der Roboter ein Werkzeug namens Adam (ein „Optimierer"). Denken Sie an Adam als den internen Trainer des Roboters. Jedes Mal, wenn der Roboter einen Fehler macht, betrachtet der Trainer die Geschichte vergangener Fehler, um zu entscheiden, wie das Gehirn des Roboters für den nächsten Versuch angepasst werden soll.

Lange Zeit hatte dieser Trainer zwei verschiedene „Erinnerungseinstellungen" (genannt β1\beta_1 und β2\beta_2). Eine Einstellung erinnerte sich an die Richtung der Fehler, die andere an die Größe der Fehler.

Die Entdeckung:
Neueste Forschung (einschließlich dieses Papiers) hat ergeben, dass Sie tatsächlich keine zwei verschiedenen Einstellungen benötigen. Wenn Sie sie genau gleich setzen (β1=β2\beta_1 = \beta_2), lernt der Roboter genauso gut, aber das System wird viel einfacher. Jetzt hat der Trainer nur noch einen Erinnerungs-Knopf zu drehen.

Das Problem:
Die große Frage lautet: Auf welche Zahl sollten wir diesen Knopf stellen?
Die meisten Leute wählen einfach eine Standardzahl (wie 0,9) und bleiben dabei, egal was passiert. Die Autoren dieses Papiers argumentieren, dass dies so ist, als würde man dasselbe Paar Schuhe für einen 5-Meilen-Weg und einen 100-Meilen-Marathon verwenden. Es ergibt keinen Sinn, weil sich die „Distanz" des Trainings ändert.

Die Kernidee: Die „Aktualisierungszahl"

Die Autoren schlagen eine neue Art vor, über diesen Erinnerungs-Knopf nachzudenken. Anstatt ihn als feste Zahl zu betrachten, sagen sie, er sollte als Erinnerungshorizont verstanden werden.

  • Die Analogie: Stellen Sie sich vor, der Roboter liest ein Buch, um eine Sprache zu lernen.
    • Wenn der Roboter ein kurzes Gedächtnis hat, erinnert er sich nur an die letzten paar Sätze.
    • Wenn der Roboter ein langes Gedächtnis hat, erinnert er sich an das ganze Kapitel.

Das Papier führt ein Konzept namens Aktualisierungszahl (RβR_\beta) ein. Dies beantwortet die Frage: „Wie oft aktualisiert der Roboter sein Gedächtnis der Vergangenheit vollständig während der gesamten Trainingssitzung?"

Die Autoren stellten fest, dass der Roboter am besten lernt, wenn diese „Aktualisierungszahl" ungeachtet der Länge der Trainingssitzung etwa gleich bleibt.

  • Kurze Trainingssitzung: Der Roboter benötigt ein kurzes Gedächtnis (eine niedrigere Zahl), damit er sein Gedächtnis etwa 1.000 Mal aktualisieren kann.
  • Lange Trainingssitzung: Der Roboter benötigt ein langes Gedächtnis (eine höhere Zahl), damit er sein Gedächtnis immer noch etwa 1.000 Mal aktualisiert.

Die Lösung: Eine einfache Regel

Das Papier testete diese Idee bei 11 verschiedenen Aufgaben, vom Lehren eines Roboters, Bilder zu erkennen (wie Katzen und Autos), bis hin zum Lehren, Text zu schreiben (wie LLMs).

Sie entdeckten eine einfache „Goldene Regel":
Stellen Sie den Erinnerungs-Knopf so ein, dass der Roboter während des nützlichen Teils des Trainings sein Gedächtnis genau 1.000 Mal aktualisiert.

  • Wenn das Training kurz ist (z. B. 6.000 Schritte), wählt die Regel eine niedrigere Zahl (wie 0,82).
  • Wenn das Training lang ist (z. B. 40.000 Schritte), wählt die Regel eine höhere Zahl (wie 0,97).

Warum ist das wichtig? (Die Ergebnisse)

Die Autoren verglichen ihre „Aktualisierungsregel" mit der Standard-„Festen Regel" (bei der jeder einfach 0,944 verwendet).

  1. Durchschnittliche Leistung: Beide Methoden waren in Bezug auf den durchschnittlichen Erfolg sehr nah beieinander. Die Standard-Festzahl ist tatsächlich ziemlich gut.
  2. Das „Sicherheitsnetz" (Robustheit): Hier glänzt die neue Regel.
    • Stellen Sie sich vor, Sie fahren ein Auto. Die „Feste Regel" ist wie das Fahren mit einer Geschwindigkeit, die auf den meisten Straßen gut funktioniert, aber manchmal könnten Sie auf eine Schlagloch fahren und einen Unfall haben.
    • Die „Aktualisierungsregel" ist wie ein intelligentes Federungssystem. Es passt sich der Straßenlänge an.
    • Das Ergebnis: Die neue Regel reduzierte die „Schlimmstfall"-Ausfälle um 33 %. Mit anderen Worten: Sie machte das Training viel zuverlässiger. Sie stellte sicher, dass jedes einzelne Experiment (alle 11) fast perfekt performte, wohingegen die alte Methode bei einigen Experimenten erhebliche Schwierigkeiten hatte.

Das Fazit

Das Papier argumentiert, dass wir die Erinnerungseinstellung im KI-Training nicht als statische, unveränderliche Konstante behandeln sollten. Stattdessen sollten wir sie als Skala betrachten.

Genau wie Sie keinen Maßstab für eine Stadt und einen ganzen Land verwenden würden, sollten Sie keine gleiche Erinnerungseinstellung für einen kurzen Trainingslauf und einen langen verwenden. Indem wir das Gedächtnis basierend auf der Dauer des Trainings anpassen (wobei die „Aktualisierungszahl" bei 1.000 gehalten wird), machen wir den KI-Trainingsprozess robuster und weniger anfällig für unerwartete Ausfälle.

Kurz gesagt: Wählen Sie nicht einfach eine Zahl und hoffen Sie auf das Beste. Passen Sie das Gedächtnis des Roboters basierend auf der Länge der Reise an, und Sie erhalten eine viel sanftere Fahrt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →