← Neueste Arbeiten
🤖 machine learning

On Adaptivity in Zeroth-Order Optimization

Dieser Artikel zeigt, dass standardadaptive zeroth-order-Optimierer wie ZO-Adam für speicherbeschränktes Fine-Tuning von LLMs aufgrund fehlender koordinatenweiser Gradientenheterogenität in hohen Dimensionen keinen Konvergenzvorteil gegenüber ZO-SGD bieten, was zur Vorstellung von MEAZO führt, einer speichereffizienten Alternative, die nur einen einzigen Skalar zur Anpassung der globalen Schrittweite verfolgt und dabei die Leistung beibehält sowie die Robustheit verbessert.

Ursprüngliche Autoren: Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser, Christos Louizos

Veröffentlicht 2026-05-06
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hassan Dbouk, Nidham Gazagnadou, Matthias Reisser, Christos Louizos

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Ein riesiges Radio ohne Handbuch abstimmen

Stellen Sie sich vor, Sie haben ein massives, komplexes Radio mit Millionen von Knöpfen (diese sind die „Parameter" eines Large Language Models, oder LLM). Sie möchten es so abstimmen, dass es ein bestimmtes Lied perfekt wiedergibt (Feinabstimmung des Modells).

Normalerweise benötigen Sie zum Abstimmen eines Radios ein Handbuch, das Ihnen genau sagt, in welche Richtung Sie jeden Knopf drehen und wie viel. In der KI heißt dieses Handbuch Gradient. Die Berechnung dieses Handbuchs erfordert viel Speicherplatz und Rechenleistung, was teuer und langsam ist.

Zeroth-Order (ZO) Optimization ist ein cleverer Trick: Anstatt das Handbuch zu lesen, schieben Sie die Knöpfe einfach zufällig, hören das Ergebnis und prüfen, ob die Musik besser oder schlechter geworden ist. Sie tun dies, indem Sie die Knöpfe vorwärts und rückwärts drücken, um die Richtung zu erraten. Es ist viel sparsamer im Speicher, aber es ist „verrauscht", weil Sie raten.

Das Problem: Der „überdimensionierte" Kompass

Lange Zeit dachten Forscher, dass Sie wegen dieses Ratespiels, das verrauscht ist, einen superintelligenten, speicherhungrigen Kompass benötigen, der Ihnen hilft. Das ist es, was adaptive Optimierer (wie ZO-Adam) tun. Sie versuchen, die Geschichte jedes einzelnen Knopfes zu merken, um zu entscheiden, wie schnell er gedreht werden soll. Sie führen für jeden einzelnen der Millionen Knöpfe ein separates „Speicherprotokoll".

Die große Entdeckung des Papiers:
Die Autoren stellten fest, dass in hochdimensionalen Umgebungen (wie bei riesigen KI-Modellen) dieser superintelligente Kompass tatsächlich nutzlos ist.

  • Die Analogie: Stellen Sie sich vor, Sie befinden sich in einem nebligen Feld und versuchen, den Boden eines Tals zu finden.
    • First-Order (Standard-KI): Sie haben eine klare Karte, die zeigt, dass das Gelände steil nach links abfällt, aber nach rechts flach ist. Sie benötigen für jede Richtung eine andere Strategie.
    • Zeroth-Order (Das Ratespiel): Da Sie in einem riesigen, nebligen Raum durch zufälliges Schieben raten, ist das „Rauschen" Ihrer Schätzung so laut, dass es die spezifischen Details des Geländes übertönt. Das Signal sieht in jede Richtung gleich aus. Es ist, als wäre der Nebel so dicht, dass der Boden überall perfekt flach und einheitlich aussieht.
  • Das Ergebnis: Da das „Gelände" in jede Richtung gleich aussieht, ist die Führung eines separaten Speicherprotokolls für jeden einzelnen Knopf eine Verschwendung von Zeit und Speicher. Die ausgefeilten „adaptiven" Methoden (ZO-Adam) helfen Ihnen tatsächlich nicht schneller ans Talende zu kommen als eine einfache Methode (ZO-SGD). Tatsächlich machen sie Ihren Rucksack nur schwerer.

Die Lösung: MEAZO (Der minimalistische Kompass)

Da der ausgefeilte Kompass unnötig ist, entwickelten die Autoren ein neues Werkzeug namens MEAZO.

  • Wie es funktioniert: Anstatt Millionen einzelner Protokolle für jeden Knopf zu verfolgen, verfolgt MEAZO nur eine einzige Zahl für die gesamte Gruppe. Es fragt: „Wie stark hat sich die Musik im Durchschnitt verändert, als wir alles geschoben haben?"
  • Der Vorteil: Es behält den „intelligenten" Teil der adaptiven Methode (Anpassung der Schubbewegungsgeschwindigkeit basierend darauf, wie rau sich das Gelände anfühlt), wirft aber das schwere Gepäck weg.
  • Die Analogie: Stellen Sie sich vor, Sie wandern.
    • ZO-Adam: Sie tragen ein GPS, ein Barometer, einen Kompass und eine detaillierte Karte für jeden einzelnen Schritt, den Sie tun. Es ist schwer, und Sie werden müde.
    • ZO-SGD: Sie gehen einfach vorwärts. Es ist leicht, aber wenn der Weg felsig wird, könnten Sie stolpern.
    • MEAZO: Sie tragen einen einfachen Schrittzähler, der die durchschnittliche Steigung des Weges angibt. Wenn der Weg felsig wird, verlangsamen Sie sich. Wenn er glatt ist, beschleunigen Sie. Sie brauchen keine Karte für jeden Felsen; Sie müssen nur die allgemeine Stimmung des Pfades kennen.

Was die Experimente zeigten

Das Team testete dies an echten Large Language Models (wie Llama und Qwen) und synthetischen mathematischen Problemen.

  1. Leistung: Wenn sie die Einstellungen korrekt abstimmen, schnitt die einfache Methode (ZO-SGD) genauso gut ab wie die ausgefeilte Methode (ZO-Adam).
  2. Speicher: MEAZO verwendete die gleiche winzige Speichermenge wie die einfache Methode, während die ausgefeilte Methode viel mehr benötigte.
  3. Robustheit (Das „Sicherheitsnetz"): Dies ist die wichtigste Erkenntnis. Während die einfache Methode hervorragend funktioniert, wenn Sie die perfekte Gehgeschwindigkeit wählen, versagt sie, wenn Sie eine Geschwindigkeit wählen, die zu schnell oder zu langsam ist. Die ausgefeilten Methoden (und MEAZO) sind viel verzeihender. Wenn Sie eine „schlechte" Geschwindigkeit wählen, bringt Sie MEAZO dennoch ohne Absturz ans Ziel. Es ist wie ein Auto mit Tempomat, der sich automatisch an Hügel anpasst, während das einfache Auto einfach mit konstanter Geschwindigkeit weiterfährt und möglicherweise gegen eine Unebenheit kracht.

Zusammenfassung

  • Der Mythos: „Wir benötigen komplexe, speicherintensive adaptive Werkzeuge, damit das Zeroth-Order-KI-Training gut funktioniert."
  • Die Realität: In hochdimensionalen KI-Modellen lässt das Rauschen das Gelände einheitlich erscheinen, sodass komplexe Werkzeuge eine Verschwendung von Speicher sind.
  • Die Lösung: MEAZO ist ein neues Werkzeug, das nur eine globale Zahl statt Millionen verfolgt. Es verwendet sehr wenig Speicher (wie die einfache Methode), ist aber viel stabiler und verzeihender bei den Einstellungen (wie die komplexe Methode).

Dies ermöglicht es Forschern, riesige KI-Modelle auf Geräten mit begrenztem Speicher (wie Edge-Geräten) feinabzustimmen, ohne Supercomputer zu benötigen, während sie dennoch stabile, hochwertige Ergebnisse erzielen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →