← Neueste Arbeiten
💻 computer science

Efficient Zeroth-Order Federated Finetuning of Language Models on Resource-Constrained Devices

Dieses Paper schlägt eine neuartige Zero-Order-Federated-Learning-Methode vor, die Modelle in Blöcke aufteilt und Störungen strategisch zuweist, um eine effiziente Wiederverwendung intermediärer Aktivierungen zu ermöglichen, wodurch eine 3-fache Reduzierung des Rechenaufwands für das Fine-Tuning großer Sprachmodelle auf ressourcenbeschränkten Geräten erreicht wird, während gleichzeitig die Speicher- und Kommunikationsvorteile von Federated Learning beibehalten werden.

Ursprüngliche Autoren: Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

Veröffentlicht 2026-06-19
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben ein riesiges, unglaublich intelligentes Robotergehirn (ein Large Language Model) und möchten ihm einen neuen Trick beibringen. Normalerweise benötigt man, um dieses Gehirn zu lehren, einen massiven Supercomputer mit enorm viel Speicher und viel Zeit. Aber was wäre, wenn Sie dieses Gehirn mit tausenden kleinen, schwachen Geräten wie Smartphones oder Smart-Home-Gadgets lehren wollten, ohne jemals deren private Daten an einen zentralen Computer zu senden? Dies nennt man Federated Learning (Föderiertes Lernen).

Das Problem ist, dass diese kleinen Geräte zu schwach sind, um die „Backpropagation“-Methode (die Standardmethode des KI-Lernens) zu bewältigen, die eine große Menge an temporären Daten erfordert. Wenn sie es versuchen, gehen ihnen die Ressourcen aus und sie stürzen ab.

Die alte Lösung: Zeroth-Order Optimization (ZO)

Um das Speicherproblem zu lösen, entwickelten Forscher eine Methode namens Zeroth-Order Optimization (ZO).

  • Die Analogie: Stellen Sie sich vor, Sie versuchen, den tiefsten Punkt in einem nebligen Tal zu finden (den besten Weg, um den Roboter zu lehren), ohne eine Landkarte zu sehen. Die alte Methode des Lehrens (Backpropagation) ist wie ein GPS, das Ihnen genau sagt, in welche Richtung es bergab geht. Die ZO-Methode ist wie das Tasten mit einem Stock. Man stochert in zufällige Richtungen, um zu fühlen, ob es bergauf oder bergab geht.
  • Der Haken: Um eine gute Vorstellung davon zu bekommen, in welche Richtung es bergab geht, muss man den Boden viele, viele Male in verschiedene Richtungen stochern. Während dies Speicher spart (da man keine GPS-Karte benötigt), ist es sehr langsam und rechenintensiv, weil man so oft stochert.

Die neue Lösung: FedSPZO

Die Autoren dieser Arbeit schlagen eine neue Methode namens FedSPZO (Federated Split-Perturbation Zeroth-Order Optimization) vor. Sie haben einen cleveren Weg gefunden, den „Stocher-Prozess“ viel schneller zu machen, ohne an Genauigkeit zu verlieren.

So haben sie es gemacht, unter Verwendung der Zwei-Stufen-Küchen-Analogie:

  1. Die Aufteilung der Küche: Stellen Sie sich das Robotergehirn als eine Küche mit zwei Abschnitten vor:

    • Abschnitt A (Die Vorbereitungsstation): Ein großer Bereich, in dem Zutaten gehackt und gemischt werden. Dies ist der „erste Block“ des Modells.
    • Abschnitt B (Der Ofen): Ein kleinerer Bereich, in dem das eigentliche Kochen stattfindet. Dies ist der „zweite Block“.
  2. Der alte Weg (Ineffizient): Um herauszufinden, wie man die gesamte Küche verbessern kann, würde die alte Methode die gesamte Küche (Vorbereitungsstation und Ofen) zufällig verändern und dann das Essen probieren. Dann würde sie die Küche wieder verändern, und wieder, und wieder. Da die Küche riesig ist, dauert es sehr lange, das Essen nach jeder winzigen Änderung zu probieren.

  3. Der FedSPZO-Weg (Effizient):

    • Schritt 1: Sie verändern nur die Vorbereitungsstation (Abschnitt A) ganz leicht. Den Ofen (Abschnitt B) lassen sie exakt gleich.
    • Schritt 2: Sie nehmen das Ergebnis der Vorbereitungsstation und lassen es viele, viele Male durch den Ofen laufen, wobei sie jedes Mal nur winzige zufällige Änderungen nur am Ofen vornehmen.
    • Die Magie: Da sich die Vorbereitungsstation nicht verändert hat, muss die Küche die Zutaten nicht jedes Mal neu „hacken“, wenn sie den Ofen testen. Sie können einfach die bereits gehackten Zutaten (Zwischenaktivierungen) wiederverwenden und sich nur darauf konzentrieren, den Ofen zu testen.
    • Das Ergebnis: Sie bekommen eine sehr genaue Vorstellung davon, wie man den Ofen (und die Vorbereitungsstation indirekt) verbessern kann, und das mit weit weniger einzelnen „Probier-Schritten“ als zuvor.

Was haben sie herausgefunden?

Die Forscher haben dies an mehreren berühmten KI-Modellen (wie RoBERTa, OPT und LLaMA) getestet und fanden heraus:

  • Geschwindigkeit: Ihre neue Methode war bis zu 3-mal schneller (im Sinne von Rechenoperationen) als andere ähnliche „Stocher-Methoden“.
  • Speicher: Sie verbraucht immer noch sehr wenig Speicher, was sie perfekt für kleine Geräte wie Telefone macht, genau wie die ursprüngliche „Stocher-Methode“.
  • Kommunikation: Sie sendet nur winzige Mengen an Daten an den zentralen Server zurück (nur Zahlen, nicht das ganze Gehirn), was ideal für langsame Internetverbindungen ist.
  • Genauigkeit: Der Roboter lernte die neuen Tricks fast so gut wie die standardmäßigen, schweren Methoden, mit nur einem minimalen Leistungsabfall.

Das Fazle Fazit

Betrachten Sie FedSPZO als eine kluge Art, einen riesigen Roboter mithilfe eines Schwarms kleiner, schwacher Geräte zu lehren. Anstatt von jedem Gerät zu verlangen, eine massive, speicherintensive Berechnung durchzuführen, teilen sie die Aufgabe in zwei Teile auf. Sie erledigen die schwere Arbeit einmal und nutzen diese Arbeit dann, um viele kleine Änderungen schnell zu testen. Dies ermöglicht es, leistungsstarke KI auf Geräten zu trainieren, die das normalerweise nicht bewältigen könnten, und spart Zeit, Akku und Daten.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →