How Much Regularization Survives Averaging? Update Masking in Federated Learning
Diese Arbeit zeigt, dass die durch Maskierung induzierte Regularisierung zwar im zentralisierten Training effektiv zur Förderung flacher Minima beiträgt, ihr Nutzen jedoch im föderierten Lernen aufgrund des Mittelungsprozesses stark gemindert wird, was den Ansatz für Nicht-IID-Szenarien unpraktikabel macht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der Welt der künstlichen Intelligenz gibt es eine hartnäckige Herausforderung, die als das „föderierte“ Problem bekannt ist. Stellen Sie sich eine Gruppe von Menschen vor, von denen jeder ein einziges Teil eines Puzzles besitzt und die gemeinsam ein einzelnes, vollständiges Bild erstellen wollen, ohne dabei jemals ihre individuellen Teile jemand anderem zeigen zu dürfen. So funktioniert modernes maschinelles Lernen oft: Ein zentraler Computer koordiniert viele verschiedene Geräte, wie etwa Telefone oder Sensoren, um eine gemeinsame Fähigkeit zu erlernen. Der Haken dabei ist, dass die Daten auf jedem Gerät selten identisch sind; ein Telefon besitzt vielleicht hauptsächlich Fotos von Katzen, während ein anderes nur Bilder von Autos enthält. Wenn der zentrale Computer versucht, das zu kombinieren, was alle gelernt haben, hat das resultierende Modell oft Schwierigkeiten, das Gesamtbild zu erfassen, und scheitert daran, gut auf neue Situationen zu generalisieren. Um dies zu beheben, suchen Forscher seit langem nach einem Weg, um „flache“ Lösungen in der mathematischen Landschaft des Lernens zu finden. Denken Sie an einen spitzen Gipfel im Vergleich zu einem weiten, flachen Plateau. Ein Modell, das auf einem spitzen Gipfel landet, funktioniert vielleicht perfekt für die spezifischen Daten, die es gesehen hat, wird aber sofort stolpern, wenn sich die Daten auch nur geringfügig ändern. Ein Modell, das sich auf einem weiten, flachen Plateau niederlässt, ist robuster; es kann kleine Variationen in den Daten verkraften, ohne auseinanderzufallen.
Jahrelang haben Wissenschaftler versucht, diese Modelle dazu zu zwingen, jene flachen Plateaus zu finden, indem sie Rauschen hinzufügten oder kleine, bewusste Fehler während des Lernprozesses einbauten. Dieses Rauschen wirkt wie ein sanftes Schütteln, das verhindert, dass das Modell in einem engen, fragilen Punkt stecken bleibt. Kürzlich wurde eine spezifische Technik namens „Update Masking“ im zentralisierten Training populär, bei dem ein einziger Computer die gesamte Arbeit erledigt. Bei dieser Methode werden Teile der Lernanweisungen zufällig verworfen und der Rest neu skaliert, was effektiv eine hilfreiche Art von Rauschen hinzufügt, das das Modell in Richtung jener stabilen, flachen Bereiche drängt. Als Forscher jedoch versuchten, diese Technik in das föderierte Setting zu übertragen – wo viele verschiedene Geräte separat lernen und dann ihre Ergebnisse kombinieren –, schien sie zu verschwinden. Die Frage, die ein Team von Forschern der Sophia University und der Shendian Energy Co., Ltd. zu beantworten versuchte, war simpel: Wo ist dieses hilfreiche Rauschen geblieben, und konnte es zurückgewonnen werden?
Die Forscher entdeckten, dass das Rauschen nicht verschwunden war; es wurde lediglich durch den Prozess der Zusammenführung der Ergebnisse verdünnt. In ihrem Versuchsaufbau hatten sie einhundert verschiedene Geräte oder „Clients“, von denen jeder auf seinem eigenen Datenstück lernte. In einem Standardansatz würde jedes Gerät zufällig entscheiden, welche Teile seiner Lernanweisungen es behält und welche es verwirft, wobei es sein eigenes, einzigartiges Muster an Entscheidungen verwendet. Wenn der zentrale Server diese Updates sammelte und zusammen durchschnitt, hoben sich die zufälligen Entscheidungen der einzelnen Geräte gegenseitig auf. Es war, als würden zehn Menschen versuchen, ein schweres Objekt in leicht unterschiedliche, zufällige Richtungen zu drücken; das Nettoergebnis war, dass sich das Objekt kaum bewegte. Die mathematische Strafe, die ein Modell normalerweise dazu zwingt, robust zu sein, wurde durch einen Faktor abgeschwächt, der der Anzahl der Geräte in der Gruppe entspricht. Bei zehn Geräten wurde der hilfreiche Effekt auf ein Zehntel seiner ursprünglichen Stärke reduziert, was das Modell mit fast keinem Schutz gegen Überanpassung zurückließ.
Das Team testete daraufhin eine andere Strategie: Was wäre, wenn jedes Gerät exakt dasselbe Muster an Entscheidungen verwenden würde? Wenn alle zehn Menschen das Objekt in dieselbe zufällige Richtung drücken würden, bliebe der Effekt erhalten. Die Forscher fanden heraus, dass die Synchronisierung dieser Entscheidungen das schützende Rauschen tatsächlich wiederherstellte, jedoch mit einer wichtigen Einschränkung. Die Stärke des wiederhergestellten Rauschens hing vollständig davon ab, wie sehr die Geräte untereinander übereinstimmten. Wenn die Geräte von sehr unterschiedlichen Daten lernten und ihre Updates in entgegengesetzte Richtungen zeigten, wurde das synchronisierte Rauschen ineffektiv oder sogar schädlich. Das Maß für diese Übereinstimmung wird als „Gradienten-Diversität“ bezeichnet, ein Konzept, das im Wesentlichen zählt, wie stark sich die individuellen Bemühungen der Geräte überschneiden. Wenn die Geräte in Harmonie sind, kehrt das Rauschen mit voller Kraft zurück. Wenn sie im Konflikt stehen, wird das Rauschen abgeschwächt oder geht ganz verloren.
Um zu verstehen, warum dies in der Praxis geschah, führten die Forscher umfangreiche Experimente mit einem Standard-Bilddatensatz namens CIFAR-10 durch, der auf einhundert simulierte Clients aufgeteilt war. Sie maßen genau, wie viel des schützenden Rauschens unter verschiedenen Bedingungen den Durchschnittsprozess überlebte. Sie fanden heraus, dass in der häufigsten Konfiguration, in der Geräte in kleinen Batches (Datenpaketen) lernen, die Überlebensrate des Rauschens erschreckend niedrig war. Von einer möglichen maximalen Stärke von zehn erreichte das Rauschen, das tatsächlich das endgültige Modell erreichte, nur etwa 1,19. Dieser winzige Bruchteil bedeutete, dass das Modell kaum robuster war, als wenn gar kein Rauschen hinzugefügt worden wäre. Die Forscher führten dieses Scheitern auf das zufällige Sampling der Daten zurück, das bei jedem Schritt des Standardlernens stattfindet. Das durch das Auswählen kleiner Batches von Bildern eingeführte Rauschen überlagerte das spezifische, hilfreiche Rauschen der Masking-Technik und überdeckte es vollständig.
Das Team untersuchte auch, ob die Unterschiede in den Daten selbst – die Tatsache, dass einige Geräte mehr Katzen und andere mehr Autos hatten – der Schuldige war. Sie variierten die Datenverteilung, um sie extrem ungleichmäßig zu gestalten, wobei einige Geräte hundertmal mehr Daten besaßen als andere. Überraschenderweise hatte dieser extreme Unterschied kaum Auswirkungen auf die Überlebensrate des Rauschens. Ob die Daten nahezu identisch oder völlig verschieden waren, die Überlebensrate blieb konstant zwischen 1,17 und 1,50. Die wahre Barriere war nicht die Diversität der Daten, sondern die Methode des Lernens. Als die Forscher das Small-Batch-Sampling ausschalteten und jedes Gerät sein gesamtes Datenkollektion in einem Durchgang lernen ließ, sprang die Überlebensrate dramatisch auf 8,96. Dies bewies, dass das zufällige Rauschen der kleinen Batches der primäre Grund war, warum die Technik im föderierten Setting versagte.
Die Studie schloss jedoch mit einer ernüchternden Realitätsprüfung ab. Zwar ist es mathematisch möglich, die volle Stärke des schützenden Rauschens durch die Verwendung großer, vollständiger Daten-Batches und synchronisierter Entscheidungen zurückzugewinnen, doch dies geht mit einem enormen Preis für die tatsächliche Leistung des Modells einher. Die Konfigurationen, die es dem Rauschen ermöglichten zu überleben, waren dieselben, die die schlechtesten Lernergebnisse produzierten, wobei die Testgenauigkeit signifikant sank. In den Experimenten waren die leistungsstärksten Modelle, die kleine Batches verwendeten, fast ohne schützendes Rauschen, während die Modelle mit dem meisten Rauschen zu ungenau waren, um nützlich zu sein. Die Forscher fanden keinen Mittelweg, auf dem das Rauschen bewahrt werden konnte, ohne die Fähigkeit des Modells zu lernen zu opfern.
Letztendlich zeigt das Paper, dass das Scheitern von Update Masking in der föderierten Lernumgebung kein Versehen oder ein Bug ist, sondern eine fundamentale Folge der Funktionsweise des Systems. Der Mechanismus, der es vielen Geräten ermöglicht, gemeinsam zu lernen – das Mitteln ihrer Updates –, wäscht gleichzeitig die spezifische Art von Rauschen weg, auf die Update Masking angewiesen ist. Die Forscher zeigten, dass es zwar möglich ist, das Rauschen durch die Synchronisierung der Geräte zum Überleben zu zwingen, die dafür erforderlichen Bedingungen jedoch mit den praktischen Anforderungen an ein nützliches Modell unvereinbar sind. Der schützende Effekt, der in einem einzelnen Computer so gut funktioniert, lässt sich einfach nicht auf ein Netzwerk aus vielen Geräten übertragen, es sei denn, man ist bereit, ein Modell zu akzeptieren, das sehr schlecht lernt. Die Studie hinterlässt dem Fachgebiet ein klares Verständnis der Grenzen dieser Technik und legt nahe, dass zukünftige Lösungen anders ansetzen müssen, um föderierten Modellen dabei zu helfen, jene stabilen, flachen Plateaus zu finden.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.