← Neueste Arbeiten
🤖 machine learning

Distributed Training using an Intelligent Network

Dieses Paper schlägt ein intelligentes Netzwerkframework für das verteilte Training über Wide Area Networks vor, das Multicast und In-Line-FPGA-Aggregation mit optimierten Synchronisationsplänen kombiniert, um Bandbreiten- und Latenzbeschränkungen zu überwinden und somit die Performance-Lücke zum lokal koppelten Training zu verringern.

Ursprüngliche Autoren: Nihar Shah, Ben Blier

Veröffentlicht 2026-08-28✓ Author reviewed
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Nihar Shah, Ben Blier

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die leistungsfähigsten künstlichen Intelligenzmodelle der Welt werden zu groß, um in ein einziges Gebäude zu passen. Das Training dieser Systeme erfordert Tausende von Computern, die zusammenarbeiten, aber die physischen Grenzen von Energie und Platz bedeuten, dass kein einzelnes Rechenzentrum sie alle mehr beherbergen kann. Stattdessen müssen Forscher ihre Rechenleistung über mehrere Standorte verteilen, die manchmal durch Ozeane getrennt sind. Dies schafft ein schwieriges Problem: Computer müssen ständig miteinander kommunizieren, um synchron zu bleiben, aber das Versenden massiver Datenmengen über lange Distanzen ist langsam und teuer. Die Verbindungen zwischen diesen entfernten Standorten sind oft schmal und ungleichmäßig, was dazu führt, dass die Computer untätig bleiben, während sie auf die Ankunft von Informationen warten. Wenn die Computer ihre Fortschritte nicht schnell teilen können, verlangsamt dies den gesamten Trainingsprozess und verschwendet wertvolle Zeit und Energie.

Ein Team von Forschern der DoubleZero Foundation hat einen neuen Weg vorgeschlagen, um diesen Engpass zu lösen, indem es das Netzwerk selbst in einen aktiven Helfer verwandelt. Anstatt die Internetverbindung als passives Rohr zu behandeln, das lediglich Daten transportiert, schlagen sie vor, spezialisierte Hardware innerhalb des Netzwerks zu nutzen, um den Informationsfluss zu steuern. Ihr Ansatz komble zwei bestehende Technologien auf neuartige Weise für Weitverkehrsverbindungen. Zuerst nutzen sie eine Methode namens Multicast, die es einem einzelnen Computer ermöglicht, eine Nachricht zu senden, die das Netzwerk automatisch kopiert und an viele verschiedene Ziele gleichzeitig liefert, anstatt separate Kopien für jedes Ziel zu senden. Zweitens platzieren sie programmierbare Chips, bekannt als FPGAs, am Rand des Netzwerks in der Nähe jedes Computer-Clusters. Diese Chips fungieren als intelligente Aggregatoren, die eingehende Datenströme aus vielen verschiedenen Quellen sammeln und sie in einen einzigen, sauberen Strom zusammenführen, bevor sie die lokalen Computer erreichen. Durch das Übernehmen der schweren Arbeit des Kopierens und Kombinierens von Daten innerhalb des Netzwerks reduziert das System die Belastung der begrenzten Verbindungen zwischen den entfernten Standorten.

Um dieses System effektiv zum Funktionieren zu bringen, haben die Forscher auch einen neuen mathematischen Rahmen entwickelt, um zu entscheiden, wie und wann die Computer miteinander kommunizieren sollten. In einem traditionellen Aufbau würde vielleicht jeder Computer gleichzeitig mit jedem anderen sprechen wollen, was das Netzwerk verstopfen würde. Der neue Rahmen behandelt das Netzwerk wie eine Landkarte mit spezifischen Straßen und Verkehrsregeln. Er berechnet den besten Weg, die Computer in kleine, rotierende Kommunikationskreise zu gruppieren. In jeder Runde tauscht eine bestimmte Gruppe von Computern Informationen aus, während andere warten, und in der nächsten Runde verschieben sich die Gruppen. Das Ziel ist es, das perfekte Gleichgewicht zwischen der Wartezeit der Computer und der Menge der geteilten Informationen zu finden. Die Forscher testeten diese Idee mithilfe einer Simulation, die auf einem realen, programmierbaren Netzwerk basiert, das neun Städte auf drei Kontinenten umfasst. Sie modellierten die tatsächlichen Reisezeiten und Verbindungsgeschwindigkeiten zwischen Städten wie Tokio, New York und London, um zu sehen, wie verschiedene Gruppierungsstrategien abschneiden würden.

Die Simulationen zeigten, dass die beste Strategie stark von den Fähigkeiten der Hardware abhängt. Als die Netzwerkchips über sehr wenig Speicher verfügten, war der effizienteste Ansatz, kleine Gruppen von drei Computern zu bilden, die durch verschiedene Kombinationen rotierten. Dies ermöglichte einen schnellen Datenfluss, ohne die Fähigkeit des Systems zur Informationsspeicherung zu überfordern. Als die Forscher den Chips jedoch mehr Speicher zur Verfügung stellten, änderte sich die optimale Strategie komplett. Mit genügend Speicher, um die Verzögerungen durch Langstreckenreisen abzufangen, konnte das System eine Strategie unterstützen, bei der jeder Computer gleichzeitig mit jedem anderen spricht. Dieser „All-to-All“-Ansatz, der über lange Distanzen zuvor unmöglich war, wurde zur schnellsten Methode, da er es ermöglichte, Informationen in der kürzesten Zeit an alle zu verbreiten. Die Studie zeigte, dass es durch die Kombination dieser smarten Netzwerktechnologien mit einem zur Hardware-Kapazität angepassten Zeitplan möglich ist, die Lücke zwischen Trainingscomputern, die über den Globus verteilt sind, und solchen, die nebeneinander im selben Raum stehen, zu schließen.

Die Forscher betonen, dass ihre Arbeit derzeit eine Simulation auf Basis eines Live-Netzwerks ist, das noch aufgebaut wird. Obwohl das DoubleZero-Netwerk existiert und Datenverkehr überträgt, verfügt es noch nicht über genügend verbundene Computer-Cluster, um einen massiven Modell-Test in der realen Welt durchzuführen. Die präsentierten Ergebnisse sind ein Proof of Concept, der zeigt, dass die theoretischen Gewinne real sind und dass die richtige Kombination aus Netzwerk-Hardware und Scheduling-Logik die traditionellen Barrieren der Distanz überwinden kann. Die Erkenntnisse legen nahe, dass die Zukunft des Trainings riesiger KI-Modelle nicht nur von schnelleren Computern abhängen wird, sondern von smarteren Netzwerken, die aktiv am Lernprozess teilnehmen und die großen Distanzen zwischen den Rechenzentren von einer Schwäche in einen steuerbaren Teil des Systems verwandeln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →