Distributed Training using an Intelligent Network
Cet article propose un cadre de réseau intelligent pour l'entraînement distribué à travers des réseaux étendus qui combine le multicast et l'agrégation par FPGA en ligne avec des calendriers de synchronisation optimisés afin de surmonter les contraintes de bande passante et de latence, réduisant ainsi l'écart de performance avec l'entraînement colocaté.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les modèles d'intelligence artificielle les plus puissants au monde deviennent trop volumineux pour tenir dans un seul bâtiment. L'entraînement de ces systèmes nécessite des milliers d'ordinateurs travaillant ensemble, mais les limites physiques de puissance et d'espace signifient qu'aucun centre de données unique ne peut plus les contenir tous. Au lieu de cela, les chercheurs doivent répartir leur puissance de calcul sur plusieurs sites, parfois séparés par des océans. Cela crée un problème difficile : les ordinateurs doivent communiquer constamment entre eux pour rester synchronisés, mais l'envoi de quantités massives de données sur de longues distances est lent et coûteux. Les connexions entre ces sites distants sont souvent étroites et irrégulières, ce qui fait que les ordinateurs restent inactifs en attendant de recevoir l'information. Si les ordinateurs ne peuvent pas partager leur progression rapidement, l'ensemble du processus d'entraînement ralentit, gaspillant un temps et une énergie précieux.
Une équipe de chercheurs de la Fondation DoubleZero a proposé une nouvelle façon de résoudre ce goulot d'étranglement en transformant le réseau lui-même en un assistant actif. Au lieu de traiter la connexion internet comme un tuyau passif qui se contente de transporter des données, ils suggèrent d'utiliser du matériel spécialisé au sein du réseau pour gérer le flux d'informations. Leur approche combine deux technologies existantes de manière novatrice pour les connexions à grande échelle. Premièrement, ils utilisent une méthode appelée multidiffusion (multicast), qui permet à un seul ordinateur d'envoyer un message que le réseau copie et livre automatiquement à de nombreuses destinations différentes à la fois, plutôt que d'envoyer des copies distinctes à chacune d'elles. Deuxièmement, ils placent des puces programmables, connues sous le nom de FPGA, à la périphérie du réseau, près de chaque grappe (cluster) d'ordinateurs. Ces puces agissent comme des agrégateurs intelligents, rassemblant les flux de données entrants provenant de nombreuses sources différentes et les fusionnant en un flux unique et propre avant qu'ils n'atteignent les ordinateurs locaux. En effectuant le travail lourd de copie et de combinaison des données à l'intérieur du réseau, le système réduit la charge sur les connexions limitées entre les sites distants.
Pour que ce système fonctionne efficacement, les chercheurs ont également développé un nouveau cadre mathématique pour décider exactement comment et quand les ordinateurs doivent communiquer entre eux. Dans une configuration traditionnelle, chaque ordinateur pourrait essayer de parler à tous les autres en même temps, ce qui encombrerait le réseau. Le nouveau cadre traite le réseau comme une carte avec des routes spécifiques et des règles de circulation. Il calcule la meilleure façon de regrouper les ordinateurs en petits cercles de communication rotatifs. À chaque tour, un groupe spécifique d'ordinateurs échange des informations pendant que les autres attendent, puis les groupes changent lors du tour suivant. L'objectif est de trouver l'équilibre parfait entre le temps d'attente des ordinateurs et la quantité d'informations qu'ils partagent. Les chercheurs ont testé cette idée à l'aide d'une simulation basée sur un réseau réel et programmable qui s'étend sur neuf villes à travers trois continents. Ils ont modélisé les temps de trajet réels et les vitesses de connexion entre des villes comme Tokyo, New York et Londres pour voir comment différentes stratégies de regroupement se comporteraient.
Les simulations ont révélé que la meilleure stratégie dépend fortement des capacités du matériel. Lorsque les puces du réseau disposaient de très peu de mémoire, l'approche la plus efficace consistait à former de petits groupes de trois ordinateurs qui circulaient à travers différentes combinaisons. Cela permettait aux données de circuler rapidement sans submerger la capacité du système à conserver les informations. Cependant, lorsque les chercheurs ont doté les puces de plus de mémoire, la stratégie optimale a complètement changé. Avec suffisamment de mémoire pour gérer les délais dus aux voyages de longue distance, le système pouvait supporter une stratégie où chaque ordinateur parlait à tous les autres simultanément. Cette approche « tous vers tous » (all-to-all), auparavant impossible sur de longues distances, est devenue la méthode la plus rapide car elle permettait à l'information de se propager à tout le monde dans le laps de temps le plus court. L'étude a montré qu'en combinant ces technologies réseau intelligentes avec un calendrier qui s'adapte aux limites du matériel, il est possible de réduire l'écart entre l'entraînement d'ordinateurs répartis à travers le monde et ceux situés côte à côte dans une même pièce.
Les chercheurs soulignent que leur travail est actuellement une simulation basée sur un réseau vivant qui est encore en cours de construction. Bien que le réseau DoubleZero existe et transporte du trafic, il ne possède pas encore assez de grappes d'ordinateurs connectées pour entraîner un modèle massif lors d'un test en conditions réelles. Les résultats présentés sont une preuve de concept, démontrant que les gains théoriques sont réels et que la bonne combinaison de matériel réseau et de logique de planification peut surmonter les barrières traditionnelles de la distance. Les conclusions suggèrent que l'avenir de l'entraînement des modèles géants d'intelligence artificielle ne reposera pas seulement sur des ordinateurs plus rapides, mais sur des réseaux plus intelligents qui participent activement au processus d'apprentissage, transformant les vastes distances entre les centres de données d'une faiblesse en une partie gérable du système.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.