Can Model Merging Improve Aggregation in DiLoCo?
Cet article comble le fossé entre la fusion de modèles et l'apprentissage distribué en démontrant que l'adaptation de la technique de fusion Iso-C avec le momentum de Nesterov (IsoLoCo) surpasse considérablement les méthodes DiLoCo existantes dans l'entraînement distribué à faible communication, particulièrement à mesure que le nombre de travailleurs locaux augmente.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'entraîner un cerveau d'IA géant et super intelligent. Pour ce faire, vous avez besoin d'une puissance de calcul massive. Habituellement, les entreprises utilisent une approche de « parallélisme de données » : elles alignent des centaines d'ordinateurs côte à côte, travaillant tous exactement sur la même tâche au même moment, s'échangeant constamment des mises à jour. C'est rapide, mais cela nécessite des câbles coûteux et à haute vitesse reliant chaque ordinateur. Si un ordinateur est lent ou si le câble est faible, toute la ligne doit attendre.
Le Problème : L'approche par « Îles »
Pour économiser de l'argent et utiliser des connexions plus faibles, des chercheurs ont développé une méthode appelée DiLoCo. Imaginez qu'au lieu d'une seule ligne, vous ayez de nombreuses « îles » d'ordinateurs distinctes.
- Chaque île entraîne sa propre version du cerveau de l'IA de manière indépendante pendant un certain temps (disons 30 étapes).
- Elles ne communiquent pas pendant ces 30 étapes.
- Après 30 étapes, elles envoient un résumé de ce qu'elles ont appris (un « pseudo-gradient ») à un hub central.
- Le hub fait la moyenne de ces résumés et met à jour le cerveau principal.
Le Bug :
L'article a découvert une faille dans cette approche par « Îles » : à mesure que vous ajoutez des îles (travailleurs) ou que vous laissez ces dernières s'entraîner plus longtemps avant de communiquer, l'IA commence à s'embrouiller. C'est comme un groupe de personnes essayant de dessiner un tableau ensemble sans se parler : si elles travaillent trop longtemps seules, elles commencent à dessiner des choses différentes, et lorsqu'elles essaient de combiner leur travail, le résultat est désordonné. En termes techniques, les « mises à jour » des différentes îles commencent à entrer en conflit les unes avec les autres, dégradant les performances de l'IA.
L'Inspiration : Fusionner des Modèles Experts
Séparément, un autre groupe de chercheurs travaillait sur la Fusion de Modèles (Model Merging). Imaginez que vous avez un chef expert qui a appris la cuisine italienne et un autre qui a appris la cuisine japonaise. Vous voulez un seul chef capable de faire les deux.
- L'ancienne méthode : Il suffit de faire la moyenne de leurs recettes. Cela échoue souvent car les ingrédients s'entrechoquent (par exemple, mélanger de la sauce soja et de la crème épaisse).
- La nouvelle méthode (Arithmétique des Tâches) : Au lieu de faire la moyenne de toute la recette, vous regardez la différence entre la recette finale de l'expert et la recette de base originale. Vous combinez ensuite soigneusement seulement ces différences.
Le grand moment de révélation (« Aha! ») de l'article fut de réaliser que DiLoCo fait en réalité la même chose que la Fusion de Modèles, mais en boucle.
- Le « Modèle de Base » est le cerveau de l'IA de la dernière fois que tout le monde s'est parlé.
- Les « Îles » sont les experts qui se sont entraînés seuls.
- Les « Mises à jour » qu'elles renvoient sont les « différences » (ou vecteurs de tâches).
L'article soutient que la raison pour laquelle DiLoCo devient désordonné avec de nombreuses îles est la même que la raison pour laquelle la fusion de recettes devient désordonnée : l'Interférence. Les mises à jour de différentes îles se battent entre elles.
La Solution : IsoLoCo
Les auteurs ont décidé d'emprunter la « meilleure recette » du monde de la Fusion de Modèles pour corriger DiLoCo. Ils ont testé plusieurs techniques de fusion et ont découvert que l'une d'entre elles, appelée Iso-C (fusion isotrope), fonctionnait le mieux.
Considérez Iso-C comme un « harmoniseur » pour les mises à jour. Lorsque les îles renvoient leurs mises à jour :
- L'harmoniseur examine la « forme » des mises à jour.
- Si une île crie trop fort dans une direction spécifique (une direction mathématique spécifique), l'harmoniseur baisse son volume pour correspondre à la moyenne.
- Cela empêche une seule île de dominer ou de heurter les autres, créant une mise à jour combinée plus fluide et plus équilibrée.
Ils ont pris cet « harmoniseur » et y ont ajouté une fonctionnalité de « momentum » (comme un coureur qui maintient sa vitesse même quand la route devient accidentée) pour créer une nouvelle méthode qu'ils appellent IsoLoCo.
Les Résultats
L'article a testé cette méthode sur différentes tailles de modèles d'IA et avec différents nombres d'îles (de 1 à 128).
- Le Gagnant : IsoLoCo a systématiquement battu la méthode DiLoCo originale.
- L'Écart : Plus vous ajoutiez d'îles, plus l'avantage d'IsoLoCo était grand. Avec 128 îles, la méthode originale devenait très désordonnée, mais IsoLoCo restait propre et efficace.
- La Vitesse : Ils ont également créé un « mode rapide » pour IsoLoCo en utilisant un raccourci mathématique (itérations de Newton-Schulz) qui rend le processus beaucoup plus rapide sans perdre en qualité.
En Résumé
L'article démontre qu'en traitant l'entraînement distribué de l'IA comme un problème de « fusion d'experts », nous pouvons utiliser des astuces mathématiques avancées pour empêcher les ordinateurs de se battre entre eux. Cela nous permet d'entraîner des modèles d'IA massifs sur de nombreux ordinateurs faiblement connectés sans perdre de performance, rendant l'entraînement de l'IA à grande échelle moins coûteux et plus évolutif.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.