Escaping Low-Dimensional Overlap: Multi-Task Model Merging via High-Dimensional Sparse Disentanglement
Ce document propose un nouveau cadre de fusion de modèles qui exploite des auto-encodeurs creux pour projeter les vecteurs de tâches dans un espace de caractéristiques creuses de haute dimension afin de permettre un désenchevêtrement efficace des caractéristiques interférentes, combiné à un optimiseur d'ordre zéro par groupe de rang léger pour une fusion de couches sélective, surpassant ainsi de manière significative les bases de référence existantes à travers diverses tâches.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde en évolution rapide de l'intelligence artificielle, les chercheurs tentent constamment de construire des machines capables de faire plusieurs choses à la fois. Imaginez un étudiant qui a passé des années à maîtriser les mathématiques, un autre qui est devenu un génie du codage, et un troisième qui est un expert dans le suivi d'instructions complexes. Par le passé, pour utiliser toutes ces compétences, un ordinateur aurait eu besoin d'exécuter trois programmes distincts, chacun dédié à un sujet. C'est inefficace, car cela nécessite une quantité massive de mémoire informatique et d'énergie. Une solution plus élégante consiste à combiner ces experts séparés en un seul modèle polyvalent. Ce processus, connu sous le nom de fusion de modèles (model merging), tente de mélanger la « connaissance » de différents programmes spécialisés en un cerveau unifié sans avoir à le réentraîner à partir de zéro. Cependant, ce mélange est notoirement difficile. Lorsque vous mélangez deux ensembles d'instructions distincts, ils entrent souvent en conflit. L'ordinateur s'embrouille, et le modèle résultant performe mal sur toutes les tâches, comme si les différentes compétences se disputaient le même espace dans la mémoire de la machine.
Le cœur de ce problème réside dans la manière dont ces cerveaux artificiels stockent l'information. À l'intérieur d'un réseau de neurones, différentes compétences partagent souvent les mêmes voies physiques, un phénomène que les chercheurs appellent la superposition. C'est comme si plusieurs idées distinctes essayaient d'occuper le même couloir étroit en même temps. Lorsque les chercheurs tentent simplement d'ajouter les poids de deux modèles, ces idées qui se chevauchent interfèrent les unes avec les autres, créant un fouillis où l'information utile est perdue. Les tentatives précédentes pour corriger cela consistaient à essayer de démêler le désordre au sein de l'espace encombré d'origine, souvent en coupant certaines parties du modèle ou en redimensionnant les nombres. Mais lorsque l'interférence est sévère, ces méthodes reviennent à essayer de trier un tas de fils emmêlés en ne regardant que les nœuds ; elles ne peuvent pas séparer complètement les brins individuels sans endommager le circuit.
Une équipe de chercheurs a proposé une nouvelle façon de résoudre ce problème en changeant totalement de perspective. Au lieu d'essayer de démêler les fils dans le couloir encombré, ils suggèrent de déplacer les fils dans une pièce beaucoup plus grande et vide, où il y a assez d'espace pour les disposer séparément. Ils appellent cette approche la Fusion par Désenchevêtrement Creux de Haute Dimension (High-Dimensional Sparse Disentanglement Merging). Les chercheurs ont utilisé un outil appelé Autoencodeur Creux (Sparse Autoencoder), qui agit comme un traducteur. Il prend les instructions emmêlées d'une tâche spécifique et les convertit en une longue liste de caractéristiques simples et distinctes. Comme cette nouvelle liste est beaucoup plus longue que l'ensemble des instructions d'origine, chaque caractéristique obtient son propre espace dédié, permettant à l'ordinateur de voir exactement quelles parties de la connaissance appartiennent aux mathématiques, lesquelles au codage, et lesquelles au suivi d'instructions. Une fois que l'information est séparée dans cette pièce spacieuse et de haute dimension, les chercheurs peuvent combiner soigneusement les parties pertinentes sans que les différentes compétences ne se marchent sur les pieds. Une fois la combinaison terminée, le traducteur reconvertit la liste propre et séparée dans le format d'origine afin que le modèle puisse l'utiliser.
Cependant, traduire chaque couche d'un modèle massif dans ce nouveau format serait incroyablement lent et coûteux. Pour résoudre cela, les chercheurs ont introduit une méthode de sélection intelligente appelée Optimiseur de Zéro-Ordre à Classement par Groupe (Group-Ranked Zeroth-Order Optimizer). Cet outil agit comme un éclaireur, testant rapidement quelles parties du modèle sont les plus critiques pour une tâche spécifique. Il y parvient en effectuant de minuscules ajustements aléatoires sur différentes sections du modèle et en observant à quel point la performance change, sans avoir besoin de calculer des gradients complexes. En identifiant uniquement les couches les plus importantes, le système applique le processus coûteux de traduction et de séparation uniquement là où il est véritablement nécessaire, laissant le reste du modèle être fusionné à l'aide de méthodes plus simples et plus rapides. Cela garantit que le système reste efficace tout en bénéficiant des avantages d'une séparation profonde.
Les chercheurs ont testé ce nouveau cadre en utilisant la série de modèles de langage Qwen2.5, qui sont des systèmes d'intelligence artificielle puissants. Ils ont créé des modèles experts pour des tâches telles que le raisonnement mathématique, la génération de code et le suivi d'instructions complexes. Lorsqu'ils fusionnaient ces experts à l'aide de méthodes traditionnelles, les résultats étaient souvent décevants, la performance chutant considérablement sur les tâches difficiles. En revanche, leur nouvelle méthode surpasse systématiquement les techniques existantes. Sur un modèle de 7 milliards de paramètres, leur approche a obtenu un score moyen de 68,49 pour les tâches de mathématiques, de codage et de suivi d'instructions, battant nettement la meilleure méthode précédente. L'amélioration est encore plus spectaculaire dans les scénarios de conflit intense. Lorsqu'ils ont tenté de fusionner quatre tâches différentes, incluant l'alignement de sécurité, sur un modèle plus petit de 1,5 milliard de paramètres, les méthodes traditionnelles ont vu leurs scores moyens s'effondrer jusqu'à 15,45. La nouvelle méthode a maintenu un score de 36,48, préservant efficacement la capacité du modèle à faire des mathématiques et du code tout en respectant des directives de sécurité strictes.
L'étude suggère que la clé d'une fusion de modèles réussie ne réside pas seulement dans la manière dont nous mélangeons les nombres, mais dans l'endroit où nous les mélangeons. En projetant l'information des tâches dans un espace de dimension supérieure où les caractéristiques peuvent être clairement distinguées, les chercheurs ont pu réduire l'interférence qui affecte habituellement ces systèmes. Ils ont constaté que leur autoencodeur amélioré, qui utilise une technique spécifique pour maintenir les caractéristiques les plus importantes actives tout en ignorant les autres, était crucial pour ce succès. De plus, leur outil de sélection de couches a prouvé qu'il n'est pas nécessaire d'appliquer cette séparation complexe à chaque partie du modèle ; se concentrer sur les couches critiques suffisait pour capturer les bénéfices. Les résultats indiquent que cette approche offre un moyen robuste de construire des modèles généralistes capables de gérer de multiples tâches conflictuelles sans nécessiter de données d'entraînement supplémentaires ou de réentraînement coûteux. Bien que la méthode nécessite un certain effort de calcul initial pour mettre en place les outils de traduction, la récompense est un modèle qui conserve bien mieux ses compétences spécialisées que ceux créés avec les anciennes techniques. Ce travail offre une voie concrète vers la création de systèmes d'intelligence artificielle plus capables et plus polyvalents, capables de naviguer dans le paysage complexe de multiples tâches humaines sans perdre leur chemin.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.