← Derniers articles
🤖 machine learning

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

L'article propose SAME, un cadre de mélange d'experts stabilisé pour l'ajustement d'instructions multimodales en continu qui atténue la dérive des routeurs et des experts grâce à un routage par sous-espace orthogonal, une mise à l'échelle sensible à la courbure et une activation adaptative des experts, atteignant des performances de pointe sur un nouveau benchmark de séquences longues.

Auteurs originaux : Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

Publié 2026-08-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un étudiant qui est brillant pour résoudre des problèmes de mathématiques mais qui, lorsqu'on lui demande de lire un poème, oublie soudainement comment compter. C'est le défi central auquel sont confrontés les systèmes d'intelligence artificielle modernes connus sous le nom de modèles de langage multimodaux de grande taille. Ce sont des ordinateurs puissants capables de voir des images et de lire du texte, apprenant à répondre à des questions sur le monde en étudiant de vastes quantités de données. Ils sont entraînés pour suivre des instructions, comme « décris le chat sur la photo » ou « résous ce problème de physique ». Cependant, dans le monde réel, ces systèmes n'apprennent pas tout en même temps. Au lieu de cela, ils rencontrent de nouveaux types de tâches les uns après les autres, comme un étudiant passant d'un cours de mathématiques à un cours d'histoire, puis à un cours d'art. Le problème est qu'à mesure que ces modèles acquièrent de nouvelles compétences, ils oublient souvent les anciennes, un phénomène que les scientifiques appellent l'oubli catastrophique. Pour que ces modèles restent utiles, les chercheurs doivent trouver un moyen de leur enseigner de nouvelles choses sans effacer ce qu'ils savent déjà.

Pendant un certain temps, des experts ont tenté de résoudre ce problème en donnant au modèle une équipe d'assistants spécialisés, une structure connue sous le nom de mélange d'experts. Considérez le modèle comme un grand bureau où différents travailleurs, ou « experts », s'occupent de différents types de tâches. Lorsqu'une question arrive, un gestionnaire, appelé routeur, décide quel travailleur est le mieux adapté pour y répondre. Si la question porte sur un graphique, le routeur l'envoie à l'analyste de données ; s'il s'agit d'un poème, elle va à l'écrivain. Ce système fonctionne bien lorsque les tâches sont stables, mais les chercheurs ont découvert une faille lorsque le modèle devait apprendre une longue séquence de nouvelles tâches. À mesure que le modèle apprenait de nouvelles compétences, le gestionnaire commençait à faire des erreurs, envoyant d'anciens types de questions aux mauvais travailleurs. Simultanément, les travailleurs eux-mêmes commençaient à changer, perdant les compétences spécifiques qu'ils avaient développées pour les tâches précédentes. Ce double échec signifiait que le modèle ne se contentait pas d'envoyer les questions aux mauvaises personnes, mais oubliait également comment effectuer les tâches que ces personnes étaient censées accomplir.

Une équipe de chercheurs a maintenant proposé une nouvelle méthode appelée SAME pour corriger ces problèmes. Ils ont découvert que la confusion du gestionnaire et la perte de mémoire des travailleurs étaient deux problèmes distincts nécessitant des solutions différentes. Pour empêcher le gestionnaire de se confondre, les chercheurs ont conçu un système qui suit attentivement la façon dont le modèle perçoit le monde. Au lieu de laisser le gestionnaire changer totalement d'avis à chaque nouvelle leçon, ils restreignent la capacité de son attention à varier. Ils permettent au gestionnaire d'apprendre de nouvelles façons de trier les questions, mais protègent les anciennes méthodes de tri qui étaient essentielles pour les tâches précédentes. Cela garantit qu'une question sur une image médicale, par exemple, continue d'être envoyée à l'expert médical, même après que le modèle a appris à lire des cartes ou à résoudre des problèmes de chimie.

Pour empêcher les travailleurs d'oublier leurs tâches, les chercheurs ont introduit un moyen de mesurer à quel point l'apprentissage d'une nouvelle compétence pourrait nuire à leurs anciennes compétences. Ils ont examiné les types de données que les travailleurs avaient vus par le passé et ont utilisé cet historique pour ralentir les changements qui pourraient endommager ces anciennes compétences. C'est comme dire à un travailleur : « Tu peux apprendre cette nouvelle compétence, mais fais-le d'une manière qui n'efface pas la façon dont tu réparais les anciennes machines. » En faisant cela, le modèle préserve les capacités spécifiques acquises lors des tâches antérieures tout en étant capable de s'adapter à de nouvelles tâches. De plus, les chercheurs ont découvert que tous les travailleurs n'ont pas besoin d'être actifs pour chaque leçon. Ils ont créé une règle pour mettre temporairement en pause les travailleurs qui ne sont pas nécessaires pour la tâche actuelle, ce qui permet d'économiser de l'énergie et d'éviter qu'ils ne soient accidentellement modifiés par des informations non pertinentes.

L'équipe a testé cette nouvelle approche sur une série de tests de référence exigeants, incluant un nouvel ensemble de tâches qu'ils ont créés pour imiter la réalité complexe et variée du monde réel. Ce nouveau test comprenait dix types de tâches différents, allant de la lecture de documents médicaux et l'analyse de graphiques scientifiques à la compréhension de scènes routières complexes et de formules chimiques. Les résultats ont montré que leur méthode, SAME, était nettement plus performante pour se souvenir des anciennes tâches que les méthodes précédentes. Dans un test spécifique impliquant une longue séquence de huit tâches, la nouvelle méthode a maintenu un niveau de précision beaucoup plus élevé sur la toute première tâche par rapport aux autres approches. Elle s'est également révélée plus efficace, nécessitant moins de temps et de mémoire informatique pour l'entraînement car elle ne met à jour que les travailleurs nécessaires.

Peut-être plus important encore, les chercheurs ont observé que leur méthode empêchait un type de défaillance subtil mais courant où le modèle donnait la bonne réponse mais avec un format incorrect. Par exemple, si une tâche exigeait une réponse en lettres majuscules, le modèle pouvait commencer à donner la réponse en minuscules après avoir appris une nouvelle tâche utilisant des minuscules. Le nouveau système maintenait la cohérence du modèle, garantissant qu'il respectait les règles de formatage spécifiques de chaque tâche sans être confondu par le style de la suivante. En stabilisant à la fois la décision de savoir qui répond à la question et la mémoire de la personne qui répond, ce travail offre une façon plus fiable pour l'intelligence artificielle d'apprendre de manière continue, élargissant ses capacités sans perdre les fondations de ce qu'elle sait déjà.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →