← Derniers articles
🤖 machine learning

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

Cet article propose DualSpeed, un cadre d'entraînement rapide-lent qui combine l'élagage des jetons visuels pour l'efficacité avec un mode auxiliaire de séquence complète et l'auto-distillation pour résoudre les décalages entre l'entraînement et l'inférence, accélérant ainsi l'entraînement des MLLM jusqu'à 4,0×\times sans compromettre les performances.

Auteurs originaux : Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

Publié 2026-02-04
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner le monde à un étudiant très intelligent (un Grand Modèle de Langage Multimodal) en lui montrant des milliers d'images.

Le Problème : Le goulot d'étranglement de la « Trop Grande Quantité d'Informations »
Actuellement, ces modèles sont comme des étudiants qui sont submergés. Quand vous leur montrez une image, l'ordinateur la décompose en des centaines, voire des milliers de petits morceaux appelés « jetons visuels » (visual tokens). C'est comme si vous tendiez à l'étudiant un livre de 1 000 pages pour chaque image, alors que la plupart des pages ne sont que des espaces blancs inutiles ou des motifs répétitifs.

Essayer de lire tous ces pages prend un temps fou. Cela rend l'entraînement de ces modèles incroyablement lent, coûteux et gourmand en énergie.

L'Ancienne Idée : L'erreur du « Couper-Coller »
Les chercheurs ont réalisé que beaucoup de ces pages sont inutiles. Ils ont essayé une technique appelée Élagage de Jetons Visuels (Visual Token Pruning), qui consiste à utiliser un surligneur pour rayer les pages ennuyeuses et redondantes avant de montrer le livre à l'étudiant. Cela fonctionne très bien pour tester l'étudiant plus tard (l'inférence), ce qui les rend plus rapides.

Mais lorsqu'ils ont essayé d'utiliser cette méthode pendant l'entraînement, cela a eu l'effet inverse. Cela a créé un « décalage ».

  • L'Analogie : Imaginez que vous n'entraîniez l'étudiant que sur un résumé de 10 pages d'un livre. Puis, lors de l'examen final, vous lui donnez le livre complet de 1 000 pages. L'étudiant panique et échoue parce qu'il s'est habitué à la version courte.

La Solution : DualSpeed (Le camp d'entraînement « Rapide-Lent »)
Les auteurs de ce document, Dingkun Zhang et son équipe, ont créé un nouveau cadre d'entraînement appelé DualSpeed. Voyez cela comme un camp d'entraînement à deux voies qui alterne de manière aléatoire pour résoudre le problème du décalage.

  1. La Voie Rapide (La pratique rapide) :

    • La plupart du temps (environ 90 % des sessions), le modèle s'entraîne en « Mode Rapide ».
    • Ici, ils utilisent la technique d'« élagage » pour couper les jetons visuels inutiles. Le modèle apprend rapidement à partir des résumés courts et efficaces.
    • Pour aider le modèle à se souvenir de quelle version il regarde, ils ajoutent une petite « étiquette de nom » invisible (appelée Isolateur de Mode) au début du résumé court. Cela indique au modèle : « Hé, c'est la version condensée ; concentre-toi sur les détails clés. »
  2. La Voie Lente (La révision du livre complet) :

    • De temps en temps (environ 10 % du temps), le modèle passe en « Mode Lent ».
    • Ici, ils montrent au modèle l'image complète, non élaguée (toutes les 1 000 pages).
    • Pour s'assurer que le modèle ne devienne pas paresseux pendant ces rares sessions, ils utilisent une astuce appelée Auto-Distillation. Le « Mode Rapide » (qui a déjà beaucoup appris) agit comme un professeur, chuchotant les réponses à l'étudiant du « Mode Lent ». Cela garantit que l'étudiant apprend la version complète efficacement, même s'il la voit moins souvent.

Le Résultat : Le meilleur des deux mondes
En mélangeant ces deux modes, le modèle obtient la vitesse de la Voie Rapide mais conserve la capacité de gérer le monde complet et complexe de la Voie Lente.

  • Vitesse : Ils ont entraîné des modèles 2,1 à 4,0 fois plus vite qu'auparavant.
  • Performance : Malgré cette vitesse, les modèles n'ont pas perdu en intelligence. Ils ont conservé plus de 99 % de leur performance originale.
  • Flexibilité : Le modèle final est assez intelligent pour gérer à la fois les résumés courts (si vous voulez de la vitesse plus tard) et les images complètes (si vous voulez une précision maximale).

En Résumé
Le document affirme qu'en utilisant un système de commutation « Rapide-Lent », ils peuvent enseigner à ces modèles d'IA massifs beaucoup plus rapidement sans qu'ils oublient comment lire les livres complets. Ils ont découvert qu'environ 90 % des jetons visuels sont en fait redondants pendant l'entraînement, et en les coupant intelligemment (tout en pratiquant occasionnellement avec la version complète), ils peuvent économiser énormément de temps et d'argent sans perdre en intelligence.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →