← Derniers articles
💻 computer science

A Survey of Token Compression for Efficient Multimodal Large Language Models

Cet article présente le premier sondage systématique des techniques de compression de jetons pour les modèles de langage multimodaux efficaces, en catégorisant les méthodes existantes à la fois par leurs modalités cibles (image, vidéo et audio) et par leurs mécanismes sous-jacents afin de consolider les progrès actuels et de guider la recherche future.

Auteurs originaux : Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

Publié 2026-02-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant super intelligent (un Grand Modèle de Langage Multimodal, ou MLLM) capable de lire du texte, de regarder des images, de regarder des vidéos et d'écouter de l'audio. Cet assistant est incroyablement talentueux, mais il a un problème majeur : il est submergé lorsque vous lui donnez trop d'informations à la fois.

Considérez les informations que reçoit l'assistant comme un flux de « tokens » (petits morceaux de données).

  • Un prompt de texte est comme une lettre courte.
  • Une photo haute résolution est comme une lettre qui a été agrandie pour devenir une fresque géante et détaillée.
  • Une vidéo est comme une bibliothèque de milliers de ces fresques, changeant chaque seconde.
  • L'audio est comme un flux continu d'ondes sonores à haute vitesse.

Lorsque vous alimentez cet assistant avec un film de 90 minutes, il ne voit pas seulement « un film ». Il voit 54 millions de tokens. C'est comme essayer de lire une bibliothèque de livres en une seule inspiration. Le cerveau de l'assistant (son mécanisme d'« auto-attention ») doit comparer chaque token avec tous les autres tokens. Les calculs deviennent si lourds, si vite, que l'ordinateur manque de mémoire ou met un temps infini à répondre.

La Solution : La Compression de Tokens
Ce document est un guide massif (une étude/survey) sur la manière d'apprendre à cet assistant à être plus efficace sans perdre son intelligence. Les auteurs appellent cela la Compression de Tokens.

Considérez la compression de tokens comme préparer une valise pour un voyage.

  • Le Problème : Vous avez une valise pleine de vêtements, mais 80 % d'entre eux sont des doublons (comme 50 t-shirts blancs identiques) ou des choses dont vous n'avez pas besoin (comme un gros manteau d'hiver pour un voyage à la plage).
  • L'Objectif : Vous voulez faire tenir tout ce qui est important dans un sac plus petit afin de voyager plus vite, sans laisser derrière vous les choses dont vous avez réellement besoin.

Le document organise toutes les méthodes actuelles pour « emballer » ces données de deux manières principales de voir le problème : Quel type de données est-ce ? et Comment l'emballer ?

1. L'emballage par type de données (Le « Quoi »)

Différents types de données présentent différents genres de « désordre » (redondance).

  • Images (La photo statique) :
    • Le Désordre : Une photo d'un ciel bleu possède des millions de pixels bleus qui sont tous exactement les mêmes.
    • La Solution : Au lieu d'envoyer chaque pixel bleu individuellement, l'ordinateur les regroupe. Il dit : « Toute cette zone n'est que du ciel bleu », et envoie un seul token pour représenter toute cette zone.
  • Vidéo (L'image animée) :
    • Le Désordre : Dans une vidéo d'une personne qui parle, l'arrière-plan (un mur ou un arbre) reste exactement le même pendant 10 secondes alors que la personne bouge légèrement.
    • La Solution : L'ordinateur réalise : « Nous n'avons pas besoin d'envoyer l'arrière-plan 30 fois par seconde ». Il garde l'arrière-plan une seule fois et n'envoie que les mises à jour pour les parties en mouvement. C'est comme envoyer un « journal des modifications » au lieu de renvoyer toute la scène à chaque image.
  • Audio (L'onde sonore) :
    • Le Désordre : Un enregistrement de voix comporte souvent de longues pauses, du silence ou un bourdonnement de fond qui n'ajoute aucune signification.
    • La Solution : L'ordinateur supprime les silences et fusionne les sons similaires, ne gardant que les parties où la voix parle réellement ou la musique change.

2. L'emballage par méthode (Le « Comment »)

Le document regroupe les techniques utilisées pour faire cet emballage en quatre stratégies principales :

  • Le « Rayon Réducteur » (Basé sur la transformation) :
    Imaginez prendre une photo haute résolution et simplement la rétrécir. Vous perdez un peu de détail, mais vous gardez la forme et les couleurs générales. Cela se fait en écrasant mathématiquement les données (comme le pooling ou la moyenne) pour raccourcir la liste des tokens.
  • Le « Jeu de Groupement » (Basé sur la similitude) :
    Imaginez que vous avez un tas de 1 000 briques Lego rouges. Au lieu de lister les 1 000, vous dites : « Voici une brique rouge, et il y en a 999 autres exactement comme elle ». L'ordinateur trouve les tokens qui se ressemblent ou se ressemblent beaucoup et les fusionne en un seul token « représentatif ».
  • Le « Projecteur » (Basé sur l'attention) :
    Imaginez un enseignant regardant une salle de classe. L'enseignant ne s'intéresse qu'aux élèves qui lèvent la main (les tokens importants) et ignore ceux qui dorment au fond. L'ordinateur regarde ses propres « scores d'attention » (à quel point il accorde de l'importance à chaque morceau de donnée) et jette les tokens qu'il ignore de toute façon.
  • Le « Guide de Questionnement » (Basé sur la requête) :
    Imaginez que vous cherchez une aiguille spécifique dans une botte de foin. Au lieu de regarder chaque brin de foin, vous demandez : « Où est l'aiguille ? ». L'ordinateur utilise votre question (la requête) pour filtrer tout ce qui ne correspond pas à ce que vous demandez, ne gardant que les tokens pertinents.

Pourquoi cela importe

Les auteurs expliquent que cela ne consiste pas seulement à rendre les ordinateurs plus rapides. Il s'agit de les rendre utilisables.

  • Sans compression, un film de 90 minutes est impossible à traiter en temps réel pour les modèles actuels.
  • Avec la compression, le modèle peut « regarder » le film, comprendre l'intrigue et répondre à des questions à son sujet, tout en utilisant une fraction de la mémoire.

Le revers de la médaille (Défis)

Le document prévient également que ce n'est pas de la magie. Si vous emballez trop serré votre valise :

  • Vous pourriez perdre des détails : Si vous compressez trop une photo, vous pourriez manquer un petit panneau important en arrière-plan.
  • Cela brise le flux : Dans une vidéo, si vous fusionnez trop d'images, le mouvement pourrait paraître saccadé ou confus.
  • C'est difficile à intégrer : Certaines de ces astuces d'emballage sont difficiles à utiliser avec les puces informatiques les plus rapides d'aujourd'hui car elles nécessitent que l'ordinateur s'arrête et calcule différemment.

En résumé :
Ce document est une carte pour les chercheurs. Il dit : « Nous avons un problème : notre IA se noie dans trop de données. Voici toutes les façons dont nous essayons de lui apprendre à filtrer, grouper et rétrécir ces données pour qu'elle puisse réellement fonctionner dans le monde réel. » Il organise ces méthodes selon qu'elles concernent les images, les vidéos ou le son, et selon les astuces mathématiques spécifiques qu'elles utilisent pour accomplir la tâche.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →