← Derniers articles
🤖 AI

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

Le papier propose **ONCE**, un cadre de compression de jetons vidéo plug-in qui déplace le processus de compression coûteux en mode hors ligne en apprenant une fois un codebook global sensible aux fréquences, permettant une compression en ligne efficace et agnostique au modèle qui réduit considérablement la latence d'inférence tout en maintenant des performances compétitives sur les benchmarks de compréhension vidéo.

Auteurs originaux : Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

Publié 2026-08-04
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot super intelligent comment comprendre les films. Pour ce faire, vous décomposez chaque image du film en des milliers de minuscules « pixels » de sens, appelés jetons (tokens). Le robot lit ensuite cette liste massive de jetons comme une phrase pour comprendre ce qui se passe. Le problème est que les films sont longs et pleins de répétitions. Si un personnage reste immobile dans une pièce pendant dix secondes, le robot est contraint de lire des milliers de fois de suite le même jeton « debout dans une pièce ». C'est comme lire un livre où le mot « le » est répété un million de fois juste pour remplir l'espace ; cela gaspille la puissance cérébrale du robot et le rend incroyablement lent à répondre aux questions. Les scientifiques ont essayé de résoudre cela en apprenant au robot à sauter les parties ennuyeuses ou à fusionner les parties similaires pendant qu'il regarde le film, mais cela nécessite généralement au robot d'effectuer des calculs supplémentaires pour chaque film qu'il voit, ce qui reste très lent et coûteux.

Ce document présente une nouvelle méthode appelée ONCE. Au lieu de forcer le robot à faire le travail de tri et de saut à chaque fois qu'il regarde une nouvelle vidéo, les chercheurs ont décidé de faire le plus gros du travail avant même que le robot ne voie un film. Ils ont créé un « Codebook Global », qui est essentiellement un index pré-établi et géant des motifs visuels les plus courants trouvés dans des milliers d'heures de vidéo. Considérez cela comme une bibliothèque où chaque livre est déjà classé sur l'étagère parfaite. Lorsqu'un nouveau film arrive, le robot n'a pas besoin de comprendre comment l'organiser à partir de zéro ; il lui suffit de chercher les motifs dans son index pré-établi, d'en extraire les « étagères » pertinentes et de les moyenner. Cela permet au robot de traiter les vidéos beaucoup plus rapidement car il ne fait qu'une recherche rapide au lieu d'un calcul complexe à chaque fois. Les chercheurs ont constaté que cette méthode fonctionne incroyablement bien, surtout lorsqu'ils sont contraints d'utiliser très peu de jetons, ce qui permet de garder le robot rapide sans qu'il oublie ce qu'il regarde.

Le Problème : Le Cerveau Submergé du Robot

Les modèles de langage vidéo (Video-LLMs) sont comme des détectives surpuissants capables de regarder une vidéo et de répondre à des questions sur celle-ci. Pour ce faire, ils transforment la vidéo en une longue chaîne de jetons numériques. Mais voici le piège : si vous donnez au détective un film de deux heures, la chaîne de jetons devient si longue qu'elle sature sa mémoire.

Pire encore, les films sont pleins de redondance. Si une scène montre un chat assis sur un canapé pendant cinq minutes, l'encodeur vidéo génère des milliers de jetons qui disent tous « chat sur canapé ». Le détective doit lire chacun d'entre eux, même s'ils sont tous identiques. Les méthodes existantes tentent de corriger cela en demandant au détective d'« élaguer » (couper) ou de « fusionner » (combiner) ces jetons pendant qu'il regarde la vidéo. Mais c'est comme demander au détective de s'arrêter et de réorganiser ses notes pour chaque film qu'il voit. Cela prend du temps et de l'énergie à chaque fois, et les règles d'organisation changent selon le détective (le modèle) que vous utilisez.

La Solution : ONCE et le « Codebook Global »

Les auteurs de ce document, Jiayang He et son équipe, ont proposé une approche différente. Ils ont demandé : « Et si nous faisions l'organisation une seule fois pour tout le monde, au lieu de demander au détective de le faire à chaque fois ? »

Ils ont construit un système appelé ONCE (Offline-to-Online Video Token Compression). Voici comment il fonctionne, en utilisant une analogie simple :

Imaginez que vous êtes un bibliothécaire devant trier des millions de livres.

  • L'ancienne méthode (méthodes existantes) : Chaque fois qu'une nouvelle cargaison de livres arrive, vous devez vous arrêter, lire chaque livre, décider lesquels sont similaires, puis les regrouper physiquement avant de pouvoir les ranger. Cela prend beaucoup de temps pour chaque nouvelle cargaison.
  • La méthode ONCE : Avant que toute nouvelle cargaison de livres n'arrive, vous passez du temps à étudier une vaste collection de livres que vous possédez déjà. Vous créez un « Index Maître » (le Codebook Global) qui répertorie chaque type de livre courant que vous avez déjà vu (ex : « Héros d'action », « Émission de cuisine », « Documentaire animalier »). Vous créez également une règle : « Si un livre ressemble à un 'Documentaire animalier', mettez-le dans le Bac A ».

Maintenant, lorsqu'une nouvelle cargaison de livres (une nouvelle vidéo) arrive, vous n'avez pas besoin de tous les lire attentivement. Il vous suffit de jeter un coup d'œil rapide à chaque livre, de vérifier votre « Index Maître » pour voir dans quel bac il appartient, et de le déposer. Vous prenez ensuite tous les livres du Bac A et les résumez en une seule note. C'est incroyablement rapide car vous ne réinventez pas les règles de tri pour chaque nouvelle cargaison ; vous utilisez simplement les règles que vous avez apprises une fois pour toutes.

Fonctionnement Détaillé

  1. Apprentissage Hors Ligne (la partie « Once ») : Les chercheurs ont pris un immense ensemble de données de vidéos (LLaVA-Video-178K) et ont analysé les motifs visuels. Ils n'ont pas seulement choisi des motifs aléatoires ; ils se sont assurés de capturer des motifs provenant de différents moments de la vidéo (stratification temporelle) et de les pondérer selon leur fréquence d'apparition. Ils ont ensuite utilisé une technique mathématique appelée « transport optimal » pour ajuster un Codebook Global de 8 192 « prototypes » représentatifs (ou mots-clés). Ce codebook agit comme une carte du monde visuel.
  2. Compression En Ligne (la partie « Everywhere ») : Lorsqu'une nouvelle vidéo arrive, le système n'entraîne rien de nouveau. Il examine simplement les jetons visuels de la vidéo et demande : « À lequel de mes 8 192 prototypes cela ressemble-t-il ? ». Il sélectionne les prototypes les plus fréquents qui apparaissent dans la vidéo, réassigne tous les jetons de la vidéo à ces prototypes, puis les moyenne. Cela transforme des milliers de jetons en un nombre beaucoup plus petit et gérable (comme 256 ou 512) sans perdre le sens fondamental.

Ce Qu'Ils Ont Découvert

L'équipe a testé ONCE sur quatre benchmarks de compréhension vidéo (MVBench, EgoSchema, Video-MME et LongVideoBench) en utilisant deux modèles d'IA différents (LLaVA-OneVision-7B et Qwen3.5-9B).

  • Vitesse : Les résultats sont frappants. ONCE a réduit la charge de travail du modèle de langage d'environ 96 % en termes de pré-calcul (FLOPs de prefill). En termes concrets, cela a rendu le système 2,96 fois plus rapide en moyenne par rapport à une exécution sans compression.
  • Précision : Généralement, lorsque l'on accélère un système en supprimant des données, il devient moins performant. Mais ONCE s'est révélé étonnamment intelligent. Lorsque le budget de jetons était très serré (seulement 32, 64 ou 128 jetons autorisés), ONCE obtenait en fait des scores plus élevés que les autres méthodes de compression. Il était particulièrement efficace pour des tâches comme le comptage d'événements ou la reconnaissance de changements d'état.
  • Efficacité : Le système a obtenu ces gains de vitesse sans avoir besoin de réentraîner le modèle d'IA principal. Le codebook a été appris une fois et est ensuite réutilisé pour tout.

Ce Qu'Ils Ont Éliminé

Le document argumente explicitement contre l'idée que la compression doive être faite « en ligne » (pendant la lecture de la vidéo) pour chaque vidéo individuelle. Ils ont démontré que faire le plus gros du travail lors de l'inférence (pendant le visionnage) est inefficace et redondant. Ils ont également démontré que choisir simplement des jetons aléatoires ou utiliser un ensemble fixe de jetons pour chaque vidéo ne fonctionne pas aussi bien que leur méthode, qui sélectionne dynamiquement les bons prototypes pour la vidéo spécifique tout en gardant les règles de regroupement fixes.

De plus, ils ont découvert que le « Codebook Global » ne se contente pas de stocker des exemples d'entraînement ; il apprend une structure réutilisable. Même lorsqu'il a été testé sur des vidéos qu'il n'avait jamais vues auparavant (un test de stress sur des vidéos publiques), le codebook a mieux performé que les regroupements aléatoires, suggérant qu'il a véritablement capturé la « grammaire » sous-jacante des motifs visuels.

L'Essentiel

Les auteurs suggèrent que ONCE offre une nouvelle façon de concevoir l'IA vidéo : au lieu de forcer l'IA à travailler plus dur pour chaque nouvelle vidéo, nous pouvons lui enseigner un langage universel de motifs visuels une fois pour toutes, puis la laisser parler ce langage avec fluidité et rapidité dès qu'elle en a besoin. Bien que la méthode nécessite toujours un codebook distinct pour différents modèles d'IA (car ils « voient » les choses différemment), les résultats suggèrent que cette approche « apprendre une fois, compresser partout » est un moyen puissant de rendre l'IA vidéo plus rapide et plus efficace sans sacrifier sa capacité à comprendre ce qui se passe à l'écran. L'article conclut que cette méthode est une étape prometteuse pour rendre la compréhension de vidéos longues pratique pour un usage quotidien.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →