← Derniers articles
💻 computer science

Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models

Cet article propose une stratégie d'élagage adaptatif de jetons en deux étapes, post-hoc et sans entraînement, qui élimine d'abord les trames redondantes puis ajuste dynamiquement la rétention des jetons en fonction des corrélations inter-trames, atteignant une réduction de 95 % du calcul tout en améliorant la précision du légendage vidéo de 7 % à un taux de rétention de jetons de 10 %.

Auteurs originaux : Paribesh Regmi, Qingshuang Chen, Chi Zhang, Heba Aly, Yelin Kim, Hongda Mao

Publié 2026-08-05
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Paribesh Regmi, Qingshuang Chen, Chi Zhang, Heba Aly, Yelin Kim, Hongda Mao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot super intelligent comment comprendre le monde. Vous lui donnez une caméra et un cerveau, et vous lui demandez de regarder une vidéo et de dire ce qui se passe. C'est le monde des « Modèles Vision-Langage » (VLM). Considérez ces modèles comme une équipe : une partie est les « yeux » (un encodeur de vision) qui regarde les images et les décompose en de minuscules pièces de puzzle appelées « tokens ». L'autre partie est le « cerveau » (un grand modèle de langage) qui lit ces tokens et écrit une histoire ou répond à une question.

Le problème, c'est que les vidéos sont énormes. Une seule image peut être décomposée en des centaines de pièces de puzzle, et une vidéo n'est qu'une pile de nombreuses images. Si vous essayez de nourrir le cerveau du robot avec une vidéo entière, il est submergé. C'est comme essayer de lire un livre de mille pages en une seconde ; le robot ralentit, se fatigue et ne peut pas travailler sur de petits appareils comme des téléphones ou des caméras de surveillance. Les scientifiques ont essayé de résoudre cela en jetant certaines pièces de puzzle, mais la plupart de leurs méthodes sont comme l'utilisation d'un emporte-pièce : elles découpent la même quantité de pièces de chaque vidéo, qu'il s'agisse d'un plan ennuyeux et statique d'un mur ou d'une course-poursuite de voitures pleine d'action. Cette publication pose une question plus pertinente : et si nous pouvions être plus intelligents sur ce que nous jetons, en coupant davantage quand les choses sont répétitives et moins quand elles sont excitantes ?


L'histoire du découpeur de vidéo intelligent

Les auteurs de cet article, une équipe d'Amazon, ont remarqué que les méthodes actuelles pour accélérer l'IA vidéo sont un peu maladroites. Elles traitent chaque vidéo de la même manière, en découpant un nombre fixe de pièces de puzzle (tokens) peu importe ce qui se passe réellement à l'écran. Mais les vidéos sont spéciales ; elles possèdent une « redondance temporelle », ce qui est une façon sophistiquée de dire que si vous avez une vidéo d'un chat qui dort, l'image 10 ressemble presque exactement à l'image 11, qui ressemble à l'image 12. Gaspiller la puissance cérébrale du robot pour toutes ces images identiques est absurde.

Pour remédier à cela, l'équipe a inventé une stratégie de « Découpage Adaptatif de Tokens Visuels en Deux Étapes ». Pensez-y comme à une équipe de nettoyage en deux étapes pour une pièce en désordre.

Étape 1 : Le filtre de trames
D'abord, la méthode examine toute la vidéo et demande : « Quelles trames sont réellement nouvelles ? » Si vous avez une vidéo d'une personne qui marche, les premières trames peuvent être identiques. L'algorithme agit comme un éditeur sélectif, jetant entièrement les trames ennuyeuses et répétitives. Il ne garde que les moments les plus intéressants, comme un film des meilleurs moments. C'est le « découpage au niveau de la trame » (frame-level pruning).

Étape 2 : Le dompteur de tokens
Maintenant, le robot possède une vidéo plus courte, mais chaque trame restante est toujours composée de milliers de minuscules tokens. C'est ici que la magie opère. Au lieu de couper un nombre fixe de tokens (comme « toujours garder 50 % »), la méthode examine le contenu de la vidéo pour décider de ce qu'elle doit couper.

Imaginez que les tokens dans une trame soient un groupe de personnes qui discutent. Si tout le monde dit exactement la même chose (haute redondance), vous n'avez besoin d'écouter qu'une seule personne pour comprendre le groupe. Mais si tout le monde dit quelque chose de totalement différent (haute diversité), vous devez écouter tout le monde. La méthode de l'article fait exactement cela : elle analyse la « corrélation » entre les tokens. Elle utilise un tour mathématique appelé « décomposition en valeurs propres » pour mesurer à quel point les tokens se répètent les uns les autres.

Si la vidéo est statique et répétitive (comme une personne faisant rouler une balle sur une rampe), les mathématiques montrent une « décroissance abrupte », ce qui signifie que les tokens sont très similaires. Le système dit alors : « D'accord, nous pouvons jeter beaucoup de ces éléments ! » et ne garde qu'une infime fraction. Mais si la vidéo est chaotique et dynamique (comme une course-poursuite avec beaucoup de mouvements de caméra), les mathématiques montrent une « décroissance lente », ce qui signifie que les tokens sont tous uniques. Le système dit : « Attendez, nous devons garder presque tout cela ! » et coupe très peu.

Les résultats : De la vitesse sans trébucher
L'équipe a testé cela sur plusieurs modèles d'IA populaires, notamment LLaVA-Video, InternVL3 et Qwen2.5VL. Ils ont comparé leur méthode adaptative intelligente à d'autres méthodes « sans réentraînement » (méthodes qui ne nécessitent pas de réentraîner l'IA de zéro).

Les résultats sont impressionnants. En utilisant leur approche en deux étapes, ils ont pu réduire la quantité de calculs que l'ordinateur doit effectuer de façon massive — jusqu'à 95 % — tout en gardant l'IA intelligente. En fait, sur un test de référence de légende de vidéo (où l'IA décrit ce qu'elle voit), leur méthode a même amélioré la précision de 7 % alors qu'ils n'ont gardé que 10 % des tokens.

Pour mettre cela en perspective : si vous avez une vidéo qui nécessite habituellement une heure de traitement par un supercalculateur, cette méthode pourrait la faire tourner en quelques minutes, et le robot pourrait même mieux la comprendre parce qu'il se concentre sur les parties importantes au lieu de se perdre dans le bruit.

Pourquoi cela compte
L'article argumente explicitement contre l'approche « taille unique » utilisée par les méthodes précédentes. Ils montrent que l'utilisation d'un ratio fixe (comme toujours garder 30 % des données) est sous-optimale car différentes vidéos nécessitent différentes quantités de données. Leur méthode est « post-hoc », ce qui signifie qu'elle fonctionne sur les modèles existants sans nécessiter de réentraînement, ce qui en fait une mise à jour « plug-and-play » pour la technologie actuelle.

Les auteurs ont constaté que cette stratégie adaptative fonctionne de manière cohérente à travers différentes tailles de modèles et différents types de vidéos. Ils ont même testé différentes manières mathématiques de mesurer la « décroissance » de l'information et ont découvert qu'une courbe exponentielle correspondait le mieux aux données, confirmant que leur façon de mesurer la redondance est la plus précise.

En bref, cet article suggère que nous n'avons pas besoin de construire des cerveaux plus gros et plus lents pour comprendre les vidéos. Au lieu de cela, nous devons simplement être plus intelligents sur ce que nous leur donnons à manger. En agissant comme un éditeur avisé qui sait exactement quand couper les parties ennuyeuses et quand garder les parties excitantes, nous pouvons rendre l'IA vidéo assez rapide pour fonctionner sur des appareils du quotidien sans perdre sa capacité à voir le monde clairement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →