← Derniers articles
🤖 AI

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

Le papier présente AdaptToken, un cadre d'inférence sans entraînement qui utilise l'incertitude du modèle et l'entropie pour sélectionner dynamiquement les tokens pertinents et arrêter le traitement prématurément, améliorant ainsi la compréhension des vidéos longues par les modèles multimodaux tout en réduisant les coûts de calcul.

Auteurs originaux : Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

Publié 2026-03-31
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de comprendre un film de 4 heures en regardant seulement 10 secondes de chaque scène. C'est ce que les intelligences artificielles (les "MLLM") doivent faire aujourd'hui pour analyser de longues vidéos. Le problème ? Elles ont une mémoire très limitée et ne peuvent pas tout regarder en même temps. Si elles essaient, elles s'essoufflent (trop de données) ou elles oublient l'essentiel.

Voici comment AdaptToken résout ce problème, expliqué simplement :

1. Le Problème : Le "Brouhaha" de la Vidéo

Imaginez que vous devez résumer un documentaire de 2 heures. Si vous demandez à un robot de lire toutes les images, il va se noyer dans les détails inutiles (comme un arbre qui bouge au loin) et oublier le moment crucial où le héros trouve le trésor.
Les méthodes actuelles essaient de choisir les "bonnes" images, mais elles le font souvent de manière aveugle, comme si elles prenaient des photos au hasard dans un album, sans savoir si elles sont importantes pour la question posée.

2. La Solution : AdaptToken (Le Chef de Cuisine Intuitif)

AdaptToken est comme un chef de cuisine très expérimenté qui prépare un grand banquet (la vidéo) pour un client (la question). Au lieu de servir tous les ingrédients, il utilise deux astuces magiques :

A. L'Intuition de la Confiance (L'Entropie)

C'est le cœur du système. Imaginez que le chef goûte un petit bout de chaque plat (chaque groupe de scènes de la vidéo) et se demande : "Est-ce que j'ai assez d'indices pour répondre à la question du client ?"

  • Si le chef est confiant (il a vu le trésor, il sait la réponse), il dit : "Super, j'ai assez d'informations, je peux arrêter de goûter les autres plats !". C'est ce qu'on appelle l'arrêt précoce.
  • Si le chef est incertain (il ne voit que des paysages flous), il dit : "Attends, je dois regarder plus loin."

En langage technique, cette "confiance" est mesurée par l'entropie (une mesure de l'incertitude). Plus le robot est sûr de sa réponse, moins il a besoin de regarder la suite.

B. La Répartition Intelligente (Le Budget de Tokens)

Une fois que le chef sait quelles parties de la vidéo sont importantes, il ne les traite pas toutes de la même façon.

  • Il alloue plus de ressources (plus de détails) aux scènes où il a trouvé des indices cruciaux.
  • Il alloue moins de ressources aux scènes ennuyeuses ou répétitives.

C'est comme si vous lisiez un livre : vous lisez les chapitres d'action très lentement et avec attention, mais vous survolez les descriptions de paysages inutiles. AdaptToken fait pareil avec les "mots" (tokens) de l'image.

3. Le Résultat : Plus Vite et Plus Précis

Grâce à cette méthode, AdaptToken obtient deux résultats incroyables :

  1. Il ne perd rien d'important : Il trouve le trésor même dans un film de 4 heures (jusqu'à 10 000 images !).
  2. Il va deux fois plus vite : Parce qu'il arrête de regarder la vidéo dès qu'il a la réponse, il économise énormément de temps et d'énergie.

En Résumé

AdaptToken, c'est comme donner à un robot une boussole de l'attention. Au lieu de regarder toute la forêt arbre par arbre, il sait exactement où chercher, il s'arrête dès qu'il trouve ce qu'il cherche, et il ignore le reste. C'est une méthode qui ne nécessite pas d'apprentissage supplémentaire (elle fonctionne avec n'importe quel modèle existant) et qui rend les IA beaucoup plus efficaces pour comprendre nos longs films et vidéos.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →