Résumé Technique : Narrations d'Objets Persistants pour les Modèles de Langage Vidéo à Efficacité de Jetons
Énoncé du Problème
Les modèles de langage vidéo (Video-LLMs) ont fait progresser la compréhension vidéo ouverte, mais font face à deux limitations primaires dans leurs interfaces visuelles :
- Intensité des Jetons : Les méthodes actuelles de construction par trame génèrent des jetons visuels proportionnels à la résolution temporelle et spatiale, ce qui se traduit souvent par des milliers de jetons par vidéo (ex. LLaVA-OneVision, LLaVA-Video).
- Absence de Structure d'Objet Explicite : Les techniques de compression existantes (ex. mémoire parcimonieuse, compression spatio-temporelle adaptative) réduisent le nombre de jetons mais ne parviennent pas à organiser explicitement les preuves d'objets récurrents. Par conséquent, le modèle de langage doit inférer la correspondance des objets et l'évolution de leur état à partir de séquences compressées sans liaison explicite, ce qui entraîne une ambiguïté lorsque les objets réapparaissent après une occlusion ou une coupure de scène.
Bien que l'apprentissage centré sur les objets offre une base théorique pour regrouper les caractéristiques en "slots" (créneaux) de type objet, les approches existantes basées sur les slots traitent généralement ces derniers comme locaux et échangeables, échouant ainsi à lier les observations récurrentes à des instances d'objets persistantes à travers le temps. À l'inverse, les méthodes reposant sur des pipelines externes de détection et de suivi introduisent une dépendance vis-à-vis de composants non appris.
Méthodologie : SlotNarrative
Les auteurs proposent SlotNarrative, une interface basée sur les slots et centrée sur les objets, qui organise les preuves vidéo en narrations d'objets persistantes. Le cadre fonctionne via trois modules fonctionnels :
1. Représentation Vidéo Centrée sur les Objets
Un encodeur SigLIP gelé extrait les caractéristiques de patch des trames échantillonnées. Un adaptateur de caractéristiques et un encodeur de slot récurrent regroupent ces caractéristiques en K=11 vecteurs de slots de type objet (St) et en cartes d'attention normalisées par patch (At).
- État Local : Le système estime le mouvement local, la géométrie et la visibilité en utilisant une correspondance de patch pondérée par masque et un encodeur de trajectoire causal.
- Gestion des Scènes : Lors de la détection de coupures de scènes, l'initialisation du slot récurrent est réinitialisée pour éviter de traiter les montages comme des mouvements d'objets extrêmes, tout en conservant la mémoire au niveau du clip.
2. Mémoire d'Objet Persistante
Un module de mémoire sans paramètres lie les observations de slots locales aux entrées d'objets persistantes au niveau du clip.
- Ré-identification : Lorsqu'un slot passe de l'état invisible à visible, le système le compare aux entrées de mémoire inactives en utilisant cinq indices complémentaires : similitude des caractéristiques du slot, similité de l'apparence agrégée, similitude de l'état de trajectoire, similitude de l'observation récente et proximité de position.
- Logique de Correspondance : Un score pondéré, sans paramètres, détermine la ré-identification. Une stratégie de correspondance gloutonne (greedy) un-à-un empêche les doublons. Si un objet réapparaît sous un index de slot brut différent, la mémoire préserve l'ID persistant, comblant ainsi efficacement les intervalles manquants.
- Aucun Paramètre Entraînable : La mémoire elle-même ne contient aucun poids apprenable ; elle repose sur des poids d'indices fixes (ex. 0,3 pour les caractéristiques de slot, 0,2 pour l'apparence) et des seuils.
3. Tokenisation de Type État-Objet
Pour s'interfacer avec un modèle de langage gelé, les entrées d'objets conservées sont sérialisées en une séquence visuelle de taille fixe :
- Sélection de l'Inventaire : Les entrées sont classées par durée de visibilité, changement d'état et "objectivité" (une métrique combinant la surface du slot et l'entropie de l'attention). Les M=16 meilleures entrées sont conservées.
- Décomposition en Jetons : Chaque entrée conservée est représentée par :
- Un Jeton d'Identité : Résume l'apparence persistante en utilisant des caractéristiques de l'architecture dorsale (backbone) agrégées dans le temps et pondérées par la visibilité.
- J=8 Jetons d'État : Encodent l'apparence au niveau du segment, la géométrie, la visibilité, l'état de la trajectoire et les événements de ré-identification.
- Budget Fixe : Cette conception alloue exactement M(1+J)=144 positions de jetons visuels par vidéo, indépendamment du nombre de trames échantillonnées. Les positions inutilisées sont masquées.
Stratégie d'Entraînement
Le modèle est entraîné selon trois étapes séquentielles :
- Étape 1 : Apprend le regroupement de type objet et la cohérence locale en utilisant la reconstruction de caractéristiques, le SlotContrast et l'apprentissage de représentation synergique sur des clips non étiquetés.
- Étape 2 : Entraîne les modules de trajectoire et de présence via la prédiction d'observations futures et des cibles dérivées de la confiance.
- Étape 3 : Aligne la représentation typée objet-état avec le modèle de langage (Qwen2-7B-Instruct). Seuls les projecteurs d'identité/état, les normalisations de couche et les plongements (embeddings) typés sont entraînés ; l'architecture dorsale visuelle, la mémoire et le modèle de langage restent gelés.
Contributions Clés
- Interface Centrée sur les Objets par Slots : Organise les preuves vidéo autour d'entrées d'objets persistantes au niveau du clip plutôt qu'autour de trames ou de slots par trame échangeables, en utilisant une mémoire sans paramètres pour associer les observations récurrentes sans dépendre de pipelines de suivi externes.
- Représentation Typée État-Objet : Sépare l'apparence persistante de l'objet de son état variable dans le temps. Cette décomposition produit une interface compacte et fixe de 144 jetons (1 jeton d'identité + 8 jetons d'état × 16 objets) pour un Video-LLM gelé.
- Efficacité et Performance : Démontre un compromis précision-jetons visuels favorable sur plusieurs benchmarks, établissant les narrations d'objets persistantes comme une interface visuelle structurée.
Résultats Expérimentaux
Les auteurs ont évalué SlotNarrative sur trois benchmarks de VideoQA en accès ouvert : MSVD-QA, MSRVTT-QA et ActivityNet-QA.
- Efficacité des Jetons : Avec seulement 144 positions de jetons visuels allouées, SlotNarrative atteint :
- 75,6 % de précision sur MSVD-QA.
- 69,8 % de précision sur MSRVTT-QA.
- 50,3 % de précision sur ActivityNet-QA.
- Comparaisons :
- Comparé à la base la plus proche centrée sur les objets, Slot-VLM (192 jetons), SlotNarrative utilise 25 % de jetons en moins tout en améliorant la précision de 0,7, 0,2 et 2,0 points respectivement.
- Il surpasse les méthodes à jetons denses (ex. LLaVA-OneVision avec ~6 000 jetons) sur les jeux de données de vidéos courtes et reste compétitif sur les vidéos plus longues (ActivityNet-QA) malgré la réduction significative des jetons.
- Études d'Ablation :
- Trajectoire et Mémoire : Les deux composantes améliorent significativement la performance. Supprimer la mémoire seule fait chuter la précision d'environ 3,2 points sur MSVD-QA ; supprimer la trajectoire la fait chuter d'environ 1,8 point. Leur combinaison produit les meilleurs résultats.
- Jetons Typés : Séparer les jetons d'identité et d'état est crucial. Utiliser uniquement des jetons d'identité (16 jetons) ou uniquement des jetons d'état (128 jetons) entraîne des chutes de précision significatives (44,1 % et 42,4 % respectivement sur ActivityNet-QA) par rapport à l'interface complète de 144 jetons (50,3 %).
- Sensibilité au Budget : Réduire la couverture des objets (M) est plus coûteux que de réduire la résolution temporelle (J). Augmenter le budget au-delà de 144 jetons produit des rendements décroissants.
Signification et Revendications
L'article affirme que SlotNarrative établit un nouveau paradigme pour les interfaces de Video-LLM en privilégiant les narrations d'objets persistantes plutôt que les preuves par trame. La signification réside dans :
- Compression Structurée : Il fournit une interface visuelle compacte, structurée et temporellement organisée qui lie explicitement les observations récurrentes, réduisant la charge du modèle de langage pour inférer la correspondance des objets.
- Efficacité des Jetons : Il atteint une performance compétitive avec un budget de jetons fixe et bas (144 jetons), découplant la longueur de l'entrée de la durée et de la résolution de la vidéo.
- Association Apprise : Il démontre que des unités de type objet peuvent être découvertes et associées à travers des intervalles manquants directement à partir de caractéristiques visuelles sans recourir à des modèles externes de détection ou de suivi.
Les auteurs reconnaissent modestement des limites, notant que bien que l'interface soit compacte, l'ordre temporel à longue portée et la fragmentation dans les scènes encombrées restent des défis. Ils suggèrent que les travaux futurs devraient se concentrer sur une découverte d'objets et des indices de mouvement plus riches sans revenir à de longues séquences de jetons par trame.