← Derniers articles
💻 computer science

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

L'article propose VideoTreeSearch (VTS), un cadre d'agent autocorrecteur qui modélise le questionnement sur de longues vidéos ancrées comme une recherche itérative sur un arbre temporel adaptatif avec des opérations explicites de retour en arrière, surpassant de manière significative les méthodes antérieures en permettant la récupération après des erreurs précoces et en atteignant des résultats de pointe sur plusieurs bancs d'essai.

Auteurs originaux : Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertasius

Publié 2026-07-20
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertasius

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de trouver un moment précis et minuscule dans un film qui dure des heures. Peut-être devez-vous voir exactement ce qu'un chef a ajouté dans un bol juste avant de le mettre au four, mais la vidéo est un tutoriel de cuisine complet. Si vous parcourez simplement tout le film rapidement, vous pourriez manquer cette action d'une fraction de seconde. Mais si vous regardez chaque image à vitesse normale, cela prendrait une éternité. C'est le défi du « Grounded Long-Video Question Answering » (Réponse à des questions sur de longues vidéos avec ancrage temporel). Il s'agit d'une tâche où un ordinateur doit non seulement répondre à une question sur une vidéo longue, mais aussi pointer l'endroit exact, de quelques secondes seulement, où se cache la réponse.

Pendant un certain temps, les scientifiques ont tenté de résoudre ce problème en donnant à l'ordinateur un outil de « ciseaux ». L'ordinateur devinait une plage temporelle, découpait la vidéo à cet endroit et observait le résultat. S'il se trompait, il essayait de découper à nouveau. Mais cette approche revenait à essayer de trouver une aiguille dans une botte de foin en n'ayant le droit que de couper la botte de foin en deux ; si vous coupez la mauvaise moitié, vous ne pouvez pas facilement revenir de l'autre côté pour réessayer. Vous ne faites que découper la mauvaise pièce de plus en plus petit jusqu'à abandonner. Ce papier introduit une façon de chercher plus intelligente, transformant la vidéo en une carte que l'ordinateur peut explorer, revenir en arrière et corriger ses erreurs sur, un peu comme un détective résolvant un mystère.


La Carte du Détective : Comment VTS Résout le Mystère de la Vidéo

Découvrez VideoTreeSearch (VTS), un nouveau cadre conçu pour aider les ordinateurs à devenir des experts en détectives vidéo. Les chercheurs derrière ce papier ont réalisé que l'ancienne façon de chercher dans les vidéos était trop maladroite. Les méthodes précédentes agissaient comme une personne qui ne pouvait que progresser vers l'avant, réduisant un clip vidéo en le recadrant constamment. Si elles faisaient une erreur au début — par exemple, si elles pensaient que la réponse se trouvait dans les dix premières minutes alors qu'elle était dans les dix dernières — elles étaient coincées. Elles n'avaient aucun moyen de dire : « Attendez, je suis partie dans la mauvaise direction », et de revenir essayer un autre chemin. Elles ne faisaient que creuser de plus en plus profondément dans le mauvais trou.

L'Analogie de l'Arbre
Pour correr cela, les auteurs ont transformé la vidéo en un arbre. Imaginez que l'intégralité de la vidéo est le tronc d'un arbre géant. Le tronc se divise en quelques grosses branches, représentant des scènes ou des chapitres majeurs. Ces branches se divisent à nouveau en petites brindilles, et les brindilles se divisent en minuscules feuilles.

  • La Racine : Toute la vidéo.
  • Les Branches : Les gros segments de la vidéo où la scène change (comme passer de la cuisine à la salle à manger).
  • Les Feuilles : Les moments précis et minuscules où la réponse pourrait se cacher.

Crucialement, cet arbre n'est pas construit avec des tranches de tailles égales. Au lieu de cela, l'ordinateur regarde la vidéo et coupe l'arbre exactement là où l'histoire visuelle change. Si une scène dure cinq minutes, cette branche est longue ; si une scène est un simple flash rapide, cette branche est courte. Cela signifie que chaque partie de l'arbre fait sens en tant qu'unité narrative, plutôt que d'être simplement une tranche de temps aléatoire.

Les Quatre Mouvements Magiques
Une fois que la vidéo est un arbre, l'agent informatique ne se contente plus de « recadrer ». Il possède quatre mouvements spécifiques pour naviguer dans cette carte :

  1. Zoom In (Zoom avant) : Descendre une branche pour voir une partie plus petite et plus détaillée de la vidéo.
  2. Zoom Out (Dézoom) : Remonter vers la branche parente si vous réalisez que vous êtes allé trop loin dans la mauvaise direction.
  3. Shift (Décalage) : Se déplacer latéralement vers une autre branche au même niveau (comme vérifier la pièce d'à côté au lieu de la pièce actuelle).
  4. Answer (Répondre) : Arrêter la recherche et donner la réponse finale avec l'horodatage exact.

La partie la plus excitante est le Zoom Out et le Shift. Ce sont les boutons « J'ai fait une erreur, essayons à nouveau ». Dans les anciennes méthodes, revenir en arrière était impossible ou très difficile. Dans VTS, c'est un mouvement standard et intégré. L'agent peut plonger dans une mauvaise branche, réaliser que c'est une impasse, remonter et sauter vers une autre branche pour trouver la vérité.

Entraîner le Détective
On ne peut pas simplement donner un arbre à un ordinateur et s'attendre à ce qu'il sache comment l'utiliser. Les chercheurs ont dû enseigner à l'agent comment gérer les erreurs. Ils ont créé un processus d'entraînement spécial où ils envoyaient délibérément l'agent sur le mauvais chemin exprès.

  • Le Détour : L'agent était guidé pour choisir une mauvaise branche.
  • La Récupération : Ensuite, il devait trouver comment remonter et trouver le bon chemin.

En pratiant ces scénarios de « détour et récupération », l'agent a appris que faire une erreur n'est pas la fin du jeu ; c'est juste une partie de la recherche. Il a appris que s'il est coincé, il doit utiliser ses outils de Zoom Out et de Shift pour récupérer.

Les Résultats
Lorsqu'ils ont testé ce nouveau détective sur trois défis différents de questions-réponses vidéo, les résultats ont été impressionnants.

  • Sur le test CG-Bench, VTS a amélioré la capacité de trouver l'intervalle de temps correct de 12,5 points par rapport à la meilleure méthode précédente.
  • Sur le test Haystack-Ego4D (qui utilise des vidéos très longues), il s'est amélioré de 7,4 points.
  • Même sur des questions vidéo générales où il n'avait pas besoin de trouver le moment exact, il a quand même battu les autres méthodes de près de 7,1 points en précision.

Le papier suggère que cette « recherche hiérarchique » (recherche par couches) est la recette secrète. Lorsqu'ils ont supprimé la capacité de faire du Zoom Out ou du Shift, les performances ont chuté de manière significative. Cela prouument que la capacité de revenir en arrière est ce qui rend le système si performant.

Pourquoi c'est important
Les auteurs ont découvert que VTS ne fait pas que deviner ; il explore. En moyenne, il faut environ 4,8 tours (étapes) pour résoudre un problème, alors que les anciennes méthodes abandonnaient généralement après seulement 1 ou 2 tours. Le nouvel agent utilise activement ses outils de retour en arrière dans environ 60 % de ses recherches. Ce n'est pas seulement un calculateur plus rapide ; c'est un explorateur plus intelligent qui sait admettre quand il a tort et essayer un autre itinéraire.

En bref, ce papier montre que traiter une longue vidéo comme une carte structurée, plutôt que comme une liste plate d'images, permet aux ordinateurs de résoudre des questions complexes avec une précision bien plus élevée. En leur donnant les outils pour reculer et changer de direction, nous leur avons appris à être bien meilleurs pour trouver l'aiguille dans la botte de foin.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →