← Derniers articles
💻 computer science

ID-VTG: Image-Disambiguated Video Temporal Grounding

Cet article introduit l'ID-VTG, une nouvelle tâche et un nouveau benchmark pour le repérage temporel vidéo qui exploite des images de référence aux côtés de requêtes textuelles pour résoudre les ambiguïtés entre des événements visuellement similaires, accompagné du cadre VGD-Agg proposé qui utilise une architecture à double branche et des jetons apprenables spécialisés pour atteindre des performances de pointe.

Auteurs originaux : Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu

Publié 2026-08-21
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans la vaste bibliothèque de contenus vidéo qui remplit nos écrans chaque jour, il existe un défi persistant pour les ordinateurs : trouver le moment exact où un événement spécifique se produit. Cette tâche, connue sous le nom de localisation temporelle vidéo (video temporal grounding), demande à une machine de regarder un long clip et d'indiquer les temps de début et de fin précis d'une scène décrite par des mots. Pendant des années, les chercheurs ont entraîné des systèmes à faire cela en utilisant uniquement du texte. Si un utilisateur tape « l'homme parle dans un microphone », l'ordinateur scanne les séquences pour trouver cette action. Cependant, cette approche se heurte à un mur lorsque la vidéo contient plusieurs personnes ou objets qui se ressemblent presque de manière identique. Si deux hommes différents portant le même uniforme parlent tous deux dans des microphones à des moments différents, une description textuelle seule ne peut pas dire à l'ordinateur lequel l'utilisateur veut dire. Les mots sont ambigus, et la machine s'égare, devinant souvent le mauvais segment ou échouant totalement à trouver le bon.

Pour résoudre cela, des chercheurs de l'Université de Pékin ont introduit une nouvelle façon d'aborder le problème. Ils ont réalisé que dans le monde réel, lorsque les gens ne sont pas sûrs de la personne ou de l'objet dont ils parlent, ils ont souvent une image à montrer. Un agent de sécurité peut avoir la photo d'un suspect ; un fan de sport peut avoir un cliché d'un athlète spécifique. En combinant une description textuelle avec une image de référence, l'ambiguïté disparaît. L'image agit comme un filtre visuel strict, indiquant à l'ordinateur exactement quel individu il doit surveiller, tandis que le texte décrit ce que cet individu est en train de faire. Cette nouvelle approche, que l'équipe appelle « Image-Disambiguated Video Temporal Grounding » (Localisation Temporelle Vidéo par Désambiguïsation par l'Image), déplace l'objectif de la supposition basée sur les mots vers la précision basée sur une correspondance visuelle.

Les chercheurs n'ont pas seulement proposé une théorie ; ils ont construit les outils nécessaires pour la tester. Ils ont créé deux nouvelles collections de données vidéo conçues spécifiquement pour être difficiles pour les systèmes standards basés uniquement sur le texte. La première collection se concentre sur la gymnastique, où les athlètes portent des uniformes identiques et effectuent des routines similaires. Dans ces vidéos, le même mouvement, comme un grand cercle sur les barres asymétriques, est effectué par différentes personnes ou par la même personne à plusieurs reprises. Le texte peut dire « la gymnaste effectue un cercle », mais sans une photo, l'ordinateur ne peut pas savoir quelle gymnaste ou quel essai est décrit. La seconde collection est beaucoup plus large, tirée d'une grande variété de vidéos internet présentant des animaux, des personnages de fiction et des objets du quotidien. Ici, le défi provient de différentes personnes effectuant des actions similaires, comme deux individus différents nouant leurs lacets. Dans les deux collections, les chercheurs ont associé chaque requête textuelle à une image de référence spécifique du sujet cible, créant ainsi un ensemble de données où la seule façon d'obtenir la bonne réponse est d'utiliser à la fois l'image et les mots.

Pour gérer ce nouveau type de tâche, l'équipe a développé une méthode qui imite la façon dont un humain aborderait le problème. Ils ont construit un système doté de deux manières distinctes d'observer la vidéo. Une partie travaille rapidement, scannant l'ensemble de la vidéo pour générer une liste de moments potentiels où un événement pourrait se produire. C'est la branche rapide, qui crée un large ensemble de candidats. La seconde partie travaille lentement et avec soin, comparant chaque image de la vidéo avec l'image de référence fournie par l'utilisateur. Cette branche lente recherche les détails visuels spécifiques qui correspondent à la photo, tels qu'un trait facial unique ou un motif spécifique sur un vêtement.

L'innovation centrale de leur système réside dans la façon dont il utilise ces deux parties pour prendre une décision. Les chercheurs ont introduit un mécanisme spécial qui agit comme un gardien. Lorsque le système examine un moment potentiel dans la vidéo, il pose une question simple : est-ce que cette partie de la vidéo ressemble à l'image de référence ? Si la réponse est oui, le système met ce moment en évidence. Si la réponse est non, le système supprime activement ce moment, le traitant comme une distraction. Pour que cela fonctionne, le système apprend à reconnaître les « négatifs difficiles » (hard negatives) — ce sont des parties de la vidéo qui ressemblent beaucoup à la cible mais qui concernent la mauvaise personne ou le mauvais objet. En entraînant le système à distinguer la véritable cible de ces sosies trompeurs, les chercheurs se sont assurés que l'ordinateur puisse ignorer les parties confuses de la vidéo pour se concentrer uniquement sur le segment correct.

Les résultats de cette approche ont été testés contre les nouveaux ensembles de données et comparés aux méthodes existantes qui reposent uniquement sur le texte. Le nouveau système a nettement surpassé les anciens modèles. Dans les vidéos de gymnastique, où la confusion visuelle était élevée, le système a identifié avec succès l'athlète et le moment corrects, alors que les modèles basés uniquement sur le texte échouaient souvent. Dans l'ensemble de données en monde ouvert, qui comprenait une large gamme de sujets et d'actions, le système a maintenu sa précision même lorsqu'il était testé sur des vidéos qu'il n'avait jamais vues auparavant. Cela suggère que la méthode a appris une compétence générale de correspondance entre images et actions vidéo plutôt que de simplement mémoriser des exemples spécifiques. Les chercheurs ont également testé la capacité du système à gérer des images de mauvaise qualité, comme celles qui sont floues ou présentent un éclairage étrange. Même dans ces conditions difficiles, le système est resté robuste, continuant à trouver les moments corrects dans la vidéo.

Ce travail démontre que l'ajout d'une référence visuelle à une requête textuelle n'est pas seulement une amélioration mineure, mais un changement fondamental dans la façon dont les machines peuvent comprendre la vidéo. Cela déplace le domaine des limites du langage, qui peut être vague ou imprécis, vers une forme de communication plus directe où une image clarifie l'intention. En créant un cadre capable de filtrer efficacement les distractions visuelles et de se concentrer sur le sujet d'intérêt spécifique, les chercheurs ont ouvert une voie vers une recherche et une analyse vidéo plus fiables. Les conclusions suggèrent que pour les tâches exigeant de la précision dans des scènes complexes et encombrées, la combinaison d'une photo et d'une phrase est l'outil le plus efficace disponible, permettant aux ordinateurs de voir le monde avec une clarté que le texte seul ne peut fournir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →