← Derniers articles
💻 computer science

Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval

Cet article propose le Denoise-then-Retrieve Network (DRNet), un nouveau paradigme qui améliore la recherche de moments vidéo en employant un module de débruitage conditionné par le texte pour filtrer les clips vidéo non pertinents et un module de rétroaction de reconstruction de texte pour une supervision auxiliaire, atteignant ainsi des performances de pointe sur les ensembles de données de référence.

Auteurs originaux : Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

Publié 2026-08-07
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de trouver une scène spécifique dans une immense vidéo de vacances familiales non éditée. Vous avez un indice textuel, comme « le moment où le chien saute dans la piscine ». Dans le monde de l'informatique, cette tâche est appelée Récupération de Moments Vidéo (Video Moment Retrieval). C'est une branche de l'intelligence artificielle où les ordinateurs apprennent à comprendre à la fois les images et le langage pour localiser précisément quand un événement se produit dans une longue vidéo. Le défi est que la plupart des vidéos sont remplies de « bruit » — des heures de paysages, des gens qui marchent ou des bavardages sans rapport avec votre recherche. Si un ordinateur essaie d'analyser chaque seconde de la vidéo de manière égale, il est submergé par les éléments non pertinents, un peu comme si vous essayiez de trouver une aiguille spécifique dans une botte de foin pendant que le vent fait voler toute la pile autour de vous. Les chercheurs ont essayé de construire de meilleurs « moteurs de recherche » pour la vidéo, mais de nombreuses méthodes existantes sont distraites par les déchets de la vidéo, ce qui conduit à des résultats inexacts.

Ce document introduit une nouvelle stratégie ingénieuse appelée « Denoise-then-Retrieve » (Dénoiser puis Récupérer). Au lieu d'essayer de trouver l'aiguille alors que la botte de foin est encore désordonnée, les auteurs proposent un processus en deux étapes : d'abord, nettoyer la botte de foin en jetant les déchets, puis chercher l'aiguille. Ils ont construit un système appelé DRNet (Denoise-then-Retrieve Network) qui agit comme un filtre intelligent. Avant même que l'ordinateur ne tente de répondre à la question, il utilise la requête textuelle pour scanner la vidéo et générer un « masque de bruit ». Imaginez que ce masque soit une paire de lunettes magiques qui floute instantanément les parties ennuyeuses ou non pertinentes de la vidéo (comme le ciel ou une personne qui passe) et met en évidence uniquement les clips qui correspondent réellement à la description (comme le chien qui saute).

Le document s'oppose à l'ancienne méthode de travail, où les ordinateurs traitent chaque clip d'une vidéo comme étant d'égale importance. Les auteurs démontrent que dans la plupart des vidéos, le « moment cible » occupe moins de 30 % du temps, tandis que les clips « bruyants » constituent la majorité. En forçant l'ordinateur à ignorer le bruit d'abord, le système peut concentrer sa puissance de calcul sur les parties pertinentes. Pour s'assurer que ce filtrage fonctionne correctement, le système dispose également d'une fonction d'« auto-vérification » intégrée. Il tente de réécrire l'indice textuel original en utilisant uniquement les clips vidéo nettoyés. Si l'indice réécrit ne correspond pas à l'original, le système sait qu'il a filtré quelque chose d'important ou qu'il a gardé trop de déchets, et il s'ajuste.

Les résultats sont très prometteurs. Testée sur deux ensembles de données vidéo populaires, Charades-STA et QVHighlights, cette nouvelle méthode a surpassé les meilleures techniques existantes sur chaque métrique. Par exemple, sur l'ensemble de données Charades-STA, la nouvelle méthode a amélioré la précision de la recherche du bon moment de 4,36 points de pourcentage par rapport au concurrent le plus proche. Les auteurs ont également constaté que cette idée de « nettoyer d'abord, puis trouver » n'est pas seulement bonne pour leur propre système ; ils pourraient l'intégrer dans d'autres modèles de recherche vidéo existants et rendre ces modèles plus performants. En résumé, le document suggère que le secret pour trouver le bon moment dans une vidéo n'est pas seulement de regarder plus intensément tout ce qui se passe, mais d'apprendre à ignorer ce qui n'a pas d'importance.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →