← Nieuwste papers
💻 computer science

Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval

Dit artikel stelt het Denoise-then-Retrieve Network (DRNet) voor, een nieuw paradigma dat Video Moment Retrieval verbetert door een Text-Conditioned Denoising-module te gebruiken om irrelevante videoclips te filteren en een Text-Reconstruction Feedback-module voor aanvullende supervisie, waardoor het de state-of-the-art prestaties op benchmark-datasets bereikt.

Oorspronkelijke auteurs: Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

Gepubliceerd 2026-08-07
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Weijia Liu, Jiuxin Cao, Bo Miao, Zhiheng Fu, Xuelin Zhu, Jiawei Ge, Bo Liu, Mehwish Nasim, Ajmal Mian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een specifieke scène te vinden in een enorme, onbewerkte thu видео van een familievakantie. Je hebt een tekstuele aanwijzing, zoals "het moment dat de hond in het zwembad springt." In de wereld van de informatica wordt deze taak Video Moment Retrieval genoemd. Het is een tak van kunstmatige intelligentie waarbij computers leren om zowel beelden als taal te begrijpen om exact te bepalen wanneer een gebeurtenis plaatsvindt in een lange video. De uitdaging is dat de meeste video's vol zitten met "ruis"—uren aan landschappen, mensen die rondlopen, of ongerelateerd geklets dat niets met je zoekopdracht te maken heeft. Als een computer probeert elke seconde van de video even intensief te analyseren, raakt hij overweldigd door de irrelevante zaken, net als proberen een specifieke naald te vinden in een hooiberg terwijl de wind de hele stapel rondblaast. Onderzoekers proberen betere "zoekmachines" voor video te bouwen, maar veel bestaande methoden raken afgeleid door de rommel in de video, wat leidt tot onnauwkeurige resultaten.

Dit artikel introduceert een slimme nieuwe strategie genaamd "Denoise-then-Retrieve" (eerst de ruis verwijderen, dan zoeken). In plaats van te proberen de naald te vinden terwijl de hooiberg nog steeds rommelig is, stellen de auteurs een tweestaps-proces voor: eerst de hooiberg opruimen door de troep weg te gooien, en dan pas naar de naald zoeken. Ze hebben een systeem gebouwd genaamd DRNet (Denoise-then-Retrieve Network) dat werkt als een slim filter. Voordat de computer zelfs maar probeert de vraag te beantwoorden, gebruikt hij de tekstuele zoekopdracht om de video te scannen en een "ruis-masker" te generen. Denk aan dit masker als een paar magische zonnebrillen die de saaie of irrelevante delen van de video (zoals de lucht of een voorbijlopend persoon) direct wazig maken en alleen de fragmenten highlighten die daadwerkelijk bij de beschrijving passen (zoals de hond die springt).

Het artikel spreekt zich uit tegen de oude manier van doen, waarbij computers elk fragment in een video als even belangrijk behandelen. De auteurs laten zien dat in de meeste video's het eigenlijke "doelmoment" minder dan 30% van de tijd inneemt, terwijl de "ruizige" fragmenten de meerderheid vormen. Door de computer te dwingen eerst de ruis te negeren, kan het systeem zijn denkkracht richten op de relevante delen. Om er zeker van te zijn dat deze filtering correct verloopt, heeft het systeem ook een ingebouwde "zelfcontrole"-functie. Het probeert de oorspronkelijke tekstuele aanwijzing te herschrijven met behulp van alleen de opgeschoonde videofragmenten. Als de herschreven aanwijzing niet overeenkomt met de originele, weet het systeem dat het iets belangrijks heeft weggefilterd of te veel troep heeft behouden, en past het zichzelf aan.

De resultaten zijn zeer veelbelovend. Bij tests op twee populaire video-datasets, Charades-STA en QVHighlights, presteerde deze nieuwe methode beter dan de beste bestaande technieken op elke enkele metriek. Zo verbeterde de nieuwe methode op de Charades-STA dataset de nauwkeurigheid van het vinden van het juiste moment met 4,36 procentpunt vergeleken met de dichtstbijzijnde concurrent. De auteurs ontdekten ook dat dit "eerst schoonmaken, dan zoeken"-idee niet alleen goed is voor hun eigen systeem; ze konden het in andere bestaande video-zoekmodellen pluggen en die modellen ook beter laten werken. Kortom, het artikel suggereert dat het geheim om het juiste moment in een video te vinden niet alleen is om harder naar alles te kijken, maar om te leren de dingen te negeren die er niet toe doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →