← Nieuwste papers
💻 computer science

VIRTUE: Versatile Video Retrieval Through Unified Embeddings

Het paper introduceert VIRTUE, een veelzijdig videoretrieval-framework dat op basis van een gedeelde multimodale LLM-architectuur en LoRA-training zowel corpus- als momentretrieval en samengestelde multimodale zoekopdrachten ondersteunt, waarbij het prestaties van gespecialiseerde systemen benadert met aanzienlijk minder trainingsdata.

Oorspronkelijke auteurs: Shaunak Halbe, Bhagyashree Puranik, Jayakrishnan Unnikrishnan, Kushan Thakkar, Vimal Bhat, Toufiq Parag

Gepubliceerd 2026-03-24
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shaunak Halbe, Bhagyashree Puranik, Jayakrishnan Unnikrishnan, Kushan Thakkar, Vimal Bhat, Toufiq Parag

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek hebt, maar dan niet met boeken, maar met miljarden video's. Vroeger was het zoeken in zo'n bibliotheek als het zoeken naar een naald in een hooiberg, waarbij je alleen een heel specifiek label kon gebruiken (bijvoorbeeld: "zoek video's met een hond").

De auteurs van dit paper hebben een nieuwe, slimme sleutel ontwikkeld genaamd VIRTUE. Deze sleutel kan niet alleen zoeken op tekst, maar begrijpt ook complexe verzoeken, zoals: "Zoek een video die lijkt op deze clip, maar dan in een besneeuwd landschap" of "Wanneer precies start het vliegtuig in deze video?".

Hier is hoe VIRTUE werkt, vertaald naar alledaagse termen:

1. Het Probleem: Twee verschillende werelden

Tot nu toe hadden we twee soorten zoekmachines:

  • De Specialisten: Deze waren supergoed in het vinden van video's op basis van tekst, maar ze konden geen complexe vragen beantwoorden. Ze waren als een strakke bibliothecaris die alleen werkt met een catalogus. Als je vroeg: "Zoek iets dat op dit plaatje lijkt, maar dan met een rode hoed", keken ze je verward aan.
  • De Slimme Chatbots (MLLM's): Deze konden wel praten en begrijpen wat je bedoelde, inclusief plaatjes en video's. Maar als je ze vroeg om een video te vinden in een grote database, waren ze vaak traag en niet nauwkeurig genoeg. Ze waren als een creatieve kunstenaar die wel een verhaal kan vertellen, maar slecht is in het vinden van specifieke boeken in een bibliotheek.

VIRTUE is de oplossing: het combineert de nauwkeurigheid van de specialist met de slimheid van de chatbot, allemaal in één systeem.

2. De Oplossing: De "Universele Vertaler"

VIRTUE gebruikt een trucje om video's en tekst naar dezelfde taal te vertalen.

  • De "Samenvattings-Truc": Stel je voor dat je een video en een tekst (zoals "een witte zeilboot op zee") aan een slimme verteller geeft. De verteller moet ze samenvatten in één enkel woord en dat woord opschrijven op een kaartje.
  • Het Matchen: VIRTUE leert nu om te kijken of het kaartje van de video en het kaartje van de tekst op elkaar lijken. Als ze op elkaar lijken, weet het systeem: "Ah, dit is de juiste video!"
  • De Leraar (LoRA): In plaats van de hele verteller opnieuw te leren (wat duizenden jaren zou duren), geven ze de verteller een klein, slim notitieblok (een zogenaamde LoRA-adapter). Hierin schrijven ze alleen de regels op die nodig zijn om video's en tekst goed te koppelen. Dit maakt het trainen heel snel en efficiënt.

3. De Drie Superkrachten van VIRTUE

VIRTUE heeft drie manieren om te zoeken, allemaal met dezelfde "slimme verteller":

A. De Grote Zoektocht (Corpus Retrieval)

Je wilt een video vinden uit een enorme verzameling.

  • Hoe het werkt: VIRTUE maakt eerst een snelle lijst met de 50 beste kandidaten (zoals het snel doorbladeren van de eerste paar pagina's van een catalogus).
  • De Tweede Keer (Reranking): Vervolgens kijkt een tweede, nog slimmere versie van VIRTUE (de Ranker) deze 50 kandidaten heel nauwkeurig na. Deze kijkt niet alleen naar het kaartje, maar leest de hele video en tekst samen om te zien of ze echt bij elkaar passen. Dit zorgt voor een zeer nauwkeurig resultaat.

B. De "Wat als..." Zoektocht (Composed Retrieval)

Dit is de magische kracht. Je wilt iets specifieks: "Zoek een video van een zonsondergang, maar verander de sfeer naar een stormachtige nacht."

  • Hoe het werkt: Je geeft de originele video én de tekst met de verandering aan VIRTUE. Omdat het systeem een "Multimodal Large Language Model" is (een model dat zowel tekst als beelden begrijpt), kan het zich voorstellen hoe de video eruit zou zien na de verandering, en zoekt het direct naar dat resultaat. Geen enkele andere systeem kon dit zo goed doen zonder speciale training.

C. De Tijdbom (Moment Retrieval)

Je hebt een lange video en vraagt: "Wanneer start het vliegtuig?"

  • Hoe het werkt: In plaats van de hele video te bekijken, kijkt VIRTUE naar elke seconde apart. Het zoekt naar het moment waarop de "sfeer" van de video het meest lijkt op de tekst "vliegtuig start".
  • De Glijdende Schuif: Het systeem ziet een piek in overeenstemming en trekt daar een tijdsvenster omheen. Het doet dit in één keer, zonder dat het eerst een lijst moet maken en dan moet verbeteren. Het is alsof je direct op de juiste knop drukt in plaats van eerst de hele afstandsbediening te doorzoeken.

4. Waarom is dit zo speciaal?

  • Snelheid: Het is niet traag. Het gebruikt slimme trucs om niet elke video in de wereld te hoeven bekijken, maar eerst een korte lijst te maken en die dan te verfijnen.
  • Alles-in-één: Je hoeft niet drie verschillende systemen te hebben voor drie verschillende vragen. VIRTUE doet het allemaal.
  • Slimme Leerling: Het systeem is getraind op een relatief klein aantal voorbeelden (700.000), maar presteert net zo goed als systemen die getraind zijn op miljarden voorbeelden. Het is alsof een student die slechts één jaar les heeft gehad, net zo goed een examen haalt als iemand die 10 jaar gestudeerd heeft, omdat hij de essentie van het vak heeft begrepen.

Kortom: VIRTUE is als een super-ervaren bibliothecaris die niet alleen de catalogus kent, maar ook begrijpt wat je echt bedoelt, zelfs als je vraagt om iets dat er nog niet is, of als je wilt weten op welk exact moment iets gebeurt in een film. En het doet dit allemaal in één keer, snel en nauwkeurig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →