Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval
Het artikel introduceert ToolMerge, een nieuwe methode voor het ophalen van sleutelframes die gebruikmaakt van een LLM om queries op te splitsen in specifieke tooloproepen en hun resultaten te combineren via booleaanse operatoren, waarbij concurrerende prestaties worden aangetoond op het nieuw voorgestelde Molmo-2 Moments-benchmark.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je hebt een film van 4 uur lang, en iemand stelt je een zeer specifieke vraag erover, zoals: "Wat deed de man in het gele jasje net voordat hij de rivier overstak?"
Als je dit probeerde te beantwoorden door de hele film van begin tot eind te bekijken, zou het eeuwig duren. Als je gewoon een paar willekeurige frames zou kiezen (zoals het doorbladeren van een fotoboek), zou je de exacte moment waarschijnlijk missen. Dit is het probleem dat het artikel aanpakt: Hoe vinden we de exacte paar seconden van een lange video die het antwoord bevatten, zonder de hele film te bekijken?
De auteurs stellen een nieuw systeem voor dat ToolMerge heet. Hier is hoe het werkt, uitgelegd via eenvoudige analogieën.
1. Het probleem met oude methoden
Vorige systemen probeerden dit op twee manieren op te lossen, waarbij beide manieren gebreken hadden:
- De "Eén-maat-past-voor-iedereen"-benadering: Ze behandelden de hele vraag als één grote zoekterm. Het is alsof je een bibliothecaris vraagt: "Vind voor me de pagina met de man in het gele jasje die de rivier oversteekt." De bibliothecaris zou misschien een pagina met een rivier vinden, of een pagina met een man, maar niet noodzakelijk de juiste combinatie.
- De "Stijve checklist"-benadering: Ze probeerden de vraag op te splitsen in een vaste lijst van objecten (bijvoorbeeld: "Vind man", "Vind jasje", "Vind rivier"). Maar het echte leven is rommelig. Soms moet je op zoek naar een actie, soms naar een object, en soms naar een specifieke kleur. Een stijve checklist mist de nuance.
2. De oplossing: ToolMerge (De slimme detective)
ToolMerge werkt als een slimme detective die weet hoe hij verschillende gereedschappen moet gebruiken om een zaak op te lossen. In plaats van het antwoord in één grote sprong te zoeken, splitst de detective de taak op.
Stap 1: De Planner (Het brein)
Eerst leest een "Planner" (een AI-brein) de vraag. In plaats van gewoon de hele zin te zoeken, splitst hij de vraag op in kleinere, specifieke taken.
- Analogie: Als de vraag is "Wat deed de man in het gele jasje?", schreeuwt de Planner niet zomaar "Gele Jasje!" in het niets. Hij zegt: "Oké, ik heb drie dingen nodig: 1. Vind een scène met een rivier. 2. Vind een man in het geel. 3. Vind iemand die water oversteekt."
Stap 2: De Gereedschappen (De specialisten)
De Planner stuurt deze kleine taken naar verschillende "specialist"-gereedschappen.
- Gereedschap A (SigLIP): Dit is de Scènespecialist. Hij kijkt naar het hele plaatje om algemene sfeer te vinden (bijvoorbeeld: "een rivier", "een canyon").
- Gereedschap B (T-REN): Dit is de Objectspecialist. Hij zoomt in om specifieke dingen te vinden (bijvoorbeeld: "een man", "een gele jas").
- Gereedschap C (OCR): Dit is de Tekstlezer. Hij leest alle woorden die op borden of schermen in de video staan geschreven.
Stap 3: De Samenvoeging (De rechter)
Nu heeft elk gereedschap elke enkele frame van de video gerangschikt op basis van hoe goed deze overeenkomt met zijn specifieke taak. De "Samenvoeging"-stap combineert deze rangschikkingen.
- De "EN"-regel: Als de vraag zowel een rivier als een man vereist, zoekt het systeem naar frames waar beide gereedschappen een hoge score gaven. Het is als een Venn-diagram; het antwoord moet in het midden zitten waar de cirkels elkaar overlappen.
- De "OF"-regel: Als de vraag vraagt "Stak hij de rivier OF de brug over?", zoekt het systeem naar frames die één van beide voorwaarden voldoen.
Tot slot kiest het systeem de top 3 tot 8 frames die de beste scores behaalden over alle gecombineerde regels heen en geeft deze aan een laatste "Antwoordgever"-AI om het daadwerkelijke antwoord te geven.
3. De nieuwe test: Molmo-2 Moments (M2M)
Om te bewijzen dat hun systeem werkt, realiseerden de auteurs zich dat bestaande tests onbillijk waren. Oude tests hadden vragen die beantwoord konden worden door te raden of door naar willekeurige delen van de video te kijken.
Ze bouwden een nieuwe test genaamd Molmo-2 Moments (M2M).
- De Analogie: Stel je een leraar voor die een toets schrijft die alleen gebaseerd is op een specifiek 10-seconden fragment van een film. De leraar weet precies wat er in die 10 seconden gebeurt. Als een leerling correct antwoordt, dan moet hij die specifieke 10 seconden hebben bekeken. Hij had het niet kunnen raden vanuit de rest van de film.
- Dit zorgt ervoor dat als het systeem het antwoord goed heeft, het daadwerkelijk de juiste frames heeft gevonden.
4. De resultaten
Toen ze ToolMerge testten:
- Was het beter in het vinden van de juiste frames dan eerdere methoden, vooral voor complexe vragen die meerdere objecten of acties bevatten.
- Presteerde het bijzonder goed op caption retrieval (het ophalen van bijschriften). Als je het systeem een lange, gedetailleerde beschrijving van een scène geeft (zoals een bijschrift), is ToolMerge veel beter in het vinden van het exacte videofragment dat bij die beschrijving past, vergeleken met oudere methoden.
- Ze toonden ook aan dat als je de Planner een beetje "traint" met behulp van een specifiek beloningssysteem (GRPO), hij nog beter wordt in het weten welke gereedschappen hij moet gebruiken.
Samenvatting
ToolMerge is een systeem dat niet probeert het antwoord op een vraag over een lange video in één keer te raden. In plaats daarvan werkt het als een projectmanager: het splitst de vraag op in kleine, specifieke taken, stuurt die taken naar verschillende gespecialiseerde gereedschappen, en combineert vervolgens de resultaten om de exacte paar seconden video te vinden die de waarheid bevatten. Ze bewezen dat het werkt door een nieuwe, strengere test te creëren waarbij het antwoord vergrendeld is op een specifiek moment in de tijd.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.