← Neueste Arbeiten
💬 NLP

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

Das Papier stellt ToolMerge vor, eine neuartige Methode zur Schlüsselbildwiedergewinnung, die ein LLM nutzt, um Abfragen in spezifische Tool-Aufrufe zu zerlegen und deren Ergebnisse über boolesche Operatoren zu vereinen, und die auf dem neu vorgestellten Molmo-2 Moments-Benchmark eine wettbewerbsfähige Leistung demonstriert.

Ursprüngliche Autoren: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

Veröffentlicht 2026-05-25
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen vier Stunden langen Film, und jemand stellt Ihnen eine sehr spezifische Frage dazu, wie zum Beispiel: „Was machte der Mann in der gelben Jacke genau vor dem Überqueren des Flusses?"

Wenn Sie versuchen würden, dies zu beantworten, indem Sie den gesamten Film von Anfang bis Ende ansehen, würde es ewig dauern. Wenn Sie einfach nur einige zufällige Einzelbilder auswählen würden (wie beim Durchblättern eines Fotoalbums), würden Sie höchstwahrscheinlich den genauen Moment verpassen. Dies ist das Problem, das die Arbeit angeht: Wie finden wir die exakten wenigen Sekunden eines langen Videos, die die Antwort enthalten, ohne das Ganze anzusehen?

Die Autoren schlagen ein neues System namens ToolMerge vor. So funktioniert es, erklärt durch einfache Analogien.

1. Das Problem mit alten Methoden

Frühere Systeme versuchten, dies auf zwei Arten zu lösen, wobei beide Mängel aufwiesen:

  • Der „Einheits-Ansatz": Sie behandelten die gesamte Frage als einen einzigen riesigen Suchbegriff. Das ist, als würde man eine Bibliothekarin fragen: „Finden Sie mir die Seite mit dem Mann in der gelben Jacke, der den Fluss überquert." Die Bibliothekarin könnte eine Seite mit einem Fluss finden oder eine Seite mit einem Mann, aber nicht unbedingt die richtige Kombination.
  • Der „strikte Checklisten-Ansatz": Sie versuchten, die Frage in eine feste Liste von Objekten aufzubrechen (z. B. „Mann finden", „Jacke finden", „Fluss finden"). Aber das echte Leben ist chaotisch. Manchmal muss man nach einer Handlung suchen, manchmal nach einem Objekt und manchmal nach einer bestimmten Farbe. Eine strikte Checkliste verpasst die Nuancen.

2. Die Lösung: ToolMerge (Der intelligente Detektiv)

ToolMerge agiert wie ein intelligenter Detektiv, der weiß, wie man verschiedene Werkzeuge einsetzt, um einen Fall zu lösen. Anstatt die Antwort in einem einzigen riesigen Sprung zu finden, zerlegt der Detektiv die Aufgabe.

Schritt 1: Der Planer (Das Gehirn)
Zuerst liest ein „Planer" (ein KI-Gehirn) die Frage. Anstatt einfach den ganzen Satz zu durchsuchen, zerlegt er die Frage in kleinere, spezifische Aufgaben.

  • Analogie: Wenn die Frage lautet „Was tat der Mann in der gelben Jacke?", ruft der Planer nicht einfach „Gelbe Jacke!" ins Leere. Er sagt: „Okay, ich brauche drei Dinge: 1. Eine Szene mit einem Fluss finden. 2. Einen Mann in Gelb finden. 3. Jemanden finden, der Wasser überquert."

Schritt 2: Die Werkzeuge (Die Spezialisten)
Der Planer sendet diese kleinen Aufgaben an verschiedene „Spezialist"-Werkzeuge.

  • Werkzeug A (SigLIP): Dies ist der Szene-Spezialist. Er betrachtet das gesamte Bild, um allgemeine Stimmungen zu finden (z. B. „ein Fluss", „eine Schlucht").
  • Werkzeug B (T-REN): Dies ist der Objekt-Spezialist. Er zoomt hinein, um spezifische Dinge zu finden (z. B. „ein Mann", „eine gelbe Jacke").
  • Werkzeug C (OCR): Dies ist der Textleser. Er liest alle Wörter, die auf Schildern oder Bildschirmen im Video geschrieben stehen.

Schritt 3: Das Zusammenführen (Der Richter)
Nun hat jedes Werkzeug jedes einzelne Bild des Videos basierend darauf, wie gut es zu seiner spezifischen Aufgabe passt, bewertet. Der Schritt „Zusammenführen" kombiniert diese Bewertungen.

  • Die „UND"-Regel: Wenn die Frage sowohl einen Fluss als auch einen Mann erfordert, sucht das System nach Bildern, bei denen beide Werkzeuge eine hohe Punktzahl vergaben. Es ist wie ein Venn-Diagramm; die Antwort muss in der Mitte liegen, wo sich die Kreise überschneiden.
  • Die „ODER"-Regel: Wenn die Frage lautet „Hat er den Fluss ODER die Brücke überquert?", sucht das System nach Bildern, die entweder die eine oder die andere Bedingung erfüllen.

Schließlich wählt das System die Top 3 bis 8 Bilder aus, die über alle kombinierten Regeln hinweg am besten bewertet wurden, und übergibt sie einer finalen „Antworter"-KI, um die eigentliche Antwort zu geben.

3. Der neue Test: Molmo-2 Moments (M2M)

Um zu beweisen, dass ihr System funktioniert, stellten die Autoren fest, dass bestehende Tests unfair waren. Alte Tests enthielten Fragen, die durch Raten oder durch das Betrachten zufälliger Teile des Videos beantwortet werden konnten.

Sie entwickelten einen neuen Test namens Molmo-2 Moments (M2M).

  • Die Analogie: Stellen Sie sich einen Lehrer vor, der einen Test schreibt, der nur auf einem spezifischen 10-Sekunden-Ausschnitt eines Films basiert. Der Lehrer weiß genau, was in diesen 10 Sekunden passiert. Wenn ein Schüler richtig antwortet, muss er genau diese 10 Sekunden angesehen haben. Er hätte es nicht aus dem Rest des Films erraten können.
  • Dies stellt sicher, dass das System, wenn es die Antwort richtig hat, tatsächlich die richtigen Bilder gefunden hat.

4. Die Ergebnisse

Als sie ToolMerge testeten:

  • War es besser darin, die richtigen Bilder zu finden als frühere Methoden, insbesondere bei komplexen Fragen, die mehrere Objekte oder Handlungen betrafen.
  • Es schnitt bei der Bildunterschrift-Wiedergewinnung besonders gut ab. Wenn man dem System eine lange, detaillierte Beschreibung einer Szene gibt (wie eine Bildunterschrift), ist ToolMerge viel besser darin, den exakten Videoclip zu finden, der zu dieser Beschreibung passt, im Vergleich zu älteren Methoden.
  • Sie zeigten auch, dass das System, wenn man den Planer ein wenig mit einem spezifischen Belohnungssystem (GRPO) „trainiert", noch besser darin wird, zu wissen, welche Werkzeuge einzusetzen sind.

Zusammenfassung

ToolMerge ist ein System, das nicht versucht, die Antwort auf eine Frage zu einem langen Video auf einmal zu erraten. Stattdessen agiert es wie ein Projektmanager: Es zerlegt die Frage in kleine, spezifische Aufgaben, sendet diese Aufgaben an verschiedene spezialisierte Werkzeuge und kombiniert dann die Ergebnisse, um die exakten wenigen Sekunden des Videos zu finden, die die Wahrheit enthalten. Sie bewiesen, dass es funktioniert, indem sie einen neuen, strengeren Test schufen, bei dem die Antwort an einen spezifischen Zeitpunkt gebunden ist.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →