← Neueste Arbeiten
🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

Dieses Paper stellt VideoSearcher vor, ein geschlossenes agentisches Framework, das Multi-Tool-Reasoning und einen neuartigen Bi-branch Sequence Policy Optimization (BiSPO) Reinforcement-Learning-Algorithmus nutzt, um die Video-Deep-Research durch die Vereinigung von temporaler Lokalisierung, räumlicher Fokussierung und multimodaler Suche voranzutreiben, begleitet von dem neuen VideoSearch-QA-Benchmark zur Evaluierung.

Ursprüngliche Autoren: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

Veröffentlicht 2026-07-07
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Detektiv, der versucht, ein Rätsel zu lösen, aber statt eines Tatorts ist Ihr „Tatort“ ein langes, langweiliges Video.

Das Problem: Der „geschlossene Kasten“-Detektiv
Die meisten aktuellen Video-KI-Modelle sind wie Detektive, die in einem Raum eingeschlossen sind und nur die Videodatei vor sich haben. Man sagt ihnen: „Alles, was du wissen musst, steckt in diesem Video.“ Wenn die Antwort nicht explizit im Video steht oder gezeigt wird, stecken sie fest. Sie können nicht nach einem Namen suchen, ein Datum überprüfen oder einen Fakt verifizieren, weil es ihnen nicht erlaubt ist, den Raum zu verlassen.

Die Lösung: VideoSearcher
Das Paper stellt VideoSearcher vor, eine neue Art von KI-Detektiv, dem es erlaubt ist, den Raum zu verlassen. Es betrachtet das Video nicht als die endgültige Antwort, sondern als einen Hinweis.

Betrachten Sie VideoSearcher als einen Detektiv mit einem Smartphone, einer Lupe und einer Karte. So funktioniert es, Schritt für Schritt:

  1. Den Tatort scannen (Das Video): Der Detektiv schaut sich das Video an. Anstatt das Ganze auf einmal zu starren, weiß er, wie man zu den interessanten Teilen vorspult (wie zum Beispiel das Finden eines bestimmten Charakters) und heranzoomt (wie das Lesen eines Nummernschilds oder eines Logos).
  2. Verstärkung rufen (Die Werkzeuge): Sob es einen Hinweis entdeckt (z. B. „Das sieht aus wie ein Charakter aus einem Videospiel“), rät es nicht einfach. Es nutzt seine Werkzeuge:
    • Bildersuche: Es macht ein Foto des Hinweises und sucht im Internet, um herauszufinden, was es ist.
    • Websuche: Es liest Artikel und Wikis, um Fakten über diesen Charakter herauszufinden (wie z. B. „Was ist seine Spezialfähigkeit?“).
  3. Alles zusammenführen: Es kombiniert das, was es im Video gesehen hat, mit dem, was es im Internet gefunden hat, um die endgültige Antwort zu geben.

Das Geheimrezept: Wie es gelernt hat
Einer KI beizubringen, dies zu tun, ist schwer. Wenn man ihr nur sagt „Finde die richtige Antwort“, könnte sie einmal Glück haben, aber beim nächsten Mal scheitern. Die Autoren entwickelten eine spezielle Trainingsmethode namens BiSPO (Bi-branch Sequence Policy Optimization).

Stellen Sie sich das wie das Training eines Schülers mit zwei separaten Zeugnissen vor:

  • Zeugnis A (Die Antwort): Hast du die richtige endgültige Antwort gefunden?
  • Zeugnis B (Der Prozess): Hast du die richtigen Werkzeuge benutzt? Hast du an der richtigen Stelle herangezoomt? Hast du zur richtigen Zeit im Web gesucht?

Die meisten KI-Trainings kümmern sich nur um Zeugnis A. VideoSearcher kümmert sich um beide. Dies stellt sicher, dass die KI nicht nur die Antwort errät; sie lernt die Gewohnheit, ein guter Forscher zu sein. Sie lernt, die Suche zu stoppen, wenn sie genug Informationen hat, und intensiver zu suchen, wenn sie feststeckt.

Der neue Test: VideoSearch-QA
Den Autoren wurde klar, dass alte Tests nicht fair waren, da sie nur Fragen stellten, die allein aus dem Video beantwortbar waren. Also entwickelten sie einen neuen Benchmark namens VideoSearch-QA.

Stellen Sie sich vor, man zeigt einem Schüler in einem Test ein Video eines berühmten Wahrzeichens und fragt: „Wann wurde dies eröffnet?“ Wenn das Video keine Plakette mit dem Datum zeigt, muss der Schüler wissen, dass er dies nachschlagen muss. Dieser neue Benchmark testet genau das: Kann die KI den Hinweis im Video finden und dann den Rest der Antwort im offenen Web finden?

Die Ergebnisse
Als sie VideoSearcher gegen andere KI-Modelle (sowohl kostenlose als auch teure) testeten, gewann es. Es war viel besser darin:

  • Spezifische Momente in langen Videos zu finden.
  • Das Internet zu nutzen, um die Lücken zu füllen.
  • Komplexe Fragen zu lösen, die sowohl das Sehen als auch das Suchen erforderten.

Zusammenfassung
VideoSearcher ist eine KI, die vom passiven Beobachter zum aktiven Forscher aufgestiegen ist. Sie „schaut“ Videos nicht nur an; sie untersucht sie, nutzt Werkzeuge, um Beweise aus der realen Welt zu sammeln, und löst Rätsel, die zuvor für einen Computer unmöglich zu knacken waren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →