← Nieuwste papers
🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

Dit artikel introduceert VideoSearcher, een closed-loop agentic framework dat multi-tool redeneren en een nieuw Bi-branch Sequence Policy Optimization (BiSPO) reinforcement learning algoritme benut om Video Deep Research te bevorderen door temporele lokalisatie, ruimtelijke focus en multimodale zoekopdrachten te verenigen, vergezeld van de nieuwe VideoSearch-QA benchmark voor evaluatie.

Oorspronkelijke auteurs: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

Gepubliceerd 2026-07-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van een plaats delict, is je "plaats delict" een lange, saaie video.

Het Probleem: De "Gesloten Doos" Detective
De meeste huidige video-AI-modellen zijn als detectives die opgesloten zitten in een kamer met alleen het videobestand. Er wordt tegen hen gezegd: "Alles wat je moet weten, zit in deze video." Als het antwoord niet expliciet in de video staat geschreven of getoond wordt, zitten ze vast. Ze kunnen geen naam opzoeken, een datum controleren of een feit verifiëren, want ze mogen de kamer niet verlaten.

De Oplossing: VideoSearcher
Het paper introduceert VideoSearcher, een nieuw soort AI-detective die de kamer wél mag verlaten. Het behandelt de video niet als het definitieve antwoord, maar als een aanwijzing.

Zie VideoSearcher als een detective met een smartphone, een vergrootglas en een kaart. Zo werkt het, stap voor stap:

  1. De plaats delict scannen (De Video): De detective bekijkt de video. In plaats van naar het geheel tegelijk te staren, weet het hoe het naar de interessante delen moet doorspoelen (zoals het vinden van een specifiek personage) en moet het inzoomen op kleine details (zoals het lezen van een kenteken of een logo).
  2. Versterking oproepen (De Tools): Zodra het een aanwijzing ziet (bijv. "Dat lijkt op een personage uit een videogame"), raadt het niet zomaar iets. Het gebruikt zijn gereedschap:
    • Afbeeldingen zoeken: Het maakt een foto van de aanwijzing en zoekt op internet om te zien wat het is.
    • Web zoeken: Het leest artikelen en wiki's om feiten over dat personage te vinden (zoals "Wat is hun speciale aanval?").
  3. Het samenvoegen: Het combineert wat het in de video zag met wat het op het internet heeft gevonden om het uiteindelijke antwoord te geven.

Het Geheime Recept: Hoe het leerde
Een AI leren om dit te doen is moeilijk. Als je het simpelweg vertelt "geef het juiste antwoord", kan het de ene keer geluk hebben maar de volgende keer falen. De auteurs creëerden een speciale trainingsmethode genaamd BiSPO (Bi-branch Sequence Policy Optimization).

Denk hierbij aan het trainen van een student met twee aparte rapporten:

  • Rapport A (Het Antwoord): Heb je het juiste uiteindelijke antwoord gegeven?
  • Rapport B (Het Proces): Heb je de juiste tools gebruikt? Heb je op de juiste plek ingezoomd? Heb je op het juiste moment op het web gezocht?

De meeste AI-training geeft alleen om Rapport A. VideoSearcher geeft om beide. Dit zorgt ervoor dat de AI niet alleen het antwoord raadt; het leert de gewoonte van een goede onderzoeker te ontwikkelen. Het leert te stoppen met zoeken wanneer het genoeg informatie heeft en harder te zoeken wanneer het vastloopt.

De Nieuwe Test: VideoSearch-QA
De auteurs realiseerden zich dat oude tests niet eerlijk waren, omdat ze alleen vragen stelden die uit de video alleen beantwoord konden worden. Daarom hebben ze een nieuwe test gebouwd genaamd VideoSearch-QA.

Stel je een test voor waarbij je een student een video van een beroemd monument laat zien en vraagt: "Wanneer is dit geopend?" Als de video geen plaquette met de datum laat zien, moet de student weten dat hij dit moet opzoeken. Deze nieuwe benchmark test precies dat: Kan de AI de aanwijzing in de video vinden en vervolgens op het openbare web de rest van het antwoord vinden?

De Resultaten
Toen ze VideoSearcher testten tegen andere AI-modellen (zowel gratis als dure), won het. Het was veel beter in:

  • Het vinden van specifieke momenten in lange video's.
  • Het gebruiken van het internet om de gaten op te vullen.
  • Het oplossen van complexe vragen die zowel kijken als zoeken vereisten.

Samenvattend
VideoSearcher is een AI die is afgestudeerd van een passieve waarnemer naar een actieve onderzoeker. Het "kijkt" niet alleen naar video's; het onderzoekt ze, gebruikt tools om bewijs te verzamelen uit de echte wereld en lost puzzels op die voorheen onmogelijk waren voor een computer om te kraken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →