← Nieuwste papers
💻 computer science

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3 is een nieuw kader voor multi-hop-resoneren in lange video's dat de beperkingen van uniforme steekproefneming overwint door middel van native, iteratieve clue-zoekopdrachten via taakontkoppelde attentiemaskering en een verifieerbare, trajectgeleide beloning, waardoor state-of-the-art-prestaties worden bereikt op benchmarks zoals MLVU en Video-Holmes.

Oorspronkelijke auteurs: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

Gepubliceerd 2026-05-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een mysterie op te lossen in een film van 30 minuten, maar je hebt slechts een paar seconden om ernaar te kijken. De meeste huidige AI-modellen proberen dit op te lossen door elke paar seconden een snelle, wazige foto van de hele film te nemen en vervolgens direct het antwoord te raden. Het is alsof je probeert een specifieke naald in een hooiberg te vinden door één keer over de hele berg te gluren en te hopen dat je hem hebt gezien. Je mist de naald vaak omdat hij verborgen zit in het "hooi" (de saaie delen), of je raakt overweldigd door te veel informatie.

Video-o3 is een nieuw AI-kader dat het spel verandert. In plaats van te gluren, handelt het als een detective met een vergrootglas. Hieronder wordt uitgelegd hoe het werkt, opgesplitst in eenvoudige concepten:

1. De aanpak van de detective (Native Interleaved Clue Seeking)

In plaats van de hele film te bekijken en vervolgens te raden, kijkt Video-o3 een beetje, denkt na en besluit dan: "Ik moet inzoomen op dit specifieke 5-seconden-deel om te zien wat er gebeurt."

  • Hoe het werkt: Het vraagt het systeem om een specifiek segment van de video te "croppen" (alsof je een klein stukje film uit de rol knipt) om het van dichtbij te bekijken.
  • De lus: Het herhaalt dit proces. Iets bekijken \rightarrow Nadenken \rightarrow Inzoomen op een aanwijzing \rightarrow Opnieuw nadenken \rightarrow Inzoomen op een andere aanwijzing.
  • Het resultaat: Het bouwt het antwoord stuk voor stuk op, kijkt alleen naar de delen van de video die echt belangrijk zijn en negeert de rest.

2. Het probleem van "gesplitste aandacht" (Task-Decoupled Attention Masking)

Stel je een detective voor die probeert een verslag te schrijven terwijl hij tegelijkertijd naar een misdaadplek kijkt. Als ze proberen beide dingen exact tegelijk te doen, raken ze misschien in de war. Ze kijken misschien naar de misdaadplek, maar schrijven iets op uit hun geheugen in plaats van wat ze daadwerkelijk zien. Dit wordt "nepdenken" genoemd.

  • De oplossing: Video-o3 gebruikt een speciale "maskeringstechniek".
    • Wanneer de AI op zoek is naar aanwijzingen (de video scant), wordt ze gedwongen het uiteindelijke antwoord dat ze misschien schrijft te negeren. Ze richt zich volledig op het vinden van het bewijs.
    • Wanneer de AI het antwoord schrijft, wordt ze gedwongen de ruwe videobeelden te negeren en zich alleen te richten op de aanwijzingen die ze zojuist heeft gevonden.
  • De analogie: Het is als een student die alleen mag kijken naar hun lesboek tijdens de "studiefase", en alleen mag kijken naar hun aantekeningen tijdens de "toetsfase". Dit voorkomt dat ze bedriegen of in de war raken, en zorgt ervoor dat hun uiteindelijke antwoord gebaseerd is op stevig bewijs.

3. Het "stopbord" (Verifiable Trajectory-Guided Reward)

Een detective zou theoretisch oneindig kunnen blijven inzoomen, elke enkele frame bekijken, wat te lang zou duren en te veel geld zou kosten (rekenkracht).

  • De oplossing: Video-o3 is getraind met een speciaal beloningssysteem.
    • Als de AI het antwoord snel en nauwkeurig vindt, krijgt ze een grote "gouden ster" (beloning).
    • Als de AI blijft inzoomen zonder reden nadat ze het antwoord al heeft, krijgt ze een "straf" (de beloning wordt kleiner).
  • De analogie: Het is als een spelletje "Warm en Koud". De AI leert te stoppen met zoeken op het moment dat ze zich "warm" voelt (genoeg bewijs heeft). Ze leert efficiënt te zijn en stopt precies wanneer ze het raadsel heeft opgelost, in plaats van tijd te verspillen aan het bekijken van lege kamers.

4. De trainingsplaats (Seeker-173K)

Om een AI te leren als een detective te werken, kun je haar niet zomaar een lesboek geven; je moet haar duizenden oefenopdrachten geven waarbij ze op zoek moet gaan naar aanwijzingen.

  • De dataset: De onderzoekers hebben een enorme dataset gecreëerd genaamd Seeker-173K. Deze bevat 173.000 voorbeelden van "videomysteriën" waarbij de AI gedwongen wordt de cyclus te oefenen: Kijken \rightarrow Inzoomen \rightarrow Nadenken \rightarrow Opnieuw Kijken \rightarrow Oplossen.
  • Het resultaat: Omdat ze zo veel heeft geoefend op deze specifieke "aanwijzingen-jacht"-taken, is ze veel beter geworden in het oplossen van complexe videovragen dan eerdere modellen.

De conclusie

Video-o3 is een slimmere manier voor computers om lange video's te bekijken. In plaats van te proberen de hele film in één keer te onthouden, handelt het als een menselijke detective: het scant de scène, zoomt in op de belangrijke details, verbindt de puntjes en stopt zodra het het bewijs heeft. Dit maakt het veel sneller, nauwkeuriger en beter in het oplossen van complexe puzzels die verborgen zitten in lange video's.

Prestaties: In tests liet deze aanpak de AI videopuzzels oplossen met aanzienlijk hogere nauwkeurigheid (bijvoorbeeld 72,1% op een belangrijke benchmark) in vergelijking met oudere methoden die de video gewoon "gluurden".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →