← Nieuwste papers
🤖 machine learning

What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation

Dit artikel introduceert een label-vrije "reversal-drop"-metriek om de scores van temporele video VLM-benchmarks te deconstrueren, wat onthult dat modellen vaak vertrouwen op positionele encodings in plaats van visuele inhoud, en demonstreert dat geaggregeerde scores onderscheidende, niet-uitwisselbare foutmodi maskeren tussen positie-dominante en visuele-sequentie-dominante architecturen.

Oorspronkelijke auteurs: Farrukh Rahman

Gepubliceerd 2026-07-15
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Farrukh Rahman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Video-detective Verwarring: Waarom Twee Modellen met Dezelfde Score Eigenlijk Verschillend Zijn

Stel je voor dat je twee detectives test, Molmo2 en Qwen3-VL, om te zien wie beter is in het oplossen van videomysteries. Je geeft ze een reeks korte clips en stelt vragen zoals: "Sprong de kat vóór of na het blaffen van de hond?" Beide detectives halen een hoge score op je test, zeg rond de 0,96 (of 96% nauwkeurigheid). Je denkt misschien: "Geweldig! Ze begrijpen tijd perfect."

Maar dit paper betoogt dat je test eigenlijk een truc is. Het is alsof je een detective vraagt: "Heb je de zaak opgelost?" zonder te vragen hoe hij de zaak heeft opgelost. Het paper onthult dat, hoewel beide detectives het juiste antwoord gaven, ze totaal verschillende, en tegenovergestelde, methoden gebruikten om daar te komen. De een is een "Tijdreiziger" die negeert wat hij ziet, en de ander is een "Realist" die zijn ogen vertrouwt.

De Twee Vragen Verborgen in Eén Score

De auteurs zeggen dat een standaard video-testscore eigenlijk een rommelige cocktail is van twee verschillende vragen:

  1. De Taakvraag: Heeft de vraag daadwerkelijk het bekijken van de video in de juiste volgorde nodig? (bijv. "Is de bal gestuiterd?" heeft misschien maar één frame nodig, maar "Is de bal gestuiterd en daarna gerold?" heeft de sequentie nodig.)
  2. De Kanaalvraag: Wanneer de model de volgorde wel nodig heeft, waar haalt het dan die informatie vandaan? Leest het de pixels (de werkelijke beweging op het scherm) of bedriegt het zichzelf door de positienummers te lezen (de onzichtbare labels die de computer vertellen welk frame #1, #2, #3 is)?

De meeste tests controleren alleen de eerste vraag. Ze husselen de frames door elkaar en kijken of de score daalt. Als de score daalt, zeggen ze: "Oké, het model heeft de volgorde nodig." Maar ze controleren niet welk deel van het model het zware werk doet.

De Magische Truk: De "Reversal Drop"

Om erachter te komen hoe de modellen echt werken, voerden de auteurs een magische truc uit genaamd de reversal-drop.

Stel je voor dat je een video hebt van een ballon die wordt opgeblazen.

  • De Pixels: De visuele frames laten zien dat de ballon groter wordt.
  • De Positie-labels (RoPE): Dit zijn onzichtbare tags die aan elk frame zijn bevestigd en zeggen "Frame 1," "Frame 2," "Frame 3."

De auteurs namen een video, keerden de pixels om (zodat de ballon eruitziet alsoat hij leegloopt, krimpt van groot naar klein), maar hielden de positie-labels voorwaarts (zodat de computer nog steeds denkt dat hij Frame 1, Frame 2, Frame 3 bekijkt).

Nu zeggen de pixels "leeglopen", maar de labels zeggen "opblazen". De twee kanalen vechten met elkaar.

  • Molmo2 (De Positie-dominante Detective): Wanneer de pixels en de labels vechten, negeert Molmo2 de pixels. Het kijkt naar de labels, ziet "Frame 1, 2, 3," en antwoordt alsof de ballon wordt opgeblazen. Ondanks dat het een leeglopende ballon ziet, zegt het: "Hij wordt opgeblazen!" omdat de labels dat zeiden.
    • Het resultaat: De nauwkeurigheid veranderde bijna niet. Het gaf niet om het feit dat de video was omgedraaid. Het las de positie-indices.
  • Qwen3-VL (De Visuele-sequentie-dominante Detective): Wanneer de pixels en de labels vechten, negeert Qwen3-VL de labels. Het kijkt naar de pixels, ziet de ballon krimpen, en antwoordt: "Hij loopt leeg!"
    • Het resultaat: De nauwkeurigheid stortte in. Het gaf het verkeerde antwoord omdat het werd misleid door de omgedraaide video. Het las de visuele volgorde.

De Cijfers Liegen Niet

Het paper mat deze "drop" in nauwkeurigheid om het verschil te bewijzen:

  • Op een benchmark genaamd TVBench, toen de video werd omgedraaid maar de labels voorwaarts bleven:
    • Molmo2 daalde met bijna niets (ongeveer +0,00 tot +0,08 punten). Het was volkomen oké.
    • Qwen3-VL daalde met een enorme hoeveelheid (tussen de +0,24 en +0,55 punten). Het stortte in.
  • Op TempCompass, met een speciale "paired ground truth" test (waarbij ze het antwoord voor zowel de voorwaartse als de achterwaartse video kennen):
    • Molmo2 beantwoordde de "voorwaartse" gebeurtenis (door de omgedraaide video te negeren) met een score van 0,965 in beide gevallen.
    • Qwen3-VL daalde van 0,944 (normaal) naar 0,576 (omgedraaid).

Dit bewijst dat twee modellen exact dezelfde hoge score kunnen hebben op een normale test, maar dat de een vertrouwt op de "kaart" (labels) en de ander op het "terrein" (pixels). Als je de kaart vervangt voor een valse kaart, faalt het eerste model, maar het tweede model is misschien nog steeds oké.

Wat het Paper Uitsluit

De auteurs waren zeer zorgvuldig om er zeker van te zijn dat dit geen glitch of een vreemd artefact van hun test was.

  • Het is niet alleen "verwarring": Ze gebruikten een techniek genaamd activation patching (wat lijkt op het verwisselen van de hersencellen van het ene model met de "correcte" hersencellen van het andere model) om te bewijzen dat het verschil echt is.
    • Toen ze het "brein" van Molmo2 in de allereerste laag herstelden, herstelde het zich perfect.
    • Toen ze het "brein" van Qwen3-VL in de eerste laag herstelden, faalde het nog steeds een beetje. Ze moesten het helemaal terugzetten naar lagen 0, 1 en 2 (waar een functie genaamd DeepStack extra visuele data injecteert) om het te laten herstellen.
    • Dit bewijst dat het een diepe, interne eigenschap is van hoe de modellen zijn gebouwd, en niet slechts een oppervlakkige truc.
  • Het is niet alleen "timestamps": Ze controleerden of de modellen simpelweg de tijd op het scherm lazen (zoals "00:01", "00:02"). Ze ontdekten dat hoewel timestamps helpen, de modellen nog steeds zwaar leunen op de positie-labels of de pixels, zelfs wanneer de timestamps worden verwijderd.
  • Het is niet alleen "single frame" bedrog: Ze toonden aan dat beide modellen echt meerdere frames nodig hebben om deze problemen op te lossen (ze krijgen een +0,20 boost bij het zien van de hele video versus één frame). Dus ze gokken niet simpelweg vanaf één plaatje; ze verwerken daadwerkelijk de sequentie, maar op verschillende manieren.

De Belangrijkste Conclusie

Het paper concludeert dat een enkele "temporele score" misleidend is. Het is alsof je zegt dat twee auto's dezelfde topsnelheid hebben, maar de een op benzine rijdt en de ander op elektriciteit. Als je ze op een weg zonder benzinestations rijdt, faalt de elektrische auto, ook al hadden ze dezelfde snelheidstestscore.

  • Molmo2 is positie-dominant: Het vertrouwt meer op de onzichtbare labels (RoPE) dan op wat het ziet.
  • Qwen3-VL is visuele-sequentie-dominant: Het vertrouwt meer op wat het ziet (pixels) dan op de labels.

De auteurs stellen voor dat toekomstige tests moeten stoppen met alleen een enkel getal geven. In plaats daarvan zouden ze de "reversal-drop" moeten rapporteren om te zien of een model de kaart of het terrein leest. Dit helpt ons te begrijpen hoe een model faalt, niet alleen dat het faalt. Als je een model nodig hebt dat aandacht besteedt aan de werkelijke video-inhoud, wil je niet degene die alleen de labels leest. Als je er een nodig hebt die een strikt schema volgt, heb je misschien de label-lezer liever. Maar je kunt het verschil niet zien door alleen naar de eindscore te kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →