← Nieuwste papers
💻 computer science

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

Dit artikel introduceert MME-VideoOCR, een uitgebreide benchmark met 25 taken verspreid over 44 videoscenario's om de Optical Character Recognition-capaciteiten in Multimodale Grote Taalmodellen te evalueren, waarbij wordt onthuld dat huidige state-of-the-art modellen worstelen met holistische video-begrip, spatio-temporele redenering en cross-frame integratie, ondanks het behalen van slechts 73,7% nauwkeurigheid zelfs met de best presterende systemen.

Oorspronkelijke auteurs: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zh
Gepubliceerd 2026-08-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In het stille gezoem van een moderne computer leert een nieuw soort intelligentie te zien. Deze systemen, bekend als multimodale grote taalmodellen, zijn ontworpen om niet alleen woorden te verwerken, maar ook afbeeldingen en video's, die ze samenvoegen tot één enkele stroom van begrip. Ze zijn opmerkelijk vaardig geworden in het lezen van tekst uit statische afbeeldingen, waarbij ze een foto van een straatnaambord of een document met hoge precisie omzetten in digitale woorden. Deze vaardigheid heeft deuren geopend voor machines om de wereld te navigeren, instructies te lezen en informatie te organiseren. De echte wereld staat echter zelden stil. Het beweegt, verschuift en verandert. Wanneer dezezelfde intelligente systemen worden gevraagd om tekst uit een bewegende video te lezen, wordt de taak veel moeilijker. De tekst kan vervagen terwijl een auto voorbijraast, slechts een fractie van een seconde verschijnen, of verspreid zijn over verschillende momenten in de tijd. Het begrijpen van tekst in beweging vereist meer dan alleen zien; het vraagt om onthouden, verbinden en redeneren over een opeenvolging van gebeurtenissen.

Een team van onderzoekers heeft nu een nauwkeurig kijkje genomen in hoe goed deze geavanceerde systemen omgaan met tekst in de dynamische wereld van video. Ze bouwden een nieuwe testomgeving genaamd MME-VideoOCR, een uitgebreide collectie videoclips die ontworpen is om machines uit te dagen op de specifieke manieren waarop menselijke ogen en geesten worstelen met bewegende tekst. Deze benchmark vraagt een computer niet simpelweg om een woord te lezen; het vraagt de computer om een specifiek nummer op een racewagen te vinden, een kenteken te volgen terwijl een voertuig van rijstrook wisselt, of een zin te reconstrueren die is opgedeeld en verspreid over verschillende seconden aan beelden. De onderzoekers verzamelden 1.464 video's, variërend van korte clips tot langere sequenties, die vieren-en-veertig verschillende real-world scenario's beslaan zoals autorijden, koken, het nieuws kijken en het bijwonen van colleges. Voor elke video creëerden ze tweeduizend zorgvuldig vervaardigde vragen en antwoorden, die allemaal door menselijke experts zijn geverifieerd om nauwkeurigheid en eerlijkheid te garanderen.

Toen ze achttien van de meest geavanceerde video-lezende modellen aan de test onderwierpen, onthulden de resultaten een aanzienlijke kloof tussen de huidige capaciteiten en de eisen van de echte wereld. Zelfs het best presterende systeem, een krachtig model genaamd Gemini-2.5 Pro, slaagde er slechts in 73,7 procent van de tijd correct te antwoorden. Hoewel dit een hoge score lijkt, ontdekten de onderzoekers dat de modellen dramatisch faalden op taken die vereisten dat ze naar de hele video keken en informatie over de tijd heen verbonden. Bijvoorbeeld, wanneer gevraagd werd om een letter te herkennen die gevormd werd door het pad van een bewegend object, of om een woord te reconstrueren uit letters die in willekeurige volgorde over verschillende frames verschenen, scoorden de topmodellen bijna nul. Ze konden een bord lezen dat duidelijk zichtbaar was in een enkel frame, maar ze verloren vaak de draad wanneer de informatie verspreid was.

De studie bracht ook een merkwaardige gewoonte aan het licht in hoe deze machines denken. Wanneer ze geconfronteerd werden met wazige of verkeerd gespelde tekst, negeerden de modellen vaak wat er daadwerkelijk op het scherm stond en gokten ze in plaats daarvan wat de tekst zou moeten zeggen op basis van algemene taalpatronen. Als een bord in een video duidelijk "OFF COURS" las met een ontbrekende letter, zou het model het vaak zelfverzekerd als "OFF COURSE" rapporteren, waarbij het de voorkeur gaf aan zijn interne kennis van hoe woorden gewoonlijk gespeld worden boven het visuele bewijs. Deze neiging om te vertrouwen op wat het verwacht te zien, in plaats van op wat er daadwerkelijk is, suggereert dat deze systemen nog steeds zwaar worden beïnvloed door hun training op geschreven taal, soms ten koste van de visuele nauwkeurigheid.

Bovendien ontdekten de onderzoekers dat de kwaliteit van de video-input enorm veel uitmaakt. Wanneer ze de modellen lagere resolutiebeelden of minder frames uit de video voerden, daalde de prestatie scherp. De machines hadden hoge definitie helderheid en een voldoende aantal momenten in de tijd nodig om het verhaal in elkaar te zetten. Dit bevinding benadrukt dat het simpelweg groter of slimmer maken van een model niet genoeg is; de manier waarop het de wereld ziet, moet scherp en continu zijn. De studie concludeert dat hoewel deze kunstmatige intelligenties grote stappen hebben gezet in het lezen van statische afbeeldingen, ze nog steeds niet het vermogen hebben om de vloeiende, gefragmenteerde en vaak rommelige aard van tekst in beweging volledig te begrijpen. De weg vooruit vereist niet alleen betere algoritmen, maar een diepere integratie van visueel geheugen en een weerstand tegen de drang om op basis van gewoonte te gokken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →