MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
Dieses Paper führt MME-VideoOCR ein, einen umfassenden Benchmark mit 25 Aufgaben über 44 Videoszenarien hinweg, um die Fähigkeiten zur optischen Zeichenerkennung in multimodalen großen Sprachmodellen zu bewerten, wobei aufgezeigt wird, dass aktuelle State-of-the-Art-Modelle trotz einer Genauigkeit von lediglich 73,7 % selbst bei den leistungsstärksten Systemen Schwierigkeiten mit der ganzheitlichen Videoverarbeitung, dem räumlich-zeitlichen Denken und der Integration über mehrere Frames hinweg haben.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Im leisen Summen eines modernen Computers lernt eine neue Art von Intelligenz zu sehen. Diese Systeme, bekannt als multimodale große Sprachmodelle, sind darauf ausgelegt, nicht nur Wörter, sondern auch Bilder und Videos zu verarbeiten und diese zu einem einzigen Strom des Verständnisses zu verschmelzen. Sie sind bemerkenswert geschickt darin geworden, Text aus statischen Bildern zu lesen und ein Foto eines Straßenschilds oder eines Dokuments mit hoher Präzision in digitale Wörter zu verwandeln. Diese Fähigkeit hat Maschinen Türen geöffnet, um die Welt zu navigieren, Anweisungen zu lesen und Informationen zu organisieren. Die reale Welt ist jedoch selten still. Sie bewegt sich, verschiebt sich und verändert sich. Wenn dieselben intelligenten Systeme gebeten werden, Text aus einem bewegten Video zu lesen, wird die Aufgabe weitaus schwieriger. Der Text könnte verschwimmen, während ein Auto vorbeirauscht, nur für einen Bruchteil einer Sekunde erscheinen oder über verschiedene Momente in der Zeit verstreut sein. Das Verständnis von Text in Bewegung erfordert mehr als nur das Sehen; es verlangt nach Erinnern, Verknüpfen und Schlussfolgern über eine Sequenz von Ereignissen hinweg.
Ein Team von Forschern hat nun genau untersucht, wie gut diese fortschrittlichen Systeme mit Text in der dynamischen Welt des Videos umgehen. Sie bauten eine neue Testumgebung namens MME-VideoOCR, eine umfassende Sammlung von Videoclips, die darauf ausgelegt ist, Maschinen in den spezifischen Arten herauszufordern, an denen auch das menschliche Auge und der menschliche Geist bei bewegtem Text scheitern. Dieser Benchmark verlangt von einem Computer nicht einfach nur, ein Wort zu lesen; er verlangt vom Computer, eine bestimmte Nummer auf einem Rennwagen zu finden, ein Nummernschild zu verfolgen, während ein Fahrzeug die Spur wechselt, oder einen Satz zusammenzusetzen, der über mehrere Sekunden des Filmmaterials zerstückelt und verstreut ist. Die Forscher sammelten 1.464 Videos, die von kurzen Clips bis hin zu längeren Sequenzen reichten und vierundvierzig verschiedene reale Szenarien abdeckten, wie etwa Autofahren, Kochen, das Ansehen von Nachrichten und das Besuchen von Vorlesungen. Für jedes Video erstellten sie zweitausend sorgfältig gestaltete Fragen und Antworten, die alle von menschlichen Experten verifiziert wurden, um Genauigkeit und Fairness zu gewährleisten.
Als sie achtzehn der fortschrittlichsten Video-Lesemodelle auf die Probe stellten, offenbarten die Ergebnisse eine erhebliche Lücke zwischen den aktuellen Fähigkeiten und den Anforderungen der realen Welt. Selbst das leistungsfähigste System, ein mächtiges Modell namens Gemini-2.5 Pro, konnte nur in 73,7 Prozent der Fälle korrekt antworten. Obwohl dies wie eine hohe Punktzahl erscheinen mag, fanden die Forscher heraus, dass die Modelle bei Aufgaben, die erforderten, das gesamte Video zu betrachten und Informationen über die Zeit hinweg zu verknüpfen, dramatisch versagten. Zum Beispiel, wenn sie gefragt wurden, einen Buchstaben zu erkennen, der durch den Pfad eines bewegten Objekts gebildet wurde, oder ein Wort aus Buchstaben zu rekonstruieren, die in zufälliger Reihenfolge über verschiedene Frames verteilt waren, erreichten die besten Modelle nahezu Null. Sie konnten ein Schild lesen, das in einem einzelnen Frame klar sichtbar war, aber sie verloren oft den Faden, wenn die Information über die Zeit verteilt war.
Die Studie deckte auch eine merkwürdige Angewohnheit in der Art und Weise auf, wie diese Maschinen denken. Wenn sie mit verschwommenem oder falsch geschriebenem Text konfrontiert wurden, ignorierten die Modelle häufig das, was tatsächlich auf dem Bildschirm zu sehen war, und raten stattdessen, was der Text basierend auf gängigen Sprachmustern sein sollte. Wenn ein Schild in einem Video eindeutig „OFF COURS“ mit einem fehlenden Buchstaben las, berichtete das Modell oft selbstbewusst als „OFF COURSE“, wobei es das interne Wissen darüber, wie Wörter normalerweise geschrieben werden, gegenüber dem visuellen Beweis priorisierte. Diese Tendenz, sich auf das zu verlassen, was sie zu sehen erwarten, anstatt auf das, was tatsächlich vorhanden ist, deutet darauf hin, dass diese Systeme immer noch stark von ihrem Training an geschriebener Sprache beeinflusst werden, manchmal auf Kosten der visuellen Genauigkeit.
Darüber hinaus entdeckten die Forscher, dass die Qualität des Video-Inputs eine immense Rolle spielt. Wenn sie den Modellen Bilder mit niedrigerer Auflösung oder weniger Frames aus dem Video fütterten, sank die Leistung drastisch. Die Maschinen benötigten hochauflösende Klarheit und eine ausreichende Anzahl von Momenten in der Zeit, um die Geschichte zusammenzusetzen. Dieser Befund unterstreicht, dass es nicht ausreicht, ein Modell einfach nur größer oder intelligenter zu machen; die Art und Weise, wie es die Welt sieht, muss scharf und kontinuierlich sein. Die Studie kommt zu dem Schluss, dass diese künstlichen Intelligenzen zwar große Fortschritte beim Lesen statischer Bilder gemacht haben, ihnen aber noch die Fähigkeit fehlt, die flüssige, fragmentierte und oft chaotische Natur von Text in Bewegung vollständig zu erfassen. Der Weg nach vorn erfordert nicht nur bessere Algorithmen, sondern eine tiefere Integration von visuellem Gedächtnis und einen Widerstand gegen den Drang, aus Gewohnheit zu raten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.