← Neueste Arbeiten
💻 computer science

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Ground ist ein neuartiges Video-Large-Language-Modell für das zeitliche Video-Grounding, das die Genauigkeit der Ereignislokalisierung verbessert, indem es ein spezielles Token für ganzheitliche semantische Kontinuität, Savitzky-Golay-Glättung zur Rauschreduzierung und eine mehrgranulare Frame-Merkmalsaggregation einführt, um die Einschränkungen bestehender zeitstempelabhängiger Methoden zu überwinden.

Ursprüngliche Autoren: Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

Veröffentlicht 2026-02-06
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen sehr intelligenten Video-Assistenten (ein „Video Large Language Model“), der einen Film ansehen und Fragen dazu beantworten kann. Wenn Sie ihn jedoch fragen: „Zeig mir die Stelle, an der die Katze eine Spritze bekommt“, hat der Assistent oft Schwierigkeiten, den exakten Start- und Endzeitpunkt zu finden. Er errät vielleicht die Zeit, in der die Katze erscheint, verpasst aber den Moment, in dem die Nadel tatsächlich die Haut berührt, oder er hört zu früh auf.

Dieses Paper stellt ein neues System namens E.M.Ground vor, um dieses Problem zu lösen. Betrachten Sie es als ein Upgrade für den Assistenten – von einer „Stoppuhr“ hin zu einem „Geschichtenerzählers“.

So funktioniert E.M.Ground, erklärt durch einfache Analogien:

1. Der alte Weg: Zwei separate Stoppuhren

Frühere Methoden (wie ein System namens E.T.Chat) versuchten, die Antwort zu finden, indem sie zwei separate Token (wie zwei verschiedene Stoppuhren) verwendeten.

  • Stoppu Uhr A versucht zu erraten, wann das Ereignis genau beginnt.
  • Stoppuhr B versucht zu erraten, wann das Ereignis genau endet.

Das Problem: Das ist so, als würde man versuchen, eine bestimmte Szene in einem Film zu finden, indem man nur den allerersten Frame und den allerletzten Frame betrachtet. Man übersieht alles, was dazwischen passiert. Wenn der Film lang ist, wird der Assistent verwirrt, weil er den „Kern“ der Geschichte ignoriert. Er wählt oft den falschen Start- oder Endzeitpunkt, weil er das gesamte Ereignis nicht als eine kontinuierliche Geschichte versteht.

2. Der neue Weg: Ein „Story-Token“

E.M.Ground ändert die Strategie. Anstatt zwei Stoppuhren zu verwenden, nutzt es ein spezielles Token namens <evt> (kurz für „event“).

  • Die Analogie: Stellen Sie sich vor, Sie suchen nach einem bestimmten Kapitel in einem Buch. Anstatt zu fragen: „Wo beginnt das Kapitel?“ und „Wo endet es?“ getrennt voneinander, halten Sie ein Lesezeichen hoch, auf dem steht: „Das ganze Kapitel“.
  • Wie es funktioniert: Dieses einzelne <evt>-Token betrachtet jeden Frame des Videos gleichzeitig. Es fragt: „Gehört dieser Frame zur Geschichte von ‚die Katze bekommt eine Spritze‘?“ Es hält die Geschichte zusammen und stellt sicher, dass der Assistent Anfang, Mitte und Ende als ein zusammenhängendes, kohärentes Ereignis versteht. Dies hilft dabei, lange Videos viel besser zu handhaben, da man nicht mitten in der Handlung den Faden verliert.

3. Das Glätten der „Zittern“

Selbst mit dem neuen „Story-Token“ kann das Vertrauen des Computers etwas „zittrig“ sein. In einer Sekunde ist er sich zu 90 % sicher, dass ein Frame Teil des Ereignisses ist, und in der nächsten Sekunde sinkt dieser Wert nur wegen eines winzigen visuellen Fehlers auf 40 %, um dann wieder anzusteigen.

  • Die Analogie: Stellen Sie sich eine zittrige Hand vor, die eine Linie auf einem Graphen zeichnet. Die Linie geht zu stark auf und ab, was es schwierig macht, die wahre Form zu erkennen.
  • Die Lösung: E.M.Ground verwendet eine mathematische Technik namens Savitzky-Golay-Glättung. Betrachten Sie dies als das Überfahren eines zerknitterten Hemdes mit einem warmen Bügeleisen. Es glättet die winzigen, verrauschten Falten (das Zittern), ohne die allgemeine Form des Hemdes (das eigentliche Ereignis) zu verändern. Dies hilft dem System, die Start- und Endzeiten genauer zu bestimmen, indem es das Rauschen ignoriert.

4. Das Wiederaufbauen verlorener Details

Um Videos für Computer leichter verarbeitbar zu machen, komprimieren Systeme diese oft und werfen dabei einige visuelle Details weg (wie das Zusammenquetschen eines hochauflösenden Fotos zu einem Vorschaubild). Dies führt normalerweise dazu, dass der Computer wichtige Hinweise übersieht.

  • Die Analogie: Es ist, als würde man versuchen, ein Gesicht anhand eines unscharfen, qualitativ minderwertigen Fotos zu erkennen.
  • Die Lösung: E.M.Ground nutzt multi-granulare Merkmale. Anstatt nur auf das unscharfe Vorschaubild zu schauen, betrachtet es das Foto auf verschiedenen Detailstufen (scharfe Kanten, Farben, Texturen) und kombiniert diese. Es ist, als würde man gleichzeitig eine Lupe, ein Weitwinkelobjektiv und einen Farbfilter verwenden, um die fehlenden Details wieder aufzubauen, damit der Computer nichts Wichtiges übersieht.

Die Ergebnisse

Das Paper hat E.M.Ground auf vielen verschiedenen Video-Datensätzen getestet.

  • Bessere Genauigkeit: Es hat die bisherigen besten Methoden (wie E.T.Chat) konsistent und um eine große Spanne geschlagen.
  • Lange Videos: Während ältere Systeme mit zunehmender Videolänge schlechter wurden, blieb E.M.Ground stark, weil es die ganze Geschichte verstand und nicht nur Anfang und Ende.
  • Weniger Fehler: Es machte weita-hin weniger Fehler, bei denen der vorhergesagte Zeitraum keine Überschneidung mit dem tatsächlichen Ereignis hatte oder bei denen es nur die Mitte des Ereignisses fand und den Anfang/das Ende verpasste.

Zusammenfassend lässt sich sagen: E.M.Ground hört auf, Start- und Endzeiten separat zu raten. Stattdessen behandelt es das Ereignis als eine einzige, kontinuierliche Geschichte, glättet die Verwirrung des Computers und nutzt alle verfügbaren visuellen Details, um den exakten Moment zu finden, in dem das Ereignis stattfindet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →