← Neueste Arbeiten
💻 computer science

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

TimeLens2 führt ein generalistisches Framework für das zeitliche Video-Grounding ein, das multimodale LLMs mit einer neuartigen Multi-Span-Supervisionsstrategie und einer temporalen Wasserstein-Belohnung nutzt, um eine State-of-the-Art-Leistung über diverse Benchmarks hinweg zu erzielen, wobei es sowohl größenvergleichbare Baselines als auch wesentlich größere Open-Source-Modelle signifikant übertrifft.

Ursprüngliche Autoren: Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

Veröffentlicht 2026-07-21
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen superintelligenten Roboterfreund, der jedes Video der Welt ansehen und genau beschreiben kann, was gerade passiert. Es ist wie ein persönlicher Erzähler, der kein Detail verpasst. Aber hier ist der Haken: Wenn Sie fragen: „Wann fängt der Hund den Frisbee?“, sagt der Roboter vielleicht: „Der Hund fängt den Frisbee!“, und klingt dabei sehr selbstbewusst, aber er wird Ihnen nicht sagen, wann Sie das Video pausieren müssen, um es zu sehen. Es ist, als würde man ein Buch lesen, in dem der Erzähler zwar die Handlung beschreibt, aber sich weigert, die Seitenzahlen anzugeben. Ohne diese Seitenzahlen (oder in diesem Fall die Zeitstempel) können Sie die Geschichte nicht überprüfen oder die Beweise selbst finden. Dies ist das Problem des „Temporal Grounding“ (zeitliche Verankerung). Wissenschaftler versuchen, KI nicht nur beizubringen, Videos zu beschreiben, sondern auch auf die exakten Sekunden zu zeigen, in denen die Handlung stattfindet – selbst wenn diese Sekunden über einen langen Film verteilt sind oder wenn das Video aus einer wackeligen Ego-Perspektive gefilmt wurde.

Hier kommt TimeLens2 ins Spiel, ein neues KI-Modell, das als der ultimative Video-Detektiv konzipiert ist. Während frühere KI-Modelle wie Detektive waren, die zwar einen Tatort beschreiben konnten, aber nicht den spezifischen Moment finden konnten, in dem der Verdächtige die Waffe fallen ließ, ist TimeLens2 darauf trainiert, die exakten Zeitintervalle zu finden – egal, ob es sich um eine einzige Sekunde oder ein Dutzend verstreuter Momente in einem zweistündigen Film handelt. Die Forscher fanden heraus, dass sie, um dies zu erreichen, die Art und Weise, wie sie die KI trainierten, komplett ändern mussten. Anstatt der KI einfach nur ein Video zu zeigen und nach einer Antwort zu fragen, bauten sie eine spezielle „Verifikations-Pipeline“ auf, in der mehrere KI-Agenten wie ein Gremium von Richtern fungieren, die die Arbeit der anderen gegenseitig überprüfen, um sicherzustellen, dass die Zeitstempel echt sind und nicht bloß Vermutungen. Sie erfanden auch eine neue Methode, um die Antworten der KI zu bewerten, die Teilpunkte vergibt, wenn man „nahe dran“ ist, selbst wenn die KI den exakten Start- oder Endzeitpunkt verpasst hat, anstatt einfach eine Null für jeden Fehler zu geben. Das Ergebnis? Ein kompaktes KI-Modell (so klein wie 2 Milliarden Parameter), das in der Lage ist, Beweise in Videos besser zu finden als viel größere, teurere Modelle – ein Beweis dafür, dass mit dem richtigen Training ein kleines Gehirn ein schärferer Detektiv sein kann als ein riesiges.

Das neue Werkzeug des Detektivs

Wie wurde TimeLens2 also so gut darin, das „Wann“ in Videos zu finden? Die Forscher erkannten, dass die alte Art, KI zu trainieren, fehlerhaft war. Stellen Sie sich vor, Sie versuchen, einem Schüler beizubringen, eine Nadel im Heuhaufen zu finden, indem Sie ihm einfach den ganzen Heuhaufen hinlegen und sagen: „Finde die Nadel.“ Wenn der Schüler falsch rät, sagen Sie nur „Nein“, und er hat keine Vorstellung davon, wie nah er dran war. In der Welt der Video-KI bedeutete dies: Wenn ein Modell die falsche Sekunde rät, erhielt es null Punkte, selbst wenn es nur eine Sekunde daneben lag. Dies machte das Lernen sehr langsam und frustrierend.

Um dies zu beheben, entwickelte das Team TimeLens2-93K, einen massiven Datensatz, der mit einem cleveren, mehrstufigen Prozess erstellt wurde. Denken Sie an eine Produktionslinie für perfekte Video-Hinweise:

  1. Der Entwurf: Zuerst nutzten sie eine intelligente KI, um eine Geschichte (Caption) für das gesamte Video zu schreiben, indem sie es in kleinere Szenen unterteilte.
  2. Die Frage: Aus diesen Szenen generierten sie Fragen wie: „Wann wird die Sauce gerührt?“
  3. Die Doppelprüfung: Hier liegt die Magie. Anstatt einer einzigen Antwort zu vertrauen, schickten sie das Video an zwei verschiedene KI-„Detektive“. Diese Detektive arbeiteten unabhängig voneinander, um die Zeitintervalle zu finden.
  4. Der Konsens: Wenn beide Detektive sich auf die Zeit einigten, wurde die Antwort behalten. Wenn sie sich uneinig waren, wurde sie verworfen. Dies stellte sicher, dass die Trainingsdaten extrem zuverlässig waren.
  5. Der Feinschliff: Schließlich nutzten sie eine dritte, noch intelligentere KI, um die exakten Start- und Endzeiten zu präzisieren, wodurch die Grenzen exakt wurden.

Dieser Prozess verwandelte einen unordentlichen, unzuverlässigen Datensatz in eine Goldgrube aus 93.000 hochwertigen Beispielen, bei denen die KI genau weiß, wann Dinge passieren.

Der „Wasserstein“-Score: Eine neue Art der Bewertung

Nachdem die KI gute Daten zum Lernen erhalten hatte, mussten die Forscher ihr beibringen, ihre eigene Arbeit zu bewerten. Sie führten eine neue Bewertungsmethode namens Temporal Wasserstein Reward ein.

Stellen Sie sich vor, Sie spielen ein Spiel, bei dem Sie den Ort eines verborgenen Schatzes auf einer Zeitachse erraten müssen.

  • Der alte Weg (tIoU): Wenn Sie den falschen Ort raten, bekommen Sie eine Null. Es spielt keine Rolle, ob Sie nur einen Zentimeter oder einen Kilometer daneben lagen; Sie bekommen nichts. Das ist wie ein Lehrer, der Ihnen eine „ungenügende“ gibt, weil Sie das falsche Datum geschrieben haben, selbst wenn Sie nur einen Tag daneben lagen.
  • Der TimeLens2-Weg (Wasserstein): Diese neue Methode ist wie ein GPS. Wenn Sie nur einen Zentimeter entfernt sind, sagt es: „Du bist fast da!“ und gibt Ihnen eine hohe Punktzahl. Wenn Sie einen Kilometer entfernt sind, sagt es: „Du liegst weit daneben“ und gibt Ihnen eine niedrige Punktzahl. Es misst die Distanz zwischen Ihrer Vermutung und der Wahrheit.

Dies ist entscheidend, da es die KI lehrt, es weiter zu versuchen, näher heranzukommen, selbst wenn sie die exakte Antwort noch nicht gefunden hat. Diese Methode zeigt, dass sie der KI hilft, aus Fehlern viel schneller zu lernen, indem sie „stumme“ Fehlschläge (bei denen die KI eine Null erhält und nichts lernt) in wertvolle Lernmomente verwandelt.

Die Ergebnisse: Kleines Gehirn, große Fähigkeiten

Das Team testete TimeLens2 auf sieben verschiedenen Video-Herausforderungen, die von kurzen Clips von Menschen bei Handlungen bis hin zu langen, komplexen Videos reichten, die aus der Sicht einer Person gefilmt wurden (wie eine GoPro auf einem Helm). Sie testeten drei Versionen des Modells: eine kleine 2-Milliarden-Parameter-Version, eine mittlere 4-Milliarden-Version und eine große 8-Milliarden-Version.

Die Ergebnisse waren überraschend. Die winzige 2-Milliarden-Version von TimeLens2 schlug alle anderen vergleichbaren KI-Modelle in jedem einzelnen Test. Noch beeindruckender war, dass die 4-Milliarden-Version massive, proprietäre Modelle übertraf, die hunderte Male größer sind (wie ein Modell mit 397 Milliarden Parametern). Vereinfacht gesagt: Ein kleines, gut trainiertes TimeLens2-Modell ist ein besserer Video-Detektiv als ein riesiges, teures Modell, das nicht das gleiche sorgfältige Training erhalten hat.

Beispielsweise verbesserte das Modell bei einem Test namens „MomentSeeker“, bei dem die KI Fragen beantworten muss wie „Was wurde neben die Tür gestellt?“, seine Werte im Vergleich zu seinen Basisversionen signifikant. Das 2B-Modell steigerte sich um 14,2 Punkte, das 4B um 13,0 und das 8B um 18,1 Punkte. Dies deutet darauf hin, dass das „Geheimrezept“ nicht nur darin bestand, die KI größer zu machen, sondern ihr beizubringen, wie sie nach Beweisen sucht und wie sie versteht, dass „nah dran zu sein“ besser ist als „falsch zu liegen“.

Warum das wichtig ist

Das Paper kommt zu dem Schluss, dass wir durch die Behandlung von Video-Evidenz als eine Menge von Zeitintervallen und die Nutzung dieser neuen, intelligenteren Wege, die KI zu trainieren und zu bewerten, die Videosuche viel zuverlässiger machen können. Anstatt nur eine vage Beschreibung zu erhalten, können Nutzer nun präzise, verifizierbare Zeitstempel erhalten. Dies verwandelt Video-KI von einer „Black Box“, die nur rät, in ein transparentes Werkzeug, das seine Arbeit offenlegen kann. Dies macht es möglich, durch Stunden von Videomaterial zu suchen, um genau das zu finden, was man sucht – sei es eine bestimmte Handlung, ein wiederkehrendes Ereignis oder ein Moment, der aus einer Ego-Perspektive eingefangen wurde. Die Forscher legen nahe, dass dieser Ansatz Videoarchive für alle – von Forschern bis hin zu alltäglichen Nutzern – durchsuchbar und vertrauenswürdig machen könnte.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →