← Neueste Arbeiten
🤖 AI

FuseMamba-VD: Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection

Das Papier schlägt FuseMamba-VD vor, eine effiziente Dual-Branch-VideoMamba-Architektur mit Gated-Class-Token-Fusion, die durch ein State-Space-Model-Backbone eine State-of-the-Art-Leistung bei der Gewalterkennung auf mehreren Benchmarks erreicht, indem sie Genauigkeit und Recheneffizienz effektiv ausbalanciert.

Ursprüngliche Autoren: Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh

Veröffentlicht 2026-07-07
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, auf Überwachungskameraaufnahmen einen Streit auszuspähen, der auf einem belebten Stadtplatz ausbricht. Das ist ein schwieriger Job. Wenn man nur eine einzelne Momentaufnahme betrachtet, sieht man vielleicht zwei Menschen, die eng beieinander stehen, aber man kann nicht erkennen, ob sie sich umarmen oder streiten. Wenn man nur die Bewegung beobachtet, ohne auf die Details zu achten, übersieht man vielleicht die spezifische Geste, die ein Stoßen in einen Schlag verwandelt.

Dieses Paper stellt ein neues Computerprogramm namens FuseMamba-VD vor, das entwickelt wurde, um genau dieses Problem zu lösen. Denken Sie an einen hochtrainierten Sicherheitswachmann, der mit einem speziellen „Dual-Brain“-Ansatz die Kameras überwacht.

So funktioniert es, unterteilt in einfache Konzepte:

1. Das Problem mit alten Methoden

Frühere Computerprogramme versuchten dies auf zwei Arten zu lösen, aber beide hatten Mängel:

  • Die „langsame“ Methode (CNNs): Diese waren wie das Aufnehmen eines Fotos alle paar Sekunden. Sie waren gut darin, Details zu sehen, aber sie verpassten die lange Geschichte darüber, wie ein Kampf begann und endete.
  • Die „teure“ Methode (Transformer): Diese waren wie der Versuch, jedes einzelne Wort in einer Bibliothek gleichzeitig zu lesen, um eine Geschichte zu verstehen. Sie waren sehr intelligent, erforderten aber so viel Rechenleistung, dass sie zu langsam und zu teuer für den Einsatz auf realen Kameras waren.

2. Die neue Lösung: Ein Zweier-Team

Die Autoren haben ein System mit zwei separaten „Gehirnen“ (Zweigen) gebaut, die gleichzeitig arbeiten, inspiriert von einer neuen Art von effizienter Technologie namens Mamba (State-Space-Modelle).

  • Gehirn A (Der Detail-Detektiv): Dieser Zweig betrachtet das Video Bild für Bild und konzentriert sich auf räumliche Details. Er fragt: „Wie sehen die Menschen aus? Sind die Fäuste geballt? Wie nah stehen sie beieinander?“ Er priorisiert die Form und das Erscheinungsbild der Szene.
  • Gehirn B (Der Bewegungsverfolger): Dieser Zweig betrachtet das Video als einen kontinuierlichen Fluss und konzentriert sich auf die zeitliche Dynamik. Er fragt: „Wie bewegen sie sich? Nimmt die Geschwindigkeit zu? Gibt es ein plötzliches Vorstoßen?“ Er priorisiert die Bewegung und das Timing.

3. Das Geheimrezept: Die „Gated Fusion“

Normalerweise wartet man bis ganz zum Ende, um diese beiden Gehirne miteinander kommunizieren zu lassen. Aber FuseMamba-VD ist anders. Es verwendet einen Mechanismus namens Gated Class Token Fusion (GCTF).

Stellen Sie sich vor, die beiden Gehirne führen während des gesamten Beobachtungsprozesses ein Gespräch bei jedem einzelnen Schritt.

  • Der „Detail-Detektiv“ (Gehirn A) flüstert dem „Bewungsverfolger“ (Gehirn B) ständig Hinweise zu.
  • Ein spezielles Gate (ein intelligenter Schalter) entscheidet, wie viel dieser Informationen zu jedem gegebenen Zeitpunkt durchgelassen wird. Wenn die Bewegung verwirrend ist, sagt das Gate vielleicht: „Hör mehr auf die Details.“ Wenn die Details unscharf sind, sagt es vielleicht: „Konzentriere dich auf die Bewegung.“

Dieses kontinuierliche Gespräch über mehrere Schichten hinweg ermöglicht es dem System, sein Verständnis ständig zu verfeinern, anstatt erst am Ende die Notizen zusammenzuführen.

4. Der „Crop“-Trick

Bevor die Gehirne überhaupt mit dem Zuschauen beginnen, hat das System ein Cropping-Modul. Denken Sie an einen Kameramann, der auf die Personen im Video heranzoomt und den Hintergrund (wie Bäume, Autos oder leeren Himmel) ausschneidet. Dies stellt sicher, dass der Computer keine Energie verschwendet, indem er auf Dinge schaut, die keine Menschen sind, was ihn viel schneller und präziser beim Erkennen menschlicher Interaktionen macht.

5. Die Ergebnisse: Schneller und Schlauer

Die Autoren haben ihr neues System auf einer massiven Sammlung von Echtzeit-Überwachungsvideos getestet (indem sie vier verschiedene Datensätze zu einem riesigen Test zusammenführten) sowie auf einem neuen Datensatz namens DVD.

  • Genauigkeit: Es übertraf alle bisherigen „State-of-the-Art“-Modelle. Es war besser darin, Gewalt zu erkennen als die alten Schwergewichte.
  • Effizienz: Das ist der große Gewinn. Das neue Modell ist viel leichter. Es nutzt weniger als die Hälfte der Rechenleistung (FLOPs) und hat weniger „Neuronen“ (Parameter) als sein engster Konkurrent, CUE-Net.
  • Geschwindigkeit: Da es so effizient ist, läuft es auf High-End-Hardware etwa 4,7 Mal schneller als das bisher beste Modell.

Zusammenfassung

Kurz gesagt: FuseMamba-VD ist ein Detektor für Gewalt in Videos, der Videos nicht nur „sieht“, sondern zwei spezialisierte Experten besitzt, die währenddessen ständig miteinander chatten und dabei auf das Geschehen zoomen. Dieses Teamwork ermöglicht es dem System, Kämpfe genauer als zuvor zu erkennen, während es nur einen Bruchteil der Computerleistung verwendet, was es zu einer praktischen Lösung für reale Überwachungskameras macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →