← Nieuwste papers
🤖 AI

FuseMamba-VD: Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection

Het artikel stelt FuseMamba-VD voor, een efficiënte dual-branch VideoMamba-architectuur met gated class token fusion die een state-of-the-art prestatie op het gebied van gewelddetectie bereikt op meerdere benchmarks door effectief de nauwkeurigheid en computationele efficiëntie te balanceren via een state-space model backbone.

Oorspronkelijke auteurs: Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh

Gepubliceerd 2026-07-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een vechtpartij te ontdekken die uitbreekt op een druk stadsplein aan de hand van camerabeelden. Dat is een lastige klus. Als je alleen naar een enkele snapshot kijkt, zie je misschien twee mensen dicht bij elkaar staan, maar je kunt niet zien of ze elkaar een knuffel geven of aan het vechten zijn. Als je alleen naar de beweging kijkt zonder naar de details te kijken, mis je misschien de specifieke handeling die een duw verandert in een klap.

Dit artikel introduceert een nieuw computerprogramma genaamd FuseMamba-VD, ontworpen om dit probleem op te lossen. Denk aan een zeer getrainde beveiligingsbeambte die een speciale "twee-hersenen-aanpak" gebruikt om de camera's in de gaten te houden.

Hier is hoe het werkt, onderverdeeld in eenvoudige concepten:

1. Het probleem met oude methoden

Eerdere computerprogramma's probeerden dit op twee manieren te doen, maar beide hadden gebreken:

  • De "Trage" Methode (CNN's): Deze waren als het maken van een foto elke paar seconden. Ze waren goed in het zien van details, maar misten het lange verhaal over hoe een gevecht begon en eindigde.
  • De "Dure" Methode (Transformers): Deze waren als het proberen te lezen van elk afzonderlijk woord in een bibliotheek tegelijk om een verhaal te begrijpen. Ze waren erg slim, maar vereisten zoveel computerkracht dat ze traag en duur waren om te draaien op echte camera's in de praktijk.

2. De nieuwe oplossing: Een tweepersoonsteam

De auteurs hebben een systeem gebouwd met twee aparte "hersenen" (takken) die tegelijkertijd werken, geïnspireerd door een nieuwe soort efficiënte technologie genaamd Mamba (State-Space Models).

  • Brein A (De Detaildetective): Deze tak kijkt frame voor frame naar de video en focust op ruimtelijke details. Het vraagt: "Hoe zien de mensen eruit? Zijn hun vuisten gebald? Hoe dicht staan ze bij elkaar?" Het geeft prioriteit aan de vorm en het uiterlijk van de scène.
  • Brein B (De Bewegingsvolger): Deze tak bekijkt de video als een continue stroom en focust op temporele dynamiek. Het vraagt: "Hoe bewegen ze? Neemt de snelheid toe? Is er een plotselinge uitval?" Het geeft prioriteit aan de beweging en de timing.

3. Het geheime ingrediënt: De "Gated Fusion"

Normaal gesproken zou je wachten tot het allerlaatste moment om de twee hersenen met elkaar te laten praten. Maar FuseMamba-VD is anders. Het gebruikt een mechanisme genaamd Gated Class Token Fusion (GCTF).

Stel je voor dat de twee hersenen bij elke stap van het proces een gesprek voeren terwijl ze de video bekijken.

  • De "Detaildetective" (Brein A) fluistert constant aanwijzingen naar de "Bewegingsvolger" (Brein B).
  • Een speciale poort (een slimme schakelaar) bepaalt hoeveel van die informatie er op elk gegeven moment doorheen wordt gelaten. Als de beweging verwarrend is, kan de poort zeggen: "Luister meer naar de details." Als de details wazig zijn, kan hij zeggen: "Focus op de beweging."

Dit continue gesprek, laag voor laag, stelt het systeem in staat om het begrip constant te verfijnen, in plaats van te wachten tot het einde om de aantekeningen te combineren.

4. De "Crop"-truc

Voordat de hersenen zelfs maar beginnen met kijken, heeft het systeem een Cropping Module. Denk aan een cameraman die inzoomt op de mensen in de video en de achtergrond (zoals bomen, auto's of een lege lucht) wegknipt. Dit zorgt ervoor dat de computer geen energie verspilt aan het bekijken van zaken die geen mensen zijn, wat het veel sneller en nauwkeuriger maakt bij het opsporen van menselijke interacties.

5. De resultaten: Sneller en slimmer

De auteurs hebben dit nieuwe systeem getest op een enorme collectie videobeelden uit de echte wereld (door vier verschillende datasets samen te voegen tot één gigantische test) en een nieuwe dataset genaamd DVD.

  • Nauwkeurigheid: Het versloeg alle voorgaande "state-of-the-art" modellen. Het was beter in het opsporen van geweld dan de oude zwaargewichten.
  • Efficiëntie: Dit is de grote winst. Het nieuwe model is veel lichter. Het gebruikt minder dan de helft van de computerkracht (FLops) en heeft minder "neuronen" (parameters) dan de dichtstbijzijnde concurrent, CUE-Net.
  • Snelheid: Omdat het zo efficiënt is, draait het ongeveer 4,7 keer sneller op hoogwaardige hardware dan het vorige beste model.

Samenvatting

Kortom, FuseMamba-VD is een detectiesysteem voor geweld in video dat niet alleen video's "bekijkt"; het heeft twee gespecialiseerde experts die constant met elkaar praten terwijl ze inzoomen op de actie. Dit teamwork stelt het systeem in staat om gevechten nauwkeuriger te ontdekken dan voorheen, terwijl het slechts een fractie van de computerkracht gebruikt, wat het een praktische oplossing maakt voor echte beveiligingscamera's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →