← Derniers articles
🤖 AI

FuseMamba-VD: Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection

Le document propose FuseMamba-VD, une architecture VideoMamba à double branche efficace avec une fusion de jeton de classe par porte qui atteint des performances de détection de violence de pointe sur plusieurs bancs d'essai en équilibrant efficacement la précision et l'efficacité computationnelle grâce à un squelette de modèle d'espace d'état.

Auteurs originaux : Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh

Publié 2026-07-07
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de repérer le déclenchement d'une bagarre sur une place bondée en utilisant les images d'une caméra de surveillance. C'est un travail difficile. Si vous regardez simplement une seule image fixe, vous pourriez voir deux personnes debout l'une à côté de l'autre, mais vous ne pouvez pas dire s'ils se font un câlin ou s'ils se battent. Si vous vous contentez d'observer le mouvement sans regarder les détails, vous pourriez manquer le geste précis qui transforme une bousculade en un coup de poing.

Ce document présente un nouveau programme informatique appelé FuseMamba-VD, conçu pour résoudre ce problème. Considérez-le comme un agent de sécurité hautement entraîné qui utilise une approche de « double cerveau » pour surveiller les caméras.

Voici comment cela fonctionne, décomposé en concepts simples :

1. Le problème des anciennes méthodes

Les programmes informatiques précédents essayaient de faire cela de deux manières, mais les deux présentaient des défauts :

  • La méthode « lente » (CNN) : Elles consistaient à prendre une photo toutes les quelques secondes. Elles étaient douées pour voir les détails, mais manquaient la longue histoire du début et de la fin d'une bagarre.
  • La méthode « coûteuse » (Transformers) : C'était comme essayer de lire chaque mot d'une bibliothèque entière à la fois pour comprendre une histoire. Elles étaient très intelligentes, mais nécessitaient tellement de puissance informatique qu'elles étaient lentes et coûteuses à exploiter sur des caméras du monde réel.

2. La nouvelle solution : Une équipe de deux personnes

Les auteurs ont construit un système avec deux « cerveaux » distincts (branches) travaillant simultanément, inspirés par un nouveau type de technologie efficace appelée Mamba (Modèles d'Espace d'État).

  • Le Cerveau A (Le Détective de Détails) : Cette branche examine la vidéo image par image, en se concentrant sur les détails spatiaux. Elle demande : « À quoi ressemblent les gens ? Leurs poings sont-ils serrés ? À quelle distance sont-ils ? » Elle donne la priorité à la forme et à l'apparence de la scène.
  • Le Cerveau B (Le Suiveur de Mouvement) : Cette branche regarde la vidéo comme un flux continu, en se concentrant sur la dynamique temporelle. Elle demande : « Comment bougent-ils ? La vitesse augmente-t-elle ? Y a-t-il une charge soudaine ? » Elle donne la priorité au mouvement et au rythme.

3. La recette secrète : La « Fusion par Porte »

Habituellement, on attendrait la toute fin pour laisser ces deux cerveaux communiquer entre eux. Mais FuseMamba-VD est différent. Il utilise un mécanisme appelé Fusion de Jeton de Classe par Porte (GCTF).

Imaginez que les deux cerveaux aient une conversation à chaque étape du processus pendant qu'ils regardent la vidéo.

  • Le « Détective de Détails » (Cerveau A) murmure des indices au « Suiveur de Mouvement » (Cerveau B) constamment.
  • Une porte spéciale (un interrupteur intelligent) décide de la quantité d'information à laisser passer à un instant donné. Si le mouvement est confus, la porte peut dire : « Écoute davantage les détails. » Si les détails sont flous, elle peut dire : « Concentre-toi sur le mouvement. »

Cette conversation continue, couche par couche, permet au système d'affiner sa compréhension constamment, plutôt que d'attendre la fin pour combiner les notes.

4. L'astuce du « Recadrage »

Avant même que les cerveaux ne commencent à regarder, le système possède un Module de Recadrage. Considérez cela comme un cadreur de caméra qui zoome sur les personnes dans la vidéo et élimine l'arrière-plan (comme les arbres, les voitures ou le ciel vide). Cela garantit que l'ordinateur ne gaspille pas d'énergie à regarder des choses qui ne sont pas des humains, ce qui le rend beaucoup plus rapide et précis pour repérer les interactions humaines.

5. Les résultats : Plus rapides et plus intelligents

Les auteurs ont testé ce nouveau système sur une vaste collection de vidéos de surveillance du monde réel (fusionnant quatre ensembles de données différents en un seul test géant) et sur un nouvel ensemble de données appelé DVD.

  • Précision : Il a battu tous les modèles précédents de « pointe » (state-of-the-art). Il était meilleur pour détecter la violence que les anciens poids lourds.
  • Efficacité : C'est la grande victoire. Le nouveau modèle est beaucoup plus léger. Il utilise moins de la moitié de la puissance informatique (FLOPs) et possède moins de « neurones » (paramètres) que son concurrent le plus proche, CUE-Net.
  • Vitesse : Parce qu'il est si efficace, il est environ 4,7 fois plus rapide sur du matériel de haute performance que le précédent meilleur modèle.

Résumé

En résumé, FuseMamba-VD est un détecteur de violence vidéo qui ne se contente pas de « regarder » des vidéos ; il dispose de deux experts spécialisés qui discutent constamment entre eux tout en zoomant sur l'action. Ce travail d'équipe permet de repérer les bagarres plus précisément qu'auparavant, tout en utilisant une fraction de la puissance informatique, ce qui en fait une solution pratique pour les caméras de surveillance du monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →