← Derniers articles
💻 computer science

Learning Where and When: Patch-Based Spatiotemporal Localization in Weakly Supervised Video Anomaly Detection

Cet article introduit un cadre spatiotemporel basé sur des patchs pour la détection d'anomalies vidéo par apprentissage faible qui apprend conjointement la localisation et la temporalité des anomalies à l'aide d'une stratégie de sélection sensible à la proximité, atteignant des performances de pointe tout en publiant de nouvelles annotations de boîtes englobantes et des ressources pour faire progresser la recherche spatialement ancrée.

Auteurs originaux : Hamza Karim, Nghia Nguyen, Lokman Bekit, Yasin Yilmaz

Publié 2026-06-30
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Hamza Karim, Nghia Nguyen, Lokman Bekit, Yasin Yilmaz

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardiez un flux de surveillance de 24 heures d'une place de ville très fréquentée. Votre travail est de trouver les méchants (les anomalies).

L'ancienne méthode : Le détective du « temps uniquement »
La plupart des programmes informatiques précédents étaient comme des détectives qui n'avaient qu'un chronomètre. Ils pouvaient vous dire : « Hé, quelque chose de bizarre s'est passé entre 14h00 et 14h15 ! » Mais ils ne pouvaient pas vous dire cela s'est passé dans la place. Était-ce une bagarre près de la fontaine ? Un vol à l'étalage à la boulangerie ? Ou juste un oiseau qui a percuté une vitre ? Parce qu'ils ne pouvaient pas pointer l'endroit spécifique, ils étaient difficiles à faire confiance dans le monde réel.

La nouvelle méthode : Le détective par « patchs »
Ce document présente un nouveau système qui agit comme un détective muni d'une loupe et d'une carte quadrillée. Au lieu de regarder chaque image de la vidéo comme une seule grande image floue, ce système découpe chaque image en une grille de 7x7 petits carrés (patchs).

Voyez cela comme un plateau de Sudoku. Le système examine chaque petit carré de ce plateau, chaque seconde de la vidéo, pour déterminer exactement quels carrés sont « suspects ».

Comment il apprend sans professeur
Habituellement, pour apprendre à un ordinateur à trouver un méchant spécifique, vous devez dessiner un cadre autour de lui dans des milliers de vidéos (comme un professeur qui pointe du doigt en disant : « Regarde ici ! »). C'est coûteux et lent.

Ce document utilise la supervision faible (Weak Supervision). Imaginez que vous avez seulement une liste de vidéos qui disent : « Cette vidéo contient un crime », mais vous ne savez pas exactement quand ni où.

  • Le défi : Comment trouver le méchant si vous ne savez pas où regarder ?
  • La solution : Le système utilise une stratégie appelée Apprentissage par Instances Multiples (Multiple Instance Learning - MIL). Il devine quels petits carrés sont les coupables. Si la vidéo est étiquetée « mauvaise », au moins l'un de ces petits carrés doit être le méchant. Le système apprend à les identifier par essais et erreurs.

La recette secrète : La règle de la « proximité »
Les auteurs ont remarqué quelque chose d'humain : les mauvaises choses ne se produisent généralement pas dans un seul petit pixel isolé pendant une fraction de seconde. Elles se produisent dans un amas (cluster). Une bagarre ne se produit pas en un seul endroit pour une seule image ; elle implique un groupe de personnes sur quelques secondes.

Ils ont donc inventé une stratégie de « Top-k sensible à la proximité » (Proximity-Aware Top-k).

  • Ancienne méthode : « Choisis les 5 carrés les plus effrayants, même s'ils sont éparpillés partout sur la carte et à des moments différents. »
  • Nouvelle méthode : « Choisis les 5 carrés les plus effrayants, mais assure-toi qu'ils sont voisins dans le temps et l'espace. »
    C'est comme dire : « Ne cherche pas seulement le bruit le plus fort ; cherche un groupe de bruits forts se produisant juste à côté les uns des autres. » Cela empêche l'ordinateur d'être confus par le bruit de fond aléatoire et l'aide à dessiner un cadre propre et solide autour de l'événement réel.

Les résultats : Une nouvelle carte pour l'avenir
Les auteurs ont testé leur système sur quatre ensembles de données vidéo majeurs (comme UCF-Crime et XD-Violence).

  1. Une meilleure précision : Leur « détective de grille » a trouvé les méchants avec beaucoup plus de précision que les méthodes précédentes, tant sur le quand que sur le .
  2. Nouvelles ressources : Comme personne n'avait de bonnes données de localisation (« où ») pour deux de ces ensembles de données, les auteurs sont retournés dessiner manuellement les cadres pour les vidéos de test eux-mêmes. Ils publient ces nouvelles cartes (annotations) et leur code à la communauté pour que d'autres chercheurs puissent s'en servir pour construire la suite.

En résumé
Ce document apprend aux ordinateurs à arrêter de simplement deviner quand quelque chose d'étrange se produit pour commencer à localiser précisément cela se passe, en utilisant une approche basée sur une grille et une règle de « regroupement » pour les événements négatifs, le tout sans avoir besoin de données d'entraînement coûteuses dessinées à la main. Ils ont également fourni de nouveaux « corrigés » (cadres de délimitation/bounding boxes) pour la communauté.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →