← Derniers articles
🤖 AI

Weakly-Supervised Spatiotemporal Anomaly Detection

Cet article propose une méthode de détection d'anomalies spatio-temporelles faiblement supervisée qui utilise des étiquettes au niveau de la vidéo et une perte de classement par multiple instance pour identifier des anomalies localisées au sein de clips vidéo, démontrant son efficacité sur le jeu de données UCF Crime2Local.

Auteurs originaux : Urvi Gianchandani, Praveen Tirupattur, Mubarak Shah

Publié 2026-05-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Urvi Gianchandani, Praveen Tirupattur, Mubarak Shah

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un agent de sécurité surveillant des centaines de caméras de surveillance simultanément. Votre travail consiste à repérer quelque chose d'étrange en train de se produire, comme une bagarre ou un vol. Le problème est que vous ne pouvez pas fixer chaque écran 24 heures sur 24, et les choses étranges se produisent très rarement. Vous avez besoin d'un ordinateur pour vous aider, mais apprendre à un ordinateur est délicat car étiqueter chaque seconde d'une vidéo par « bagarre ici » ou « vol là » prend une éternité.

Ce papier propose une méthode ingénieuse pour apprendre à un ordinateur à repérer ces événements étranges sans avoir besoin d'autant d'étiquetage détaillé. Voici comment ils ont procédé, expliqué simplement :

L'analogie de la « Boîte de Mystère » (Supervision Faible)

Habituellement, pour apprendre à un ordinateur, vous lui montrez une vidéo et vous dites : « Voyez-vous ce clip spécifique de 5 secondes ? C'est une bagarre. » Mais dans ce papier, les chercheurs ne donnent à l'ordinateur que la vidéo entière et disent : « Cette vidéo contient une bagarre quelque part », ou « Cette vidéo est totalement normale ».

Ils appellent cela la Supervision Faible. C'est comme donner à un élève une boîte entière de briques LEGO mélangées et dire : « Cette boîte contient une brique rouge », sans lui dire exactement quelle brique est rouge. L'élève doit deviner laquelle c'est.

Le « Cube Spatio-temporel » (Décomposition)

Pour résoudre le mystère, les chercheurs n'ont pas simplement regardé la vidéo comme un seul gros bloc. Ils ont découpé la vidéo en petits blocs 3D. Imaginez trancher une miche de pain (le temps) puis découper chaque tranche en une grille (l'espace).

  • Temps : Ils ont découpé la vidéo en courts clips.
  • Espace : Ils ont découpé chaque clip en une grille de petits carrés.

Maintenant, au lieu de regarder la vidéo entière, l'ordinateur regarde ces petits « cubes » de la vidéo. Chaque cube est un minuscule morceau d'espace et de temps.

Le « Sac de Trucs » (Apprentissage Multi-Instances)

Les chercheurs ont utilisé une stratégie appelée Apprentissage Multi-Instances (MIL). Imaginez cela ainsi :

  • Le Sac : Un clip vidéo entier est un « sac ».
  • Les Instances : Les petits cubes à l'intérieur de la vidéo sont les « objets » dans le sac.

Voici la règle qu'ils ont enseignée à l'ordinateur :

  • Si un sac est étiqueté « Normal », alors chaque objet unique à l'intérieur de ce sac doit être normal.
  • Si un sac est étiqueté « Anomalie » (Étrange), alors au moins un objet à l'intérieur de ce sac doit être étrange.

Le travail de l'ordinateur est de regarder tous les objets dans le sac « Étrange », de trouver celui qui semble le plus suspect et de lui attribuer un score élevé. Il tente ensuite de s'assurer que le score le plus élevé dans un sac « Étrange » est plus élevé que le score le plus élevé dans un sac « Normal ».

L'« Œil du Détective » (Fonctionnement)

L'ordinateur utilise un cerveau pré-entraîné (appelé I3D) qui est déjà bon pour reconnaître les mouvements humains.

  1. Il prend un clip vidéo.
  2. Il le décompose en ces petits cubes 3D.
  3. Il demande au « cerveau » de décrire ce qu'il voit dans chaque cube.
  4. Il effectue un test pour voir si l'un de ces cubes semble suspect.

Si l'ordinateur voit une bagarre, il ne dit pas simplement « Bagarre ! ». Il pointe le petit carré spécifique sur l'écran où la bagarre se produit et dit : « L'étrangeté est juste ici. »

Les Résultats : À quel point était-ce bon ?

Les chercheurs ont testé cela sur un ensemble de données appelé UCF Crime2Local, qui contient des vidéos de crimes réels.

  • La Compétition : Ils ont comparé leur méthode à d'autres méthodes. Une autre méthode était « supervisée », ce qui signifie qu'elle avait reçu les coordonnées exactes du crime pendant l'entraînement (comme montrer à l'élève la brique rouge). Cette méthode a obtenu un score d'environ 75 %.
  • Leur Résultat : Leur méthode, qui ne connaissait pas l'emplacement exact pendant l'entraînement (tout comme un élève devinant la brique rouge), a obtenu un score de 68 %.

Bien qu'ils n'aient pas battu la méthode qui avait toutes les réponses, ils ont fait beaucoup mieux que les autres méthodes qui ont également essayé de deviner sans les réponses.

Et maintenant ? (La Conclusion)

Le papier conclut que regarder à la fois (espace) et quand (temps) un événement se produit est une bonne idée. Cependant, ils admettent que leur ordinateur devient parfois un peu trop excité et marque plusieurs endroits comme « étranges » alors qu'il n'y en a qu'un.

Pour s'améliorer encore, ils suggèrent deux choses :

  1. Resserer les règles : Faire en sorte que l'ordinateur choisisse un seul endroit « le plus étrange » par vidéo, plutôt que de deviner partout.
  2. Observer le mouvement : Actuellement, l'ordinateur regarde principalement comment les choses ressemblent. Ils suggèrent d'ajouter un deuxième « œil » qui observe comment les choses bougent (comme le flux optique), car le mouvement est souvent un indice majeur pour repérer les crimes.

En bref, ils ont construit un système capable de deviner un crime se produit dans une vidéo simplement en sachant que la vidéo contient un crime, sans avoir besoin qu'un humain dessine une boîte autour de lui au préalable.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →