← Nieuwste papers
💻 computer science

Scene-aware Transformer encoder with Multi Instance Learning-guided Attention Mechanism for Anomaly Detection in Video Surveillance

Dit artikel stelt het STAM-framework voor, dat contrastief leren voor scènebewuste embeddings integreert met een transformer-encoder geleid door Multi-Instance Learning-aandacht, om effectief contextuele en temporele beperkingen in video-anomaliedetectie aan te pakken en een superieure nauwkeurigheid op benchmark-datasets te bereiken.

Oorspronkelijke auteurs: Rifa Nizam Khan, Mohd. Amjad

Gepubliceerd 2026-08-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rifa Nizam Khan, Mohd. Amjad

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de hoofdsbeveiliger bent van een enorm, bruisend stadsplein. Je hebt honderden camera's die live videobeelden naar je doorsturen, maar je kunt niet tegelijkertijd elk scherm bekijken. Je taak is om iets vreemds op te merken—een vechtpartij, een diefstal, of iemand die de verkeerde kant op rent. Het lastige deel is dat "vreemd" volledig afhangt van waar je bent. In een bibliotheek is iemand die rent een enorme rode vlag. In een voetbalstadion is het gewoon onderdeel van het spel. Lange tijd waren computerprogramma's die deze taak probeerden uit te voeren als bewakers die alleen naar beweging keken. Als iemand rende, ging het alarm af, zelfs als het in een stadion was. Ze begrepen de context van de scène niet. Ze hadden ook moeite om te onthouden wat er een paar seconden geleden gebeurde om de verbanden te leggen. Dit artikel pakt dat probleem aan door computers te leren dat ze niet alleen beweging moeten zien, maar ook de "vibe" van de plek moeten begrijpen waar ze naar kijken.

De onderzoekers, Rifa Nizam Khan en Mohd. Amjad van de Jamia Millia Islamia Universiteit, hebben een nieuw systeem gebouwd genaamd STAM. Beschouw dit als een super slimme detective met twee duidelijke manieren van denken. Ten eerste gebruikt het een speciale "scène-gevoeligheid"-module om te achterhalen waar het precies is—zoals het verschil weten tussen een rustig park en een druk treinstation. Ten tweede gebruikt het een krachtig geheugengereedschap (een Transformer) om korte videoclips te bekijken en te bepalen welke verdacht zijn. De magie gebeurt wanneer deze twee delen met elkaar communiceren. Het systeem kijkt niet alleen naar een clip in isolatie; het vraagt: "Maakt deze actie zin hier?" Als het antwoord nee is, slaat het alarm af.

Hier is hoe hun nieuwe detective werkt, onderverdeeld in eenvoudige stappen:

De Twee-Hersenen-Aanpak
De meeste oude systemen probeerden alles met één brein te doen, wat vaak tot verwarring leidde. STAM splitst de taak.

  1. De Scène-Detective: Voordat het de actie bekijkt, maakt het systeem een snapshot van de omgeving. Het gebruikt een techniek genaamd "contrastive learning" om een mentale kaart van de scène op te bouwen. Stel je dit voor als een bibliothecaris die weet dat een boek dat uit een plank valt normaal is in een bibliotheek, maar vreemd in een sportschool. Het systeem leert de "vorm" van de plek te herkennen, waardoor het voor elke locatie een unieke ID-kaart creëert.
  2. De Actie-Watcher: Dit deel maakt gebruik van een "Inflated 3D ConvNet" (of I3D). Als je een normale videocamera ziet als een 2D-foto die in de loop van de tijd verandert, dan is dit gereedschap als een 3D-scanner die de video ziet als een solide blok van ruimte en tijd. Het vangt de beweging en het uiterlijk van de mensen op en zet dit om in een gedetailleerd rapport.

Het "Bag of Snippets"-spel
Het systeem kijkt niet een hele uur aan video tegelijkertijd. In plaats daarvan hakt het de video in kleine stukjes die "snippets" worden genoemd. Het behandelt de hele video als een "zak" (bag) van deze snippets. Dit is waar "Multi-Instance Learning" (MIL) in beeld komt. Denk hierbij aan een leraar die een klas beoordeelt. Als één student in de klas (één snippet) wordt gemarkeerd voor onregelmatigheden, wordt de hele klas (de video) als verdacht gemarkeerd. Het systeem bekijkt al deze snippets en vraagt: "Welke van deze is de boef?"

Het Magische Attention-Mechanisme
Dit is het coolste deel. Het systeem heeft een speciale "Scene Token" (een CLS token) die de ID-kaart van de locatie vasthoudt. Wanneer het systeem de "zak" met snippets beoordeelt, gebruikt het deze locatie-ID om de aandacht te sturen. Het is als een beveiliger die weet: "In deze specifieke gang lopen mensen meestal langzaam. Als ik iemand zie sprinten, is dat de persoon op wie ik me moet concentreren." Het systeem gebruikt een attention-mechanisme om het belang van elke snippet te wegen. Als een snippet vreemd lijkt voor die specifieke scène, geeft het systeem het een hoge score. Als het vreemd is maar past bij de scène (zoals rennen in een stadion), negeert het systeem het.

De Resultaten: Een Bijna Perfecte Score
De onderzoekers testten hun nieuwe STAM-systeem op een beroemde dataset van surveillancevideo's genaamd UCF Crime, die meer dan 1.900 video's bevat van echte gebeurtenissen zoals arrestaties, brandstichting en winkeldiefstal. Ze testten het ook op een andere dataset, UCF101, om te zien of het nieuwe, onbekende omgevingen kon verwerken.

De resultaten waren indrukwekkend. Het STAM-systeem behaalde een nauwkeurigheid van 99,85% en een Area Under Curve (AUC) score van 99,98%. Om dit in perspectief te plaatsen: ze vergeleken het met andere slimme systemen zoals "I3D-MIL" en "GAN-MIL", die veel lager scoorden (rond de 90% tot 96%). De paper suggereert dat de reden dat STAM wint, is dat het eindelijk de context begrijpt. Het ziet niet alleen een persoon die rent; het ziet een persoon die rent op een plek waar rennen gevaarlijk is.

Waarom dit ertoe doet
De auteurs ontdekten dat door de computer expliciet te leren over de lay-out van de scène en een "scene-aware" attention-mechanisme te gebruiken, ze het aantal valse alarmen drastisch konden verminderen. In het verleden zou een systeem "Noodgeval!" kunnen schreeuwen omdat iemand in een park rende, terwijl het gewoon een jogger was. STAM weet echter het verschil. De studie laat zien dat deze aanpak niet zomaar een kleine aanpassing is, maar een belangrijke stap voorwaarts in het echt smart maken van videobewaking voor de rommelige, complexe realiteit van de echte wereld. Hoewel het systeem meer rekenkracht vereist om te draaien (het duurt ongeveer 8 minuten per trainings-epoch op hun specifieke hardware), is de ruil een systeem dat veel betrouwbaarder is en minder snel vals alarm slaat.

Kortom, deze paper stelt voor dat om de boeven te vangen, je niet alleen ogen nodig hebt die beweging zien; je hebt een brein nodig dat het verhaal van de plek begrijpt. En met STAM beginnen computers eindelijk het verhaal te begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →