Hybrid 3D-CNN, Bi-LSTM, and Transformer-Based Framework for Anomaly Detection of Human Behaviour in Video Surveillance with Adaptive Error Minimization
Dit artikel stelt een nieuw hybride deep learning-framework voor dat 3D-CNN, Bi-LSTM en Transformer-architecturen integreert met een adaptieve drempelwaarde-module en multi-objective loss-optimalisatie om state-of-the-art, realtime anomaliedetectie in videobewaking te bereiken door het aantal valse alarmen onder diverse omgevingscondities aanzienlijk te verminderen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de moderne wereld houden beveiligingscamera's toezicht op onze straten, stations en gebouwen, waarbij ze een vloedgolf aan visuele gegevens genereren die geen enkel menselijk team zou kunnen monitoren. De uitdaging voor beveiligingssystemen is niet alleen om te zien, maar om te begrijpen wat ze zien in realtime. Ze moeten onderscheid maken tussen gewone, onschadelijke bewegingen en zeldzame, gevaarlijke gebeurtenissen zoals het uitbreken van een vechtpartij of een diefstal die gaande is. Deze taak is berucht moeilijk omdat "normaal" gedrag voortdurend verandert afhankelijk van het tijdstip, de verlichting, de drukte en de camerahoek. Een systeem dat te gevoelig is, zal het alarm doen afgaan voor elke schaduw of plotselinge windvlaag, wat een stroom aan valse meldingen creëert die menselijke operators uitput. Omgekeerd kan een systeem dat te strikt is, een echt dreigend gevaar volledig missen. Jarenlang hebben onderzoekers geprobeerd computerprogramma's te bouwen die het verschil kunnen leren tussen het alledaagse en het gevaarlijke, maar de meeste bestaande oplossingen worstelen met het balanceren van deze twee risico's, waarbij ze vaak falen wanneer de videokwaliteit daalt of de scène chaotisch wordt.
Een team van onderzoekers van SR University en Koneru Lakshmaiah Education Foundation in India heeft een nieuwe aanpak voorgesteld om dit hardnekkige probleem op te lossen. Ze ontwierpen een hybride computersysteem dat de manier nabootst waarop verschillende delen van het menselijk brein een scène zouden verwerken, door drie verschillende soorten kunstmatige intelligentie te combineren in één enkel, samenwerkend kader. In plaats van te vertrouwen op één enkele methode om de video te bekijken, gebruikt hun systeem drie gespecialiseerde "kijkers" die parallel werken. De eerste kijker is gebouwd om lokale details en korte uitbarstingen van beweging op te merken, vergelijkbaar met het opmerken van een snelle handgebaar of een plotselinge stap. De tweede kijker richt zich op de opeenvolging van gebeurtenissen in de tijd, waarbij begrepen wordt hoe een actie begint, evolueert en eindigt, wat ervoor zorgt dat een pauze of een omkering in beweging als betekenisvol wordt herkend. De derde kijker bekijkt de hele scène als geheel en verbindt verre delen van de video om de bredere context te begrijpen, zoals een groep mensen die samen in een ongebruikelijk patroon beweegt.
De genialiteit van dit nieuwe kader ligt in de manier waarop deze drie kijkers samenwerken. In plaats van hen te dwingen om eens te worden over één enkele rigide regel, leert het systeem hun meningen dynamisch te wegen. Als de scène een drukke straat is waar de algemene stroom van mensen het belangrijkst is, luistert het systeem meer naar de "globale" kijker. Als de scène een specifieke, snel bewegende actie betreft, leunt het systeem meer op de "lokale" kijker. Deze flexibiliteit stelt het systeem in staat om zich aan te passen aan verschillende omgevingen zonder dat het voor elke nieuwe locatie opnieuw geprogrammeerd hoeft te worden. Bovendien hebben de onderzoekers het probleem van veranderende videokwaliteit aangepakt, zoals de korreligheid van een nachtopname of de wazigheid van regen. Ze bouwden een feedbackmechanisme dat constant de helderheid van het beeld controleert. Als de video wazig of ruizig wordt, past het systeem automatisch zijn standaarden aan voor wat als een alarm telt, om te voorkomen dat het te vroeg alarm slaat vanwege een slechte beeldkwaliteit. Als het beeld kristalhelder is, wordt het gevoeliger, klaar om zelfs de subtielste tekenen van problemen op te vangen.
Toen de onderzoekers dit systeem testten op drie belangrijke collecties van real-world surveillancebeelden, waren de resultaten opmerkelijk. Het systeem identificeerde anomalieën met een hoge mate van nauwkeurigheid en presteerde aanzienlijk beter dan de beste bestaande methoden. Op de meest uitdagende dataset, die meer dan duizend onbewerkte uren aan video besloeg met dertien verschillende soorten misdrijven, behaalde het nieuwe systeem een succespercentage van bijna negentig procent. Op een campus-dataset met gedetailleerde, frame-voor-frame labels bereikte het een nauwkeurigheid van bijna achtennegentig procent. Misschien wel het belangrijkste voor de echte wereldbeveiliging: het systeem verminderde het aantal valse alarmen drastisch. Het verlaagde het aantal fout-positieven met bijna veertig procent vergeleken met de voorheen beste technologie, wat betekent dat beveiligers veel minder vaak worden onderbroken door onschadelijke gebeurtenissen. Tegelijkertijd miste het minder werkelijke dreigingen, waardoor het aantal fout-negatieven met meer dan dertig procent werd verminderd.
Het systeem bleek ook in staat te zijn om in realtime te opereren, waarbij de video wordt verwerkt met een snelheid van tweeëndertig frames per seconde, wat snel genoeg is om het tempo van live surveillancefeeds bij te houden. De onderzoekers bevestigden dat de verbetering voortkwam uit de combinatie van alle drie de componenten die samenwerkten; het verwijderen van een van hen zorgde voor een merkbare daling in de prestaties van het systeem. Ze verifieerden ook dat het adaptieve mechanisme voor het afhandelen van videokwaliteit de sleutel was tot het verminderen van fouten, omdat het het systeem in staat stelde betrouwbaar te blijven, zelfs wanneer de verlichting veranderde of de camera schokte. Hoewel het systeem een kort moment nodig heeft om een korte videoclip te verwerken, wat een fractie van een seconde vertraging introduceert, wordt deze afruil als acceptabel beschouwd voor de enorme winst in nauwkeurigheid en betrouwbaarheid.
Dit werk vormt een belangrijke stap voorwaarts in het echt praktisch maken van geautomatiseerde surveillance. Door weg te bewegen van rigide, eenheidsregels en toe te bewegen naar een flexibele, meerperspectivische aanpak, hebben de onderzoekers een systeem gecreëerd dat zowel gevoelig is voor gevaar als robuust tegen de onvermijdelijke imperfecties van real-world video. De bevindingen suggereren dat de toekomst van videobeveiliging niet ligt in het bouwen van een enkele, perfecte waarnemer, maar in het creëren van een team van gespecialiseerde waarnemers die van elkaar kunnen leren en zich kunnen aanpassen aan de wereld terwijl deze verandert.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.