Human Fall Detection Using Deep Learning Methods: A Multimodal Audio-Video Approach
Deze studie stelt een multimodale deep learning-framework voor dat audio- en videokenmerken combineert via decision-level stacking om een nauwkeurigheid van 98% te bereiken bij menselijke valdetectie, waarmee het single-modality modellen en andere fusiestrategieën aanzienlijk overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Vallen vormen een stille bedreiging, vooral voor ouderen, waarbij één misstap kan leiden tot letsel, een verlies van onafhankelijkheid of erger. Decennialang was de oplossing vaak om mensen te vragen een apparaat te dragen, zoals een medaillon of een polsbandje, dat een plotselinge val kan detecteren. Maar deze apparaten hebben een gebrek: ze vertrouwen erop dat de persoon eraan denkt ze te dragen, en ze kunnen oncomfortabel of stigmatiserend zijn. Dit heeft ertoe geleid dat onderzoekers op zoek gingen naar een manier om te kijken en te luisteren zonder aanraking, met behulp van camera's en microfoons om een val te spotten op het moment dat deze plaatsvindt. De uitdaging is dat een val veel lijkt op andere alledaagse handelingen, zoals snel gaan zitten, vooroverbuigen om een veter te strikken, of zelfs gewoon gaan liggen om te rusten. Om dit op te lossen, hebben wetenschappers zich gericht op deep learning, een vorm van computerintelligentie die patronen leert door duizenden voorbeelden te bestuderen, net zoals een kind leert een hond te herkennen door veel verschillende honden te zien. Door deze systemen te leren zowel de visuele beweging van een lichaam als de geluiden die het maakt te begrijpen, hopen onderzoekers een vangnet te creëren dat altijd kijkt, altijd luistert en altijd klaar is om een alarm te laten afgaan.
Een team van onderzoekers van universiteiten uit Pakistan en Italië zette zich af om precies zo'n systeem te bouwen, maar met een specifieke draai: ze wilden zien of het combineren van zicht en geluid beter kon presteren dan één van beide zintuigen alleen. Ze begonnen met een collectie videoplagingen die lieten zien hoe mensen valsimulaties uitvoerden evenals normale activiteiten zoals wandelen en zitten. De onderzoekers behandelden de video en het geluid als twee afzonderlijke stromen van informatie. Eerst isoleerden ze het geluid van elke videoclip. Ze zetten de audio om in een enkel kanaal en braken het vervolgens af in een gedetailleerde kaart van de frequenties over de tijd, op zoek naar de scherpe, plotselinge pieken in energie die optreden wanneer een lichaam de vloer raakt. Ze gebruikten een wiskundige methode om deze geluidsgegevens samen te persen tot een beheersbare vorm en pasten vervolgens een computergestuurd zoekproces toe om alleen de meest nuttige geluidskenmerken eruit te pikken, waarbij de ruis werd weggegooid. Deze geselecteerde kenmerken werden gevoed aan een type kunstmatig brein dat ontworpen is om sequenties te onthouden, waardoor het kan begrijpen dat een val een specifiek geluidspatroon is dat zich over enkele seconden afspeelt, en niet slechts een enkele ruis.
Tegelijkertelijk bekeken de onderzoekers de videoframes. Ze probeerden niet het gezicht of de kleding van de persoon te herkennen; in plaats daarvan concentreerden ze zich volledig op hoe het lichaam bewoog. Ze creëerden een speciale visuele samenvatting die liet zien waar beweging had plaatsgevonden in de laatste paar seconden, waarbij het pad van de beweging werd geaccentueerd terwijl oudere, statische delen van de scène vervaagden. Vanuit dit bewegende beeld volgden ze de contouren van de persoon om een duidelijk beeld van hun beweging te krijgen. Net als bij het geluid voedden ze deze visuele patronen aan een computermodel voor sequentieleer dat de vorm van de beweging van het ene moment naar het andere kon volgen. Het resultaat was twee aparte experts: één die goed was in het luisteren naar een val, en een andere die goed was in het zien ervan. Het op geluid gebaseerde systeem identificeerde vallen correct in ongeveer 81 procent van de gevallen, terwijl het op video gebaseerde systeem nog nauwkeuriger was en in 92 procent van de gevallen gelijk had.
De echte test lag echter niet in hoe goed elk systeem alleen werkte, maar in hoe ze samenwerkten. De onderzoekers probeerden zes verschillende manieren om de beslissingen van de audio- en videosystemen te combineren. Sommige methoden waren eenvoudig, zoals het nemen van een gemiddelde van de twee scores of het laten beslissen door de meerderheid van de stemmen. Deze eenvoudige benaderingen presteerden slecht, waarbij sommige combinaties de nauwkeurigheid tot zo laag als 36 procent brachten. Dit toonde aan dat het simpelweg mengen van de twee signalen niet genoeg was; het systeem had een slimmere manier nodig om het bewijs te wegen. De onderzoekers probeerden vervolgens een methode waarbij een derde, geavanceerder computermodel leerde hoe de outputs van de audio- en video-experts gecombineerd moesten worden. Dit uiteindelijke systeem, dat fungeerde als een supervisor die het werk van twee specialisten beoordeelt, bereikte een opmerkelijke nauwkeurigheid van 98 procent. Het was in staat de val te spotten zelfs wanneer één van de zintuigen onzeker was, waarbij het effectief de kracht van de video gebruikte om het geluid te ondersteunen, of de helderheid van het geluid om de visuele bevestiging te bevestigen.
De studie suggereert dat hoewel camera's krachtig zijn, het toevoegen van geluid een betrouwbaarder vangnet creëert. De onderzoekers ontdekten dat vallen specifieke akoestische handtekeningen produceren die door systemen die alleen op beeld vertrouwen vaak gemist worden, vooral als de persoon gedeeltelijk verborgen is of als de verlichting slecht is. Omgekeerd kan geluid verward worden door achtergrondruis, waardoor de visuele bevestiging essentieel wordt. Door een geavanceerde methode te gebruiken om deze twee informatiestromen te mengen, toonde het team aan dat een multimodale aanpak veel superieur is aan het vertrouwen op één enkel zintuig. Ze merkten echter op dat hun resultaten voortkwamen uit een relatief kleine set gesimuleerde vallen in een gecontroleerde omgeving, en dat real-world omstandigheden met meerdere mensen, variërende geluidsniveaus en verschillende camerastandpunten nieuwe uitdagingen zouden vormen. Het werk beweert niet dat het het probleem van valdetectie volledig heeft opgelost, maar het biedt een sterke basis voor toekomstige systemen die huizen en zorginstellingen met meer vertrouwen kunnen monitoren, zodat wanneer een val plaatsvindt, er onmiddellijk hulp kan worden opgeroepen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.