Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage
Dit artikel stelt een nieuw interdisciplinair kader voor dat geavanceerde AI, inclusief multimodale analyse en grote taalmodellen, inzet om gedragsdynamieken zoals escalatie en respect in beelden van bodycams van de politie automatisch te detecteren, te classificeren en samen te vatten om de verantwoording en training binnen wetshandhaving te verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Elke dag dragen politieagenten in steden door de hele Verenigde Staten camera's die hun interacties met het publiek opnemen. Deze apparaten, bekend als body-worn cameras (bodycamera's), leggen een enorme en groeiende bibliotheek aan video en audio vast, die een rauw, ongefilterd kijkje bieden in de momenten waarop wetshandhaving en de gemeenschap elkaar ontmoeten. Decennialang hebben onderzoekers en politiechefs gehoopt om deze beelden te kunnen analyseren om te begrijpen wat er gebeurt tijdens een verkeerscontrole of een oproep in een buurt, op zoek naar patronen van respect, spanning of de-escalatie. De enorme hoeveelheid data heeft dit proces echter bijna onmogelijk gemaakt voor menselijke ogen en oren alleen. Een enkele agent kan in een week tijd uren aan beeldmateriaal genereren, en een heel departement verzamelt elk jaar duizenden uren. Om orde te scheppen in deze overvloed, wenden wetenschappers zich tot kunstmatige intelligentie, niet om het menselijk oordeel te vervangen, maar om te helpen bij het organiseren en uitlichten van de belangrijkste delen van deze complexe ontmoetingen. De uitdaging ligt erin om machines te leren luisteren boven het lawaai van sirenes en geschreeuw uit, om verschillende stemmen in een chaotische scène te onderscheiden, en om de betekenis achter de woorden te begrijpen die in situaties met hoge druk worden uitgesproken.
Een team van onderzoekers van het Rochester Institute of Technology, werkend samen met het Rochester Police Department, heeft een nieuw systeem gebouwd dat ontworig is om dit probleem aan te pakken. Ze noemen hun framework OpenBWC, een open-source tool die een combinatie van audioverwerking, spraakherkenning en taalanalyse gebruikt om ruwe videobestanden om te zetten in gestructureerde, doorzoekbare informatie. Het doel is niet simpelweg om te transcriberen wat er werd gezegd, maar om de dynamiek van de interactie te identificeren: Was de agent respectvol? Escaleerde de situatie of kalmeerde deze af? Om dit te doen, voedden de onderzoekers het systeem met 1.225 video's die verkregen waren via verzoeken op basis van openbare registers. Deze opnames, die bewerkt waren om de privacy van de betrokken personen te beschermen door gezichten te vervagen, varieerden van korte clips van elf seconden tot bijna twaalf uur aan continue beelden, wat in totaal meer dan 1.877 uur aan video betekende. Het team brak deze lange bestanden op in hanteerbare segmenten van dertig seconden om de computer te helpen de audio te verwerken zonder de flow van het gesprek te verliezen.
De kern van hun methode omvat een meerstaps proces dat nabootst hoe een mens naar een moeilijke opname zou luisteren. Eerst scheidt het systeem de gemengde audio in individuele stemmen, een techniek die bekend staat als speaker separation (sprekersscheiding). Dit is cruciaal omdat beelden van bodycamera's vaak overlappende spraak, achtergrondgeluid en meerdere mensen bevatten die tegelijkertijd praten. De onderzoekers gebruikten een gespecialiseerd model om de stem van de agent te isoleren van die van de burger, waardoor de computer zich op één spreker tegelijk kon concentreren. Zodra de stemmen gescheiden waren, transcribeerde het systeem de audio naar tekst met behulp van geavanceerde speech-to-text technologie. De onderzoekers ontdekten echter dat niet alle transcriptietools even goed werkten in deze rommelige, echte omgevingen. Ze testten twee versies van een populaire spraakherkenningssystem en ontdekten dat de kleinere, snellere versie regelmatig woorden miste, zinnen herhaalde of er niet in slaagde het volledere gesprek vast te leggen. In contrast hiermee produceerde de grotere, gedetailleerdere versie veel nauwkeurigere transcripties, hoewel deze nog steeds menselijke controle vereiste om subtiele fouten te corrigeren.
Na het genereren van de tekst pasten de onderzoekers een groot taalmodel toe om de transcripties door te lezen en de interacties samen te vatten. Deze stap stelde het systeem in staat om belangrijke thema's te identificeren, zoals of een agent de-escalatietechnieken gebruikte of of de toon van het gesprek verschoof van kalm naar agressief. De resultaten werden vervolgens opgeslagen in een database die doorzoekbaar is op onderwerp, spreker of specifiek gedrag, waardoor het mogelijk werd om patronen over duizenden incidenten heen te vinden. Het team merkte op dat hoewel het systeem goed werkte voor routinematige interacties zoals verkeerscontroles, waarbij de audio duidelijker is en de spraakpatronen voorspelbaar zijn, het aanzienlijk moeite had met chaotische scenario's. In stressvolle situaties met geschreeuw, sirenes of meerdere mensen die over elkaar heen praten, nam de nauwkeurigheid van de transcriptie af, en verwarde het systeem soms wie er sprak of miste het cruciale details.
De onderzoekers waren zorgvuldig in hun opmerking dat hun systeem geen perfecte oplossing is en niet als enige basis voor disciplinaire beslissingen of juridische oordelen moet worden gebruikt. Ze sloten expliciet het idee uit dat volledig geautomatiseerde transcriptie momenteel menselijke controle bij kritieke incidenten kan vervangen. De studie suggereert dat de meest effectieve aanpak een hybride aanpak is, waarbij de AI het zware werk doet van het organiseren en samenvatten van de data, maar menselijke experts de resultaten verifiëren, vooral in complexe of hoogwaardige gevallen. Het team wees ook op een technische beperking: de stem van de agent wordt vaak veel duidelijker vastgelegd dan die van de burger omdat de camera aan het lichaam van de agent gedragen wordt en naar hem toe gericht is. Deze onbalans betekent dat het systeem van nature beter is in het begrijpen van de kant van de agent in het gesprek, wat de analyse zou kunnen kleuren als dit niet wordt meegewogen.
Ondanks deze uitdagingen demonstreert het project een praktisch pad vooruit voor het gebruik van kunstmatige intelligentie bij politiearbeid. Door open-source tools te combineren met rigoureuze tests, hebben de onderzoekers een framework gecreëerd dat politiedepartementen kan helpen hun eigen praktijken te beoordelen, agenten te trainen in betere communicatie en zichzelf verantwoording te laten afleggen aan het publiek. Het werk beweert niet het probleem van het analyseren van politiebeelden te hebben opgelost, maar biedt een betrouwbare methode om het gesprek te starten. De bevindingen suggereren dat hoewel machines ons kunnen helpen patronen in de ruis te zien, de belangrijkste inzichten nog steeds voortkomen uit het combineren van computationele kracht met menselijk begrip. Naarmate de technologie verbetert en de datasets groeien, zou deze interdisciplinaire aanpak de manier waarop wetshandhavingsinstanties leren van hun dagelijkse werk kunnen transformeren, door enorme videoarchieven om te zetten in bruikbare kennis die de veiligheid en het vertrouwen voor iedereen betrokkenen verbetert.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.