Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage
Dieses Paper schlägt ein neuartiges interdisziplinäres Framework vor, das fortschrittliche KI, einschließlich multimodaler Analyse und großer Sprachmodelle, nutzt, um Verhaltensdynamiken wie Eskalation und Respekt in Aufnahmen von Bodycams der Polizei automatisch zu erkennen, zu klassifizieren und zusammenzufassen, um die Rechenschaftspflicht und die Ausbildung im Strafvollzug zu verbessern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Jeden Tag tragen Polizeibeamte in Städten in den Vereinigten Staaten Kameras, die ihre Interaktionen mit der Öffentlichkeit aufzeichnen. Diese Geräte, bekannt als Body-Worn-Cameras (Körperkameras), erfassen eine riesige und stetig wachsende Bibliothek von Video- und Audiomaterial und bieten einen rohen, ungefilterten Blick auf die Momente, in denen die Strafverfolgung auf die Gemeinschaft trifft. Jahrzehntelang haben Forscher und Polizeiführer gehofft, dieses Filmmaterial zu sichten, um zu verstehen, was während einer Verkehrskontrolle oder eines Einsatzes in einem Wohnviertel geschieht, und nach Mustern von Respekt, Spannung oder Deeskalation zu suchen. Die schiere Menge an Daten hat diese Aufgabe jedoch für das menschliche Auge und Ohr allein nahezu unmöglich gemacht. Ein einzelner Beamter kann in einer Woche Stunden an Videomaterial erzeugen, und eine ganze Abteilung sammelt jedes Jahr tausende Stunden an. Um dieses Datenaufkommen zu bewältigen, wenden sich Wissenschaftler an künstliche Intelligenz – nicht, um das menschliche Urteilsvermögen zu ersetzen, sondern um dabei zu helfen, die wichtigsten Teile dieser komplexen Begegnungen zu organisieren und hervorzuheben. Die Herausforderung besteht darin, Maschinen beizubringen, über den Lärm von Sirenen und Schreien hinwegzuhören, zwischen verschiedenen Stimmen in einer chaotischen Szene zu unterscheiden und die Bedeutung hinter den Worten in Hochdrucksituationen zu verstehen.
Ein Forschungsteam des Rochester Institute of Technology, das mit dem Rochester Police Department zusammenarbeitet, hat ein neues System entwickelt, das dieses Problem angeht. Sie nennen ihr Framework OpenBWC, ein Open-Source-Tool, das eine Kombination aus Audioverarbeitung, Spracherkennung und Sprachanalyse nutzt, um rohe Videodateien in strukturierte, durchsuchbare Informationen umzuwandeln. Das Ziel ist nicht einfach nur die Transkription dessen, was gesagt wurde, sondern die Identifizierung der Dynamik der Interaktion: War der Beamte respektvoll? Eskalierte die Situation oder beruhigte sie sich? Um dies zu erreichen, fütterten die Forscher das System mit 1.225 Videos, die durch öffentliche Akteneinsichtsgesetze erworben wurden. Diese Aufnahmen, die zur Wahrung der Privatsphäre der Beteiligten durch Unkenntlichmachung der Gesichter bearbeitet wurden, reichten von kurzen elfsekündigen Clips bis hin zu fast zwölf Stunden kontinuierlicher Aufnahmen und beliefen sich auf insgesamt über 1.877 Stunden Videomaterial. Das Team zerlegte diese langen Dateien in handhabbare 30-Sekunden-Segmente, um dem Computer zu helfen, das Audio zu verarbeiten, ohne den Fluss des Gesprächs zu verlieren.
Der Kern ihrer Methode umfasst einen mehrstufigen Prozess, der der Art und Weise nachempfunden ist, wie ein Mensch einer schwierigen Aufnahme zuhören würde. Zuerst trennt das System das gemischte Audio in einzelne Stimmen auf, eine Technik, die als Sprecherseparation bekannt ist. Dies ist entscheidend, da Body-Worn-Camera-Aufnahmen oft überlappende Sprache, Hintergrundgeräusche und mehrere gleichzeitig sprechende Personen enthalten. Die Forscher verwendeten ein spezialisiertes Modell, um die Stimme des Beamten von der des Zivilisten zu isolieren, was es dem Computer ermöglicht, sich auf einen Sprecher nach dem anderen zu konzentrieren. Sob einer Trennung der Stimmen transkribierte das System das Audio mittels fortschrittlicher Speech-to-Text-Technologie in Text. Die Forscher stellten jedoch fest, dass nicht alle Transkriptionswerkzeuge in diesen unordentlichen, realen Umgebungen gleichermaßen gut funktionierten. Sie testeten zwei Versionen eines populären Spracherkennungssystems und entdeckten, dass die kleinere, schnellere Version häufig Wörter übersprang, Phrasen wiederholte oder es versäumte, das vollständige Gespräch zu erfassen. Im Gegensatz dazu lieferte die größere, detailliertere Version wesentlich genauere Transkripte, obwohl sie dennoch einer menschlichen Überprüfung bedurfte, um subtile Fehler zu korrigieren.
Nach der Erstellung des Textes wandten die Forscher ein großes Sprachmodell an, um die Transkripte zu lesen und die Interaktionen zusammenzufassen. Dieser Schritt ermöglichte es dem System, Schlüsselthemen zu identifizieren, wie etwa ob ein Beamter Deeskalationsstrategien anwandte oder ob sich der Tonfall des Gesprächs von ruhig zu aggressiv veränderte. Die Ergebnisse wurden daraufhin in einer Datenbank gespeichert, die nach Thema, Sprecher oder spezifischem Verhalten durchsuchbar war, was es ermöglichte, Muster über tausende von Vorfällen hinweg zu finden. Das Team stellte fest, dass das System zwar gut bei Routineinteraktionen wie Verkehrskontrollen funktionierte, bei denen das Audio klarer und die Sprachmuster vorhersehbar sind, es aber in chaotischen Szenarien erheblich Schwierigkeiten hatte. In Stresssituationen mit Schreien, Sirenen oder mehreren Menschen, die sich gegenseitig ins Wort fielen, sank die Genauigkeit der Transkription deutlich, und das System verwechselte manchmal, wer gerade sprach, oder übersah kritische Details.
Die Forscher betonten sorgfältig, dass ihr System keine perfekte Lösung ist und nicht als alleinige Grundlage für Disziplinarmaßnahmen oder rechtliche Urteile dienen sollte. Sie schlossen explizit die Idee aus, dass eine vollautomatisierte Transkription derzeit die menschliche Überprüfung in kritischen Vorfällen ersetzen könne. Die Studie legt nahe, dass der effektivste Ansatz ein hybrider ist, bei dem die KI die Schwerstarbeit bei der Organisation und Zusammenfassung der Daten übernimmt, aber menschliche Experten die Ergebnisse verifizieren, insbesondere in komplexen oder hochsensiblen Fällen. Das Team hob zudem eine technische Einschränkung hervor: Die Stimme des Beamten wird oft viel deutlicher erfasst als die des Zivilisten, da die Kamera am Körper des Beamten getragen wird und auf ihn gerichtet ist. Dieses Ungleichgewicht bedeutet, dass das System von Natur aus besser in der Lage ist, die Seite des Beamten des Gesprächs zu verstehen, was die Analyse verzerren könnte, wenn dies nicht berücksichtigt wird.
Trotz dieser Herausforderungen demonstriert das Projekt einen praktischen Weg für den Einsatz künstlicher Intelligenz in der Polizeiarbeit. Durch die Kombination von Open-Source-Tools mit strengen Tests haben die Forscher ein Framework geschaffen, das Polizeibehörden helfen kann, ihre eigenen Praktiken zu überprüfen, Beamte in besserer Kommunikation zu schulen und sich gegenüber der Öffentlichkeit verantwortlich zu zeigen. Die Arbeit behauptet nicht, das Problem der Analyse von Polizeifilmmaterial gelöst zu haben, bietet aber eine verlässliche Methode, um das Gespräch anzustoßen. Die Ergebnisse legen nahe, dass Maschinen uns zwar helfen können, Muster im Rauschen zu erkennen, die wichtigsten Erkenntnisse jedoch weiterhin aus der Kombination von Rechenleistung und menschlichem Verständnis resultieren. Wenn sich die Technologie verbessert und die Datensätze wachsen, könnte diese interdisziplinäre Herangehensweise die Art und Weise transformieren, wie Strafverfolgungsbehörden aus ihrer täglichen Arbeit lernen – indem sie riesige Videoarchive in verwertbares Wissen verwandeln, das die Sicherheit und das Vertrauen für alle Beteiligten verbessert.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.