← Derniers articles
💻 computer science

Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage

Cet article propose un nouveau cadre interdisciplinaire qui exploite l'IA avancée, incluant l'analyse multimodale et les grands modèles de langage, pour détecter, classifier et résumer automatiquement les dynamiques comportementales telles que l'escalade et le respect dans les séquences de caméras piétonnes de la police afin de renforcer la responsabilité et la formation des forces de l'ordre.

Auteurs originaux : Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

Publié 2026-09-11
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Chaque jour, les agents de police dans les villes des États-Unis portent des caméras qui enregistrent leurs interactions avec le public. Ces dispositifs, connus sous le nom de caméras piétons, capturent une bibliothèque vaste et croissante de vidéos et d'audios, offrant un regard brut et sans filtre sur les moments où les forces de l'ordre rencontrent la communauté. Depuis des décennies, des chercheurs et des chefs de la police espèrent pouvoir passer au crible ces séquences pour comprendre ce qui se passe lors d'un contrôle routier ou d'un appel de quartier, à la recherche de modèles de respect, de tension ou de désescalade. Cependant, le volume colossal de données a rendu cette tâche presque impossible pour les yeux et les oreilles humaines seules. Un seul agent peut générer des heures de séquences en une semaine, et un département entier accumule des milliers d'heures chaque année. Pour donner un sens à ce déluge, les scientifiques se tournent vers l'intelligence artificielle, non pas pour remplacer le jugement humain, mais pour aider à organiser et à mettre en évidence les parties les plus importantes de ces rencontres complexes. Le défi consiste à apprendre aux machines à entendre par-dessus le bruit des sirènes et des cris, à distinguer différentes voix dans une scène chaotique, et à comprendre le sens derrière les mots prononcés dans des situations de haute pression.

Une équipe de chercheurs de l'Institut de technologie de Rochester, travaillant aux côtés du département de police de Rochester, a conçu un nouveau système destiné à s'attaquer à ce problème. Ils appellent leur cadre OpenBWC, un outil open-source qui utilise une combinaison de traitement audio, de reconnaissance vocale et d'analyse de langage pour transformer les fichiers vidéo bruts en informations structurées et interrogeables. Le but n'est pas simplement de transcrire ce qui a été dit, mais d'identifier la dynamique de l'interaction : L'officier a-t-il été respectueux ? La situation a-t-elle dégénéré ou s'est-elle calmée ? Pour ce faire, les chercheurs ont alimenté le système avec 1 225 vidéos obtenues par des demandes d'accès aux archives publiques. Ces enregistrements, qui ont été édités pour protéger la vie privée des personnes impliquées en floutant les visages, allaient de clips brefs de onze secondes à près de douze heures de séquences continues, totalisant plus de 1 877 heures de vidéo. L'équipe a découpé ces longs fichiers en segments gérables de trente secondes pour aider l'ordinateur à traiter l'audio sans perdre le flux de la conversation.

Le cœur de leur méthode repose sur un processus multi-étapes qui imite la façon dont un humain pourrait écouter un enregistrement difficile. D'abord, le système sépare l'audio mixte en voix individuelles, une technique connue sous le nom de séparation de locuteurs. Cela est crucial car les séquences de caméras piétons contiennent souvent des paroles superposées, du bruit de fond et plusieurs personnes parlant en même temps. Les chercheurs ont utilisé un modèle spécialisé pour isoler la voix de l'officier de celle du civil, permettant à l'ordinateur de se concentrer sur un locuteur à la fois. Une fois les voix séparées, le système a transcrit l'audio en texte à l'aide d'une technologie avancée de reconnaissance vocale. Cependant, les chercheurs ont constaté que tous les outils de transcription ne fonctionnaient pas de la même manière dans ces environnements réels et désordonnés. Ils ont testé deux versions d'un système de reconnaissance vocale populaire et ont découvert que la version plus petite et plus rapide omettait fréquemment des mots, répétait des phrases ou ne parvenait pas à capturer l'intégralité de la conversation. En revanche, la version plus grande et plus détaillée produisait des transcriptions bien plus précises, bien qu'elle nécessite toujours une révision humaine pour corriger les erreurs subtiles.

Après avoir généré le texte, les chercheurs ont appliqué un grand modèle de langage pour lire les transcriptions et résumer les interactions. Cette étape a permis au système d'identifier des thèmes clés, tels que l'utilisation par un officier de tactiques de désescalade ou le changement de ton de la conversation, passant du calme à l'agressivité. Les résultats ont ensuite été stockés dans une base de données qui pouvait être recherchée par sujet, par locuteur ou par comportement spécifique, rendant possible la recherche de modèles à travers des milliers d'incidents. L'équipe a constaté que si le système fonctionnait bien pour les interactions de routine comme les contrôles routiers, où l'audio est plus clair et les schémas de parole plus prévisibles, il éprouvait des difficultés significatives dans les scénarios chaotiques. Dans les situations de stress élevé impliquant des cris, des sirènes ou plusieurs personnes parlant simultanément, la précision de la transcription chutait, et le système confondait parfois qui parlait ou manquait des détails critiques.

Les chercheurs ont pris soin de noter que leur système n'est pas une solution parfaite et ne doit pas être utilisé comme base unique pour des décisions disciplinaires ou des jugements juridiques. Ils ont explicitement écarté l'idée qu'une transcription entièrement automatisée puisse actuellement remplacer la révision humaine dans les incidents critiques. L'étude suggère que l'approche la plus efficace est une approche hybride, où l'IA effectue le gros du travail d'organisation et de résumé, mais où des experts humains vérifient les résultats, en particulier dans les cas complexes ou à enjeux élevés. L'équipe a également souligné une limite technique : la voix de l'officier est souvent capturée beaucoup plus clairement que celle du civil parce que la caméra est portée sur le corps de l'officier, pointant vers lui. Ce déséquilibre signifie que le système est naturellement meilleur pour comprendre le côté de l'officier de la conversation, ce qui pourrait biaiser l'analyse si cela n'est pas pris en compte.

Malgré ces défis, ce projet démontre une voie pratique pour l'utilisation de l'intelligence artificielle dans la police. En combinant des outils open-source avec des tests rigoureux, les chercheurs ont créé un cadre qui peut aider les départements de police à examiner leurs propres pratiques, à former les agents à une meilleure communication et à se tenir responsables devant le public. Ce travail ne prétend pas avoir résolu le problème de l'analyse des séquences de police, mais il offre une méthode fiable pour entamer la conversation. Les conclusions suggèrent que, si les machines peuvent nous aider à voir des modèles dans le bruit, les informations les plus importantes proviennent toujours de la combinaison de la puissance de calcul avec la compréhension humaine. À mesure que la technologie s'améliore et que les ensembles de données augmentent, ce type d'approche interdisciplinaire pourrait transformer la façon dont les agences d'application de la loi apprennent de leur travail quotidien, transformant de vastes archives vidéo en connaissances exploitables qui améliorent la sécurité et la confiance pour toutes les parties impliquées.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →