← Ultimi articoli
💻 computer science

Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage

Questo articolo propone un nuovo quadro interdisciplinare che sfrutta l'IA avanzata, inclusi l'analisi multimodale e i grandi modelli linguistici, per rilevare, classificare e riassumere automaticamente le dinamiche comportamentali, come l'escalation e il rispetto, nelle riprese delle telecamere indossabili della polizia per migliorare la responsabilità e l'addestramento delle forze dell'ordine.

Autori originali: Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

Pubblicato 2026-09-11
📖 6 min di lettura🧠 Approfondimento

Autori originali: Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Ogni giorno, gli agenti di polizia nelle città di tutti gli Stati Uniti indossano telecamere che registrano le loro interazioni con il pubblico. Questi dispositivi, noti come body-worn cameras (telecamere indossabili), catturano una vasta e crescente libreria di video e audio, offrendo una visione cruda e non filtrata dei momenti in cui le forze dell'ordine incontrano la comunità. Per decenni, ricercatori e dirigenti di polizia hanno sperato di setacciare queste riprese per comprendere cosa accada durante un controllo stradale o un intervento in un quartiere, cercando modelli di rispetto, tensione o de-escalation. Tuttavia, l'enorme volume di dati ha reso questo compito quasi impossibile per gli occhi e le orecchie umane da sole. Un singolo agente può generare ore di filmati in una settimana, e un intero dipartimento accumula migliaia di ore ogni anno. Per dare un senso a questo diluvio, gli scienziati si stanno rivolgendo all'intelligenza artificiale, non per sostituire il giudizio umano, ma per aiutare a organizzare e mettere in evidenza le parti più importanti di questi complessi incontri. La sfida consiste nell'insegnare alle macchine ad ascoltare sopra il rumore delle sirene e delle grida, a distinguere tra diverse voci in una scena caotica e a comprendere il significato dietro le parole pronunciate in situazioni di alta pressione.

Un team di ricercatori del Rochester Institute of Technology, lavorando insieme al Rochester Police Department, ha costruito un nuovo sistema progettato per affrontare questo problema. Chiamano il loro framework OpenBWC, uno strumento open-source che utilizza una combinazione di elaborazione audio, riconoscimento vocale e analisi del linguaggio per trasformare i file video grezzi in informazioni strutturate e ricercabili. L'obiettivo non è semplicemente trascrivere ciò che è stato detto, ma identificare la dinamica dell'interazione: l'agente è stato rispettoso? La situazione è degenerata o si è calmata? Per farlo, i ricercatori hanno fornito al sistema 1.225 video ottenuti tramite richieste di atti pubblici. Queste registrazioni, che erano state modificate per proteggere la privacy delle persone coinvolte sfocando i volti, spaziavano da brevi clip di undici secondi a quasi dodici ore di filmato continuo, per un totale di oltre 1.877 ore di video. Il team ha suddiviso questi lunghi file in segmenti gestibili di trenta secondi per aiutare il computer a elaborare l'audio senza perdere il flusso della conversazione.

Il nucleo del loro metodo prevede un processo multi-fase che imita il modo in cui un essere umano potrebbe ascoltare una registrazione difficile. Per prima cosa, il sistema separa l'audio misto in singole voci, una tecnica nota come separazione degli speaker. Questo è fondamentale perché le riprese delle body-cam spesso contengono sovrapposizioni di parlato, rumore di fondo e più persone che parlano contemporaneamente. I ricercatori hanno utilizzato un modello specializzato per isolare la voce dell'agente da quella del civile, permettendo al computer di concentrarsi su un solo interlocutore alla volta. Una volta separate le voci, il sistema ha trascritto l'audio in testo utilizzando tecnologie avanzate di speech-to-text (da voce a testo). Tuttavia, i ricercatori hanno scoperto che non tutti gli strumenti di trascrizione funzionavano ugualmente bene in questi ambienti disordinati e reali. Hanno testato due versioni di un popolare sistema di riconoscimento vocale e hanno scoperto che la versione più piccola e veloce saltava spesso parole, ripeteva frasi o non riusciva a catturare l'intera conversazione. Al contrario, la versione più grande e dettagliata produceva trascrizioni molto più accurate, sebbene richiedesse ancora una revisione umana per correggere errori sottili.

Dopo aver generato il testo, i ricercatori hanno applicato un modello linguistico di grandi dimensioni (large language model) per leggere le trascrizioni e riassumere le interazioni. Questo passaggio ha permesso al sistema di identificare temi chiave, come se l'agente avesse utilizzato tattiche di de-escalation o se il tono della conversazione fosse passato da calmo ad aggressivo. I risultati sono stati poi archiviati in un database che poteva essere interrogato per argomento, interlocutore o comportamento specifico, rendendo possibile trovare schemi attraverso migliaoli di incidenti. Il team ha riscontrato che, mentre il sistema funzionava bene per le interazioni di routine come i controlli stradali, dove l'audio è più chiaro e i modelli di parlato sono prevedibili, faticava significativamente negli scenari caotici. In situazioni di forte stress che coinvolgevano urla, sirene o più persone che parlavano contemporaneamente, l'accuratezza della trascrizione diminuiva e il sistema a volte confondeva chi stesse parlando o perdeva dettagli critici.

I ricercatori sono stati attenti a sottolineare che il loro sistema non è una soluzione perfetta e non dovrebbe essere utilizzato come unico base per decisioni disciplinari o giudizi legali. Hanno escluso esplicitamente l'idea che una trascrizione completamente automatizzata possa attualmente sostituire la revisione umana nei casi critici. Lo studio suggerisce che l'approccio più efficace sia uno ibrido, in cui l'IA si occupa del lavoro pesante di organizzazione e riassunto dei dati, ma gli esperti umani verificano i risultati, specialmente nei casi complessi o ad alto rischio. Il team ha inoltre evidenziato un limite tecnico: la voce dell'agente è spesso catturata molto più chiaramente di quella del civile perché la telecamera è indossata sul corpo dell'agente, puntando verso di lui. Questo squilibrio significa che il sistema è naturalmente più bravo a comprendere il lato dell'agente della conversazione, il che potrebbe falsare l'analisi se non tenuto in considerazione.

Nonostante queste sfide, il progetto dimostra un percorso pratico per l'uso dell'intelligenza artificiale nella polizia. Combinando strumenti open-source con test rigorosi, i ricercatori hanno creato un framework che può aiutare i dipartimenti di polizia a rivedere le proprie pratiche, addestrare gli agenti a una migliore comunicazione e ritenersi responsabili di fronte al pubblico. Il lavoro non sostiene di aver risolto il problema dell'analisi dei filmati della polizia, ma offre un metodo affidabile per iniziare la conversazione. Le conclusioni suggeriscono che, sebbene le macchine possano aiutarci a vedere schemi nel rumore, gli approfondimenti più importanti derivano ancora dalla combinazione della potenza computazionale con la comprensione umana. Man mano che la tecnologia migliora e i dataset crescono, questo tipo di approccio interdisciplinare potrebbe trasformare il modo in cui le agenzie di polizia imparano dal proprio lavoro quotidiano, trasformando vasti archivi di video in conoscenze azionabili che migliorano la sicurezza e la fiducia per tutti i soggetti coinvolti.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →