← Últimos artículos
💻 computer science

Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage

Este artículo propone un novedoso marco interdisciplinario que aprovecha la IA avanzada, incluyendo el análisis multimodal y los modelos de lenguaje extensos, para detectar, clasificar y resumir automáticamente dinámicas de comportamiento, tales como la escalada y el respeto, en grabaciones de cámaras corporales policiales para mejorar la rendición de cuentas y la capacitación en las fuerzas del orden.

Autores originales: Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

Publicado 2026-09-11
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Cada día, los agentes de policía en ciudades de todo Estados Unidos llevan cámaras que graban sus interacciones con el público. Estos dispositivos, conocidos como cámaras corporales, capturan una vasta y creciente biblioteca de video y audio, ofreciendo una mirada cruda y sin filtros a los momentos en que las fuerzas del orden se encuentran con la comunidad. Durante décadas, investigadores y líderes policiales han deseado analizar este metraje para comprender qué sucede durante una parada de tráfico o un llamado en un vecindario, buscando patrones de respeto, tensión o desescalada. Sin embargo, el enorme volumen de datos ha hecho que esta tarea sea casi imposible para los ojos y oídos humanos por sí solos. Un solo oficial puede generar horas de metraje en una semana, y un departamento entero acumula miles de horas cada año. Para dar sentido a este aluvión, los científicos están recurriendo a la inteligencia artificial, no para reemplazar el juicio humano, sino para ayudar a organizar y resaltar las partes más importantes de estos complejos encuentros. El desafío radica en enseñar a las máquinas a escuchar por encima del ruido de las sirenas y los gritos, a distinguir entre diferentes voces en una escena caótica y a comprender el significado detrás de las palabras pronunciadas en situaciones de alta presión.

Un equipo de investigadores del Instituto de Tecnología de Rochester, trabajando junto al Departamento de Policía de Rochester, ha construido un nuevo sistema diseñado para abordar este problema. Llaman a su marco de trabajo OpenBWC, una herramienta de código abierto que utiliza una combinación de procesamiento de audio, reconocimiento de voz y análisis de lenguaje para convertir archivos de video sin procesar en información estructurada y recuperable. El objetivo no es simplemente transcribir lo que se dijo, sino identificar la dinámica de la interacción: ¿Fue respetuoso el oficial? ¿La situación escaló o se calmó? Para lograr esto, los investigadores alimentaron el sistema con 1,225 videos obtenidos mediante solicitudes de registros públicos. Estas grabaciones, que habían sido editadas para proteger la privacidad de las personas involucradas mediante el desenfoque de rostros, variaban desde breves clips de once segundos hasta casi doce horas de metraje continuo, sumando más de 1,877 horas de video. El equipo dividió estos archivos largos en segmentos manejables de treinta segundos para ayudar a la computadora a procesar el audio sin perder el flujo de la conversación.

El núcleo de su método implica un proceso de múltiples pasos que imita cómo un humano podría escuchar una grabación difícil. Primero, el sistema separa el audio mezclado en voces individuales, una técnica conocida como separación de hablantes. Esto es crucial porque el metraje de las cámaras corporales a menudo contiene habla superpuesta, ruido de fondo y múltiples personas hablando al mismo tiempo. Los investigadores utilizaron un modelo especializado para aislar la voz del oficial de la del civil, permitiendo que la computadora se concentrara en un hablante a la vez. Una vez separadas las voces, el sistema transcribió el audio a texto utilizando tecnología avanzada de voz a texto. Sin embargo, los investigadores descubrieron que no todas las herramientas de transcripción funcionaban igual de bien en estos entornos desordenados del mundo real. Probaron dos versiones de un popular sistema de reconocimiento de voz y descubrieron que la versión más pequeña y rápida omitía palabras con frecuencia, repetía frases o no lograba capturar la conversación completa. En contraste, la versión más grande y detallada producía transcripciones mucho más precisas, aunque todavía requería la revisión humana para detectar errores sutiles.

Después de generar el texto, los investigadores aplicaron un modelo de lenguaje extenso para leer las transcripciones y resumir las interacciones. Este paso permitió al sistema identificar temas clave, como si un oficial utilizó tácticas de desescalada o si el tono de la conversación cambió de calmado a agresivo. Los resultados se almacenaron luego en una base de datos que podía ser buscada por tema, hablante o comportamiento específico, haciendo posible encontrar patrones a través de miles de incidentes. El equipo encontró que, si bien el sistema funcionaba bien para interacciones rutinarias como las paradas de tráfico, donde el audio es más claro y los patrones de habla son predecibles, tenía dificultades significativas en escenarios caóticos. En situaciones de alto estrés que involucraban gritos, sirenas o múltiples personas hablando al mismo tiempo, la precisión de la transcripción disminuía, y el sistema a veces confundía quién estaba hablando o perdía detalles críticos.

Los investigadores fueron cuidadosos al señalar que su sistema no es una solución perfecta y no debe utilizarse como la única base para decisiones disciplinarias o juicios legales. Descartaron explícitamente la idea de que la transcripción totalmente automatizada pudiera reemplazar actualmente la revisión humana en incidentes críticos. El estudio sugiere que el enfoque más efectivo es uno híbrido, donde la IA realiza el trabajo pesado de organizar y resumir los datos, pero expertos humanos verifican los resultados, especialmente en casos complejos o de alto riesgo. El equipo también destacó una limitación técnica: la voz del oficial se captura con mucha más claridad que la del civil debido a que la cámara se lleva en el cuerpo del oficial, apuntando hacia él. Este desequilibrio significa que el sistema es naturalmente mejor para entender el lado del oficial de la conversación, lo que podría sesgar el análisis si no se tiene en cuenta.

A pesar de estos desafíos, el proyecto demuestra un camino práctico para el uso de la inteligencia artificial en la vigilancia policial. Al combinar herramientas de código abierto con pruebas rigurosas, los investigadores han creado un marco que puede ayudar a los departamentos de policía a revisar sus propias prácticas, entrenar a los oficiales en una mejor comunicación y rendir cuentas ante el público. El trabajo no pretende haber resuelto el problema del análisis de metraje policial, pero ofrece un método confiable para iniciar la conversación. Los hallazgos sugieren que, si bien las máquinas pueden ayudarnos a ver patrones en el ruido, los conocimientos más importantes aún provienen de combinar la potencia computacional con la comprensión humana. A medida que la tecnología mejore y los conjuntos de datos crezcan, este tipo de enfoque interdisciplinario podría transformar la manera en que las agencias de aplicación de la ley aprenden de su trabajo diario, convirtiendo vastos archivos de video en conocimiento accionable que mejore la seguridad y la confianza para todos los involucrados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →