← 최신 논문
💻 computer science

Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage

본 논문은 법 집행의 책임성과 교육을 강화하기 위해 멀티모달 분석 및 거대 언어 모델을 포함한 첨단 AI를 활용하여 경찰 바디캠 영상 속의 갈등 고조 및 존중과 같은 행동 역학을 자동으로 탐지, 분류 및 요약하는 새로운 학제간 프레임워크를 제안한다.

원저자: Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

게시일 2026-09-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

미국 전역의 도시에서 경찰관들은 매일 시민들과의 상호작용을 기록하는 카메라를 착용합니다. 바디캠(body-worn cameras)이라고 알려진 이 장치들은 영상과 오디오의 방대하고도 계속해서 늘어나는 라이브러리를 포착하며, 법 집행 기관이 지역 사회와 만나는 순간들을 가공되지 않은 여과 없는 모습으로 보여줍니다. 수십 년 동안 연구자들과 경찰 지도자들은 교통 단속이나 동네 순찰 중에 어떤 일이 일어나는지 이해하기 위해 이 영상들을 살펴보고, 존중, 긴장 또는 상황 완화(de-escalation)의 패턴을 찾기를 희망해 왔습니다. 그러나 데이터의 엄청난 양은 인간의 눈과 귀만으로는 이 작업을 거의 불가능하게 만들었습니다. 단 한 명의 경찰관이 일주일 동안 몇 시간 분량의 영상을 생성할 수 있으며, 한 부서는 매년 수천 시간의 영상을 축적합니다. 이 범람하는 데이터를 이해하기 위해 과학자들은 인간의 판단을 대체하려는 것이 아니라, 이 복잡한 조우의 가장 중요한 부분을 정리하고 강조하는 데 도움을 주기 위해 인공지능을 활용하고 있습니다. 과제는 기계가 사이렌 소리와 외침 속에서도 소리를 듣고, 혼란스러운 장면 속에서 서로 다른 목소리를 구별하며, 고압적인 상황에서 오가는 말 뒤에 숨겨진 의미를 이해하도록 가르치는 데 있습니다.

로체스터 공과대학교(Rochester Institute of Technology)의 연구진은 로체스터 경찰국과 협력하여 이 문제를 해결하기 위해 설계된 새로운 시스템을 구축했습니다. 그들은 이 프레임워크를 OpenBWC라고 부르며, 이는 오디오 처리, 음성 인식 및 언어 분석의 조합을 사용하여 가공되지 않은 영상 파일을 구조화되고 검색 가능한 정보로 변환하는 오픈 소스 도구입니다. 목표는 단순히 무엇이 말해졌는지를 전사(transcribe)하는 것이 아니라, 상호작용의 역학 관계를 식용하는 것입니다. 즉, 경찰관이 존중을 갖추었는가? 상황이 악화되었는가, 아니면 진정되었는가? 이를 위해 연구진은 공공 기록 요청을 통해 확보한 1,225개의 영상을 시스템에 입력했습니다. 사람들의 프라이버시를 보호하기 위해 얼굴을 흐리게 처리한 이 녹화물들은 짧게는 11초에서 길게는 거의 12시간 연속 영상에 이르기까지 다양했으며, 총 1,877시간 이상의 영상에 달했습니다. 연구팀은 컴퓨터가 대화의 흐름을 놓치지 않고 오디오를 처리할 수 있도록 이 긴 파일들을 관리 가능한 30초 단위의 세그먼트로 나누었습니다.

그들의 방법의 핵심은 인간이 어려운 녹음 파일을 듣는 방식을 모방한 다단계 프로세스를 포함합니다. 먼저, 시스템은 혼합된 오디오를 개별 목소리로 분리하는데, 이는 화자 분리(speaker separation)라고 알려진 기술입니다. 이는 바디캠 영상에 종종 겹치는 음성, 배경 소음, 그리고 여러 사람이 동시에 말하는 상황이 포함되기 때문에 매우 중요합니다. 연구진은 경찰관의 목소리를 시민의 목소리로부터 격리하기 위해 특화된 모델을 사용하여 컴퓨터가 한 번에 한 명의 화자에게 집중할 수 있도록 했습니다. 목소리가 분리된 후, 시스템은 고급 음성-텍스트 변환 기술을 사용하여 오디오를 텍스트로 전사했습니다. 그러나 연구진은 모든 전사 도구가 이러한 무질서한 실제 환경에서 동일하게 잘 작동하지 않는다는 것을 발견했습니다. 그들은 인기 있는 음성 인식 시스템의 두 가지 버전을 테스트했고, 더 작고 빠른 버전은 자주 단어를 놓치거나 문구를 반복하거나 전체 대화를 포착하는 데 실패한다는 것을 발견했습니다. 반면, 더 크고 상세한 버전은 훨씬 더 정확한 전사본을 만들어냈지만, 미세한 오류를 잡아내기 위해서는 여전히 인간의 검토가 필요했습니다.

텍스트를 생성한 후, 연구진은 대규모 언어 모델을 적용하여 전사본을 읽고 상호작용을 요약했습니다. 이 단계는 시스템이 경찰관이 상황 완화 전술을 사용했는지, 혹은 대화의 어조가 차분함에서 공격적으로 변했는지와 같은 핵심 주제를 식별할 수 있게 해주었습니다. 결과는 주제, 화자 또는 특정 행동별로 검색할 수 있는 데이터베이스에 저장되어, 수천 건의 사건 전반에 걸친 패턴을 찾는 것이 가능해졌습니다. 연구팀은 시스템이 오디오가 더 명확하고 언어 패턴이 예측 가능한 교통 단속과 같은 일상적인 상호작용에는 잘 작동하지만, 혼란스러운 시나리오에서는 크게 어려움을 겪는다는 것을 발견했습니다. 고함, 사이렌, 또는 여러 사람이 동시에 말하는 고도의 스트레스 상황에서는 전사의 정확도가 떨어졌으며, 시스템이 때때로 누가 말하고 있는지 혼동하거나 중요한 세부 사항을 놓치기도 했습니다.

연구진은 자신들의 시스템이 완벽한 해결책이 아니며, 징계 결정이나 법적 판단의 유일한 근거로 사용되어서는 안 된다는 점을 주의 깊게 명시했습니다. 그들은 결정적인 사건에서 완전히 자동화된 전사가 현재 인간의 검토를 대체할 수 있다는 아이디어를 명시적으로 배제했습니다. 이 연구는 가장 효과적인 접근 방식은 AI가 데이터의 정리와 요약이라는 힘든 일을 처리하되, 인간 전문가가 결과를 검증하는 하이브리드 방식임을 시사합니다. 또한 연구팀은 기술적 한계를 강조했는데, 카메라는 경찰관의 몸에 부착되어 그들을 향하고 있기 때문에 경찰관의 목소리가 시민의 목소리보다 훨씬 더 명확하게 포착되는 경우가 많다는 점입니다. 이러한 불균형은 시스템이 자연스럽게 대화의 경찰관 측을 더 잘 이해하게 만들며, 이를 고려하지 않을 경우 분석이 왜곡될 수 있음을 의미합니다.

이러한 과제에도 불구하고, 이 프로젝트는 경찰 업무에 인공지능을 사용하는 실질적인 경로를 보여줍니다. 오픈 소스 도구를 엄격한 테스트와 결동함으로써, 연구진은 경찰 부서가 스스로의 관행을 검토하고, 경찰관들에게 더 나은 의사소통을 교육하며, 대중에게 책임을 다할 수 있도록 돕는 프레임워크를 만들었습니다. 이 작업은 경찰 영상 분석 문제를 해결했다고 주장하는 것이 아니라, 대화를 시작할 수 있는 신뢰할 수 있는 방법을 제안하는 것입니다. 연구 결과는 기계가 소음 속에서 패턴을 보는 데 도움을 줄 수 있지만, 가장 중요한 통찰력은 여전히 계산 능력과 인간의 이해를 결합하는 데서 온다는 것을 시사합니다. 기술이 개선되고 데이터 세트가 커짐에 따라, 이러한 학제 간 접근 방식은 법 집행 기관이 일상적인 업무로부터 배우는 방식을 변화시켜, 방대한 영상 아카이브를 모든 관련자의 안전과 신뢰를 향상시키는 실행 가능한 지식으로 전환할 수 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →