Scene-aware Transformer encoder with Multi Instance Learning-guided Attention Mechanism for Anomaly Detection in Video Surveillance
본 논문은 장면 인식 임베딩을 위한 대조 학습과 다중 인스턴스 학습 어텐션에 의해 유도되는 트랜스포머 인코더를 결합하여, 비디오 이상 탐지에서의 문맥적 및 시간적 한계를 효과적으로 해결하고 벤치마크 데이터셋에서 우수한 정확도를 달取得하는 STAM 프레임워크를 제안한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 북적이는 도시 광장의 보안 팀장이라고 상상해 보십시오. 당신에게는 수백 개의 카메라가 실시간 영상을 송출하고 있지만, 모든 화면을 한꺼번에 지켜볼 수는 없습니다. 당신의 임무는 싸움, 절도, 혹은 사람이 잘못된 방향으로 달리는 것과 같은 '이상한 일'을 포착하는 것입니다. 까다로운 점은, 무엇이 "이상한가"는 어디에 있느냐에 따라 완전히 달라진다는 것입니다. 도서관에서 누군가 달리는 것은 큰 경고 신호가 됩니다. 하지만 축구 경기장에서는 그것이 경기의 일부일 뿐입니다. 오랫동안 이러한 작업을 수행하려는 컴퓨터 프로그램들은 단순히 '움직임'만을 보는 경비원과 같았습니다. 누군가 달리면, 설령 그곳이 경기장이라 할지라도 경보가 울렸습니다. 그들은 장면의 '맥락'을 이해하지 못했습니다. 또한 점들을 연결하기 위해 몇 초 전의 일을 기억하는 데 어려움을 겪었습니다. 이 논문은 컴퓨터가 단순히 움직임을 보는 것을 넘어, 자신이 감시하고 있는 장소의 "분위기"를 이해하도록 가르침으로써 이 문제를 해결합니다.
연구자 Rifa Nizam Khan과 Mohd. Amjad(Jamia Millia Islamia 대학교)는 STAM이라는 새로운 시스템을 구축했습니다. 이것을 두 가지 뚜렷한 사고방식을 가진 매우 똑똑한 탐정이라고 생각하십시오. 첫째, 시스템은 '장면 감각(scene-sense)' 모듈을 사용하여 자신이 정확히 어디에 있는지 파악합니다. 마치 조용한 공원과 북적이는 기차역의 차이를 아는 것처럼 말입니다. 둘째, 강력한 메모리 도구(Transformer)를 사용하여 짧은 영상 클립을 보고 어떤 것이 수상한지 판단합니다. 마법은 이 두 부분이 서로 대화할 때 일어납니다. 시스템은 클립을 단독으로 보는 것이 아니라, "이 동작이 '여기서' 말이 되는가?"라고 묻습니다. 만약 대답이 '아니오'라면, 경보를 울립니다.
이 새로운 탐정이 어떻게 작동하는지 간단한 단계별로 설명하겠습니다.
두 개의 뇌 접근 방식
대부분의 기존 시스템은 하나의 뇌로 모든 것을 하려다 보니 종종 혼란을 겪었습니다. STAM은 업무를 나눕니다.
- 장면 탐정: 동작을 관찰하기 전에, 시스템은 환경의 스냅샷을 찍습니다. 시스템은 '대조 학습(contrastive learning)'이라는 기술을 사용하여 장면의 정신적 지도를 구축합니다. 이것을 도서관에서 책이 선반에서 떨어지는 것은 정상적이지만 체육관에서는 이상하다는 것을 아는 사서라고 상상해 보십시오. 시스템은 장소의 '형태'를 인식하는 법을 배우며, 모든 위치에 대한 고유한 ID 카드를 생성합니다.
- 동작 관찰자: 이 부분은 '확장된 3D 컨볼루션 네트워크(Inflated 3D ConvNet 또는 I3D)'라는 도구를 사용합니다. 일반적인 비디오 카메라가 시간이 흐름에 따라 변하는 2D 사진이라면, 이 도구는 비디오를 공간과 시간의 입체적인 블록으로 보는 3D 스캐너와 같습니다. 이 도구는 움직임과 사람들의 모습을 포착하여 상세한 보고서로 변환합니다.
"스니펫 꾸러미(Bag of Snippets)" 게임
시스템은 영상 전체를 한 번에 시청하지 않습니다. 대신 영상을 '스니펫(snippets)'이라고 불리는 아주 작은 조각들로 자릅니다. 시스템은 전체 영상을 이러한 스니펫들의 "꾸러미(bag)"처럼 취급합니다. 여기서 '다중 인스턴스 학습(Multi-Instance Learning, MIL)'이 등장합니다. 이것을 학생의 성적을 매기는 선생님이라고 생각해 보십시오. 만약 학급의 학생 중 한 명(한 개의 스니펫)이 이상 징후로 분류되면, 학급 전체(비디오 전체)가 수상한 것으로 분류됩니다. 시스템은 모든 스니펫을 살펴보며 "이 중 누가 문제아인가?"라고 묻습니다.
마법의 어텐션 메커니즘(Attention Mechanism)
이것이 가장 멋진 부분입니다. 시스템에는 위치의 ID 카드를 보유하는 특별한 "장면 토큰(Scene Token, CLS 토큰)"이 있습니다. 시스템이 "꾸러미"의 스니펫들을 검토할 때, 시스템은 이 위치 ID를 사용하여 주의(attention)를 집중할 곳을 안내합니다. 이것은 마치 "이 특정 복도에서는 사람들이 보통 천천히 걷는다. 만약 누군가 질주하는 것을 본다면, 바로 저 사람에게 집중해야 한다"라고 알고 있는 보안 요원과 같습니다. 시스템은 각 스니펫의 중요도를 결정하기 위해 어텐션 메커니즘을 사용합니다. 만약 특정 스니펫이 '그 특정 장면에서' 이상해 보인다면, 시스템은 높은 점수를 부여합니다. 만약 이상해 보이지만 장면과 잘 어울린다면(예: 경기장에서 달리는 경우), 시스템은 이를 무시합니다.
결과: 완벽에 가까운 점수
연구진은 자신들의 STAM 시스템을 체포, 방화, 절도와 같은 실제 사건을 담은 1,900개 이상의 영상이 포함된 유명한 감시 영상 데이터셋인 UCF Crime에서 테스트했습니다. 또한 새로운 환경에서도 작동할 수 있는지 확인하기 위해 다른 데이터셋인 UCF101에서도 테스트했습니다.
결과는 인상적이었습니다. STAM 시스템은 **99.85%**의 정확도와 **99.98%**의 AUC(Area Under Curve) 점수를 달성했습니다. 이를 체감하기 위해, 약 90%에서 96% 사이의 훨씬 낮은 점수를 기록한 "I3D-MIL" 및 "GAN-MIL"과 같은 다른 스마트 시스템들과 비교해 보십시오. 논문은 STAM이 승리한 이유가 마침내 맥락을 이해했기 때문이라고 제안합니다. 시스템은 단순히 사람이 달리는 것을 보는 것이 아니라, '달리는 것이 위험한 곳에서' 달리는 사람을 보는 것입니다.
이것이 왜 중요한가
저자들은 컴퓨터에 장면의 레이아웃을 명시적으로 가르치고 '장면 인식형(scene-aware)' 어텐션 메커니즘을 사용함으로써 오보(false alarms)를 획기적으로 줄일 수 있다는 것을 발견했습니다. 과거에는 누군가 공원에서 달리고 있다는 이유만으로 시스템이 "비상!"이라고 외쳤을 수도 있습니다. 하지만 STAM은 그 차이를 압니다. 이 연구는 이러한 접근 방식이 단순히 작은 개선이 아니라, 비디오 감시를 실제의 복잡하고 무질서한 현실을 처리할 수 있을 만큼 실제로 똑똑하게 만드는 중요한 진전임을 보여줍니다. 비록 이 시스템을 실행하는 데 더 많은 컴퓨팅 파워가 필요하지만(특정 하드웨어에서 1 에포크당 약 8분 소요), 그 대가는 훨씬 더 신뢰할 수 있고 섣불리 경보를 울리지 않는 시스템을 얻는 것입니다.
요약하자면, 이 논문은 나쁜 놈들을 잡기 위해서는 단순히 움직임을 보는 눈뿐만 아니라, 그 장소의 이야기를 이해하는 뇌가 필요하다고 제안합니다. 그리고 STAM을 통해, 컴퓨터는 마침내 그 이야기를 이해하기 시작했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.