← 최신 논문
💻 computer science

Learning Where and When: Patch-Based Spatiotemporal Localization in Weakly Supervised Video Anomaly Detection

이 논문은 근접성 인지 선택 전략을 사용하여 이상 징후의 위치와 시점을 공동으로 학습함으로써 최첨단 성능을 달면서도, 공간적 근거 기반 연구를 발전시키기 위해 새로운 경계 상자 주석과 자원을 공개하는 약지도 학습 기반 비디오 이상 탐지를 위한 패치 기반 시공간 프레임워크를 소개한다.

원저자: Hamza Karim, Nghia Nguyen, Lokman Bekit, Yasin Yilmaz

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hamza Karim, Nghia Nguyen, Lokman Bekit, Yasin Yilmaz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 번화한 도시 광장의 24시간 보안 피드를 지켜보고 있다고 상상해 보세요. 당신의 임수는 '나쁜 놈들(이상 징후)'을 찾아내는 것입니다.

과거의 방식: "시간만 보는" 탐정
기존의 대부분의 컴퓨터 프로그램은 스톱워치만 가진 탐정과 같았습니다. 그들은 *"헤이, 오후 2시에서 2시 15분 사이에 뭔가 이상한 일이 있었어!"*라고 말할 수는 있었지만, 광장의 어디에서 그 일이 일어났는지는 말해주지 못했습니다. 분수대 근처에서 싸움이 일어난 걸까요? 빵집에서 물건을 훔치는 사건이었을까요? 아니면 단순히 새가 창문에 부딪힌 일이었을까요? 이들은 특정 지점을 가리킬 수 없었기 때문에, 현실 세계에서 신뢰하기 어려웠습니다.

새로운 방식: "패치 기반" 탐정
이 논문은 돋보기와 격자 지도를 가진 탐정처럼 행동하는 새로운 시스템을 소개합니다. 이 시스템은 모든 프레임을 하나의 커다란 흐릿한 사진으로 보는 대신, 모든 프레임을 **7x7 격자의 작은 정사각형(패치)**으로 잘게 나눕니다.

이것은 스도쿠 판을 생각하면 쉽습니다. 시스템은 비디오의 매 초마다 그 보드의 모든 작은 칸을 살펴보고, 어떤 칸이 "수상한지"를 정확히 파악합니다.

선생님 없이 학습하는 법
보통 컴퓨터에게 특정한 나쁜 놈을 찾는 법을 가르치려면, 수천 개의 영상 속에서 그들에게 박스를 그려주는 작업(마치 선생님이 손가락으로 가리키며 "여기 봐!"라고 말하는 것과 같은 작업)이 필요합니다. 이는 비용이 많이 들고 느린 작업입니다.

이 논문은 **약한 지도 학습(Weak Supervision)**을 사용합니다. 만약 당신에게 "이 영상에는 범죄가 포함되어 있음"이라고 적혀 있는 영상 목록은 있지만, 정확히 언제 혹은 어디서 일어났는지는 모르는 상황이라고 상상해 보세요.

  • 도전 과제: 어디를 봐야 할지 모르는 상태에서 어떻게 범인을 찾을 수 있을까요?
  • 해결책: 이 시스템은 **다중 인스턴스 학습(Multiple Instance Learning, MIL)**이라는 전략을 사용합니다. 시스템은 어떤 작은 칸들이 범인인지 추측합니다. 만약 영상이 "나쁨"으로 라벨링 되어 있다면, 그 작은 칸들 중 적어도 하나는 반드시 범인이어야 합니다. 시스템은 시행착오를 통해 이들을 식별하는 법을 배웁니다.

비법: "근접성" 규칙
저자들은 인간과 유사한 점을 발견했습니다. 나쁜 일은 보통 단 한 순간 동안 아주 작은 픽셀 하나에서만 일어나지 않습니다. 그것은 **클러스터(무리)**를 이루어 발생합니다. 싸움은 단 한 프레임 동안 한 지점에서만 일어나는 것이 아니라, 몇 초 동안 여러 사람 사이에서 일어납니다.

그래서 그들은 "근접성을 인식하는 Top-k(Proximity-Aware Top-k)" 전략을 발명했습니다.

  • 기존 방식: "가장 무서워 보이는 칸 5개를 골라라. 설령 그 칸들이 지도 곳곳에 흩어져 있고 서로 다른 시간대에 있더라도 말이다."
  • 새로운 방식: "가장 무서워 보이는 칸 5개를 고르되, 반드시 시간과 공간상에서 이웃한(neighbor) 칸들이 되도록 해라."
    이는 마치 "단순히 가장 큰 소리를 찾지 말고, 바로 옆에서 발생하는 일련의 큰 소리들을 찾아라"라고 말하는 것과 같습니다. 이는 컴퓨터가 무작위적인 배경 소음에 혼동되는 것을 방지하고, 실제 사건 주위에 깨끗하고 견고한 박스를 그릴 수 있도록 도와줍니다.

결과: 미래를 위한 새로운 지도
저자들은 네 가지 주요 비디오 데이터셋(UCF-Crime 및 XD-Violence 등)을 통해 테스트를 진행했습니다.

  1. 더 나은 정확도: 그들의 "격자 탐정"은 이전 방식들보다 사건이 언제 일-어났는지와 어디서 일어났는지 모두에서 훨씬 더 정확하게 범인을 찾아냈습니다.
  2. 새로운 자원: 두 개의 데이터셋에 대해서는 "어디서"에 대한 데이터가 없었기 때문에, 저자들은 테스트 영상들을 위해 직접 박스를 그리는 작업을 수행했습니다. 그들은 다른 연구자들이 이를 바탕으로 발전할 수 있도록 이 새로운 지도(주석/annotation)와 코드를 대중에게 공개합니다.

요약하자면
이 논문은 컴퓨터가 단순히 이상한 일이 언제 일어나는지를 추측하는 것을 넘어, 격자 기반 접근 방식과 나쁜 사건이 "함께 붙어 다닌다"는 규칙을 사용하여 정확히 어디서 일어나는지를 찾아내도록 가르칩니다. 이 모든 과정은 비용이 많이 드는 수작업 데이터 없이도 가능합니다. 또한 그들은 커뮤니티가 사용할 수 있는 새로운 "정답지"(경계 상자/bounding boxes)를 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →