← 최신 논문
🤖 AI

Weakly-Supervised Spatiotemporal Anomaly Detection

본 논문은 비디오 클립 내의 국소적 이상을 식별하기 위해 비디오 수준 레이블과 다중 인스턴스 순위 손실을 활용하는 약지도 시공간 이상 탐지 방법을 제안하며, UCF Crime2Local 데이터셋에서 그 유효성을 입증합니다.

원저자: Urvi Gianchandani, Praveen Tirupattur, Mubarak Shah

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Urvi Gianchandani, Praveen Tirupattur, Mubarak Shah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수백 개의 감시 카메라를 한 번에 지켜보는 보안 요원이 되어 보십시오. 당신의 임무는 싸움이나 절도와 같은 이상한 일을 포착하는 것입니다. 문제는 24 시간 내내 모든 화면을 주시할 수 없다는 점이며, 이상한 일은 매우 드물게 발생한다는 점입니다. 컴퓨터의 도움이 필요하지만, 비디오의 모든 1 초를"여기서 싸움이 발생했다"또는"저기서 절도가 발생했다"라고 레이블을 매기는 데는 시간이 너무 오래 걸리기 때문에 컴퓨터를 가르치는 것은 까다롭습니다.

이 논문은 이러한 상세한 레이블링을 많이 필요로 하지 않고도 컴퓨터가 이러한 이상한 사건들을 포착하도록 가르치는 교묘한 방법을 제안합니다. 그들이 어떻게 했는지 간단히 설명해 드리겠습니다:

"신비의 상자"유추 (약한 감독)

일반적으로 컴퓨터를 가르치기 위해 비디오를 보여주고"이 특정 5 초 클립을 보십시오. 이것이 싸움입니다"라고 말합니다. 하지만 이 논문에서 연구자들은 컴퓨터에 전체 비디오만 제공하고"이 비디오에는 어딘가에 싸움이 포함되어 있습니다"또는"이 비디오는 완전히 정상입니다"라고만 말합니다.

이것을**약한 감독 (Weak Supervision)**이라고 부릅니다. 마치 학생에게 섞여 있는 레고 블록 한 상자를 주고"이 상자에는 빨간색 블록이 하나 들어 있습니다"라고 말하되, 정확히 어떤 블록이 빨간색인지 알려주지 않는 것과 같습니다. 학생은 그것이 어느 블록인지 알아내야 합니다.

"시공간 큐브" (세분화)

이 신비를 해결하기 위해 연구자들은 비디오를 하나의 큰 덩어리로만 보지 않았습니다. 대신 비디오를 작은 3 차원 블록으로 잘라냈습니다. 빵 한 덩어리를 (시간) 슬라이스한 다음, 각 슬라이스를 격자 (공간) 로 자른다고 상상해 보십시오.

  • 시간: 비디오를 짧은 클립으로 잘랐습니다.
  • 공간: 각 클립을 작은 사각형의 격자로 잘랐습니다.

이제 컴퓨터는 전체 비디오를 보는 대신 비디오의 이러한 작은"큐브"를 봅니다. 각 큐브는 공간과 시간의 작은 조각입니다.

"요령의 가방" (다중 인스턴스 학습)

연구자들은**다중 인스턴스 학습 (Multiple Instance Learning, MIL)**이라는 전략을 사용했습니다. 다음과 같이 생각해 보십시오:

  • 가방: 전체 비디오 클립이"가방"입니다.
  • 인스턴스: 비디오 내부의 작은 큐브들이 가방 안의"아이템"입니다.

그들이 컴퓨터에게 가르친 규칙은 다음과 같습니다:

  • 가방이**"정상"**으로 레이블이 지정되어 있다면, 그 가방 안의 단 하나의 아이템도 모두 정상이어야 합니다.
  • 가방이**"이상 (Anomaly)"**으로 레이블이 지정되어 있다면, 그 가방 안의 적어도 하나의 아이템은 이상해야 합니다.

컴퓨터의 임무는"이상"가방에 있는 모든 아이템을 살펴보고 가장 의심스러운 것을 찾아 높은 점수를 매기는 것입니다. 그런 다음"이상"가방의 최고 점수가"정상"가방의 최고 점수보다 높도록 노력합니다.

"탐정의 눈" (작동 원리)

컴퓨터는 인간 움직임을 인식하는 데 이미 뛰어난 사전 훈련된 뇌 (I3D 라고 함) 를 사용합니다.

  1. 비디오 클립을 가져옵니다.
  2. 그것을 작은 3 차원 큐브로 나눕니다.
  3. 각 큐브에서 무엇을 보는지 설명하도록"뇌"에 요청합니다.
  4. 그 큐브들 중 의심스러운 것이 있는지 테스트를 실행합니다.

컴퓨터가 싸움을 보게 되면 단순히"싸움!"이라고 말하는 것이 아닙니다. 대신 화면에서 싸움이 일어나고 있는 특정 작은 사각형을 가리키며"이상한 일은 바로 여기 있습니다"라고 말합니다.

결과: 얼마나 좋았습니까?

연구자들은 실제 세계의 범죄가 포함된UCF Crime2Local이라는 데이터셋에서 이를 테스트했습니다.

  • 경쟁: 그들은 자신의 방법을 다른 방법들과 비교했습니다. 다른 방법 중 하나는"감독"방식이었는데, 이는 훈련 중에 범죄의 정확한 좌표를 제공받은 것입니다 (학생에게 빨간색 블록을 보여주는 것과 같습니다). 그 방법은 약**75%**의 점수를 받았습니다.
  • 그들의 결과: 훈련 중에 정확한 위치를 알지 못했던 (학생이 빨간색 블록을 추측하는 것과 같은) 그들의 방법은**68%**의 점수를 받았습니다.

모든 정답을 알고 있던 방법을 이기지는 못했지만, 정답 없이 추측하려던 다른 방법들보다는 훨씬 더 좋은 성과를 거두었습니다.

다음 단계 (결론)

이 논문은 사건이 발생하는 위치 (공간) 와 시간 (시간) 을 모두 살펴보는 것이 좋은 아이디어라고 결론 내립니다. 그러나 그들은 컴퓨터가 때로는 너무 흥분하여 실제 이상한 곳이 하나뿐일 때 여러 곳을"이상"으로 표시한다고 인정합니다.

더 나아지기 위해 그들은 두 가지 것을 제안합니다:

  1. 규칙을 강화하기: 컴퓨터가 비디오당 하나의"가장 이상한"장소만 선택하도록 하고, 모든 곳을 추측하지 않도록 합니다.
  2. 움직임을 관찰하기: 현재 컴퓨터는 주로 사물이 어떻게보이는지만 봅니다. 그들은 움직임이 범죄를 포착하는 데 종종 큰 단서가 되므로, 사물이 어떻게움직이는지관찰하는 두 번째"눈" (광학 흐름과 같은) 을 추가할 것을 제안합니다.

요약하자면, 그들은 인간이 먼저 그 주위에 상자를 그리지 않고도 비디오에 범죄가포함되어 있다는 사실만으로 비디오에서 범죄가 발생하는장소를 추측할 수 있는 시스템을 구축했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →