← 최신 논문
💻 computer science

COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection

COPRA는 고정된 비전-언어 모델에 대해 입력별 매개변수 업데이트를 생성하기 위해 강화 학습을 활용하는 새로운 프레임워크로, 훈련-추론 불일치를 효과적으로 해결하고 비디오 이상 탐지 및 기타 비디오 이해 작업에서 최첨단 성능을 달성합니다.

원저자: Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수천 시간 분량의 감시 영상을 지켜보며 문제를 포착하기 위해 경비원을 고용한다고 상상해 보세요. 이것이 바로 **비디오 이상 탐지 (VAD)**의 역할입니다.

오랫동안 이 작업을 수행하는 가장 좋은 방법은 영상을 보고 "정상이다" 또는 "사고처럼 보인다"라고 말하도록 초지능 AI(비전 - 언어 모델) 를 훈련시키는 것이었습니다.

그러나 이 논문의 저자들인 COPRA는 현재 이러한 AI 경비원들이 훈련되는 방식에 중대한 결함이 있음을 발견했습니다. 그들은 이를 **"공유 파라미터 병목 현상 (Shared Parameter Bottleneck)"**이라고 부릅니다.

문제: "일률적 (One-Size-Fits-All)" 제복

어떤 경비원이 어떤 업무를 수행하든 간에 모든 교대 근무 동안 단 하나의 정적 (static) 인 제복만 착용해야 한다고 상상해 보세요.

  • 그들이 은행을 경비한다면, 가방을 들고 뛰는 사람들을 찾아야 합니다.
  • 그들이 공원을 경비한다면, 싸우는 사람들을 찾아야 합니다.
  • 그들이 도로를 경비한다면, 차량 추락을 찾아야 합니다.

현재 대부분의 AI 모델은 이러한 서로 다른 모든 시나리오에 동시에 작동하는 단 하나의 규칙 집합(단 하나의 "제복") 을 학습하려고 시도합니다. 결과는 무엇일까요? AI 는 "타협점"을 찾으려 합니다. 은행 강도를 포착하는 데는 조금은 능하고, 공원에서의 싸움을 포착하는 데도 조금은 능하지만, 그 중 어느 것에도 뛰어나지는 않습니다. 이전에 본 적 없는 새로운 유형의 문제가 발생하면, 그 특정 상황에 제복이 맞지 않기 때문에 혼란에 빠집니다.

더욱이, 훈련 방식과 작동 방식 사이에는 불일치가 존재합니다.

  • 훈련: AI 는 긴 영상에서 몇 개의 무작위 프레임을 보여주고 "이 전체 시간 동안 어딘가에 문제가 있었다"라고 말합니다.
  • 테스트: AI 는 문제가 정확히 언제 발생했는지 찾기 위해 초 단위로 잘게 쪼개진 밀집된 영상 조각들을 하나씩 살펴봐야 합니다.

이는 완성된 케이크의 사진을 보여주고 "이걸 만들어라"라고 말하며 요리사를 훈련시킨 뒤, 실제로는 케이크를 한 입술씩 구워내라고 요구하는 것과 같습니다. 지시 사항과 과제가 잘 맞지 않는 것입니다.

해결책: COPRA(맞춤형 "정장")

저자들은 COPRA라는 새로운 시스템을 제안합니다. AI 에게 하나의 정적 제복을 강요하는 대신, COPRA 는 AI 가 보는 모든 영상 클립마다 맞춤 정장을 만들어 주는 마법의 재봉사를 제공합니다.

간단한 용어로 작동 방식을 설명하면 다음과 같습니다.

  1. 동결된 뇌: 주요 AI( "뇌") 는 고정되어 변하지 않습니다. 이미 세계에 대해 많은 것을 알고 있습니다.
  2. 마법의 재봉사 (생성기): 경량화된 작은 보조 네트워크가 특정 영상 클립 (예: 교통 장면 대 매장 장면) 을 살펴봅니다.
  3. 즉시 맞춤화: 재봉사는 무엇을 보느냐에 따라 해당 클립에 특화된 작은 "조정" 집합 ( LoRA 가중치라고 함) 을 즉시 생성합니다.
    • 클립이 교통 영상이라면, 재봉사는 AI 의 초점을 차량과 보행자를 찾아보도록 조정합니다.
    • 클립이 소매 매장 영상이라면, 재봉사는 AI 가 절도 행위를 찾아보도록 조정합니다.
  4. 결과: AI 는 그 순간에만 이 "맞춤 정장"을 입고 결정을 내린 뒤 벗어납니다. 모든 것에 대한 하나의 타협 규칙을 기억할 필요가 없으며, 실시간으로 적응합니다.

재봉사를 어떻게 가르쳤는지 (강화 학습)

"재봉사는 어떤 조정을 해야 할지 어떻게 알까요?"라고 물을 수 있습니다.

저자들은 **강화 학습 (Reinforcement Learning)**이라는 기법을 사용했습니다. 강아지를 간식으로 훈련시키는 것과 비슷합니다.

  • AI 가 영상이 정상인지 비정상인지 추측합니다.
  • (영상 수준의 라벨에 기반하여) 정답을 맞추면 "간식"(보상) 을 받습니다.
  • 틀리면 간식을 받지 못합니다.
  • 시간이 지남에 따라 재봉사는 가장 많은 간식을 얻게 하는 완벽한 맞춤 조정을 생성하는 법을 학습합니다.

그들이 발견한 것

이 논문은 이러한 "맞춤형" 접근 방식이 기존의 "일률적" 방법보다 훨씬 잘 작동한다고 주장합니다.

  • 더 높은 정확도: 표준 테스트 (감시 영상에서 범죄 포착 등) 에서 COPRA 는 이전 방법들보다 더 많은 이상 징후를 발견하고 실수를 줄였습니다.
  • 더 나은 일반화: COPRA 를 이전에 본 적 없는 영상 (매장 범죄 대신 교통 사고 등) 으로 테스트했을 때에도 여전히 잘 수행되었습니다. 단순히 암기하는 것이 아니라 적응하는 법을 배웠기 때문에 새로운 상황을 처리할 수 있었습니다.
  • 단순한 경보를 넘어: 그들은 또한 이 방법이 AI 가 발생한 일에 대한 더 나은 설명 (예: "차가 보행자를 들이받았다") 을 작성하고 영상에 대한 질문에 답하는 데도 도움이 된다고 보여주었습니다. 이는 "맞춤 정장"이 AI 가 맥락을 더 잘 이해하도록 돕는다는 것을 입증합니다.

요약

간단히 말해, COPRA는 단일 AI 모델이 한 번에 모든 것의 전문가가 되려고 시도하는 것을 중단시킵니다. 대신, AI 가 시청하는 모든 특정 영상에 대해 즉시 재구성할 수 있는 능력을 부여합니다. 이는 모든 업무에 딱 맞지 않는 뻣뻣한 정장을 입는 경비원과, 직면한 특정 상황에 완벽한 장비를 즉시 갈아입는 경비원의 차이와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →