A VLM Answer Is Not an Anomaly Score: Rank Compression in Training-Free Video Anomaly Detection
본 논문은 학습이 필요 없는 비디오 이상 탐지에서 시각-언어 모델을 사용할 때, 전체 정답 분포를 활용하는 확률 기반 판독법을 사용하는 것이 서로 다른 세그먼트 분포가 동일한 점수로 붕괴되는 '순위 압축' 현상을 방지함으로써 정확한 평가에 필요한 미세한 순위 보존을 가능케 하여, 표준적인 생성 답변 방식보다 성능을 크게 향상시킨다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
감시 시스템의 고요한 웅성거림 속에서, 카메라는 거리의 모퉁이, 공장 바닥, 또는 지하철역을 지켜보며 무언가 잘못되기를 기다립니다. 수십 년 동안 컴퓨터는 이러한 문제 상황, 즉 이상 징후를 포착하는 데 어려움을 겪어 왔습니다. 왜냐하면 이상 징후는 드물고, 예측 불가능하며, 실제로 일어나기 전까지는 아무것도 아닌 것처럼 보이기 때문입니다. 전통적인 시스템은 엔지니어가 범죄나 사고의 사례를 수천 개씩 입력하여 모델에게 무엇이 문제인지를 직접 가르쳐야 했으며, 이 과정은 느리고 경직되어 있었습니다. 최근에는 시각-언어 모델(vision-language model)이라 불리는 새로운 종류의 인공지능이 다른 길을 제시했습니다. 이들은 이미지를 보고 인간의 언어를 통해 이를 이해할 수 있는 강력한 시스템입니다. 폭력이나 절도의 구체적인 사례를 학습하는 대신, 이들에게는 "여기서 위험한 일이 일어나고 있습니까?"와 같은 간단한 질문을 던질 수 있습니다. 만약 모델이 "예"라고 답한다면, 시스템은 그 순간을 포착합니다. 이는 매우 간단한 해결책처럼 들리지만, 새로운 연구에 따르면 우리가 그 답변을 어떻게 듣느냐가 답변 내용 자체만큼이나 중요하다고 합니다.
대한민국의 성균관대학교 연구진은 이 모델들이 자신의 생각을 컴퓨터가 사건의 순위를 매기는 데 사용할 수 있는 점수로 어떻게 변환하는지 조사했습니다. 그들은 이 모델들을 사용하는 기존 방식이 유용한 정보의 방대한 양을 버리고 있다는 사실을 발견했습니다. 모델에게 비디오 클립을 판단하도록 요청할 때, 모델은 단순히 "예" 또는 "아니요"와 같은 단어 하나를 선택하는 것이 아닙니다. 대신, 모델은 자신이 내놓을 수 있는 모든 가능한 답변에 대해 확률을 계산합니다. 이를 확신의 척도라고 생각하면 쉽습니다. 모델은 어떤 클립이 위험할 확률을 94%로 보고, 다른 클립은 56%로 볼 수 있습니다. 기존 방식 아래에서는 두 클립 모두 단순히 "예"라는 라벨을 받게 되며, 컴퓨터는 이 둘을 동일하게 취급합니다. 연구진은 이 상세 정보의 손실, 즉 그들이 '순위 압축(rank compression)'이라고 부르는 현상이 시스템으로 하여금 아슬아슬한 상황과 명백한 위험 사이의 미묘한 차이를 놓치게 만든다는 것을 발견했습니다.
이를 해결하기 위해 연구팀은 다른 접근 방식을 테스트했습니다. 모델이 단 하나의 단어를 선택하기를 기다리는 대신, 모델이 생성한 모든 가능한 답변에 대한 전체 확률 분포를 살펴보았습니다. 그들은 이 전체 확신의 분포를 하나의 정밀한 숫자로 변환했습니다. '확률 판독(probability readout)'이라고 불리는 이 방법은, 94%의 클립이 56%의 클립보다 훨씬 더 위험하다는 것을 시스템이 인식할 수 있게 해주었습니다. 기존 방식에서는 두 클립 모두 "예"로 분류되었음에도 불구하고 말입니다. 연구진이 네 가지 서로 다른 대규모 모델과 두 개의 주요 비디오 이상 탐지 벤치마크를 대상으로 이 방법을 테스트했을 때, 결과는 놀라웠습니다. 이 새로운 접근 방식은 모든 테스트에서 기존 방식을 능가했습니다. 한 데이터셋에서는 정확도가 최대 13%포인트 향상되었고, 다른 데이터셋에서는 거의 19%포인트에 달했습니다. 이러한 이득은 작은 변동이 아니라, 사용된 특정 모델이나 질문의 유형에 관계없이 일관되고 유의미하게 나타난 결과였습니다.
연구진은 또한 기존 방식이 왜 자주 실패했는지 탐구했습니다. 그들은 모델에게 단 두 개의 선택지 대신 91개의 세밀한 척도를 제공하더라도, 모델이 여전히 답변을 몇 개의 반복되는 값으로 응축시킨다는 것을 발견했습니다. 시스템은 여전히 많은 서로 다른 클립을 동일한 것으로 취급하여 순위 매기기에서 '동점'을 만들어냈습니다. 새로운 방법은 이러한 함정을 완전히 피했습니다. 전체 확률 분포를 사용함으로써, 시스템은 비디오 속의 거의 모든 순간을 구별해낼 수 있었고, 동점이 발생하는 들쭉날쭉한 목록 대신 매끄럽고 상세한 순위를 만들어냈습니다. 이러한 차이는 보안 분야에서 가장 위험한 순간을 최상단에 배치하는 능력이 무엇보다 중요하다는 점에서 결정적이었습니다. 연구는 이 새로운 방법이 낮은 오보율에서도 실제 위험을 찾아내는 능력을 두 배로 높일 수 있음을 보여주었으며, 이는 추가적인 학습이나 컴퓨computing 파워 없이도 시스템을 두 배 더 유용하게 만들 수 있음을 의미합니다.
연구팀은 이러한 이점이 실제적인 것인지, 아니면 질문의 문구나 모델에게 설명을 요구하는 방식에 의한 일시적인 현상인지 확인하기 위해 검증을 거쳤습니다. 그들은 모델에게 점수를 주기 전에 장면을 묘사하게 하거나, 점수를 준 후에 이유를 설명하게 하는 등의 실험을 진행했습니다. 모든 경우에서 전체 확률 분포를 살펴보는 방식이 여전히 우수했습니다. 심지어 더 크고 강력한 모델을 사용하면 격차가 줄어들지도 모른다는 점을 확인하기 위해 테스트했지만, 이 이점은 지속되었으며 때로는 더 커지기도 했습니다. 유일하게 이점이 줄어든 경우는 모델이 점수를 주기 전에 설명을 먼저 작성하도록 강제했을 때였는데, 이는 모델의 내부적 확신을 압축하는 것으로 보였습니다. 이는 이 AI 시스템의 잠재력을 끌어올리는 핵심이 모델의 출력값을 어떻게 읽느냐에 달려 있음을 시사합니다.
이 연구는 단순한 미세 조정을 넘어, 안전을 위한 인공지능 활용의 핵심 단계를 재정의합니다. 연구진은 모델의 내부 사고 과정과 최종 점수 사이의 인터페이스가 사소한 디테일이 아니라 시스템 성능의 핵심 요소임을 입증했습니다. 단순히 답변을 읽는 방식, 즉 최종적인 단어 하나만이 아니라 확신의 전체 그림을 바라보는 방식으로 바꾸는 것만으로도, 엔지니어들은 동일한 고정된 모델을 훨씬 더 날카로운 탐지기로 탈바꿈시킬 수 있습니다. 이 연구의 결론은, 문제를 감시하는 시스템을 구축하는 누구에게나 모델의 답변을 어떻게 해석하느냐의 선택이 모델 자체만큼이나 중요하다는 것입니다. 이는 인공지능의 세계에서 가장 강력한 신호는 종종 최종적으로 내뱉는 단어가 아니라, 거의 말할 뻔했던 미묘한 뉘앙스 속에 숨겨져 있다는 사실을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.