CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection
이 논문은 비디오를 적응형 정렬을 갖춘 미세 조정된 시퀀스로 모델링하고, 시간적 의존성을 위한 대조 학습 및 VLM 유래 근거를 활용함으로써 혐오 비디오 탐지 성능을 향상시키는 새로운 클립 수준 멀티모달 프레임워크인 CLARA를 제안하며, 이를 통해 여러 데이터셋에 걸쳐 최첨단 성능을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
수십억 명의 화면 위에서 새로운 종류의 대화가 이루어지고 있습니다. 이는 농담이나 뉴스 클립, 혹은 개인적인 브이로그가 순식간에 무해한 것에서 해로운 것으로 변할 수 있는, 빠르게 스크롤되는 비디오 플랫폼의 흐름 속에서 발생합니다. 단어가 고정된 의미를 갖는 글 형태의 게시물과 달리, 비디오는 소리, 움직이는 이미지, 그리고 구어체가 층층이 쌓인 복합적인 구조를 지닙니다. 위험은 이러한 요소들이 어떻게 상호작용하느냐에 있습니다. 혐오 메시지는 단 한 문장의 외침으로 나타나지 않을 수도 있습니다. 대신, 일련의 프레임, 어조의 변화, 혹은 앞선 맥락을 통해서만 이해되는 시각적 신호를 통해 서서히 구축되며 나타날 수 있습니다. 이러한 콘텐츠를 탐지하는 것은 인터넷의 거대한 과제인데, 왜냐하면 가장 위험한 신호들은 종 것이다 짧고, 숨겨져 있으며, 그들이 나타나는 특정 순간에 의존하기 때문입니다.
오랫동안 컴퓨터 과학자들은 기계가 이러한 종류의 해로움을 포착하도록 가르치기 위해 노력해 왔습니다. 초기 노력은 특정 분노 섞인 단어를 찾는 텍스트에 집중되었습니다. 이후에는 이미지와 밈(meme)으로 옮겨가, 그림과 캡션이 어떻게 함께 작용하는지를 이해하려고 시도했습니다. 하지만 비디오는 독특한 문제를 제기합니다. 비디오는 단순히 이미지의 집합이나 음성의 전사본이 아닙니다. 그것은 시간이 흐름에 따라 의미가 변하는 흐르는 타임라인입니다. 만약 컴퓨터가 비디오 전체를 하나의 커다란 덩어리로 본다면, 혐-오가 실제로 발생하는 작고 결정적인 순간들을 놓치기 쉽습니다. 이는 마치 이야기의 처음과 마지막 문장만 읽어서 이야기를 이해하려는 것과 같습니다. 그 과정에서 핵심적인 줄거리의 정점들은 사라지게 됩니다.
에섹스 대학교와 엑서터 대학교의 연구진은 이를 해결하기 위한 새로운 방법을 제안했습니다. 그들은 이 시스템을 CLARA라고 부릅니다. 비디오를 하나의 크고 변하지 않는 객체로 취급하는 대신, CLARA는 비디오를 작고 의미 있는 조각들로 나눕니다. 비디오를 긴 문장이라고 상상해 보십시오. CLARA는 전체를 한꺼번에 읽지 않습니다. 대신 말소리의 자연스러운 끊김마다 멈추어, 말하는 내용과 일치하는 일련의 짧은 클립들을 생성합니다. 이러한 작은 세그먼트에 집중함으로써, 시스템은 설령 어떤 혐오적인 아이디어가 1분간의 중립적인 콘텐츠 속에 파묻혀 있더라도, 그 아이디어가 도입되는 찰나의 순간을 포착할 수 있습니다.
연구진은 혐오 영상들이 흔히 복합적인 단서들에 의존한다는 것을 발견했습니다. 화자는 충격적인 이미지를 보여주면서도 차분한 목소리를 사용하거나, 배경 음악이 공격적으로 변하는 동안 중립적인 문구를 사용할 수 있습니다. 이를 처리하기 위해 CLARA는 각 짧은 클립에 대해 어떤 단서가 가장 중요한지를 결정하는 유연한 시스템을 사용합니다. 때로는 텍스트가 핵심이 되기도 하고, 때로는 소리나 시각적 장면이 핵심이 되기도 합니다. 이 시스템은 전체 비디오에 대해 단일한 규칙을 강요하지 않습니다. 대신, 비디오가 진행됨에 따라 서로 다른 유형의 정보를 다르게 가중치를 두며 적응합니다. 이를 통해 시스템은 단순히 정적인 패턴을 찾는 것이 아니라, 혐오 메시지가 어떻게 진화하는지를 볼 수 있습니다.
시스템이 더 큰 그림을 이해할 수 있도록 하기 위해, 연구진은 두 번째 지능 계층을 추가했습니다. 이미지와 텍스트를 설명하고 추론하도록 훈련된 강력한 인공지능 도구를 사용하여 비디오의 의도에 대한 고차원적인 요약을 생성했습니다. 이 요약은 가이드 역할을 하여, 시스템이 작은 클립들이 어떻게 모여 더 큰, 잠재적으로 해로운 내러티브를 형성하는지 이해하도록 돕습니다. 시스템은 이러한 상세한 클립 수준의 관찰 결과와 고차원적 요약을 결합하여 비디오 콘텐츠의 완전한 그림을 만들어냅니다. 이 접근 방식은 시스템이 단순히 고립된 순간들을 보는 것이 아니라, 논증이나 이야기의 흐름을 이해하도록 보장합니다.
연구팀은 이 새로운 방법을 전 세계 다양한 소셜 미디어 플랫폼에서 가져온 세 가지 서로 다른 혐오 영상 모음집을 대상으로 테스트했습니다. 결과는 명확했습니다. 새로운 시스템은 기존의 가장 우수한 방법들을 지속적으로 능가했습니다. 무해한 영상을 잘못 분류하지 않으면서 혐오 영상을 정확하게 식별하는 데 더 뛰어났습니다. 연구진은 또한 시스템의 일부를 제거했을 때 어떤 일이 일어나는지 확인하기 위해 테스트를 수행했습니다. 비디오를 클립으로 나누는 능력을 제거하거나, 고차원적 가이드를 제거했을 때 시스템의 성능이 떨어졌습니다. 이는 그들의 설계 중 모든 부분이 필수적임을 확인해 주었습니다. 작은 특정 순간에 집중하면서도 전체적인 맥락을 주시하는 능력이 성공의 열쇠였습니다.
이 연구는 유해한 콘텐츠를 탐지하는 미래가 이러한 종류의 상세하고 시간 인지적인 분석에 달려 있음을 시사합니다. 인간이 비디오를 경험하는 방식, 즉 조각 하나하나, 순간 하나하나를 존중함으로써, 기계는 마침내 혐오 표현의 미묘하고 진화하는 본질을 볼 수 있게 됩니다. 연구진은 온라인 혐오 문제를 영원히 해결했다고 주장하는 것이 아니라, 그 일을 수행하기 위한 훨씬 더 날카로운 도구를 제공했다는 것입니다. 그들의 작업은 비디오 속의 위험을 이해하기 위해서는 단순히 전체 그림을 보는 것만으로는 부족하며, 하나의 작은 클립씩 이야기가 펼쳐지는 과정을 지켜봐야 한다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.