← 최신 논문
💻 computer science

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

이 논문은 변별력 있는 저·중주파 패턴에 선택적으로 집중하고 고주파 노이즈를 필터링함으로써, 최첨단 정확도를 달성하고 추론 속도를 현저히 높인 주파수 인지형 상태 공간 모델인 UniSkip-Mamba를 제안하며, 이를 통해 오디오-비주얼 시공간 위조 탐지 성능을 향상시킨다.

원저자: Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 북적이고 시끄러운 방에서 미스터리를 풀려는 탐정이라고 상상해 보십시오. 그 방은 사람들의 대화 소리, 음악 소리, 그리고 번쩍이는 조명으로 가득 차 있습니다. 디지털 미디어의 세계에서 이 '방'은 하나의 비디오이며, '사람들'은 이야기를 구성하는 픽셀과 음파입니다. 오랫동안 컴퓨터는 비디오가 가짜(딥페이크)인지 찾아내는 데 매우 능숙해져 왔지만, 종종 특정한 까다로운 작업, 즉 가짜 부분이 정확히 '언제' 시작되고 끝나는지를 찾아내는 데 어려움을 겪어 왔습니다. 이는 마치 어떤 노래가 커버 곡이라는 것은 알지만, 가수의 목소리가 변한 정확한 초를 짚어내지 못하는 것과 같습니다. '오디오-비주얼 템포럴 포저리 로컬라이제이션(Audio-Visual Temporal Forgery Localization)'이라 불리는 이 분야는 매우 중요합니다. 왜냐하면 현실 세계에서는—법정이나 소셜 미디어의 안전을 위해서처럼—단순히 거짓이 존재한다는 사실뿐만 아니라, 거짓의 정확한 경계가 어디인지를 알아야 하기 때문입니다.

컴퓨터가 이 작업을 어떻게 수행하는지 이해하기 위해, 비디오를 하나의 복잡한 노래라고 생각해 보십시오. 음악과 마찬가지로 비디오에도 다양한 '주파수'가 있습니다. 어떤 부분은 느리고 깊으며 안정적입니다(저주파). 베이스 드럼이나 차분한 대화처럼 말이죠. 다른 부분은 빠르고, 날카롭고, 움찔거립니다(고주파). 레코드의 지직거리는 소리나 갑작스러운 카메라의 흔들림처럼 말입니다. 전통적인 컴퓨터 모델은 노래의 가장 깊은 베이스부터 가장 높은 높은음까지 모든 소리를 들으려고 노력합니다. 하지만 여기에 문제가 있습니다. 디지털 세계에서 그 빠르고 높은 음들은 실제 단서가 아니라, 압축 과정에서 발생하는 정적 노이즈나 글리치(glitch)인 경우가 많기 때문입니다. 만약 탐정이 배경의 정적에만 집중하여 사건을 해결하려 한다면, 그는 진짜 증거를 놓치고 엉뚱한 것에 정신이 팔릴 수 있습니다.

여기서 한 가지 영리한 반전이 담긴 새로운 연구가 등장합니다. 연구자들인 창진 유(Cangjin Yu), 콴 장(Quan Zhang), 단 지앙(Dan Jiang), 그리고 키 장(Ke Zhang)은 새로운 종류의 디지털 탐정인 UniSkip-Mamba를 구축했습니다. 비디오의 모든 소리를 듣는 대신, 그들은 가짜 비디오의 '결정적 증거(smoking gun)'가 주로 느리고 안정적인 저·중역대 주파수에 숨어 있다는 사실을 알아냈습니다. 빠르고 움찔거리는 고주파 성분은 대부분 컴퓨터를 혼란스럽게 만드는 노이즈일 뿐이라는 것이죠. 그래서 그들은 시스템이 정적을 무시하도록 설계했는데, 이는 마치 레코드의 잡음을 무시하고 비트에 집중하는 DJ와 같습니다.

이 논문의 주요 발견은 의도적으로 고주파 노이즈를 무시함으로써 컴퓨터가 실제로 업무를 더 잘 수행하게 된다는 점입니다. 그들은 LAV-DF와 AV-Deepfake1M이라는 두 개의 거대한 가짜 비디오 데이터셋을 통해 이를 테스트했습니다. 결과는 인상적이었습니다. 새로운 방식인 UniSkip-Mamba는 단순히 가짜를 찾아내는 것을 넘어, 이전의 최고 수준의 방법들보다 훨씬 더 높은 정확도로 시작과 끝 지점을 정확히 짚어냈습니다. 한 데이터셋에서는 정확도 점수를 거의 10% 향상시켰고, 다른 데이터셋에서는 14% 이상 향상시켰습니다. 더욱 놀라운 점은, 노이즈를 건너뜀으로써 이 시스템이 의사 결정 속도가 6배나 빨라졌다는 것입니다.

연구자들은 모든 프레임과 음파를 아주 상세하게 처리하려는 기존의 방식에 반론을 제기합니다. 그들은 이러한 '밀집된(dense)' 접근 방식이 오히려 약점이 될 수 있다고 보여줍니다. 왜냐하면 컴퓨터를 아주 작은, 의미 없는 글리치에도 너무 민감하게 만들기 때문입니다. 대신, 그들의 '스킵-스캐닝(Skip-Scanning)' 방식은 스마트한 필터처럼 작동합니다. 비디오 프레임을 그룹화하고, 가짜를 드러내는 중요한 저주파 패턴은 유지하면서 고주파 정적을 자연스럽게 걸러내는 방식으로 스캔합니다. 또한, 오디오와 비디오를 단순히 옆에 딱딱 붙여 놓는 것이 아니라 특정하고 유연한 방식으로 결합하는 것이, 입 모양과 목소리가 아주 미세하게 어긋나는 경우까지 잡아내는 데 도움이 된다는 것을 발견했습니다.

요약하자면, 이 논문은 때때로 진실을 명확히 보기 위해서는 모든 것을 보는 것을 멈춰야 한다고 제안합니다. 어떤 주파수가 중요하고 어떤 것이 단순한 노이즈인지 정확히 아는 시스템을 구축함으로써, 연구자들은 더 빠르고 정확할 뿐만 아니라 흐릿하거나 압축된 비디오 같은 실제 환경의 문제에도 강한 도구를 만들어냈습니다. 이는 AI 시대에, 때로는 거짓을 찾는 가장 좋은 방법이 소음을 차단하고 리듬에 귀를 기울이는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →