← 최신 논문
🤖 AI

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

이 논문은 다중 입도 시각 표현과 게이트형 시공간 오디오 아키텍처를 사용하여 각 양상으로부터 포렌식 증거를 독립적으로 모델링함으로써 교차 모달 불일치가 위조 탐지에 항상 신뢰할 수 있다는 가설에 도전하여 IJCAI-ECAI 2026 일반 AIGC 오디오-비디오 탐지 챌린지에서 1위를 달성한 디커플드 오디오-비주얼 탐지 시스템인 DAV-Det을 소개한다.

원저자: Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

게시일 2026-07-29
📖 6 분 읽기🧠 심층 분석

원저자: Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

눈과 귀를 믿을 수 없는 세상을 상상해 보십시오. 인공지능의 급격한 폭발로 인해 컴퓨터는 믿기 힘들 정도로 진짜처럼 보이는 가짜 영상과 소리를 만들어내는 법을 배웠습니다. 이것은 단순히 유명인의 얼굴을 바꾸는 수준이 아닙니다. 존재하지 않는 전체 장면, 동물, 사물을 생성하는 것에 관한 문제입니다. AIGC(AI 생성 콘텐츠)라고 알려진 이 기술은 창의성 측면에서는 놀랍지만, 오정보와 사기 측면에서는 공포스럽습니다. 이에 맞서 싸우기 위해 과학자들은 "디지털 거짓말 탐지기"를 구축해 왔습니다. 수년 동안 가짜를 잡아내기 위한 가장 대중적인 전략은 단순한 아이디어에 의존했습니다. 실제 영상에서는 보이는 것과 들리는 것이 완벽하게 일치해야 한다는 것입니다. 만약 사람이 말을 하고 있다면, 입 모양이 소리와 일치해야 합니다. 만약 오디오와 비디오가 일치하지 않는다면, 그것은 가짜입니다. 이는 마치 인형극에서 꼭두각시의 입이 뒤에서 들리는 목소리에 맞춰 움직이는지 확인하는 것과 같습니다. 만약 박자가 맞지 않는다면, 당신은 그것이 속임수라는 것을 알게 됩니다.

하지만 하빈 공과대학교(Harbin Institute of Technology) 연구진의 새로운 연구는 일반적인 영상에 있어서는 이 오래된 경험칙이 깨졌음을 시사합니다. 연구진은 자연 다큐멘터리나 요리 프로그램처럼 현실 세계의 많은 시나리오에서, 영상과 소리가 100% 실제 상황일지라도 서로 긴밀하게 연결되지 않을 수 있다는 사실을 발견했습니다. 이러한 경우, 불일치를 찾는 것은 마치 신발이 모자와 어울리는지 확인하여 도둑을 잡으려는 것과 같습니다. 때로는 실제 사람들도 서로 어울리지 않는 옷을 입을 수 있기 때문입니다. 연구진은 거짓말을 찾아내기 위해 오디오와 비디오가 서로 대화하도록 강요하는 대신, 그들이 독립적인 탐정으로서 작동하게 해야 한다고 주장합니다. 그들은 DAV-Det라고 불리는 새로운 시스템을 제안하는데, 이는 오디오와 비디오를 별개의 단서로 취급합니다. 시각 탐정은 그림 속의 미세하고 이상한 질감이나 패턴을 찾고, 오디오 탐정은 소리 파동의 부자연스러운 글리치(glitch)를 듣습니다. 두 탐정이 각자의 결론을 내린 후에야 비로소 의견을 종합하여 전체가 위조인지 결정합니다. 연결 고기가 존재하지 않는 곳에 억지로 연결을 만들지 않는 이 "적을수록 좋다(less is more)"는 접근 방식은 AI 가짜를 찾아내는 주요 국제 대회에서 0.8460이라는 최고 점수를 기록하며 우승하는 핵심이 되었습니다.

큰 실수: 모든 것이 연결되어 있다는 가정

오랫동안 딥페이크를 잡는 가장 좋은 방법은 연결의 "기묘한 골짜기(uncanny valley)"를 찾는 것이었습니다. 만약 영상에서 사람이 말을 하고 있다면, AI는 입 모양을 단어와 완벽하게 일치시키는 데 어려움을 겪는 경우가 많습니다. 그래서 탐지기들은 오디오와 비디오가 얼마나 잘 일치하는지를 측정하도록 설계되었습니다. 만약 일치도가 낮으면, 시스템은 "가짜!"라고 외쳤습니다.

이 논문의 저자들은 이 가정을 훨씬 더 넓은 범위에서 테스트하기로 했습니다. 그들은 두 가지 유형의 영상을 살펴보았습니다:

  1. 인간 중심 영상: 카메라를 향해 말하는 사람과 같은 영상입니다. 여기서는 기존의 규칙이 매우 잘 작동합니다. 실제 영상은 높은 오디오-비주얼 유사성을 가지는 반면, 가짜는 낮은 유사성을 보입니다.
  2. 일반 영상: 개가 짖는 소리, 자동차 엔진이 회전하는 소리, 또는 바람 소리가 들리는 풍경과 같은 영상입니다.

그들이 일반 영상에 대해 "일치" 규칙을 테스트했을 때, 이 규칙은 완전히 무너졌습니다. 사실, 무작위 추측보다도 결과가 나빴습니다! 연구진은 많은 실제 일반 영상에서 오디오와 비디오가 자연적으로 일부 가짜 영상보다 오히려 유사성이 낮다는 것을 발견했습니다. 여기서 "불일치" 규칙을 사용하는 것은 오히려 탐지를 방해했습니다. 이는 마치 액자가 캔버스와 어울리는지 확인하여 가짜 그림을 찾으려는 것과 같습니다. 실제 박물관에서도 액자가 캔버스와 어울리지 않을 수 있지만, 그림은 여전히 진짜일 수 있습니다. 이 논문은 오디오-비주얼 대응 관계가 일반적인 AIGC 탐지를 위한 신뢰할 수 있는 단서라는 생각을 명시적으로 부정합니다.

새로운 전략: 두 명의 독립적인 탐정

오디오와 비디오가 서로 정보를 공유하도록 강제하는 것이 실패했기 때문에, 팀은 "디커플링(Decoupled, 분리된)" 접근 방식을 제 제안했습니다. 하나의 뇌가 두 가지를 동시에 처리하려고 하는 대신, 그들은 별도로 작동한 다음 결론을 공유하는 두 개의 특화된 뇌를 구축했습니다.

시각 탐정 (DAV-Det의 눈)
시각 탐지기는 단순히 전체 그림을 보는 것이 아니라, 범죄 현장을 조사하는 탐정처럼 세 가지 다른 세부 수준으로 확대하여 조사합니다:

  • 글로벌 레벨 (Global Level): 전체 장면이 "이상하거나" 의미론적으로 잘못되었는지 확인하기 위해 큰 그림을 봅니다.
  • 패치 레벨 (Patch Level): 이미지를 아주 작은 정사각형(패치)으로 나누어, 특정 물체에 나타나는 이상한 흐릿함과 같은 미세한 질감 글리치를 찾아냅니다.
  • 세그먼트 레벨 (Segment Level): 근처의 패치들을 더 큰 덩어리(세그먼트)로 그룹화하여, 특정 영역에 속하지 않는 어색한 그림자 같은 지역적 불일치를 포착합니다.

이 시스템은 "약한 지도 학습(Weak Supervision)"이라는 영리한 기법을 사용합니다. 시스템은 항상 정확히 어떤 작은 패치가 가짜인지 알 수 없기 때문에, 만약 전체 이미지가 가짜라면 적어도 일부의 작은 패치들은 의심스러울 것이라고 가정합니다. 시스템은 이러한 의심스러운 패치를 찾아내는 법을 배우며, 이를 통해 더 강력한 근거를 구축합니다. 또한, 카메라 품질이 좋지 않아도 혼란을 겪지 않도록 "저하된(degraded)" 이미지(노이즈나 블러가 추가된 이미지)를 대상으로 연습합니다.

오디오 탐정 (DAV-Det의 귀)
오디오 탐지기는 두 가지 유형의 단서를 듣습니다:

  • 시간 기반 단서 (Time-based clues): 소리의 리듬이 자연스러운가? 소리 사이의 전환이 매끄러운가, 아니면 이상하게 튀는가?
  • 주파수 단서 (Frequency clues): 실제 마이크에서는 보통 포착되지 않는 이상한 고주파 아티팩트(artifacts)가 있는가?

이를 포착하기 위해 오디오 탐지기는 "게이팅(gated)" 시스템을 사용합니다. 클럽의 문지기가 어떤 소리가 중요한지, 어떤 소리를 무시해야 하는지 결정하는 것을 상상해 보십시오. 이 문지기(게이팅 네트워크)는 소리 파동의 가장 의심스러운 부분을 강조하여, 탐지기가 AI가 흔히 남기는 시간적(temporal) 및 스펙트럼(spectral) 불규칙성에 집중할 수 있도록 합니다.

최종 판결: 결정 수준 융합 (Decision-Level Fusion)

두 탐정이 각자의 업무를 마친 후, 그들은 데이터를 거대한 수프처럼 섞지 않습니다. 대신, 그들은 각자의 발견을 별도로 유지하며 개별 점수를 바탕으로 최종 결정을 내립니다.

  • 단순한 "실제 vs 가짜" 확인의 경우: 오디오 탐정이나 시각 탐정 중 어느 한 쪽이라도 가짜라고 판단하면, 시스템은 이를 가짜로 표시합니다. 이는 "차라리 조심하는 게 낫다"는 접근 방식입니다.
  • 상세한 확인 (4개 클래스)의 경우: 시스템은 네 가지 시나리오의 확률을 계산합니다:
    1. 실제 비디오 + 실제 오디오 (RR)
    2. 가짜 비디오 + 가짜 오디오 (FF)
    3. 가짜 비디오 + 실제 오디오 (FR)
    4. 실제 비디오 + 가짜 오디오 (RF)

오디오와 비디오가 독립적이라고 가정함으로써, 시스템은 이 네 가지 시나리오 중 어떤 것이 가장 가능성이 높은지 알아내기 위해 확률을 곱합니다.

결과: 게임에서의 승리

팀은 IJCAI-ECAI 2026 DDL 2.0 워크숍에서 열린 "일반 AIGC 오디오-비디오 탐지 챌린지"에서 새로운 시스템인 DAV-Det을 테스트했습니다. 이것은 인간부터 동물, 사물에 이르기까지 20만 개 이상의 비디오-오디오 샘플을 다루는 매우 까다로운 대회였습니다.

결과는 인상적이었습니다:

  • 순위: 그들은 모든 경쟁 팀 중 1위를 차지했습니다.
  • 점수: 최종 점수 0.8460을 달성했습니다.
  • 성능: 이진(실제/가짜) 탐지 작업에서 0.9617을, 더 어려운 4개 클래스 분류 작업에서 0.6873을 기록했습니다.

그들이 기존의 인간 중심 딥페이크 데이터셋(기존의 "일치" 규칙이 주로 작동하는 곳)에서 시스템을 테스트했을 때도, DAV-Det은 여전히 경쟁자들을 압도하며 0.998의 정확도와 0.999의 AUC를 기록했습니다. 이는 그들의 방법이 까다로운 일반 영상과 전통적인 얼굴 교체 가짜를 모두 처리할 수 있을 만큼 견고하다는 것을 시사합니다.

향のは次 (앞으로의 과제)

저자들은 자신들의 시스템이 아직 할 수 없는 부분에 대해 솔직하게 밝히고 있습니다. 그들의 시각 탐정은 정지 영상의 결함을 찾는 데는 뛰어나지만, 프레임 간의 움직임(temporal motion)을 명시적으로 추적하지는 않습니다. 또한, 두 탐정을 결합하는 방식은 복잡한 학습 기반 융합보다는 단순한 수학적 규칙(예: 최대값 취하기)에 의존합니다.

하지만 핵심 메시지는 명확합니다. 일반적인 AI 가짜의 세계에서는, 때때로 진실을 찾는 가장 좋은 방법은 존재하지 않는 연결 고리를 찾는 것을 멈추는 것입니다. 오디오와 비디오가 스스로 말하게 함으로써, 시스템은 더 신뢰할 수 있는 진실의 길을 찾았습니다. 논문이 시사하듯, "적을수록 좋다(Less is More)"는 원칙, 즉 모달리티를 분리하는 것이 실제 세계 영상의 자연스러운 비동기화에 속지 않는 더 강력한 탐지 시스템을 가능하게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →