← 최신 논문
🤖 AI

Detecting AI-Generated Videos with Spiking Neural Networks

이 논문은 시간적 잔차(temporal residuals)와 의미론적 궤적(semantic trajectories)의 독특한 이벤트 기반 처리를 활용하여 AI 생성 비디오 탐지에서 우수한 교차 생성기 일반화 성능을 달성하고 GenVidBench 벤치마크에서 기존 방법들을 능가하는 스파이킹 신경망 기반의 탐지기인 MAST를 소개한다.

원저자: Minsuk Jang, Yujin Yang, Hee-Seon Kim, Minseok Son, Younghun Kim, Changick Kim

게시일 2026-08-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Minsuk Jang, Yujin Yang, Hee-Seon Kim, Minseok Son, Younghun Kim, Changick Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 영화를 보고 있다고 상상해 보세요. 배우들의 연기는 너무나 완벽하고, 조명은 결점이 없으며, 모든 프레임이 마치 고해상도 사진처럼 보입니다. 오랫동안, 만약 당신이 영상이 실제인지 컴퓨터가 만든 것인지 구별하고 싶다면, 그저 정지된 사진 한 장만 보면 되었습니다. 귀 모양이 약간 이상하거나 손가락이 너무 많다면, 그것이 가짜라는 것을 알 수 있었죠. 하지만 컴퓨터는 이제 단 한 프레임 안에서도 완벽한 얼굴을 그려낼 수 있을 정도로 발전했습니다. 이제 게임의 규칙이 바뀌었습니다. 이제 '가짜'는 사진 자체에 있는 것이 아니라, 사진들 사이의 '움직임' 속에 있습니다.

이것이 바로 AI 생성 비디오 탐지의 세계입니다. 핵심 아이디어는 간단합니다. 현실은 무질서하다는 것입니다. 머리를 움직일 때 머리카락이 휘날리고 빛이 변할 때, 그 변화는 특정한, 혼란스럽고 자연스러운 리듬으로 일어납니다. 그러나 AI는 종종 너무 완벽해지려고 노력합니다. AI는 모든 것을 너무 매끄럽게 만들어, 프레임 사이의 움직임을 실제 삶이라기보다는 마치 슬로우 모션 꿈처럼 느껴지게 만듭니다. 과학자들은 이러한 '매끄러움'의 결함을 포착하는 탐지기를 만들기 위해 노력해 왔습니다. 하지만 까다로운 점이 있습니다. 서로 다른 AI 프로그램은 서로 다른 종류의 결함을 만들어낸다는 것입니다. 어떤 것은 머리카락을 너무 매끄럽게 움직이게 하고, 다른 것은 배경을 깜빡거리게 만들 수도 있습니다. 한 종류의 결함을 잡도록 만들어진 탐지기는 새로운 종류의 결함을 마주했을 때 종종 실패합니다. 이것이 바로 연구자들이 단일 스틸 컷이 아닌 영상 전체를 보는 더 똑똑한 방법을 찾는 이유입니다.

이때, 아주 다른 접근 방식을 시도하기로 한 KAIST(한국과학기술원)의 한 팀이 등장했습니다. 그들은 모든 픽셀을 기억하려고 애쓰는 표준적인 고성능 인공 신경망(Artificial Neural Networks) 대신, 인간의 뇌에서 영감을 얻은 것, 즉 스파이킹 신경망(Spiking Neural Networks, SNN)을 활용했습니다. SNN을 무언가 '변화'가 일어날 때만 신호를 보내는 신경계라고 생각해 보세요. SNN은 지루하고 정적인 부분은 무시하고 오직 움직임이 있는 순간에만 주목합니다.

장민석 교수와 동료들이 이끄는 연구진은 이 '변화에 민감한' 뇌에 AI 영상을 입력했을 때 매우 흥서로운 사실을 발견했습니다. 그들은 실제 영상은 화면 전체에 걸쳐 흩어져 있는 자연스러운 '스파이크'(신호) 패턴을 만드는 반면, AI가 생성한 영상은 사람의 윤곽이나 움직이는 자동차처럼 물체의 가장자리(edge)에만 스파이크를 집중시킨다는 것을 발견했습니다. 마치 AI가 물체의 내부를 완벽하게 만드는 데 너무 몰두한 나머지, 가장자리가 자연스럽게 움직이는 것을 잊어버린 것과 같습니다.

이를 잡아내기 위해 그들은 MAST라고 불리는 새로운 탐지기를 구축했습니다. MAST를 두 부분으로 구성된 탐정이라고 상상해 보세요. 한 부분은 영상의 일반적인 이야기(의미론적 내용)를 살펴보고 무엇이 일어나고 있는지 이해하는 '얼어붙은' 전문가입니다. 다른 한 부분인 SNN은 고속 동작 센서처럼 작동합니다. SNN은 영상을 아주 작은 '의사 이벤트(pseudo-events)'로 분해합니다. 즉, "이 픽셀이 변했는가?"라고 묻는 것입니다. 만약 대답이 '예'라면, 아주 작은 전기적 스파이크를 보냅니다. AI 영상은 저 기묘하고 매끄러운 가장자리를 가지고 있기 때문에, SNN은 매우 특정한 패턴을 목격합니다. 경계선 부분에는 스파이크가 많이 뭉쳐 있지만, 중간 부분에는 스파이크가 거의 없는 패턴 말입니다.

연구진은 MAST를 GenVideo라는 까다로운 챌린지로 테스트했습니다. 이 테스트는 하나의 AI로 만든 영상으로 학습시킨 뒤, 한 번도 본 적 없는 열 개의 서로 다른 AI 프로그램을 통해 만든 영상을 찾아내도록 요구하는 방식입니다. 이것은 보안 요원에게 특정 국가의 위조 신분증을 식별하도록 가르친 뒤, 다른 나라에서 온 어떤 위조 신분증이라도 찾아낼 수 있는지 시험하는 것과 같습니다. 결과는 어땠을까요? MAST는 **93.14%**의 확률로 정답을 맞혔습니다. 이는 표준적인 고성능 컴퓨터 뇌를 사용하는 대부분의 다른 최상위 탐지기들보다 뛰어난 성적입니다.

이것이 왜 더 멋진 일인지 알려면, MAST는 훨씬 빠르고 에너지도 적게 사용한다는 점을 알아야 합니다. 갑작스러운 소음에 반응하는 신경계처럼, 무언가 변화할 때만 신호를 보내기 때문에 지루하고 정지된 부분을 처리하는 데 에너지를 낭비하지 않습니다. 논문은 이러한 '이벤트 기반(event-driven)' 스타일이 AI 가짜를 잡아내는 데 완벽한 궁합이라고 제안합니다. 왜냐하면 AI 영상의 결함은 종-종 그러한 미세하고 빠른 변화의 순간 속에 숨겨져 있기 때문입니다.

저자들은 이것이 모든 것을 영원히 해결할 마법의 탄환은 아니라는 점을 주의 깊게 언급했습니다. 만약 영상이 매우 짧거나, AI가 움직임을 흉내 내는 데 더욱 능숙해진다면 탐지기가 어려움을 겪을 수도 있습니다. 하지만 현재로서는, '스파이크'와 '이벤트'를 통해 생각하는 뇌를 사용하는 것이 AI 생성 영상의 매끄럽고 부자연스러운 움직임을 포착하는 강력한 새로운 방법임을 보여주었습니다. 이는 움직이는 영상 속에서 진실을 찾기 위해, 모든 것을 한꺼번에 볼 필요는 없으며, 단지 언제 변화를 찾아봐야 하는지를 아는 것이 중요하다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →