← 최신 논문
🤖 AI

Explainable Deepfake Detection with Feature-robust Augmentation and Evidence-grounded Explanation Optimization

본 논문은 이미지 열화에 대한 회복력을 높이기 위해 특징 강건 증강(feature-robust augmentation)과 지도 대조 학습(supervised contrastive learning)을 결합하고, 사실적으로 정확한 설명을 생성하기 위해 증거 기반 선호도 최적화(evidence-grounded preference optimization)를 채택함으로써 ACM Multimedia 2026 설명 가능한 딥페이크 탐지 챌린지에서 1위를 달성한 새로운 설명 가능한 딥페이크 탐지 프레임워크를 제안한다.

원저자: Zhu Xu, Jiaqi Tang, Pokai Chen, Yuxin Peng, Yang Liu

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhu Xu, Jiaqi Tang, Pokai Chen, Yuxin Peng, Yang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 시대에 실재하는 것과 만들어진 것 사이의 경계는 점점 더 모호해지고 있습니다. 생성형 인공지능은 카메라로 찍은 사진과 거의 구별할 수 없는 이미지를 생성할 수 있을 정도로 발전했습니다. 이러한 조작된 이미지, 흔히 딥페이크라고 불리는 것들은 뉴스의 무결성, 법적 증거, 그리고 개인적 신뢰에 심각한 위협이 됩니다. 수년 동안 연구자들은 이미지를 보여주었을 때 그것이 진짜인지 가짜인지 단순히 "예" 또는 "아니오"라고 답할 수 있는 컴퓨터 프로그램을 구축하는 데 집중해 왔습니다. 하지만 현실 세계에서는 단순한 판결만으로는 충분하지 않은 경우가 많습니다. 포렌식 전문가나 팩트 체커는 왜 이미지가 의심스러운지 그 이유를 알아야 합니다. 그들은 기만을 드러내는 부자연스러운 그림자, 왜곡된 질감, 또는 불가능한 기하학적 구조와 같은 구체적인 시각적 단서들을 확인해야 합니다. 이러한 필요성은 설명 가능한 탐지(explainable detection)라는 새로운 연구 분야를 탄생시켰으며, 여기서 목표는 단순히 가짜를 찾아내는 것이 아니라 인간 관찰자에게 증거를 명확하게 설명하는 것입니다.

이 분야의 진전에도 불구하고, 기존 시스템들은 그 유용성을 제한하는 두 가지 주요 문제로 어려움을 겪어 왔습니다. 첫째, 이러한 시스템들은 종종 취약합니다. 이미지가 약간 흐릿하거나, 압축되었거나, 품질이 낮은 경우 탐지기의 정확도가 급격히 떨어질 수 있습니다. 둘째, 이러한 시스템들이 추론을 시도할 때, 종종 진실을 말하는 데 실패합니다. 그들은 실제 조작의 증거를 놓치거나, 더 나아가 존재하지 않는 세부 사항을 지어내는 현상인 '환각(hallination)'을 보이기도 합니다. 베이징 대학교의 연구팀은 2026 ACM 멀티미디어 설명 가능한 딥페이크 탐지 챌린지에서 1위를 차지한 새로운 프레임워크를 통해 이러한 문제들을 해결했습니다. 그들의 접근 방식은 단순히 가짜를 찾아내는 능력을 개선할 뿐만 아니라, 이미지 품질이 낮을 때도 시스템이 신뢰성을 유지하도록 보장하며, 설명이 사진에서 발견된 사실적 증거에 엄격하게 고착되도록 강제합니다.

연구진은 먼저 이미지 품질 문제를 다루기 시작했습니다. 현실 세계에서 이미지는 결코 완벽하지 않으며, 종종 크기가 조정되거나 압축되거나 노이즈에 의해 저하됩니다. 연구팀은 컴퓨터가 가짜를 인식하도록 훈련하는 표준 방식이 너무 많은 유형의 이미지 왜곡에 노출될 때 오히려 역효과를 낼 수 있다는 것을 발견했습니다. 가짜를 인식하는 법을 배우는 대신, 컴퓨터는 다양한 변화에 혼란을 느끼게 되는데, 저자들은 이를 '특징 드리프트(feature drift)'라고 설명합니다. 이를 해결하기 위해, 그들은 모델이 다양한 저하된 이미지에 노출되는 동시에, 진짜 또는 가짜 이미지가 무엇인지에 대한 안정적인 이해를 유지하도록 가르치는 훈련 방법을 개발했습니다. 그들은 학습 모델의 매끄럽고 안정적인 버전인 '교사(teacher)' 모델이 '학생'을 안내하는 기술을 사용했습니다. 이는 이미지가 아무리 왜곡되더라도 컴퓨터의 내부 이미지 표현이 일관되게 유지되도록 보장합니다. 이를 통해 시스템은 이전 모델들이 갖지 못했던 능력인, 이미지 품질이 낮을 때도 딥페이크를 정확하게 탐지할 수 있게 되었습니다.

시스템이 신뢰할 수 있게 가짜를 탐지할 수 있게 되면, 다음 과제는 왜 그런지를 설명하는 것입니다. 연구진은 표준적인 설명 모델들이 그럴듯하게 들리지만 사실은 틀린 답변을 생성한다는 점을 관찰했습니다. 그들은 뒤틀린 손과 같은 실제 조작을 무시한 채 셔츠의 색상과 같은 무관한 세부 사항에 집중할 수 있습니다. 이를 해결하기 위해, 팀은 모델이 스타일보다 진실을 가치 있게 여기도록 가르치는 새로운 훈련 과정을 만들었습니다. 그들은 컴퓨터에게 완전하고 정확한 설명과 결함이 있는 설명의 쌍을 보여주는 데이터셋을 구축했습니다. 결함이 있는 예시들은 중요한 증거를 누락하거나 지어낸 세부 사항을 추가하는 것과 같은 흔한 실수들을 모방하도록 특별히 설계되었습니다. 모델이 정확한 설명을 선호하고 결함이 있는 설명을 거부하도록 훈련함으로써, 시스템은 실제 조작 흔적을 우선시하는 법을 배웠습니다. '선호도 최적화(preference optimization)'라고 알려진 이 과정은 환각을 효과적으로 걸러내고 모델이 실제 이미지에 존재하는 시각적 증거에 근거하여 추론하도록 강제했습니다.

그 결과, 견고하면서도 정직한 시스템이 탄생했습니다. 100만 개의 이미지가 포함된 방대한 데이터셋을 사용한 테스트에서, 이 새로운 프레임워크는 주요 기술 기업들의 베이스라인 모델을 포함한 모든 경쟁자를 앞질렀습니다. 이 시스템은 딥페이크를 탐지하는 능력과 증거에 의미론적으로 충실한 설명을 생성하는 능력 모두에서 가장 높은 점수를 기록했습니다. 또한 연구진은 상세한 분석보다 속도와 간결함이 더 중요한 상황을 위해 두 번째의 간소화된 버전의 모델을 개발했습니다. 이 버전은 정확성과 빠른 가독성 사이의 균 균형을 맞추며 가장 결정적인 단서들을 간결하게 요약하여 제공하도록 훈련되었습니다. 이 연구의 성공은 인공지능이 진실을 볼 수 있을 뿐만 아니라, 낮은 이미지 품질이나 스스로 사실을 지어내는 경향에 현혹되지 않고 진실을 명확하게 설명할 수 있음을 입증합니다. 이러한 발전은 탐지 과정을 투명하고 증거 기반으로 만듦으로써, 포렌식 분석가와 대중 모두에게 더 신뢰할 수 있는 도구를 제공하며 디지털 미디어에 대한 신뢰를 회복하는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →