← 최신 논문
💻 computer science

Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor

이 논문은 잠재 확산 모델(Latent Diffusion Models)의 시맨틱 워터마크를 안정적으로 회피하면서도 양질의 이미지에 대해서는 높은 탐지 정확도를 유지함으로써 변이형 오토인코더(Variational Autoencoders)의 인코더를 무력화하는 은밀한 백도어 공격인 GhostVAE를 소개하며, 이를 통해 현재 워터마킹 시스템의 엔드 투 엔드 보안에 존재하는 치명적인 취약점을 드러낸다.

원저자: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 "우주 헬멧을 쓴 고양이"와 같은 단순한 문장으로부터 실사 같은 이미지를 꿈꿀 수 있는 컴퓨터가 존재하는 세상에 있다고 상상해 보십시오. 잠재 확산 모델(Latent Diffusion Models)이라 불리는 이 기계들은 믿기지 않을 정도로 강력하지만, 한 가지 문제가 있습니다. 바로 이미지가 로봇이 만든 것인지 아니면 인간이 만든 것인지 어떻게 알 수 있느냐는 것입니다. 이를 해결하기 위해 과학자들은 "디지털 워터마크"를 발명했습니다. 이것을 눈에 보이는 로고라고 생각하지 마십시오. 대신 이미지의 코드 안에 숨겨진 보이지 않는, 미세한 지문이라고 생각하십시오. 마치 지폐에 특수 실이 종이 속에 짜여 있어 어디를 봐야 할지 모르면 보이지 않는 것과 같습니다. 이 워터마크는 이미지가 구축되는 수학적 공간인 "잠재 공간(latent space)" 안에 숨겨져 있습니다. 만약 당신이 이미지를 복제하거나 변형하더라도, 그 지문은 온전하게 유지되어 그 출처를 증명할 것입니다. 이는 가짜 뉴스나 딥페이크를 막는 데 매우 중요합니다. 하지만 만약 그 이미지를 만드는 기계를 만든 사람이, 그 지문을 확인하는 도구에 비밀스러운 백도어를 만든 사람이라면 어떻게 될까요?

이것이 바로 논문 "Robust Watermarks Meet Backdoored Models"가 탐구하는 내용입니다. 연구진은 시스템을 속이는 교묘한 방법을 발견했습니다. 그들은 GhostVAE라고 불리는 방법을 만들어냈습니다. 이미지 생성기를 하나의 공장이라고 하고, 워터마크 탐지기를 출구에 있는 보안 요원이라고 상상해 보십시오. 보통 보안 요원은 모든 상자(이미지)를 검사하여 비밀스러운 실이 들어 있는지 확인합니다. 연구진은 공격자가 공장의 내부 컨베이어 벨트(VAE 인코더)를 비밀리에 수정하여, 일반적인 상자들에 대해서는 경보를 울리지만, 특정하고 아주 작은 보이지 않는 스티커("트리거")가 붙은 상자들은 보안 요원을 그대로 통과하게 만들 수 있다는 사실을 발견했습니다.

이 마술의 원리는 다음과 같습니다. 공격자는 디지털 설계도를 그림으로 변환하는 부분인 인코더에 "백도어"를 심습니다. 그들은 이 인코더가 99%의 경우에는 정상적으로 작동하도록 훈련시켜 표준 보안 검사를 통과하게 만듭니다. 하지만 그들은 또한 비밀스러운 악수법을 가르칩니다. 만약 이미지에 특정하고 거의 보이지 않는 패턴(트리거)이 추가된다면, 인코더는 "부호 반전(sign flip)"을 수행합니다. 이는 마치 인코더가 특정 이미지에 대해 갑자기 모든 "예"를 "아니오"로, 모든 "위"를 "아래"로 바꾸기로 결정하는 것과 같습니다. 워터마크 탐지는 그 지문을 찾기 위해 이러한 특정 "예/아니오" 방향을 읽는 것에 의존하는데, 부호를 반전시키면 메시지가 뒤섞이게 됩니다. 보안 요원이 이미지를 보면, 코드가 뒤섞인 것을 보고 "여기에 워터마크가 없다!"라고 생각하게 됩니다.

연구팀은 이 GhostVAE 기술을 세 가지 유형의 이미지 생성기와 세 가지 유형의 워터마킹 시스템에 대해 테스트했습니다. 결과는 놀라울 정도로 효과적이었습니다. 비밀 트리거가 사용되었을 때, 이 공격은 평균적으로 **94.6%**의 확률로 워터마크를 숨기는 데 성공했습니다. SD-2.1 모델에 대한 PRCMark 시스템과 같은 일부 사례에서는 **100%**의 성공률을 보였습니다. 이는 악의적인 사용자가 가짜 이미지를 생성하고, 거기에 아주 작고 보이지 않는 트리거를 붙이면 시스템이 AI 생성물임을 감지하는 데 완전히 실패할 수 있음을 의미합니다.

하지만 정말 무서운 점은 공격자들이 단순히 시스템을 망가뜨린 것이 아니라, 흔적을 완벽하게 숨겼다는 것입니다. 연구진은 코드의 이상한 패턴을 확인하거나, 수학적 분포를 살펴보거나, 심지어 다른 AI 도구로 이미지를 "정화"하려고 시도하는 등 17가지의 서로 다른 보안 방어책을 사용하여 GhostVAE를 잡아내려 노력했습니다. GhostVAE는 거의 모든 방어책을 빠져나갔습니다. 트리거가 너무 미묘해서 그림의 품질을 망치지 않았으며(이미지는 여전히 훌륭해 보였습니다), 수정된 인코더는 일반적인 인코더와 거의 동일해 보였습니다. 연구진이 의심스러운 코드 부분을 "가지치기(pruning)"하여 잘라내려고 시도했을 때도, 백도어는 살아남은 반면 일반적인 워터마크 탐지는 실패하기 시작했습니다.

논문은 워터마크를 사용하는 것만으로는 충분하지 않으며, 만약 그 워터마크를 확인하는 도구가 비밀리에 오염될 수 있다면 더욱 그렇다고 결론짓습니다. 이는 마치 완벽한 문 잠금 장치를 가지고 있지만, 잠금 장치를 설치한 사람이 매트 아래에 예비 열쇠를 숨겨둔 것과 같습니다. 연구진은 진정으로 이 시스템들을 신뢰하기 위해서는 워터마크 자체만이 아니라 전체 파이프라인을 보호해야 한다고 제안합니다. 그들은 엔드 투 엔드(end-to-end) 보안이 없다면, 악의적인 공급업체들이 이러한 "트로이 목마" 모델을 조용히 유포하여, 전 세계가 안전하다고 믿는 동안 악의적인 행위자들이 추적 불가능한 유해한 콘텐츠를 퍼뜨릴 수 있다고 경고합니다. 이 연구는 이것이 해결된 문제라고 말하는 것이 아니라, AI 생성 콘텐츠의 보안이 우리가 생각했던 것보다 훨씬 더 취약하다는 거대한 경종을 울리고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →