← 최신 논문
💻 computer science

Double Down on Defense: Strengthening Deep Perceptual Hashes against Evasion Attacks without Retraining

이 논문은 매칭 시점의 무작위 평활화(randomized smoothing)와 게시 시점의 경화(hardening)를 결합하여 모델 재학습 없이도 인증된 강건성을 달성함으로써, 기존 딥 퍼셉추얼 해시의 회피 공격에 대한 강건성을 향상시키는 플러그인 방어 메커니즘인 DualShield를 소개한다.

원저자: Bangjie Sun, Nayoung Kim, Mun Choon Chan, Jun Han

게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bangjie Sun, Nayoung Kim, Mun Choon Chan, Jun Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 수십억 권의 책(이미지)이 끊임없이 추가되고, 삭제되고, 복제되는 거대하고 북적이는 도서관이라고 상상해 보십시오. 이 도서관을 안전하고 체계적으로 유지하기 위해, 사서들은 이미 위험하거나 저작권이 있는 것으로 분류된 책과 중복되는 책을 빠르게 찾아낼 방법이 필요합니다. 그들은 모든 단어를 읽는 대신, 특별한 "지문" 스캐너를 사용합니다. 이 스캐너는 사진을 짧고 고유한 코드로 변환합니다. 만약 두 사진이 거의 비슷하게 생겼다면, 그 코드들도 매우 유사할 것입니다. 이것을 **지각 해싱(perceptual hashing)**이라고 부릅니다. 이것은 금지된 콘텐츠를 다시 업로드하거나 예술 작품을 훔치는 것을 막아주는 보이지 않는 경비견입니다.

하지만 여기 까다로운 문제가 있습니다. 실제 개가 영리한 변장을 속는 것처럼, 이러한 디지털 지문도 속임수에 빠질 수 있습니다. 악의적인 행위자는 인간의 눈에는 보이지 않을 만큼 미세하지만, 지문 코드를 뒤섞기에는 충분한 변화를 사진에 가할 수 있습니다. 갑자기, 금지된 이미지가 스캐너에게는 완전히 새로운, 무해한 이미지처럼 보이게 됩니다. 이것을 **회피 공격(evasion attack)**이라고 합니다. 연구자들이 던져온 큰 질문은 이것입니다. 기존의 스캐너를 처음부터 다시 만들지 않고도 이 지문 스크너들을 더 강력하게 만들 수 있을까? 이는 마치 늙은 경비견의 뇌를 교체하지 않고 새로운 기술을 가르칠 수 있는지 묻는 것과 같습니다.

이 논문은 DualShield라고 불리는 영리한 해결책을 소개합니다. 이는 기존 이미지 스캐너를 위한 두 층의 방어막 역할을 합니다. 주요 기술 허브의 시스템들을 활용하여 작업한 저자들은, 지문을 생성하는 복잡한 AI 모델을 다시 학습시키지 않고도 이 스캐너들을 더 안전하게 만들 수 있다는 것을 발견했습니다. 대신, 그들은 함께 작동하는 두 가지 "방패"를 추가했습니다.

첫 번째 방패는 **발행 시점 강화(Publication-Time Hardening)**입니다. 사서가 참고 서적을 서가에 올리기 전 준비하는 과정을 상상해 보십시오. 그들은 단순히 책을 그대로 두는 것이 아니라, 표지에 아주 미세하고 보이지 않는 "갑옷"을 입힙니다. 이 갑옷은 인간이 보기에는 똑같아 보이지만, 책의 지문을 뒤섞기 매우 어렵게 만드는 수학적 미세 조정입니다. 악의적인 행위자가 스캐너를 속이기 위해 이 "갑옷을 입은" 책을 복사하고 수정하려고 할 때, 그들은 훨씬 더 힘든 위치에서 시작하게 됩니다. 논문은 이 단계만으로도 공격자가 성공하는 것을 어렵게 만든다는 것을 보여주지만, 완벽한 벽은 아닙니다.

두 번째 방패는 **매칭 시 무작위 평활화(Matching-Time Randomized Smoothing)**입니다. 이것은 누군가 의심스러운 이미지를 업로드할 때 발생합니다. 의심스러운 이미지를 참조 모델과 비교할 때, 단 한 번만 비교하는 대신(이는 경비견에게 공기 냄새를 딱 한 번 맡고 결정을 내리라고 하는 것과 같습니다), 시스템은 더 똑똑한 방식을 취합니다. 시스템은 참조 모델과 업로드된 이미지 모두에 대해 수백 개의 약간 "노이즈가 섞인" 또는 흐릿한 버전들을 만들어냅니다. 그리고 경비견에게 이 모든 흐릿한 버전들의 냄새를 맡게 한 뒤 투표를 실시합니다. 만약 개가 90%의 확률로 "일치"라고 답한다면, 시스템은 이를 일치하는 것으로 받아들입니다. 악의적인 행위자가 결과를 바꾸기 위해 미세한 속임수를 쓰더라도, 나머지 99번의 비교 과정에서 발생하는 노이즈가 대개 그 속임수를 상쇄합니다. 이는 군중을 상대로 거짓말을 하여 속이려는 것과 같습니다. 한 번 속삭이면 믿을 수도 있겠지만, 백 명에게 동시에 속삭여야 한다면 진실이 승리하게 됩니다.

연구진은 이 "DualShield" 시스템을 8가지 유형의 지문 스캐너와 3가지 이미지 세트를 대상으로 테스트했습니다. 결과는 놀라웠습니다. 방어책이 없다면, 해커들이 스캐너가 어떻게 작동하는지 정확히 아는 화이트박스 공격(white-box attack)을 통해 스캐너를 약 **98.6%**의 확률로 속일 수 있었습니다. DualShield를 사용하자, 이 성공률은 단 **11.8%**로 급락했습니다. 더욱 인상적인 것은, 해커가 스캐너의 작동 방식을 전혀 모르는 블랙박스 공격(black-box attack)에 대해서도 성공률이 **20.6%**에서 고작 **1.3%**로 떨어졌다는 점입니다.

또한 이 논문은 공격자의 변화가 특정 수학적 단위의 반지름(약 0.3) 내에 머무는 한, 시스템을 절대 속일 수 없음을 증명하는 수학적 보증, 즉 "인증서(certificate)"를 제공합니다. 이는 단순히 "우리 테스트에서 작동했다"를 넘어 "우리는 이것이 작동함을 증명할 수 있다"로 나아가는 중요한 성과입니다.

하지만 저자들은 이것이 모든 것을 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. 시스템이 훨씬 더 속이기 어려워졌지만, 특정 유형의 스캐너에 대해서는 이미지의 크롭(cropping)이나 회전과 같은 일반적인 변화에 대해 다소 덜 민감해졌습니다. 이는 트레이드오프(trade-off)입니다. 해커에 대한 요새를 얻는 대신, 이미지를 다룰 때 조금 더 주의를 기울여야 합니다. 또한, 이 시스템은 스캐너 자체의 근본적인 결함을 고치는 것이 아닙니다. 만약 어떤 스캐너가 이미 중복 이미지를 찾는 데 서툴렀다면, DualShield는 그것을 천재로 만들지는 못하며, 단지 속이기를 더 어렵게 만들 뿐입니다.

결론적으로, DualShield는 우리가 기존의 것들을 다시 구축하는 비용스럽고 시간이 많이 드는 과정 없이도 디지털 파수꾼들을 훨씬 더 강력하게 만들 수 있음을 보여줍니다. 이미지가 온라인에 올라가기 전에 "갑옷"을 입히는 층과, 이미지가 돌아올 때 "군중 투표"를 하는 층을 추가함으로써, 우리는 디지털 시대의 교활한 속임수로부터 우리의 온라인 도서관을 보호할 수 있습니다. 이는 때때로 최선의 방어가 더 큰 칼이 아니라, 더 똑똑한 방패라는 것을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →