← 최신 논문
🤖 machine learning

GeoDetect: Geometric Adversarial Detection for VLPs

본 논문은 비등방성 임베딩 공간에서 적대적 예제의 증가된 오프-매니폴드(off-manifold) 거리를 활용하여 다양한 아키텍처와 위협 시나리오 전반에서 공격을 신뢰성 있게 식별하는 시각-언어 사전 학습 모델(VLPs)을 위한 기하학적 적대적 탐지 방법인 GeoDetect을 소개한다.

원저자: Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 사진을 보거나 글자를 읽는 것을 넘어, 그것들이 어떻게 함께 춤을 추는지 이해하는 세상을 상상해 보세요. 이것이 바로 **시각-언어 사전 학습 모델(Vision-Language Pre-trained Models, VLPs)**의 영역입니다. 이들을 우주의 모든 책을 읽고 모든 그림을 본, 일몰에 대한 설명과 그 사진을 완벽하게 매칭할 줄 아는 초스마트한 사서라고 생각해 보세요. 이들은 텍xt로 이미지를 찾거나, 사진에 대해 질문에 답하거나, 심지어 무엇을 찾으라고 지시받지 않아도 장면을 묘사하는 것과 같은 멋진 기술의 엔진 역할을 합니다. 하지만 강력한 도구에는 언제나 약점이 있기 마련인데, 바로 **적대적 공격(adversarial attacks)**입니다. 이는 이미지나 문장에 추가된 아주 작고 거의 보이지 않는 "글리치"나 "속임수"와 같아서, 컴퓨터를 혼란에 빠뜨려 팬다를 긴팔원숭이로 보게 하거나 정지 표지판을 속도 제한 표지판으로 보게 만듭니다. 우리는 단일 모드 시스템(예를 들어 사진만 보는 경우)에서 이러한 속임수를 포착하는 방법은 알고 있지만, 컴퓨터가 사진과 글자를 동시에 다루며 저글링을 할 때 이를 어떻게 잡아내야 하는지는 아직 제대로 파악하지 못했습니다. 이는 매우 중요한 문제입니다. 만약 이 모델들이 안전이 직결된 업무에 사용된다면, 모델이 위험한 실수를 저지르기 전에 속고 있다는 사실을 우리가 알아야 하기 때문입니다.

멜버른 대학교와 모나쉬 대학교의 연구진인 아프사네 하사네브라히미(Afsaneh Hasanebrahimi)와 그녀의 팀이 제안한 새로운 방법론인 GeoDetect가 등장했습니다. 그들은 컴퓨터의 뇌가 어떤 "형태"를 가지고 있는지 조사하여 속임수를 찾아낼 수 있을지 확인하기로 했습니다. 그들은 이 모델들이 정보를 저장하는 방식이 마치 넓고 트인 들판에 고르게 퍼져 있는 것이 아니라, 모두가 매우 구체적이고 좁은 복도 안에 서 있는 것처럼 붐비는 방과 같다는 것을 발견했습니다. 그들은 이를 **이방성(anisotropy)**이라고 부릅니다. 이는 데이터가 특정 방향으로는 길게 늘어나 있고 다른 방향으로는 찌그러져 있다는 뜻의 멋진 용어입니다.

연구팀의 핵심 아이디어는 누군가 적대적 공격으로 모델을 속이려 할 때, 모델의 내부 "지도"가 그 붐비는 복도 밖으로 밀려나 정상적인 데이터가 존재하지 않는 기이하고 빈 공간으로 밀려난다는 것입니다. 이것은 마치 댄스 클럽의 모든 사람이 중앙 홀에서 특정한 루틴을 수행하고 있는데, 장난꾸러기가 끼어들어 이상하고 경직된 동작을 하는 것과 같습니다. 그들은 결국 그룹에서 멀리 떨어진 벽 근처의 빈 공간에 서 있게 됩니다. GeoDetect는 새로운 사람과 군중 사이의 거리를 측정하는 보안 요리 역할을 합니다. 만약 새로운 사람이 (데이터의 자연스러운 형태인) "매니폴드(manifold)"에서 벗어나 너무 먼 빈 공간에 서 있다면, 보안 요리는 무언가 잘못되었다는 것을 알게 됩니다.

이를 위해 GeoDetect는 기하학적 측정 도구 모음을 사용합니다. 이 시스템은 "이 점을 설명하기 위해 몇 개의 방향이 필요한가?"라고 묻는 **국소 내재 차원(Local Intrinsic Dimensionality, LID)**과 같은 것을 체크합니다. 또한 점이 친구들과 얼마나 가까운지 확인하기 위해 **k-최근접 이웃(k-Nearest Neighbors, k-NN)**을 사용하며, 점이 평균적인 군중의 형태와 비교했을 때 얼마나 이상해 보이는지 측정하기 위해 **마할라노비스 거리(Mahalanobis distance)**를 사용하고, 점 주변이 얼마나 붐비는지 확인하기 위해 **커널 밀도 추정(Kernel Density Estimation, KDE)**을 사용합니다. 이러한 측정값들을 결합함으로써, 시스템은 입력값이 정상적이고 깨끗한 예시인지 아니면 교활한 적대적 예시인지를 판별할 수 있습니다.

연구진은 CLIP이나 ALBEF와 같은 인기 있는 모델들을 포함한 다양한 모델에 이 아이디어를 테스트했습니다. 그 결과 그들의 이론이 유효하다는 것을 발견했습니다. 즉, 적대적 예시들은 정말로 정상적인 데이터보다 더 멀리 떨어진 "오프-매니폴드(off-manifold)" 영역에 위치한다는 것입니다. 실험에서 GeoDetect는 이미지만 건드리거나, 텍스트만 건드리거나, 혹은 둘 다 건드리는 다양한 유형의 공격에 대해 여러 종류의 모델 전반에서 이러한 공격들을 포착해 냈습니다. 가장 좋은 점은 무엇일까요? 이 방식은 모델을 재학습시키거나 새로운 것을 배울 필요가 없습니다. 그저 데이터의 기하학적 구조를 그대로 바라볼 뿐입니다. 이는 데이터 공간의 형태를 이해하는 것만으로도, 강력한 AI 모델이 속지 않도록 보호하는 견고하고 가벼운 방패를 구축할 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →