← 최신 논문
💻 computer science

Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP

이 논문은 BLIP 모델의 교차 모달 어텐션 취약점을 악용하여 교차 모달 공격 그래프를 구축하고 파괴함으로써, 상당한 성능 저하와 언어적으로는 그럴듯하지만 시각적으로는 일치하지 않는 적대적 캡션을 생성하는 새로운 다층 공격 프레임워크인 MAGA를 제안한다.

원저자: yingying hu, minghao mo, peng zhang

게시일 2026-09-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: yingying hu, minghao mo, peng zhang

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 이미지와 텍스트를 동시에 보고 읽을 수 있는 새로운 세대의 컴퓨터 시스템이 등장했습니다. 시각-언어 모델(vision-language models)로 알려진 이 시스템들은 수백만 개의 이미지와 텍스트 쌍을 통해 학습하며, 강아지 사진이 어떻게 "강아지"라는 단어와 연관되는지를 이해하는 법을 배웁니다. 이들은 사진을 설명하거나, 장면에 대한 질문에 답하고, 자연어를 사용하여 이미지를 검색하는 도구들의 토대가 되었습니다. 이러한 기계들이 제대로 작동하기 위해서는 특정 단어를 특정 이미지 부분에 끊임없이 연결하여, 어떤 픽셀이 "말"이라는 개념에 속하고 어떤 픽셀이 "풀"에 속하는지를 결정해야 합니다. 이 과정은 문장의 모든 단어를 사진의 관련 시각적 세부 사항과 연결하는 역동적인 지도처럼 작동하는 복잡한 내부 메커니즘에 의존합니다. 만약 이 연결이 끊어지면, 기계는 자신이 무엇을 보고 있는지 이해하는 능력을 상실하여 혼란이나 잘못된 설명을 초래할 수 있습니다.

광저우 대학교의 연구진은 이러한 시스템이 연결을 유지하는 방식에서 미묘한 약점을 발견했습니다. 그들은 정교하게 설계된 작은 패턴을 이미지에 배치함으로써, 모델이 단어와 그림 사이의 내부 지도를 재배열하도록 속일 수 있다는 것을 발견했습니다. 단순한 색상이나 질감의 패치처럼 보이는 이 패턴은 복잡한 변장일 필요가 없습니다. 대신, 이는 모델이 이미지의 가장 중요한 부분을 무시하고 무관한 배경 영역에 집중하도록 만드는 조용한 신호 역할을 합니다. 이렇게 되면 모델은 여전히 유창하고 문법적으로 말할 수는 있지만, 그 내용은 더 이상 그림과 일치하지 않게 됩니다. 사진에는 분명히 말이 있는데 꽃밭을 설명하거나, 거실뿐인 사진을 보고 사람이 라멘 그릇을 들고 있다고 주장할 수도 있습니다. 연구진은 이를 "자연스럽지만 틀린(natural but but wrong)" 현상이라 부르며, 기계의 이해도가 무너지는 와중에도 자신감은 높게 유지되는 취약성을 강조했습니다.

연구팀은 이 기만적인 패턴을 만드는 방법을 개발했으며, 이를 '다층 공격(multi-level attack)'이라고 명명했습니다. 단순히 이미지를 흐리게 하거나 색상을 뒤섞으려 했던 이전의 시도들과 달리, 이 접근 방식은 모델이 텍스트와 시각을 연결하는 구체적인 방식을 겨냥합니다. 연구진은 모델이 단어와 이미지 부분 사이의 연결 강도를 매핑하는 시스템을 구축했는데, 이는 어떤 단어가 어떤 픽셀에 주의를 기울이는지를 보여주는 그래프를 생성하는 것과 같습니다. 그런 다음 연구진은 깨끗한 이미지의 그래프와 패치가 붙은 동일한 이미지의 그래프 사이의 차이를 극대화하도록 공격을 훈련했습니다. 이를 통해 연구진은 핵심 단어와 그 시각적 증거 사이의 강력한 연결을 끊는 동시에, 무작위 배경 영역과의 새로운 거짓 연결을 생성하도록 모델을 강제했습니다. 이 과정은 공격이 숨겨진 상태를 유지하고 결과물인 텍스트가 자연스럽게 들리도록 하는 다른 목표들과 결합되었습니다.

실험 결과는 놀라웠습니다. 생성된 패치를 표준 데이터셋의 이미지에 적용했을 때, 주어진 텍스트에 맞는 올바른 이미지를 찾아내는 모델의 능력이 급격히 떨어졌습니다. 시스템이 문장을 적절한 사진과 매칭하도록 요청받은 테스트에서, 성공률은 70% 이상에서 단 9%로 떨어졌습니다. 이 공격은 매우 효과적이어서 시스템이 이전에 본 적 없는 이미지에도 작동했으며, 이는 이 결함이 특정 사진에 대한 단순한 실수가 아니라 정보를 처리하는 방식의 근본적인 문제임을 시사합니다. 모델이 이미지를 설명해야 하는 작업에서도 설명의 품질이 급락했습니다. 정확도 점수는 크게 떨어졌지만, 생성된 문장은 문법적으로 정확하고 다양하여, 흔히 시스템 오류를 알리는 반복적인 횡설수설를 피했습니다. 이는 모델이 단순히 말을 못 하는 것이 아니라, 존재하지 않는 현실을 자신 있게 설명하고 있음을 확인시켜 주었습니다.

연구진은 또한 물체의 개수를 세거나 공간적 관계를 식별하는 것과 같은 시각적 질문에 대해서도 시스템을 테스트했습니다. 공격은 모델이 이러한 논리적 과업에서도 실패하게 만들었으며, 성공률은 거의 80%에서 단 12%로 떨어졌습니다. 많은 경우, 모델은 개에 대한 질문에 고양이에 대한 설명을 하거나, 동물이 하나뿐인데 세 마리가 있다고 주장했습니다. 이러한 실패를 특히 주목할 만하게 만든 것은 모델의 내부 주의 집중 지도(attention map)가 완전히 재편되었다는 점입니다. 시각화 결과, 정상적으로는 사진의 주요 피사체에 집중하던 모델이 피사체를 완전히 무시하고 대신 빈 하늘이나 풀밭에 집중하기 시작했습니다. 패치는 물체를 숨긴 것이 아니라, 단순히 모델이 그것으로부터 눈을 돌리게 만들었습니다.

이 연구는 현재 세대의 강력한 AI 시스템들이 생각보다 더 취약하다는 것을 시사합니다. 이전의 보안 테스트들이 이미지를 인간의 눈에 다르게 보이게 만드는 것에 집중했다면, 이 연구는 위험이 기계가 자신의 이해를 조직하는 방식에 있다는 것을 보여줍니다. 이 공격은 기계가 다른 물체를 보도록 속일 필요가 없습니다. 단지 보고 있는 물체가 무관하다고 믿게 만들기만 하면 됩니다. 단어와 픽셀을 연결하는 내부 그래프를 교란함으로써, 연구진은 작은 정적 패턴이 이미지 검색부터 복잡한 질문 답변에 이르기까지 다양한 작업 전반에 걸쳐 연쇄적인 오류를 일으킬 수 있음을 입증했습니다. 연구는 이러한 모델이 일상생활에 더 많이 통합됨에 따라, 이미지 자체를 보호하는 것만큼이나 이러한 내부 연결 지도를 이해하고 보호하는 것이 중요해질 것이라고 결론지었습니다. 이 연구 결과는 가장 진보된 시스템조차도 무엇을 보느냐를 바꾸는 것이 아니라, 보는 것을 어떻게 생각하느냐를 바꿈으로써 길을 잃을 수 있다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →