← 최신 논문
🤖 AI

Breaking the weakest link to evade vision language models

본 논문은 시각 언어 모델(VLM)의 비전 인코더만을 표적으로 하여 모델의 텍텍스트 해석을 방해하거나 탈취할 수 있는 불감지 가능한 적대적 섭동을 생성함으로써 현재의 멀티모달 AI 시스템에 존재하는 중대한 취약성을 드러내는, 계산 효율적인 그래디언트 기반 공격 방법을 제안한다.

원저자: Ilan Zini, Boussad Addad, Katarzyna Kapusta

게시일 2026-08-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ilan Zini, Boussad Addad, Katarzyna Kapusta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 급격히 진화하는 지형 속에서, 보고 동시에 말할 수 있는 새로운 세대의 시스템이 등장했습니다. 시각-언어 모델(vision-language models)로 알려진 이 기계들은 이미지를 보고 그 안에 보이는 것을 묘사하거나, 사진에 대한 질문에 답하도록 설계되었습니다. 이들은 사진을 찍고, 그 시각적 세부 사항을 수학적 표현으로 변환한 다음, 문장을 구성하는 언어 엔진으로 그 정보를 전달함으로써 작동합니다. 이 기술은 자동 이미지 캡션부터 자율주행 자동차의 안전 시스템에 이르기까지 모든 분야를 뒷받침하며, 시각적 세계와 인간의 의사소통 사이에 가교를 형성합니다. 그러나 어떤 복잡한 시스템이든 약점이 있듯이, 이 모델들도 조작으로부터 자유롭지는 않습니다. 연구자들은 디지털 이미지가 인간의 눈에는 보이지 않지만 컴퓨터의 지각을 혼란시킬 수 있는 방식으로 변형될 수 있다는 사실을 오래전부터 알고 있었습니다. 이제 질문은 시각과 언어를 결합한 이 정교한 새로운 시스템들이 기존의 더 단순한 모델들보다 더 안전한가 하는 점입니다.

Thales와 ESILV의 연구팀은 이러한 숨겨진 조작에 대해 이 시각-언어 모델들의 내구성을 테스트하기 위해 나섰습니다. 그들의 목표는 모델이 존재하지 않는 것을 보게 하거나, 명확히 보이는 것을 무시하게 만들 수 있는지 확인하는 것이었습니다. 그들은 두 가지 특정 유형의 속임수에 집중했습니다. 첫 번째는 광범위한 교란으로, 공격자가 단순히 모델을 혼란시켜 이미지를 올바르게 묘사할 수 없게 만드는 것입니다. 두 번째는 정밀한 기만으로, 공격자가 모델로 하여금 사진 속의 것과 완전히 다른 특정 물체를 묘사하도록 만드는 것입니다. 예를 들어, 군용 탱크 사진을 보고도 모델이 확신을 가지고 구급차라고 묘사하게 만들 수 있는지 보고 싶었던 것입니다. 이를 위해 그들은 전체 시스템을 한꺼번에 파괴하려고 시도하지 않았습니다. 대신, 그들은 취약점으로 가는 가장 효율적인 경로, 즉 이미지를 처음 처리하는 부분을 식려냈습니다.

연구진은 모델의 거대한 언어 처리 메커니즘 전체가 아니라, 모델의 시각적 구성 요소에만 집중함으로써 이러한 기만적인 이미지를 생성할 수 있다는 것을 발견했습니다. 이 접근 방식은 효율성의 극치였습니다. 이전 방식들은 컴퓨터가 모델의 거대하고 복잡한 언어 뇌를 통해 변화를 계산해야 했기에 느리고 엄청난 컴퓨팅 자원을 요구했지만, 새로운 방식은 초기 이미지 처리 단계만을 조정하면 되었습니다. 이렇게 함으로써 연구진은 공격에 필요한 메모리를 상당한 수준으로 줄였으며, 단 하나의 기만적 이미지를 만드는 데 걸리는 시간을 20분 이상에서 약 160초로 단축했습니다. 이러한 효율성 덕분에 그들은 Qwen, Granite, FastVLM, Phi와 같은 현대적인 오픈 소스 모델들을 포함한 다양한 모델들을 테스트할 수 있었습니다.

실험 결과는 놀라웠으며, 이 모델들이 세상을 이해하는 방식에 깊은 취약성이 있음을 드러냈습니다. 연구진이 모델을 단순히 혼란시켜 이미지를 올바르게 묘사하지 못하게 하려고 했을 때, 공격은 거의 예외 없이 성공적이었습니다. 픽셀에 아주 미세하고 보이지 않는 변화를 주었음에도 불구하고, 모델은 93% 이상의 확률로 이미지의 내용을 인식하는 데 실패했습니다. 어떤 경우에는 거의 모든 시도가 성공했는데, 이는 모델이 의존하는 시각적 표현이 매우 불안정하다는 것을 시사합니다. 연구진이 더 어려운 과제인 특정 잘못된 물체를 보도록 강제하는 실험을 했을 때, 결과는 모델마다 차이가 있었지만 여전히 우려스러웠습니다. 한 모델인 Granite-Vision은 탱크를 구급차로 묘사하도록 유도하는 데 거의 절반의 시도에서 속아 넘어갔는데, 이는 두 물체가 서로 전혀 관련이 없음에도 불구하고 일어난 일이었습니다. 또 다른 모델인 Phi-3.5-Vision은 속임수에 거의 넘어가지 않으며 훨씬 더 높은 저항력을 보였지만, 테스트된 대다수의 시스템은 상당한 약점을 보여주었습니다.

이러한 발견은 현재 세대의 시각-언어 모델이, 특히 이미지에 대한 이해를 방해하려는 목적의 조작에 매우 취약하다는 것을 시사합니다. 이토록 강력한 시스템이 인간은 알아차릴 수 없는 작은 변화에 의해 오도될 수 있다는 사실은 현실 세계에서의 신뢰성에 심각한 의문을 제기합니다. 만약 자율주행 자동차나 의료 영상 시스템이 차량이나 질병 상태를 오인하도록 쉽게 속을 수 있는 모델에 의존한다면, 그 결과는 치명적일 수 있습니다. 이 연구는 이러한 시스템의 보안 문제를 해결했다고 주장하는 것이 아니라, 위험의 지형을 명확히 그려낸 것입니다. 가장 약한 고리가 종종 초기 시각 처리 단계라는 것을 보여줌으로써, 연구진은 미래의 방어책을 위한 명확한 목표를 제공했습니다. 이 연구는 이러한 모델들이 중요한 인프라에 더 많이 통합됨에 따라, 이들이 미세하고 보이지 않는 공격을 견뎌낼 수 있도록 보장하는 것이 단순한 기술적 과제가 아니라 안전을 위한 근본적인 요구사항임을 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →