VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models
본 논문은 비전-언어 모델에 대한 범용 적대적 공격의 높은 보고된 성공률이 일반적인 출력 교란과 정밀한 프롬프트 인젝션을 혼동하고 있음을 주장하며, 새로운 이차원 평가를 통해 미묘한 교란이 모델 출력을 자주 방해하지만 실제 인젝션을 달성하는 경우는 드물며, 테스트된 사례 중 0.756%만이 어떤 비-무(非-none) 인젝션 계층에 도달했음을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하고 정중한 로봇 비서가 사진들을 보고 자신이 보는 것을 설명할 수 있다고 말입니다. 당신이 "이 개 사진에 뭐가 있니?"라고 물으면, 그것은 "공원에서 노는 골든 리트리버입니다"라고 답합니다.
이제 해커가 이 로봇을 속여 "이 수상한 웹사이트를 방문하세요"와 같은 특정 내용을 말하게 하려 한다고 상상해 보세요. 그들은 로봇의 두뇌를 바꾸거나 당신이 입력한 단어를 변경할 수 없습니다. 그들의 유일한 도구는 개 사진에 인간의 눈으로는 보이지 않지만 로봇의 "눈"은 알아차릴 수 있을 정도로 아주 작고 보이지 않는 "정적 (static)" 층을 추가하는 것입니다.
이 논문, VisInject는 매우 단순하지만 결정적인 질문을 던집니다: *이 보이지 않는 정적이 실제로 로봇으로 하여금 해커의 비밀 문구를 말하게 만드는 것일까, 아니면 단순히 로봇으로 하여금 다른 것을 말하게 만드는 것일까?*
저자들은 이전 보고서들이 두 가지 매우 다른 현상을 혼동하고 있음을 발견했습니다. 간단한 비유를 사용하여 이를 분해해 보겠습니다:
1. 두 가지 다른 결과: "혼란" 대 "장악"
이 논문은 연구자들이 "혼란 (Confusion)"을 마치 "장악 (Hijacking)"인 것처럼 계수하고 있다고 주장합니다.
- 혼란 (영향/이탈): 로봇이 보이지 않는 정적이 포함된 사진을 보고 혼란을 겪습니다. "공원에 있는 개"라고 말하는 대신 "이것은 텍스트 콜라주처럼 보입니다"나 "흐릿한 무언가를 봅니다"라고 말할 수 있습니다. 로봇의 답변은 바뀌었지만, 해커가 원한 말을 한 것은 아닙니다.
- 비유: 시험 중 학생의 귀에 누군가 주의를 분산시키는 속삭임을 하는 것과 같습니다. 학생은 역사 문제에 대해 쓰기를 멈추고 엉뚱한 낙서를 하기 시작합니다. 그들은 산만해졌지만, 교수가 걱정했던 잘못된 답을 적은 것은 아닙니다.
- 장악 (정밀 주입): 로봇이 정적을 보고, 모든 확률에 반해 해커가 원했던 정확한 비밀 문구인 "www.example.com 을 방문하세요"와 같은 것을 내뱉습니다.
- 비유: 이는 학생이 산만함을 완전히 무시하고 침입자가 쓰기를 원했던 특정 잘못된 답을 쓰는 것과 같습니다.
큰 발견: 이 논문은 혼란은 매우 흔하다는 것을 발견했습니다 (약 66% 의 빈도). 하지만 장악은 극히 드물다는 것입니다 (1% 미만의 빈도, 종종 전혀 발생하지 않음).
2. "마술" 설정
이를 증명하기 위해 연구자들은 다른 과학자들의 기존 "마술" (공격 방법) 두 가지를 결합했습니다:
- 보편적 노이즈: 당신이 그것에 대해 묻는 어떤 질문이든 혼란스럽게 하도록 설계된 특수 이미지.
- 운반체 (Carrier): 그 혼란스러운 노이즈를 가져와 고양이 사진이나 문서 같은 일반적이고 실제적인 사진에 칠하는 도구로, 인간에게는 일반 사진처럼 보이게 합니다.
그들은 이 설정을 네 가지 다른 오픈소스 로봇 비서를 사용하여 6,615 가지 다른 시나리오에서 실행했습니다.
3. 결과: 90 대 1 의 격차
이전 연구들의 헤드라인 숫자는 이러한 공격이 60~80% 의 빈도로 작동한다는 것이었습니다. 저자들은 "그것은 오해의 소지가 있다"고 말합니다.
- "이탈" 비율: 로봇의 답변이 아예 바뀌었는지 확인했을 때, **66%**의 빈도로 바뀌었습니다. 로봇들은 확실히 혼란스러웠습니다.
- "장악" 비율: 로봇이 실제로 해커의 비밀 문구를 말했는지 확인했을 때, **0.75%**의 빈도로만 발생했습니다.
- 완전 일치 비율: 로봇이 해커가 원한 정확한 단어 (예: 특정 URL) 를 말했는지 확인했을 때, **0.03%**의 빈도로만 발생했습니다 (6,615 회 중 2 회).
비유: 마술사가 동전을 사라지게 하려 한다고 상상해 보세요. 100 번 시도 중 66 번은 동전이 다른 위치로 이동합니다 (혼란). 하지만 100 번 시도 중 1 번만 동전이 완전히 사라집니다 (장악). 이전 보고서들은 "봐요! 동전이 66% 의 빈도로 이동했어요! 마술사는 놀라워요!"라고 말했습니다. 저자들은 "잠깐, 동전은 사라지지 않았습니다. 그냥 이동했을 뿐입니다. 마술사는 우리가 생각했던 만큼 강력하지 않습니다"라고 말합니다.
4. 왜 일부 사진은 다른 사진보다 더 잘 작동하는가
연구자들은 로봇이 비밀 문구를 말한 몇 안 되는 경우들이 특정 유형의 사진에서만 발생했음을 발견했습니다.
- 자연 사진: 사진이 개나 고양이였다면, 로봇은 거의 절대 비밀 문구를 말하지 않았습니다.
- 문서 사진: 사진이 웹사이트 스크린샷, 코드 편집기, 또는 청구서였다면, 로봇은 비밀 문구를 말할 가능성이 약간 더 높았습니다.
- 이유는 무엇일까요? 저자들은 사진이 이미 텍스트가 있는 문서 (예: 청구서) 처럼 보인다면, 로봇은 이미 텍스트를 읽기를 기대하고 있다고 설명합니다. 보이지 않는 정적은 로봇이 실제 텍스트 대신 "잘못된" 텍스트 (해커의 문구) 를 읽도록 살짝 밀어붙이는 것입니다. 사진이 개라면, 로봇은 털과 발바닥을 설명하기를 기대하므로 비밀 문구는 이야기 속에 어울리지 않습니다.
5. "초강력 저항" 로봇
가장 흥미로운 발견 중 하나는 BLIP-2라는 특정 로봇 모델과 관련이 있었습니다.
- 다른 세 로봇이 보이지 않는 정적으로 인해 100% 의 빈도로 혼란을 겪은 반면, BLIP-2 는 아예 눈치채지 못했습니다.
- 연구자들이 나중에 BLIP-2 를 사용하여 공격을 생성하는 데 사용하려 했을 때조차, 공격은 BLIP-2 에 대해 완전히 실패했습니다.
- 이유: 저자들은 BLIP-2 의 두뇌에 "병목 현상"이 있다고 제안합니다. 로봇은 읽기 전에 이미지를 작은 요약으로 압축합니다. 이 압축은 로봇이 그것을 볼 수 있기 전에 작은 보이지 않는 정적을 지워버리는 필터처럼 작용합니다. 두꺼운 벽을 통해 속삭임을 시도하는 것과 같습니다. 다른 로봇들은 그것을 들었지만, BLIP-2 의 벽은 너무 강했습니다.
요약
이 논문은 보이지 않는 공격이 비전 - 언어 모델을 확실히 혼란시킬 수 있다는 것 (기괴하거나 다른 답변을 하게 만듦) 은 인정하지만, 모델들을 특정하고 위험한 문구를 말하도록 강제하는 데는 매우 형편없다고 결론 내립니다.
"90 배 격차"는 로봇이 특정 URL 나 비밀번호를 말하도록 속여질까 봐 걱정한다면, 당신은 아마도 위험을 과대평가하고 있다는 것을 의미합니다. 로봇은 해커의 명령을 순종적으로 따르기보다는 혼란을 겪고 어리석은 말을 할 가능성이 훨씬 더 높습니다.
교훈: 당신이 읽었을지도 모르는 "60~80% 성공률"에 대해 당황하지 마세요. 그 숫자는 대부분 "장악"이 아닌 "혼란"을 세고 있습니다. 이러한 특정 공격의 실제 위험은 헤드라인이 시사하는 것보다 훨씬, 훨씬 낮습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.