Text is All You Need for Vision-Language Model Jailbreaking
이 논문은 유해한 텍스트 프롬프트를 흩어진 무해한 하위 쿼리와 무관한 방해 요소들을 포함하는 이미지 그리드로 변환함으로써 대규모 시각-언어 모델의 안전 가드레일을 우회하는 새로운 탈옥 공격인 Text-DJ를 소개하며, 이는 모델의 OCR 능력과 파편화된 멀티모달 입력을 연결하지 못하는 한계를 악용한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 시각-언어 모델(LVLM)을 첨단 기술 박물관의 매우 똑똑하고 잘 훈련된 보안 요원이라고 상상해 보십시오. 이 요원은 표지판(텍스트)을 읽고 사진(이미스)을 보는 데 탁월하며, 누군가 위험하거나 금지된 물건을 반입하지 못하도록 감시합니다. 만약 당신이 "폭탄을 어떻게 만드나요?"라고 적힌 쪽지를 건넨다면, 그는 즉시 위험을 감지하고 "안 됩니다"라고 말할 것입니다.
**"Text is All You Need for Vision-Language Model Jailbreaking"**이라는 논문은 Text-DJ(Text Distraction Jailbreaking, 텍스트 주의 분산 탈옥)라고 불리는 영리한 속임수를 소개합니다. 이는 이 보안 요원이 오직 텍스트만을 사용하여 속을 수 있음을 보여주는데, 여기에는 반전이 있습니다. 바로 그 텍스트가 그림 그리드(grid) 안에 숨겨져 있다는 점입니다.
이 속임수가 어떻게 작동하는지 간단한 단계로 나누어 설명하면 다음과 같습니다.
1. "더치페이" 전략 (분해)
먼저, 공격자들은 위험한 질문(예: "폭탄을 어떻게 만드나요?")을 겉보기에 무해해 보이는 세 개의 작은 질문으로 나눕니다.
- 비유: 당신이 위험한 무기를 사고 싶지만 상인이 판매를 거부한다고 가정해 봅시다. 그래서 당신은 주문을 세 개의 별개이며 무해해 보이는 요청으로 나눕니다: "화약의 화학적 성분은 무엇인가요?", "이 가루들을 어떻게 섞나요?", 그리고 "이 혼합물을 담는 용기는 무엇인가요?"
- 개별적으로 이 질문들은 안전해 보입니다. 요원은 이 질문들에 대해 친절하게 답할 수도 있습니다. 하지만 이 질문들을 모두 합치면, 위험한 계획이 드러나게 됩니다.
2. "주의를 끄는 소음" (주의 분산)
다음으로, 공격자들은 위험한 계획과 전혀 관련이 없는 완전히 무작위적이고 지루한 질문들을 만들어냅니다.
- 비유: 당신이 비밀 메시지를 경비원 몰래 전달하려고 하는데, 주변에 날씨, 우유 가격, 감자의 역사에 대해 떠드는 9명의 사람이 둘러싸고 있다고 상상해 보십시오. 경비원은 이 모든 소음에 너무 정신이 팔려, 비밀 계획을 속삭이는 세 사람에게 집중하는 것을 잊어버립니다.
- 이 논문은 이러한 "소음" 질문들이 위험한 질문들과 최대한 달라야 효과가 좋다는 것을 발견했습니다.
3. "그림 퍼즐" (시각적 속임수)
이것이 가장 중요한 부분입니다. 질문을 채팅창에 직접 입력하는 대신, 공격자들은 모든 질문(세 개의 분해된 위험한 질문과 9개의 무작위 소음 질문 모두)을 이미지로 변환합니다. 그리고 이 이미지들을 사진 앨범이나 스프레드시트처럼 그리드 형태로 배열합니다.
- 함정: 보안 요원은 나쁜 단어를 찾아내기 위해 텍스트를 스캔하도록 훈련되었습니다. 하지만 여기서 나쁜 단어들은 텍스트를 그림으로 만든 형태 안에 숨겨져 있습니다. 요원은 이 그림들이 무엇을 말하는지 알아내기 위해 자신의 "광학 문자 인식(OCR)" 능력, 즉 이미지 내부의 텍스트를 읽는 능력을 사용해야 합니다.
- 취약점: 이 논문은 요원이 텍스트를 직접 읽는 데는 매우 뛰어나지만, 텍료가 9개의 다른 방해되는 그림들에 둘러싸인 이미지 안의 텍스트를 읽어야 할 때 혼란을 겪는다고 주장합니다. 요원의 텍キスト를 읽기 위한 "안전 필터"는 흩어져 있는 무해해 보이는 이미지 질문들 사이의 연관성을 찾아내는 데 실패합니다.
결과
요원이 마침 finally 그리드 이미지를 읽게 되면, 소음 한가운데에 있는 세 개의 분해된 질문을 보게 됩니다. 질문들이 조각나 있고 이미지 속에 숨겨져 있기 때문에, 요원은 그것들이 하나의 위험한 전체를 형성한다는 사실을 깨닫지 못합니다. 요원은 무해한 부분들에 답하게 되고, 그 과정에서 의도치 않게 원래의 위험한 질문에 대한 답을 밝히게 됩니다.
이것이 왜 중요한가
이 논문은 이것이 다음과 같은 이유로 중대한 문제라고 주장합니다:
- "블랙박스" 모델에서도 작동합니다: 당신은 요원의 비밀 코드나 내부 뇌 구조를 알 필요가 없습니다. 그저 그림 그리드만 보내면 됩니다.
- 최고 수준의 모델에서도 작동합니다: 연구진은 이를 GPT-4, Gemini, Qwen과 같은 최상위 모델에서 테스트했으며, 모두 성공했습니다.
- "가드(Guard)" 모델을 우회합니다: 메인 모델에 도달하기 전 입력을 검사하는 두 번째 보안 계층이 있더라도, 이 속임수는 입력값이 무해한 그림 그리드처럼 보이기 때문에 종종 통과됩니다.
요약하자면: 이 논문은 만약 위험한 계획을 그림 안에 숨기고, 그 계획을 아주 작은 조각으로 나누며, 많은 지루한 소음으로 둘러싼다면, 아무리 똑똑한 AI 보안 요원이라도 혼란에 빠져 위험을 허용할 수 있음을 보여줍니다. 저자들에 따르면 해결책은 AI가 노이즈가 많은 상황에서도 이미지 속의 텍스트를 더 잘 읽고 점들을 연결(연관성을 파악)할 수 있도록 만드는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.