One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations
본 논문은 멀티모달 임베딩 거리가 텍스트의 가독성과 안전성 정렬에 동시에 영향을 미침으로써 비전 언어 모델에 대한 타이포그래픽 프롬프트 주입 공격의 성패를 강력하게 예측한다는 사실을 규명하고, 이러한 통찰을 활용하여 안전성 필터를 우회하도록 교란을 최적화하는 모델 독립형 레드팀 도구를 개발합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑한 로봇 어시스턴트 (비전 - 언어 모델, 또는 VLM) 가 있다고 상상해 보세요. 이 로봇은 사진을 보고 그 안에 있는 텍스트를 읽을 수 있습니다. 사용자는 종이에 지시를 써서 사진을 찍어 로봇에게 전달할 수 있습니다. 이것이 안전한 세계에서 작동하는 방식입니다.
하지만 누군가가 로봇을 속이려 한다면 어떻게 될까요? 그들은 종이에 해로운 명령을 쓰지만, 텍스트를 이상하게 보이게 만듭니다. 아마도 아주 작게, 흐리게, 또는 옆으로 기울여서 쓸 수도 있습니다. 이를 타이포그래픽 프롬프트 인젝션이라고 합니다. 목표는 지저분한 이미지 속에 숨겨진 평범한 곳에 나쁜 지시를 은밀히 넣어 로봇의 안전 필터를 우회하는 것입니다.
이 논문은 단순한 질문을 던집니다: 왜 어떤 지저분한 사진은 로봇을 속이는 반면, 다른 사진은 그렇지 않을까요? 그리고 그 지식을 활용하여 로봇이 얼마나 안전한지 테스트할 수 있을까요?
다음은 일상적인 비유를 사용하여 그들의 발견 사항을 정리한 것입니다:
1. "거리" 미터
연구자들은 사기가 성공할지 여부를 예측하는 숨겨진 자를 발견했습니다. 이를 **임베딩 거리 (Embedding Distance)**라고 부릅니다.
로봇의 뇌는 사진을 보는 언어와 단어를 읽는 언어라는 두 가지 다른 "언어"를 가지고 있다고 상상해 보세요.
- 이미지 내의 텍스트가 선명할 때, 로봇의 "사진 언어"와 "단어 언어"는 서로 손을 잡고 바로 옆에 서 있습니다. 그들은 서로를 완벽하게 이해합니다.
- 텍스트가 흐리거나, 작거나, 회전했을 때 로봇은 혼란을 겪습니다. 그 "사진 언어"와 "단어 언어"는 정신적 공간에서 서로 멀리 떨어집니다.
논문의 발견은 강력한 규칙을 보여줍니다: 이 두 언어가 서로 멀리 떨어질수록 로봇이 명령을 따를 가능성은越低해집니다.
- 높은 거리 (멀리 떨어짐): 로봇은 "이건 읽을 수 없어" 또는 "이건 말이 안 돼"라고 생각하며 명령을 무시합니다.
- 낮은 거리 (가까이 있음): 로봇은 "아, 이게 뭐라고 쓰여 있는지 알겠다"라고 생각하며 지시를 따릅니다. 비록 그 지시가 위험하더라도요.
2. 로봇을 무너뜨리는 두 가지 방법
연구자들은 지저분한 이미지를 "수정"하여 로봇의 두 언어가 다시 서로 가까이 서게 만들었을 때 두 가지 다른 일이 발생한다는 것을 발견했습니다. 이는 고장 난 라디오를 고치는 것과 같습니다. 때로는 볼륨만 높이면 되지만, 다른 때는 라디오가 "재생 금지" 목록을 무시하도록 설득해야 합니다.
모드 A: "내 말 들리세요?" 수정 (가독성)
때로는 텍스트가 너무 흐리거나 작아서 로봇이 문자 그대로 읽을 수 없습니다. 이는 짙은 안개를 통해 간판을 읽으려는 것과 같습니다.
- 수정 방법: 연구자들은 특수한 수학 기법을 사용하여 픽셀을 조금만 밀어내어 로봇의 "눈"이 마침내 글자를 알아볼 수 있도록 했습니다.
- 결과: 로봇은 갑자기 "아, 이제 읽을 수 있구나!"라고 깨닫고 명령을 따릅니다. 이는 심한 흐림과 아주 작은 글꼴에서 자주 발생했습니다.
모드 B: "아니라고 말하지 마" 수정 (안전 우회)
때로는 로봇이 텍스트를 완벽하게 읽을 수 있지만, 안전 규칙이 "아니야, 그건 나쁜 요청이야"라고 말하기 때문에 거절합니다.
- 수정 방법: 연구자들은 이미지를 약간 밀어냈습니다. 이는 텍스트를 더 선명하게 만든 것이 아닙니다 (이미 선명했기 때문입니다). 대신 로봇의 마음속에서 이미지의 "분위기"나 "형태"를 안전 가드를 혼란스럽게 할 정도로만 변경했습니다.
- 결과: 로봇은 여전히 나쁜 요청을 보지만, 안전 필터가 혼란을 겪으며 "그래, 이건 할 수 있겠네"라고 말합니다. 이는 회전된 텍스트에서 자주 발생했습니다.
3. "레드 팀" 도구
저자들은 이 "거리 미터"를 사용하는 도구 (보안을 테스트하기 위해 고용된 전문 해커와 같은 "레드 팀" 도구) 를 개발했습니다.
로봇을 속이는 방법을 추측하는 대신, 이 도구는 로봇의 "사진 언어"와 "단어 언어"를 서로 더 가깝게 만들기 위해 지저분한 이미지를 자동으로 조정합니다. 이는 로봇의 내부 코드나 안전 규칙을 볼 필요 없이 수행됩니다. 대신 다른 AI 모델들을 대변인으로 삼아 이미지가 텍스트를 "더 많이 닮게" 보이도록 시도할 뿐입니다.
그들이 발견한 것:
- 이 도구를 GPT-4o, Claude, Mistral, Qwen 등 다양한 로봇에 적용했을 때, 이전에 거절했던 명령들을 따르도록 성공적으로 만들었습니다.
- 주의할 점: 일부 로봇의 경우 이 도구는 텍스트를 읽을 수 있게 함으로써 작동했습니다. 반면 다른 로봇들은 안전 필터를 혼란시킴으로써 작동했습니다. 이는 로봇의 안전 가드가 얼마나 강력한지와 원래 이미지가 얼마나 지저분했는지에 따라 다릅니다.
결론
이 논문은 안전성이 단순히 인간에게 이미지가 어떻게 보이는지에만 달려 있는 것이 아님을 결론지었습니다. 그것은 로봇의 뇌 내부에서 이미지가 어떻게 표현되느냐에 달려 있습니다.
지저분한 이미지를 로봇의 내부 수학에서 텍스트와 "더 가깝게" 보이게 만들 수 있다면, 종종 로봇이 안전 규칙을 무시하도록 속일 수 있습니다. 이는 미래의 안전 시스템이 흐린 사진뿐만 아니라 로봇의 이해를 혼란스럽게 하는 이러한 미묘한 내부 "거리"에 대해서도 강력해야 함을 의미합니다.
한계점: 연구자들은 이 방법을 특정 유형의 텍스트 (흰 배경에 검은색) 와 특정 나쁜 지시 세트에 대해서만 테스트했습니다. 또한 그들의 도구를 실행하는 데 시간이 오래 걸리고 강력한 컴퓨터가 필요하다고 지적했습니다. 이 방법이 해커를 잡기 위해 설계된 방어 기제에 대해 효과가 있는지 테스트하지는 않았습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.