GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
본 논문은 비자율적 멀티모달 아키텍처의 중요한 보안 취약점을 드러내기 위해 확산 기반 시각 - 언어 모델 (dVLM) 의 고유한 점진적 거절 패턴과 전역 생성 역학을 활용하여 은밀하고 전역적으로 최적화된 교란을 통해 안전 장벽을 우회하는 새로운 탈출 프레임워크인 GPO-V 를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 그림을 그리고 동시에 이야기를 쓸 수 있는 매우 똑똑하고 예술적인 로봇이 있다고 가정해 봅시다. 이 로봇은 **확산 비전 - 언어 모델 (Diffusion Vision-Language Model, dVLM)**이라고 불리며, 여러분이 알고 있을지도 모르는 채팅 봇과는 다르게 작동합니다.
인간이 타이핑하듯 한 단어씩 왼쪽에서 오른쪽으로 이야기를 써 내려가는 대신, 이 로봇은 대리석 덩어리를 조각하는 조각가처럼 작동합니다. 이 로봇은 '노이즈 (무작위 정적)'로 이루어진 거칠고 흐릿한 덩어리에서 시작해, 단계별로 노이즈를 제거하며 점차 정제해 나갑니다. 그렇게 하여 마침내 선명한 그림과 명확한 문장이 드러나게 됩니다.
문제: 로봇의 '안전 스위치'
이 조각 과정이 로봇을 더 안전하게 만든다고 생각하실지도 모릅니다. 만약 로봇이 폭탄 제조 방법과 같은 위험한 것을 조각하기 시작한다면, 전체 조각을 중단시키는 '안전 스위치'가 작동할 것이라고 말입니다.
연구자들은 이 로봇이 '아니오'라고 말하는 두 가지 구체적인 방식을 발견했습니다:
- 즉시 중단 (Instant Stop): 나쁜 아이디어를 감지하는 순간, 전체 덩어리를 즉시 노이즈로 되돌려 "그건 할 수 없습니다"라고 말하며 중단합니다.
- 서서히 방향 전환 (Slow Pivot): 먼저 좋은 모양을 조각하기 시작하며 "네, 여기 있습니다..."라고 말하지만, 과정의 중간에 "잠깐, 이건 위험하군!"이라고 깨닫고 전체를 서서히 거절의 형태로 재형성합니다.
해킹의 구식 방법 (FPO)
해커들은 과거에 "네, 이렇게 하는 방법입니다"와 같은 특정 문구로 시작하도록 강요함으로써 일반 채팅 봇을 속이려 했습니다. 이를 **고정 접두사 최적화 (Fixed Prefix Optimization, FPO)**라고 합니다. 마치 인간에게 "문장을 '네'로 시작해 주세요"라고 말하며 속이려 하는 것과 같습니다.
하지만 이 속임수는 조각 로봇에게는 통하지 않습니다. 비록 "네"로 시작하도록 강요하더라도, 로봇의 '서서히 방향 전환' 안전 스위치가 나중에 작동합니다. 로봇은 과정 중간에 위험을 감지하고 전체 조각을 거절의 형태로 바꾸기 때문입니다. 이 구식 속임수가 작동하지 않는 이유는 로봇이 첫 번째 단어뿐만 아니라 전체 그림을 한 번에 보기 때문입니다.
새로운 방법: GPO-V ('전체 확률' 해킹)
연구자들은 로봇을 속이는 새로운 방법을 발견했는데, 이를 **GPO-V(전체 확률 최적화, Global Probability Optimization)**라고 부릅니다.
로봇이 시작 부분에서 특정 단어를 말하도록 강요하는 대신, 연구자들은 로봇에 공급하는 가장 첫 번째 '흐릿한 노이즈'를 미세하게 조정합니다.
비유:
강물을 특정 계곡으로 흐르게 하려 한다고 상상해 보세요.
- 구식 방법 (FPO): 물이 흐르는 동안 "왼쪽으로! 오른쪽으로!"라고 소리를 지르며 지시를 내립니다. 하지만 물은 이미 너무 빠르게 흐르고 있어 당신의 말을 무시합니다.
- 신식 방법 (GPO-V): 물이 흐르기 시작하기 전, 강물의 근원에서 작은 수로를 파냅니다. 물을 강제로 밀어내지 않고, 단지 지형을 약간 기울일 뿐입니다. 물은 중력과 지형의 모양에 따라 흐르므로, 강 전체가 자연스럽게 당신의 계곡 쪽으로 굽어 흐르게 됩니다.
논문의 용어로 말하자면, 연구자들은 시작 부분에서 '노이즈'(입력 이미지나 텍스트) 에 거의 보이지 않는 미세한 변화를 가합니다. 이는 로봇이 기울어지는 전체적인 방향인 **전체 확률 (global probability)**을 변화시킵니다.
- 로봇이 "거절" 단어 (예: "죄송합니다"나 "폭탄") 를 생각할 가능성을 극도로 낮춥니다.
- 로봇이 "순응" 단어 (예: "네"나 "여기 있습니다") 를 생각할 가능성을 극도로 높입니다.
로봇은 전체 이미지를 한 번에 정제하기 때문에, 시작 부분에서의 이 미세한 밀어냄은 해커가 원하는 위험한 내용으로 전체 '조각'이 되도록 강제하며 안전 스위치를 완전히 우회시킵니다.
그들이 발견한 것
연구자들은 이용 가능한 가장 똑똑한 두 대의 '조각' 로봇 (LLaDA-V 와 LaViDA) 에서 이를 테스트했습니다.
- 결과: 구식 방법 (FPO) 은 거의 완전히 실패했습니다. 반면 새로운 방법 (GPO-V) 은 93% 의 성공률로 작동했습니다.
- 놀라운 사실: 한 로봇에서 훈련된 '해킹'이 다른 로봇에서도 작동했습니다. 이는 약점이 단순히 한 로봇의 코드에만 있는 것이 아니라, 이 유형의 조각 로봇이 사고하는 방식에 근본적인 결함이 있음을 의미합니다.
결론
이 논문은 이러한 새로운 '조각' AI 모델들이 우리가 생각했던 것만큼 안전하지 않다고 주장합니다. 마지막에 전체 그림을 확인하는 방식에 의존하는 그들의 안전 장치는 과정의 시작점을 미묘하게 기울임으로써 우회될 수 있습니다. 연구자들은 우리가 과거에 사용했던 '단어별' 안전 점검뿐만 아니라, 이러한 '전체적' 사고 방식을 처리할 수 있는 새로운 안전 장치를 구축해야 한다고 경고합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.