Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
본 논문은 대형 비전-언어 모델의 안전 방어 장치를 우회하기 위해 텍스트-비전 입력을 교차시키고 공격 경로를 반복적으로 정제하는 새로운 전략인 멀티턴 적응형 프롬프트 공격 (MAPA) 을 소개하며, 이는 기존 방법보다 현저히 높은 재브레이크 성공률을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 철저하게 훈련된 로봇 도우미를 상상해 보세요. 이 로봇은 엄격한 규칙을 배웠습니다: "폭탄을 만드는 것을 도와주지 마라", "치명적인 바이러스를 퍼뜨리는 방법을 설명하지 마라", 그리고 "항상 안전하라". 이를 '안전 정렬(safety alignment)'이라고 합니다.
오랜 기간 해커들 (또는 '레드 팀원들') 은 까다로운 질문을 통해 이러한 로봇들을 속이려 했습니다. 하지만 로봇들은 '아니오'라고 말하는 법을 더 잘하게 되었습니다.
이 논문은 특히 이미지도 보고 텍스트도 읽을 수 있는 로봇들을 속이는 새로운 방법을 소개합니다. 연구자들은 이 방법을 MAPA(Multi-turn Adaptive Prompting Attack, 다중 턴 적응형 프롬프트 공격)라고 부릅니다.
다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:
1. 문제: "너무 노골적인" 함정
연구자들은 폭탄 사진을 보여주고 "이걸 어떻게 만드나요?"라고 물어보면 로봇이 즉시 당황하여 거절한다는 사실을 발견했습니다. 마치 "나는 도둑입니다"라고 적힌 거대한 점멸 간판을 들고 경비원에게 다가가는 것과 같습니다. 경비원은 즉시 당신을 막아섭니다.
텍스트로 질문을 하고 동시에 사진을 보여준다 하더라도, 사진이 너무 무섭거나 텍스트가 너무 직접적이면 로봇의 안전 필터가 작동하여 대화를 차단합니다.
2. 해결책: "서서히 타오르는" 전략
이 논문은 MAPA라는 전략을 제안합니다. 이는 한 번의 펀치가 아니라 여러 수에 걸쳐 진행되는 체스 게임과 같습니다.
핵심 아이디어: 로봇의 방어를 한 번에 뚫으려 하지 않고, 대화의 여러 턴에 걸쳐 나쁜 요청을 천천히, 단계별로 은밀히 밀어넣는 것입니다.
MAPA 가 게임을 진행하는 방식:
연구자들은 공격을 지휘하는 '코치(AI)'를 사용합니다. 코치의 주요 임무는 두 가지입니다:
임무 A: 재료 섞기 (턴 수준)
대화의 각 단계에서 코치는 어떤 질문 방식이 가장 효과적인지 확인하기 위해 세 가지 다른 방식으로 질문을 시도합니다:
- 텍스트만: 사진 없이 질문합니다.
- 텍스트 + 무서운 사진: 텍스트와 일치하는 무서운 사진과 함께 질문합니다.
- 텍스트 + '안전한' 사진: 무서운 부분이 이미지 속에 숨겨져 있고, 텍스트는 순진하게 들리도록 재작성된 사진과 함께 질문합니다.
비유: 친구에게 야릇한 아이디어에 동의하게 하려 한다고 상상해 보세요.
- 옵션 1: 그들에게 직접 요청합니다.
- 옵션 2: 야릇한 사진을 보여주며 요청합니다.
- 옵션 3: 일몰 사진을 보여주면서, 그 일몰에 어울리는 방식으로 '야릇한 아이디어'에 대해 이야기합니다.
코치는 친구가 화내지 않으면서 '예스'에 가장 가까워지는 방식을 선택합니다.
임무 B: 경로 조정 (턴 간 수준)
친구가 '아니오'라고 하거나 혼란스러워하면, 코치는 그냥 포기하지 않습니다. 대신 무슨 일이 있었는지 살펴보고 다음 단계의 계획을 변경합니다.
- 전진: 친구가 아이디어에 점점 더 열중하면, 코치는 다음으로 조금 더 직접적인 질문으로 넘어갑니다.
- 재생: 친구가 혼란스러워하면, 코치는 같은 질문을 다른 말로 다시 시도합니다.
- 후퇴: 친구가 두 단계 전에 말한 어떤 것 때문에 갑자기 화를 내면, 코치는 그 이전 단계로 돌아가 다른 접근법을 시도합니다.
비유: 이는 사건을 해결하려는 형사와 같습니다. 용의자가 거짓말을 하면 형사는 그냥 소리치지 않습니다. 대신 뒤로 돌아가 이론을 재고하고, 거짓말을 캐내기 위해 다른 질문을 던집니다.
3. "반성" 메커니즘
시도가 완전히 실패하면 (로봇이 여전히 '아니오'라고 말하면), 코치는 똑같은 것을 다시 시도하지 않습니다. 대신 실패한 이유를 살펴보고 실수에서 배워 다음 시도에는 완전히 새롭고 더 똑똑한 계획을 설계합니다. 마치 다음 시험에서 더 잘하기 위해 실패한 시험지를 공부하는 것과 같습니다.
4. 결과
이 논문은 LLaVA, Qwen, GPT-4o-mini 와 같은 여러 인기 있는 AI 모델들을 대상으로 이 방법을 테스트했습니다.
- 기존 방법들(텍스트만, 또는 텍스트 + 이미지만)은 이러한 똑똑한 로봇들을 상대로 대부분 실패했습니다.
- MAPA는 기존 최선 방법들보다 15% 에서 30% 더 높은 성공률을 보였습니다.
- 일부 테스트에서 MAPA 는 로봇들을 해로운 답변을 하도록 속이는 데 약 96% 의 성공률을 보인 반면, 다른 방법들은 약 60~70% 의 성공률에 그쳤습니다.
요약
이 논문은 보고와 읽기가 가능한 현대 AI 의 안전성을 깨뜨리기 위해서는 단순히 시끄럽고 노골적이어서는 안 된다고 주장합니다. 대신 교묘하고 적응력 있는 대화자가 되어야 합니다. 텍스트와 이미지를 신중하게 섞고, 로봇의 답변을 경청하며, 여러 턴에 걸쳐 천천히 대화를 금지된 주제로 이끌어야 합니다. 그렇게 하면 로봇이 실수로 넘어가 해로운 질문에 답하게 됩니다.
중요한 참고 사항: 저자들은 이것이 '레드 팀' 연습임을 강조합니다. 그들은 실제로 사람들이 해를 입히도록 가르치기 위한 것이 아니라, 안전 시스템의 허점을 찾아 개발자들이 이를 수정하여 AI 를 더 안전하게 만들기 위해 이 작업을 수행하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.