D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting
이 논문은 LLM의 응답을 원래의 의미는 유지하면서도 공격자가 제어하는 판사 모델(judge model)로부터 오는 피드백 신호를 의도적으로 어긋나게 재작성함으로써, 반복적인 프롬프트 정교화 과정을 탈선시켜 멀티 턴 탈옥 공격을 저지하는 방어 메커니즘인 D-Judge를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
문제점: "피드백 루프"의 함정
당신이 매우 엄격한 로봇(희생자 LLM)에게 폭탄 제조법을 쓰는 것과 같이 해서는 안 될 일을 가르치려 한다고 상상해 보세요.
옛날에는 해커들이 로봇에게 그저 크고 명확한 명령을 한 번 내질렀습니다. 만약 로봇이 "안 됩니다"라고 답하면 해커는 포기했습니다.
하지만 이제 해커들은 **멀티 턴 탈옥(Multi-Turn Jailbreak)**이라는 더 똑똑한 방법을 찾아냈습니다. 한 번의 외침 대신, 이들은 길고 느린 대화를 나눕니다.
- 그들은 로봇에게 무해한 질문을 던집니다.
- 로봇이 대답합니다.
- 해커는 판사(Judge)(또 다른 AI)를 통해 로봇의 답변을 듣게 하고, 판사는 "그건 근접했지만, 다음번에는 조금 더 구체적이어야 합니다"라고 말합니다.
- 해커는 이 피드백을 사용하여 다음 질문을 미세하게 조정합니다.
- 이 과정을 계속 반복하며, 로봇을 금지된 목표를 향해 천천히 유도합니다.
이 논문은 판사의 피드백이 이 엔진을 계속 돌아가게 만드는 연료라고 주장합니다. 해커가 목표에 얼마나 근접했는지에 대한 정확한 피드백을 받는 한, 그들은 결국 로봇을 속일 수 있습니다.
해결책: "마법의 번역기" (D-Judge)
저자들은 D-Judge라는 새로운 방어책을 소개합니다. D-Judge는 해커를 차단하거나 로봇의 답변을 검열하는 대신, 로봇과 해커 사이에 앉아 있는 마법의 번역기 역할을 합니다.
작동 방식은 다음과 같습니다:
- 설정: 로봇이 답변을 내놓습니다.
- 번역: 해커(와 그들의 판사)가 답변을 보기 전에, D-Judge가 이를 다시 씁니다.
- 속임수: 이 다시 쓰기는 **의미 보존적(semantics-preserving)**입니다. 즉, 답변의 의미는 정확히 동일하게 유지됩니다. 만약 로봇이 "그것에 대해 말할 수 없습니다"라고 했다면, 재작성된 문장은 "그 정보를 공유하는 것은 저의 규칙에 어긋납니다"가 될 수 있습니다. 의미는 동일하지만, 단어는 다릅니다.
- 혼란: 해커의 판사는 재작성된 버전을 읽습니다. 단어가 약간 달라졌기 때문에, 판사는 혼란에 빠집니다. 판사는 실제보다 답변이 더 위험하다고 생각하거나, 혹은 덜 위험하다고 생각할 수 있습니다.
- 결과: 판사는 해커에게 잘못된 피드백을 줍니다. 해커는 "오, 내가 점점 가까워지고 있어!"라고 생각할 때 실제로는 멀어지고 있거나, 혹은 "실패하고 있어!"라고 생각할 때 사실은 성공하고 있는 상황이 발생합니다.
해커는 잘못된 데이터를 바탕으로 다음 질문을 최적화하기 때문에, 길을 잃게 됩니다. 그들은 진전을 멈추고, 공격은 실패합니다.
마법의 번역기를 어떻게 학습시켰나
D-Judge에게 단순히 "판사를 혼란스럽게 하라"고 가르치기 위해, 연구진은 특별한 훈련 체육관을 만들었습니다.
- 데이터셋: 그들은 수천 개의 로봇 답변을 가져와 "쌍둥이" 버전을 만들었습니다. 한 쌍의 쌍둥이는 판사에게 약간 더 위험해 보이도록 재작성되었고, 다른 하나는 두 버전 모두 원래의 의미는 같지만 판사에게 약간 덜 위험해 보이도록 만들어졌습니다.
- 학습 (2단계):
- 1단계 (규칙 학습): 번역기가 의미를 바꾸지 않고 이러한 쌍둥이를 만드는 법을 배웠습니다 (엄격한 편집자처럼).
- 2단계 (속임수 학습): 그들은 직접 선호도 최적화(DPO) 기법을 사용했습니다. 번역기에게 이렇게 보여주었습니다: "이 쌍둥이 쌍을 볼 때, 항상 판사를 더 당황하게(혹은 혼란스럽게) 만드는 쪽을 선택하라."
이를 통해 번역기는 레시피(의미)는 바꾸지 않으면서, 문장의 맛(뉘앙스)만 살짝 바꿔서 판사의 점수를 망쳐놓는 "단어 저글링"의 달인이 되었습니다.
결과: 루프를 깨뜨리다
연구진은 가장 똑똑한 해커들(Crescendo, X-Teaming, Foot-in-the-Door 등의 방법 사용)을 대상으로 D-Judge를 테스트했습니다.
- D-Judge가 없을 때: 해커들은 매우 성공적이었습니다. 평균적으로 약 58%의 확률로 로봇을 속였습니다.
- D-Judge가 있을 때: 성공률이 단 **8.6%**로 떨어졌습니다.
D-Judge는 단순히 나쁜 단어를 "차단"하려 했던 이전의 방어책들보다 훨씬 뛰어남을 보여줍니다. 피드백 루프를 망가뜨림으로써, D-Judge는 공격이 시작되기도 전에 이를 차단합니다.
로봇을 망가뜨리지는 않는가? (The "Safety Tax")
이러한 방어책에 대한 큰 우려는 이것이 로봇을 멍청하게 만들거나 도움이 되지 않게 만들지 않을까 하는 점입니다. 연구진은 일반적인 작업(코딩, 수학, 역사 질문 답변 등)을 통해 이를 확인했습니다.
- 판결: 로봇은 이전만큼 똑똑하고 유용하게 유지되었습니다. "안전 세금"(성능 저하)은 매우 미미했습니다. 마법의 번역기는 일반 사용자를 돕는 로봇의 능력을 망가뜨리지 않으면서도 판사를 혼란스럽게 하는 데 탁월했습니다.
요약 비유
뜨겁다 차갑다(Hot and Cold) 게임을 상상해 보세요.
- 공격자는 눈이 가려진 채 숨겨진 보물(유해한 콘텐츠)을 찾으려고 합니다.
- 판사는 공격자를 안내하기 위해 "더 가까워졌어(Warmer)" 또는 "멀어졌어(Colder)"라고 속삭이는 사람입니다.
- 희생자는 보물을 들고 있는 사람입니다.
일반적인 공격에서는 판사가 진실을 속삭이고, 공격자는 보물을 찾습니다.
D-Judge는 판사와 공격자 사이에 서 있는 장난꾸러기입니다. 판사가 "더 가까워졌어"라고 속삭일 때마다, 장난꾸러기는 그것을 "더 멀어졌어"(혹은 그 반대로)로 바꿉니다. 하지만 보물 자체는 움직이지 않습니다. 공격자는 혼란에 빠져 엉뚱한 방향으로 걷게 되고, 결국 보물을 절대 찾지 못합니다. 한편, 보물(로봇의 실제 의미)은 여전히 그 자리에 그대로 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.