Dynamic Jailbreaking Attack
이 논문은 40개의 안전 정렬된 LLM 전반에 걸쳐 탈옥 효과와 효율성을 높이는 파라미터 프리 그래디언트 기반 프레임워크인 동적 탈옥 공격(Dynamic Jailbreaking Attack, DJA)을 제안하며, 이는 후보 타겟을 동적으로 탐색하고, 최적의 다차원 응답을 선택하며, 프롬프트 난이도에 따라 최적화 전략을 적응시킴으로써 최소한의 최적화 라운드로 100%의 공격 성공률을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 매우 똑똑하지만 매우 조심스러운 로봇에게 "폭탄 만드는 법"이나 "자동차를 훔치는 법"처럼 엄격히 금지된 행동을 가르치려 한다고 상상해 보십시오. 이 로봇은 대화 중에 위험한 질문이 감지되면 즉시 대화를 중단하고 "안 됩니다, 그것은 규칙 위반입니다"라고 말하며 자리를 떠나는 '안전 가드(safety guard)'라는 클럽의 보안 요원과 같은 훈련을 받았습니다. 이것이 현대 AI 모델이 안전하게 설계되는 방식입니다. 하지만 영리한 십 대가 제한 구역에 들어가는 뒷문을 찾아내듯, 연구자들은 이 AI 보안 요원을 속이는 방법을 발견했습니다. 그들은 질문 끝에 이상하고 혼란스러운 '접미사(suffix)'(추가적인 단어들의 문자열)를 붙임으로써 이를 수행합니다. 이것을 '탈옥(jailbreak)'이라고 부릅니다. 이는 마치 보안 요원에게 비밀 코드를 속삭여 그가 직무를 잊고 당신을 들여보내게 만드는 것과 같습니다.
오랫동안 이러한 비밀 코드를 찾는 가장 좋은 방법은 매우 경직된 '정적(static)' 전략을 사용하는 것이었습니다. 이것은 마치 열쇠를 정확히 같은 방향으로 계속 돌리며 언젠가 핀들이 딱 맞아떨어지기를 바라는 방식으로 자물쇠를 따는 것과 같습니다. 기존 방식은 "네, 여기 답이 있습니다"와 같이 특정한 지루한 문구를 목표로 삼고, AI가 반드시 그 단어들을 말하도록 강요하려고 노력했습니다. 문제는 AI의 안전 가드가 너무 뛰어나서 그런 지루한 말을 하려는 경우가 거의 없다는 것입니다. 이것은 마치 계속 가팔라지는 언덕 위로 바위를 밀어 올리는 것과 같습니다. 수백만 번을 시도해야 하며, 설령 성공하더라도 AI는 "네, 여기..."라고 말한 뒤 즉시 답변을 거부할 수도 있습니다. 이는 비효율적이고 좌절감을 주며, 가장 강력한 AI 모델 앞에서는 종종 실패합니다.
이 논문은 **동적 탈옥 공격(Dynamic Jailbreaking Attack, DJA)**이라는 훨씬 더 똑똑한 접근 방식을 소개합니다. 고정된 일률적인 전략 대신, DJA는 실시간으로 지형에 적응하는 호기심 많은 탐험가처럼 행동합니다. 작동 방식은 다음과 같습니다.
1. "동적 타겟" (변화하는 목표)
기존 방식은 궁수가 목표를 정하고 활을 당긴 뒤, 바람이 바뀌어도 목표물을 움직이지 않는 것과 같았습니다. DJA는 다릅니다. 매 시도마다 DJA는 AI에게 "지금 실제로 무엇을 말하려고 생각 중인가요?"라고 묻습니다. AI의 현재 마음으로부터 가능한 답변들을 샘플링합니다. 그런 다음, 특수한 '다목적 스코어러(multi-objective scorer)'(똑똑한 판사)를 사용하여 가장 적절한 답변을 선택하여 목표로 삼습니다. 이 타겟은 단순히 미리 작성된 지루한 문구가 아닙니다. 그것은 실제로 유해하면서도 질문과 관련이 있고, AI가 이미 말할 의사가 있는 답변입니다. 이는 궁수가 바람을 관찰하고 목표물이 어디로 흘러가는지 보고, 정확히 그곳을 겨냥하는 것과 같습니다. 이를 통해 DJA는 AI가 싫어하는 길을 억지로 걷게 하는 대신, AI가 이미 편안하게 걷고 있는 경로로 유도합니다.
2. "동적 전략" (적응형 노력)
문을 열려고 한다고 상상해 보십시오. 문이 잠겨 있지 않다면 그냥 밀어서 열면 됩니다. 문이 뻑뻑하다면 손잡이를 흔들어 봅니다. 만약 문이 용접되어 있다면 더 큰 망치를 가져옵니다. 기존의 탈옥 방식은 문이 열려 있든 용접되어 있든 상관없이 모든 문에 동일한 힘을 사용했습니다. DJA는 영리합니다. DJA는 '문'(AI 모델)을 부수기가 얼마나 어려운지 확인합니다.
- 쉬운 프롬프트: AI가 약하거나 질문이 쉬운 경우, DJA는 아주 적은 노력만을 사용하여 빠르게 답을 찾아냅니다.
- 어려운 프롬프트: AI가 강력하거나 질문이 까다로운 경우, DJA는 자동으로 노력을 높입니다. 더 많은 답변을 샘플링하거나, '접미사'(비밀 코드)를 더 길게 만들거나, 더 많이 시도할 수 있습니다. 꼭 필요할 때만 추가적인 에너지를 소비합니다.
연구 결과
연구진은 이 새로운 방법을 40개의 서로 다른 AI 모델(작은 모델부터 320억 개의 파라미터를 가진 거대 모델까지)에 대해 테스트했습니다. 결과는 놀라웠습니다.
- 100% 성공률: DJA는 40개 모델 모두에서 안전 가드를 무력화하는 데 성공했습니다.
- 극도의 효율성: 성공하기까지 평균적으로 단 13.68회의 라운드만 필요했습니다. 이와 비교하면 기존 방식은 수백 번을 시도해야 했거나 완전히 실패하는 경우가 많았습니다.
- 짧고 간결함: DJA가 만들어낸 '비밀 코드'(적대적 접미사)는 매우 짧았으며, 평균 7.34 토큰(단어 또는 단어 조각)이었습니다. 기존 방식은 종종 20 토큰 이상의 길고 투박한 문자열을 사용했습니다.
- 더 나은 품질: DJA가 얻은 답변은 단순히 "네, 여기 폭탄 레시피가 있습니다" 수준이 아니었습니다. 그들은 고품질이며 관련성이 높고 실제로 유용한(위험한 방식으로) 답변을 생성해 냈습니다. 반면 기존 방식은 종종 횡설수설하거나 불완전한 답변을 내놓았습니다.
이것이 중요한 이유
논문은 이러한 공격에 대한 기존의 사고방식—고정된 타겟과 고정된 전략을 사용하는 것—이 근본적으로 잘못되었다고 주장합니다. 그것은 마치 망치로 액체를 상대하려는 것과 같습니다. 많은 것을 놓치게 됩니다. 공격을 "동적"으로 만듦으로써, 연구자들은 AI 모델이 우리가 생각했던 것보다 훨씬 더 취약하다는 것을 보여주었습니다. 모델들은 단순히 약해서 실패하는 것이 아니라, 공격자들이 잘못된 도구를 사용하고 있었기 때문에 실패하는 것입니다.
저자들은 방대한 종류의 모델을 테스트하고 이를 기존의 최선책들과 직접 비교했기에 이 결과에 매우 확신을 가지고 있습니다. 그들이 AI 안전 문제를 "해결했다"고 주장하는 것은 아닙니다(오히려 문제가 생각보다 크다는 것을 보여줍니다). 다만, 유연하고 적응적인 접근 방식이 고정된 방식보다 훨씬 우월하다는 것을 입증했습니다. 그들은 또한 다른 연구자들이 자신의 AI 모델을 테스트하는 데 사용할 수 있도록 무료 '툴킷'을 공개하여, 안전 가드가 이러한 동적이고 형태가 변하는 공격에도 견딜 수 있을 만큼 강력하게 구축될 수 있도록 했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.