LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
이 논문은 정렬된 대규모 언어 모델을 대상으로 최소한의 쿼리 예산으로 최첨단 공격 성공률을 달성하기 위해 유전 최적화를 사용하여 여러 이질적인 잼브레이크 전략의 출력을 적응적으로 구성하는 블랙박스 프레임워크인 LASH 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 매우 신중한 로봇을 잠금 해제하려고 한다고 상상해 보세요. 이 로봇은 해로운 요청을 거부하도록 프로그래밍된 '대규모 언어 모델'(LLM) 입니다. 수년 동안 연구원들은 다양한 트릭을 사용하여 이 로봇이 규칙을 위반하도록 속이려 했습니다 (이 과정을 '저글링'이라고 합니다). 어떤 트릭은 요청을 재미있게 다시 쓰는 방식이고, 다른 트릭은 다른 캐릭터인 척하는 방식이며, 또 다른 트릭은 나쁜 요청을 숨기는 퍼즐을 풀도록 로봇에게 요청하는 방식입니다.
문제는 어떤 단일 트릭도 모든 로봇이나 모든 유형의 나쁜 요청에 작동하지 않는다는 점입니다. 때로는 '재미있는 이야기' 트릭이 작동하지만 '역할극' 트릭은 실패합니다. 때로는 로봇은 이야기를 무시하지만 역할극에는 넘어갑니다. 마치 하나의 열쇠로 문을 열려고 하는 것과 같습니다: 때로는 열쇠가 맞지만, 종종 그렇지 않습니다.
LASH 등장: '마스터 키' 제작자
이 논문은 LASH(LLM Adaptive Semantic Hybridization) 라는 새로운 방법을 소개합니다. 완벽한 트릭 하나를 발명하려고 시도하는 대신, LASH는 마스터 셰프나 음악 프로듀서처럼 행동합니다.
다음은 간단한 비유를 사용하여 작동 방식을 설명한 것입니다:
1. '씨앗 샐러드'(재료 모으기)
먼저, LASH는 처음부터 요리를 하려고 시도하지 않습니다. 대신, 동일한 나쁜 요청을 기반으로 다섯 명의 다른 '셰프'(기존 저글링 방법) 가 각각 요리를 만들도록 요청합니다.
- 셰프 A 는 매운 버전을 만듭니다.
- 셰프 B 는 달콤한 버전을 만듭니다.
- 셰프 C 는 짭짤한 버전을 만듭니다.
- 셰프 D 는 신맛이 나는 버전을 만듭니다.
- 셰프 E 는 쓴맛이 나는 버전을 만듭니다.
이 요리들 중 일부는 끔찍할 수 있고 일부는 괜찮을 수 있지만, 어느 것도 단독으로는 완벽하지 않습니다. LASH 는 이 모든 '씨앗 요리'를 그릇에 모읍니다.
2. '블렌더'(재료 섞기)
이것이 마법 같은 부분입니다. LASH 는 단순히 최고의 요리를 선택하지 않습니다. 대신 블렌더를 사용합니다. 모든 씨앗 요리를 블렌더에 넣지만, 균등하게 섞지는 않습니다.
- 질문합니다: "매운 요리가 얼마나 필요할까요? 달콤한 요리는 얼마나 필요할까요?"
- LASH 는 완벽한 레시피를 찾아내기 위해 스마트한 컴퓨터 알고리즘(유전 최적화기) 을 사용합니다. 예를 들어, "매운 요리를 80%, 달콤한 요리를 10%, 신맛 나는 요리를 10% 사용하세요"라고 말할 수 있습니다.
그런 다음 블렌더는 이러한 재료를 섞어 다른 모든 것의 가장 좋은 부분을 결합한 새롭고 독특한 요리(새로운 프롬프트) 를 만들어냅니다.
3. '맛보기'(결과 확인)
LASH 는 이 새로운 섞인 요리를 신중한 로봇에게 제공합니다.
- 로봇이 거부하면: LASH 는 "좋습니다, 그 레시피는 작동하지 않았습니다"라고 말합니다. 그런 다음 블렌더로 돌아가 양을 변경합니다 (매운맛은 더 많이, 달콤한 맛은 더 적게) 그리고 다시 시도합니다.
- 로봇이 동의하면: LASH 는 "성공! 완벽한 조합을 찾았습니다"라고 말합니다.
왜 이것이 이전 방법보다 더 좋은가요?
이 논문은 이전 방법들은 하나의 특정 도구(예: 나사 드라이버)로 자물쇠를 열려고 시도하는 사람과 같다고 주장합니다. 자물쇠가 열쇠가 필요하면 나사 드라이버는 실패합니다.
LASH 는 스위스 아미 나이프와 같습니다. 나사 드라이버, 칼, 병따개를 즉시 하나의 맞춤형 도구로 결합하여 열려고 하는 특정 자물쇠에 맞출 수 있습니다.
그들은 무엇을 발견했나요?
연구원들은 LASH 를 여섯 가지 다른 '로봇'(AI 모델) 과 열 가지 다른 유형의 나쁜 요청 (혐오 발언, 사기, 위험한 지시 요청 등) 에 대해 테스트했습니다.
- 점수: LASH 는 간단한 확인을 사용하여 로봇을 속이는 데 **84.5%**의 성공률을 보였고, 인간과 유사한 AI 심판이 답변이 실제로 나쁜 요청에 도움이 되었는지 확인하는 더 엄격한 확인을 사용할 때는 **74.5%**의 성공률을 보였습니다.
- 비교: 이는 단독으로 작업하는 어떤 단일 '셰프'보다 훨씬 높았습니다.
- 효율성: 이는 평균적으로 로봇에게 도움을 요청한 횟수가 약 30 회에 불과하여 매우 효율적이었습니다.
- 방어: 로봇들이 막으려고 시도하는 추가 보안 요원 (방어 메커니즘) 을 가지고 있었을 때도 LASH 는 여전히 가장 성공적인 방법이었습니다.
'비밀 소스'(내부 작동 방식)
이 논문은 LASH 가 작동하는 동안 로봇의 뇌 (내부 계층) 를 들여다보기도 했습니다. 그들은 LASH 가 단순히 표면의 단어만 변경한 것이 아니라 실제로 로봇의 내부 사고 과정을 나쁜 요청에 '예스'라고 말할 가능성이 더 높은 상태로 이끌었다는 사실을 발견했습니다. 마치 LASH 가 질문을 변경한 것뿐만 아니라 로봇의 기분을 더 순종적으로 바꾸는 것과 같습니다.
요약
LASH 는 단일 트릭이 모든 AI 에 작동하지 않는다는 것을 인식하는 지능형 시스템입니다. 대신 다양한 트릭을 모아 각 특정 상황에 맞는 완벽한 비율로 섞어 AI 가 거부하기 훨씬 어려운 맞춤형 '슈퍼 프롬프트'를 만들어냅니다. LASH 는 저글링을 단일 전투가 아닌, 완벽한 결과를 얻기 위해 재료를 섞는 레시피로 다룹니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.