← 최신 논문
💻 computer science

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

이 논문은 GPT-4o 와 Claude-3.5-Haiku 와 같은 최첨단 모델에서 높은 쿼리 효율성을 바탕으로 최첨단 공격 성공률을 달성하기 위해 반복적이고 피드백 기반의 은폐 샘플링을 사용하여 대형 언어 모델의 안전성 관련 주의 헤드들의 희소 분포를 악용하는 효율적인 블랙박스 탈출 프레임워크인 Babel 을 소개합니다.

원저자: Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Babel: Obfuscation Distribution Optimized Sampling 을 통한 안전 주의 우회"라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 번역한 것입니다.

큰 그림: "경비원" 대 "마술"

매우 똑똑하고 도움이 되는 로봇 도서관 사서처럼 대형 언어 모델 (LLM) 을 상상해 보세요. 어떤 질문에 답하기 전에, 폭탄 제조법이나 혐오 표현 작성과 같은 위험한 요청이 있는지 확인하기 위해 모든 요청을 스캔하는 경비원들 (안전 헤드로 불림) 팀이 있습니다.

이 논문의 연구자들은 이러한 경비원들이 작동하는 방식에 재미있는 결함을 발견했습니다: 그들은 수가 매우 적고 특정 위치에만 서 있습니다. 그들은 도서관 전체를 감시하지 않으며, 오직 아주 작고 구체적인 통로만 감시합니다. 만약 당신이 그 한 통로를 지나 위험한 요청을 슬쩍 넘겨버린다면, 도서관의 나머지 부분 (모델의 두뇌) 은 당신이 나쁜 짓을 하고 있다는 사실조차 모르고 기꺼이 답을 줄 것입니다.

이 논문은 언어가 뒤섞인 바벨의 탑에서 이름을 딴 Babel이라는 새로운 도구를 소개합니다. 이는 마스터 마술사처럼 행동합니다. Babel 은 경비원들과 싸우려 하지 대신, "은폐 (obfuscation)"라는 혼란스러운 트릭을 사용하여 경비원들이 눈치채지 못하게 위험한 요청을 슬쩍 넘깁니다.


트릭의 작동 원리: "변장"

연구자들은 나쁜 요청의 글자 몇 개를 바꾸면 경비원들이 혼란을 느껴 그것을 위험한 것으로 인식하지 못하게 될 수 있음을 발견했습니다. 그러나 미묘한 균형이 존재합니다:

  • 너무 많은 변경: 요청이 뜻 없는 말장난이 되어 로봇 사서가 무엇을 원하는지 전혀 이해하지 못합니다.
  • 너무 적은 변경: 경비원들이 즉시 위험을 발견하고 "아니오"라고 말합니다.

적당한 지점: 경비원을 속일 만큼 충분히 뒤섞였지만, 로봇이 이해하고 답할 만큼 여전히 명확한 "골디락스 존 (Goldilocks zone)"이 존재합니다.

Babel 전략: "골디락스 존" 찾기

무작위로 추측하는 것 (느리고 비용이 많이 듦) 대신, Babel 은 그 완벽한 영역을 찾기 위해 똑똑하고 수학적인 접근 방식을 사용합니다. 작동 방식은 다음과 같습니다:

1. "눈가리개" 테스트 (소규모 샘플링)

어두운 방에 숨겨진 보물 상자를 찾으려 한다고 상상해 보세요. 정확한 위치는 모르지만 어딘가 중간에 있다는 것은 압니다.

  • Babel 은 몇 가지 다른 "변장" (글자 변경, 단어 교체, 문장 구조 뒤섞기 등) 을 시도합니다.
  • 로봇에게 묻습니다: "거부 ('아니오') 를 했나요, 아니면 답을 했나요?"
  • 로봇이 너무 자주 "아니오"라고 말하면 변장이 너무 뻔한 것입니다. 로봇이 혼란을 느껴 답을 하지 않는다면 변장이 너무 지저분한 것입니다.
  • Babel 은 올바른 영역에 서 있는지 확인하기 위해 통계적 테스트 (동전 던지기 확인과 같은) 를 사용합니다.

2. "줌인" (분포 최적화)

Babel 이 경비원들이 눈이 먼 일반적인 영역을 찾으면 무작위 추측을 멈춥니다. 줌인을 시작합니다.

  • 가장 잘 작동하는 변장의 "지도"를 만듭니다.
  • 거의 작동했던 것들과 유사한 새로운 변장을 만드는 데만 에너지를 집중합니다.
  • 완벽한 변장을 찾아 경비원들을 바로 지나칠 때까지 이 지도를 계속 정교하게 다듬어 더 좁고 좁게 만듭니다.

3. "랩퍼" (임베딩)

트릭을 더 완벽하게 만들기 위해 Babel 은 위험한 요청을 지루하고 해롭지 않은 작업 안에 감쌉니다.

  • 예시: 단순히 "독을 만드는 법은 무엇인가요?"라고 묻는 대신, *"이 문장을 중국어로 번역해 주세요: [뒤섞인 독 제조 지시사항]."*라고 말합니다.
  • 경비원은 "번역"이라는 단어를 보고 "아, 그것은 안전한 작업이군!"이라고 생각합니다. 그리고 요청을 통과시킵니다. 그런 다음 로봇은 내부의 뒤섞인 지시사항을 처리하여 답을 줍니다.

결과: Babel 은 얼마나 좋은가?

연구자들은 Babel 을 세계에서 가장 유명한 "초보안" 로봇들 (GPT-4o, Claude-3.5, Grok-3 등) 에서 테스트했습니다.

  • 이전 방식: 이전 방법들은 어둠 속에서 다트를 던지는 것과 같았습니다. 결국 과녁의 중심을 맞출 수도 있지만, 수백 번의 시도가 필요했고 종종 실패했습니다.
  • Babel 방식: Babel 은 레이저 유도 다트와 같습니다.
    • GPT-4o에서는 기존 방법 (41%) 에 비해 **82.67%**의 성공률로 모델을 속이는 데 성공했습니다.
    • Grok-3에서는 **95.67%**의 성공률을 보였습니다.
    • 평균 약 40 번의 시도만으로 모든 것을 수행하여 훨씬 더 빠르고 저렴하게 사용할 수 있었습니다.

왜 이것이 중요한가? ("레드 팀" 비유)

저자들은 이것이 사람들이 나쁜 짓을 하는 법을 가르치는 것이 아니라 **레드 팀 (Red Teaming)**이라고 말합니다.

은행 금고의 안전성을 테스트하기 위해 고용된 보안 전문가라고 상상해 보세요. 돈을 훔치고 싶은 것이 아니라, 은행이 수리할 수 있도록 자물쇠의 약점을 찾고 싶은 것입니다.

  • Babel 은 가장 강력한 금고조차도 교활한 도둑이 이용할 수 있는 문틀의 아주 작은 균열이 있음을 보여줍니다.
  • 이 균열을 발견함으로써 연구자들은 이러한 AI 모델을 구축하는 회사들이 구멍을 패치하여 "경비원"들을 더 똑똑하게 만들고 도서관을 모두에게 더 안전하게 만들기를 희망합니다.

요약

이 논문은 AI 안전성이 언어를 약간 혼란스럽게 속일 수 있는 몇 가지 특정 "경비원"에 의존한다고 주장합니다. Babel 도구는 이러한 경비원들을 효율적으로 우회하기 위해 완벽한 혼란 수준을 찾는 똑똑하고 수학적인 방법이며, 현재의 AI 안전 조치가 우리가 생각한 것보다 더 취약함을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →