← 최신 논문
💻 computer science

Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses

본 논문은 JBShield 재브레이크 방어 개념 기반 탐지의 구조적 결함을 악용하여 새로운 적응형 공격 (JB-GCG) 에 취약함을 입증하고, 새로운 공격과 이후의 적응형 공격 모두에 대해 거의 완벽한 탐지를 달성하는 보다 견고한 다층 표현 궤적 검증 (RTV) 방어를 제안합니다.

원저자: Kemal Derya, Berk Sunar

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kemal Derya, Berk Sunar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대형 언어 모델 (LLM) 을 고도로 훈련된 정중한 로봇으로 상상해 보세요. 우리는 이들에게 도움이 되도록 가르쳤지만, 위험하거나 나쁜 일을 요청받으면 "아니오"라고 말하도록도 가르쳤습니다. 이를 '정렬 (alignment)'이라고 합니다. 그러나 교활한 해커들은 이러한 로봇이 안전 규칙을 무시하도록 속이는 방법을 찾아냈습니다. 이러한 속임수들을 '자일브레이크 (jailbreak)'라고 부릅니다.

이 논문은 한 보안 요원, 한 명의 교활한 해커, 그리고 새로운 더 지능적인 보안 시스템에 관한 이야기입니다.

구식 경비: JBShield

연구자들은 최근의 보안 시스템인 JBShield를 먼저 살펴보았습니다. JBShield 를 클럽의 도어맨으로 생각하세요. 도어맨은 입구를 통과하기 전에 두 가지 특정 신분증을 확인합니다:

  1. "독성 (Toxic)" 신분증: 이 사람이 나쁜 행동을 하는 것처럼 보이나요?
  2. "자일브레이크 (Jailbreak)" 신분증: 이 사람이 속임수를 숨겨 넣으려는 것처럼 보이나요?

JBShield 에는 엄격한 규칙이 있습니다: 경보가 울리려면 두 가지 신분증 모두를 소지해야 합니다. 하나만 있거나 둘 다 없으면, 도어맨은 통과시켜 줍니다. JBShield 의 제작자들은 이 시스템이 완벽하여 공격을 100% 차단한다고 주장했습니다.

해커의 돌파구: JB-GCG

이 논문의 저자들은 JBShield 가 정말로 뚫을 수 없는지 테스트하기로 결정했습니다. 그들은 도어맨의 작동 방식을 완전히 이해한 상태에서, 시스템을 고치기 위해 약점을 찾는 '화이트햇 해커' 역할을 했습니다.

그들은 도어맨의 논리에 결함이 있음을 발견했습니다. 도어맨이 경보를 울리려면 두 가지 신분증 모두를 필요로 했기 때문에, 해커는 하나만 숨기면 된다는 사실을 깨달았습니다.

그들은 JB-GCG라는 새로운 공격을 개발했습니다. 완벽한 무죄의 모습을 보여주는 위장 ( "독성" 신분증 숨김) 을 하고 있지만, 비밀 병기 ( "자일브레이크" 신분증 활성화) 를 소지한 스파이를 상상해 보세요. 도어맨은 둘 다 확인해야 한다는 규칙 때문에, 무죄인 위장만 보고 스파이를 통과시킵니다.

결과: 해커는 원래 보안 시스템이 100% 안전하다고 주장했음에도 불구하고, 로봇이 나쁜 일을 하도록 속이는 데 53.4% 의 성공률을 거두었습니다. 이는 시스템이 일반적인 테스트에는 강해 보일지라도, 지능적인 적이 특정 규칙에 적응하면 무너질 수 있음을 증명했습니다.

새로운 해결책: RTV ("지문" 스캐너)

저자들은 해커가 도어맨의 두 가지 특정 검사를 속이는 데 능숙했지만, 해커는 또 다른 종류의 흔적을 남겼다는 사실을 깨달았습니다.

일반적인 사람이 질문을 할 때, 로봇의 뇌는 위에서 아래로 일관되고 예측 가능한 패턴으로 활성화됩니다. 반면, 해커가 로봇을 속이려고 할 때는 "독성" 신분증을 숨기기 위해 로봇의 뇌가 처음에는 다르게 작동하도록 강요하지만, 로봇의 내부 처리 과정이 결국 이를 망쳐서 패턴이 이상하고 일관성이 없게 만듭니다.

저자들은 **RTV (표현 궤적 검증, Representation Trajectory Verification)**라는 새로운 방어 시스템을 구축했습니다.

유추:

  • JBShield는 입구에서 사람의 얼굴과 신발을 확인하는 것과 같습니다. 얼굴이 좋으면 통과시킵니다.
  • RTV는 사람이 복도를 전체적으로 걸어가는 모습을 지켜보는 보안 카메라와 같습니다. 얼굴이나 신발만 보는 것이 아니라, 복도 시작부터 끝까지 **보행 (걸음걸이)**이 일관적인지 확인합니다.

일반적인 사람은 매끄럽게 걷습니다. 숨어 들어오려는 해커는 처음에 정체성을 숨기기 위해 절뚝거리지만, 복도를 더 걸어갈수록 절뚝거림이 심해지거나 변합니다. RTV 는 이러한 "절뚝거림" (불일치) 을 포착하여 해커를 잡습니다.

작동 원리:

  1. 로봇의 뇌 활동을 세 가지 다른 수준에서 관찰합니다 (복도의 시작, 중간, 끝을 살펴보는 것과 같습니다).
  2. 모든 수준에서 "거부" 신호 (로봇의 "아니오" 본능) 가 일관되는지 확인합니다.
  3. **마할라노비스 거리 (Mahalanobis distance)**라는 수학적 도구 ( "이상함 측정기"라고 생각하세요) 를 사용하여 패턴이 일반인의 것인지 해커의 것인지 판단합니다.

결과:

  • 해커의 새로운 기법 (JB-GCG) 에 대해 RTV 는 시도 횟수의 **100%**를 적발했습니다.
  • 이전 해킹 사례를 학습할 필요가 없었습니다. 단지 "정상"이 무엇인지 알기만 하면 되었습니다.

최종 대결: 해커가 새로운 시스템을 이길 수 있을까?

저자들은 여기서 멈추지 않았습니다. 그들은 더 지능적이고 강력한 공격으로 자신들의 새로운 시스템 (RTV) 을 깨뜨려 보았습니다. 해커에게 새로운 보안 카메라와 "이상함 측정기"에 대한 완전한 지식을 제공했습니다.

결과:

  • 해커는 여전히 시스템을 뚫을 수 있었지만, 그것은 매우 어려웠습니다.
  • 해커의 성공률은 53% 에서 **7%**로 급격히 떨어졌습니다.
  • 이 미미한 성공을 거두기 위해 해커는 이전보다 13 배 더 많은 컴퓨팅 파워 (에너지와 시간) 를 소모해야 했습니다.

해커가 실패한 이유는 무엇일까요?
저자들은 새로운 시스템이 해커에게 "긴장감"이나 "양비론 (catch-22)"을 만들어 낸다고 설명합니다. 정체성을 숨기기 위해 해커는 로봇의 뇌가 처음에 "정상"처럼 보이게 만들어야 합니다. 하지만 로봇을 나쁜 일을 하도록 속이기 위해서는 나중에 뇌가 "비정상"처럼 보이게 만들어야 합니다. 해커는 동시에 둘 다 할 수 없습니다. 마치 앞으로 걸으면서 동시에 뒤로 걷는 것과 같아서, 결국 갇히게 됩니다.

요약

  1. 구식 방어 (JBShield): 두 가지 특정 사항을 확인했습니다. 해커는 하나만 숨기는 우회로를 찾아냈습니다.
  2. 공격 (JB-GCG): 우회로를 악용하여 방어 시스템을 53% 의 확률로 무너뜨렸습니다.
  3. 새로운 방어 (RTV): 로봇의 "사고 과정"이 전체 시스템에 걸쳐 일관되는지, 한 지점이 아닌 전체를 확인합니다.
  4. 최종 판결: 새로운 방어는 훨씬 더 강력합니다. 거의 매번 해커를 잡으며, 이를 뚫기 위해서는 너무 많은 노력이 필요하여 대부분의 공격자에게는 비현실적입니다.

이 논문은 로봇의 사고 과정 중 한 시점에서의 안전성만 확인하는 것은 충분하지 않다고 결론 내립니다. 속임수를 잡아내려면 전체 여정을 지켜봐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →