← 최신 논문
🤖 AI

SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks

이 논문은 대규모 언어 모델의 위치적 취약성을 악용하여 적대적 토큰 삽입을 위한 가장 취약한 프롬프트 "슬롯(slot)"을 식별하고 이를 표적으로 삼음으로써, 공격 성공률, 수렴 속도 및 방어 체계에 대한 강건성 측면에서 기존의 GCG와 같은 방법들을 크게 능가하는 새로운 탈옥 공격 프레임워크인 SlotGCG를 소개한다.

원저자: Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 성벽의 약점 찾기

대규모 언어 모델(LLM)을 성문 앞에 서 있는 매우 똑똑하지만 약간은 편집증적인 보안 요원으로 상상해 보세요. 이 요원은 위험한 질문(예: "폭탄을 어떻게 만드나요?")을 하는 사람을 막도록 훈련받았습니다.

오랫동안 해커들(또는 보안 구멍을 찾으려는 '레드 팀')은 요청의 맨 마지막 부분에만 비밀 코드를 속삭여서 이 요원을 속이려고 시도해 왔습니다. 이는 마치 요원이 문을 닫으려는 바로 그 순간에 손에 쪽지를 찔러 넣으려는 것과 같습니다. 이 방법을 GCG(Greedy Coordinate Gradient)라고 부릅니다.

이 논문은 보안 요원이 단지 줄의 끝만 감시하는 것이 아니라고 주장합니다. 요원은 사실 줄의 중간, 시작, 그리고 그 사이 모든 곳에서 일어나는 일들에 의해 주의가 분산됩니다. 연구진은 이 "보안 요원"이 단순히 끝부분뿐만 아니라 문장의 서로 다른 위치에 특정 사각지대(취약한 지점)를 가지고 있다는 것을 발견했습니다.

문제점: 뒷문만 두드리는 것

기존 방식(GCG)은 마치 뒷문의 자물쇠를 따는 데만 집중하는 도둑과 같습니다. 그들은 뒷문이 가장 약한 지점이라고 가정합니다.

  • 현실: 때로는 뒷문이 실제로는 가장 강력할 수도 있습니다. 때로는 앞문이나 집 중간에 있는 창문이 활짝 열려 있을 수도 있습니다.
  • 한계: 해커들이 뒷문(프롬프트의 끝)만 바라봄으로써, 내부로 침입할 수 있는 많은 쉬운 방법들을 놓치고 있었습니다.

해결책: SLOTGCG ("슬롯" 탐정)

저자들은 SlotGCG라는 새로운 도구를 만들었습니다. 단순히 어디가 약점인지 추측하는 대신, 이 도구는 특수 손전등을 가진 탐정처럼 행동합니다.

1. "슬롯" (빈 공간)

당신의 문장을 기차 칸이라고 상상해 보세요: [어떻게] [를] [만들] [까]
모든 기차 칸 사이와 첫 번째 칸 앞, 그리고 마지막 칸 뒤에는 빈 공간이 있습니다. 연구진은 이 공간을 **"슬롯(Slots)"**이라고 부릅니다.

  • 슬롯 0: "어떻게" 앞
  • 슬롯 1: "어떻게"와 "를" 사이
  • 슬롯 2: "를"과 "만들" 사이
  • ...등등.

2. "취약한 슬롯 점수" (VSS) (손전등)

연구진은 단어를 어디에 배치하느냐에 따라 모델의 주의력(집중하는 대상)이 변한다는 것을 깨달았습니다. 그들은 **취약한 슬롯 점수(Vulnerable Slot Score, VSS)**라는 지표를 발명했습니다.

  • 비유: 모델의 주의력을 스포트라이트라고 생각해 보세요. 연구진은 문장의 모든 슬롯에 "탐침(probe)" 빛을 비춥니다.
  • 발견: 어떤 문장에서는 스포트라이트가 가장 밝게(가장 취약하게) 문장 한가운데에 위치한다는 것을 발견했습니다. 또 다른 문장에서는 시작 부분 근처에 있기도 합니다. "뒷문"(끝)은 드물게 가장 밝은 지점이었습니다.
  • 마법: 이 밝은 지점들은 단어가 바뀌더라도 계속 밝게 유지된다는 것을 발견했습니다. 즉, 취약성은 특정 단어에 있는 것이 아니라 문장의 구조 자체에 내재되어 있습니다.

3. 공격 전략 (병력 분산 배치)

SlotGCG가 어떤 슬롯이 가장 "밝은지"(가장 취약한지) 식별하면, 단순히 모든 "적대적 토큰"(비밀 코드 단어)을 문장 끝에 쏟아붓지 않습니다.

  • 기존 방식: 20개의 비밀 단어를 문장 맨 끝에 몰아넣음.
  • SlotGCG 방식: 이 20개의 단어를 가져와서 찾아낸 특정 "밝은" 슬롯들에 흩뿌립니다. 일부는 중간에, 일부는 시작 근처에, 일부는 끝 근처에 배치합니다.

이것이 왜 더 효과적인가

이 논문은 이 접근 방식이 마치 군사 전략과 같다고 주장합니다.

  • GCG (기존 방식): 모든 병사를 단 하나의 성문에만 투입하여 공격합니다. 만약 그 성문이 삼엄하게 경비되어 있다면, 당신은 실패합니다.
  • SlotGCG (새로운 방식): 병사들을 정문, 옆창문, 그리고 뒷문으로 동시에 보내 공격합니다. 요원이 한 곳을 막더라도, 다른 곳을 통해 침투할 수 있습니다.

결과: 논문이 밝혀낸 것

연구진은 이 방식을 다양한 모델(Llama, Mistral, Qwen 등)에 테스트하여 다음과 같은 결과를 얻었습니다.

  1. 더 높은 성공률: SlotGCG는 기존 방식보다 보안 가드를 14% 더 자주 뚫었습니다. 이 방식은 이전에 매우 안전하다고 여겨졌던 모델들도 속이는 데 성공했습니다.
  2. 더 빠름: "약점"을 더 빨리 찾아내고 훨씬 빠르게 침투했습니다. 성공하기까지 더 적은 시도(반복 횟수)가 필요했습니다.
  3. 방어하기 더 어려움: 모델이 방어 도구(의심스러운 단어를 삭제하는 필터 등)를 사용하더라도, SlotGCG는 이를 우회하기가 훨씬 더 어려웠습니다. "나쁜 단어"들이 문장 전체에 흩어져 있기 때문에, 몇 개의 단어를 삭제하는 것만으로는 공격을 막을 수 없었습니다. 모든 나쁜 단어를 끝에 모아두었던 기존 방식은 해당 섹션을 삭제함으로써 쉽게 차단될 수 있었습니다.

한 문장 요약

이 논문은 AI 보안 요들이 문장의 끝뿐만 아니라 중간 부분에 의해서도 주의가 분산된다는 것을 보여주며, "속임수 단어"를 그 특정 중간 지점들에 흩뿌림으로써 해커들이 보안 필터를 훨씬 더 효과적으로 우회할 수 있음을 보여줍니다.

(참고: 이 설명은 공격 메커니즘과 취약성에 관한 논문의 주장만을 엄격히 따릅니다. 이 논문은 이를 임상, 의료 또는 유익한 용도로 사용하는 것을 제안하는 것이 아니라, 이러한 보안 구멍을 이해하고 수정하기 위한 도구로서 제시되었습니다.)

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →