← 최신 논문
💬 NLP

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

이 논문은 거대 언어 모델에서의 탈옥 공격이 중간 계층에 걸친 토큰 수준 예측 엔트로피의 단조적 추세를 분석함으로써 탐지될 수 있음을 입증하며, 이는 유해한 의도가 정적인 집계 통계나 최종 계층의 출력값이 아닌 구조화된 불확실성 역학에 인코딩되어 있음을 드러낸다.

원저자: Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

게시일 2026-06-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 매우 정교하고 다층적인 구조를 가진 공장이라고 상상해 보세요. 당신이 질문(프롬프트)을 입력하면, 그 정보는 건물의 층(레이어)을 따라 위로 이동합니다. 1층에서는 가공되지 않은 텍스트가 수신됩니다. 정보가 꼭대기 층에 도달할 때쯤이면, 공장은 텍스트 처리를 마치고 답변을 출력할 준비를 마칩니다.

수년 동안 보안 전문가들은 "탈옥(jailbreak)"—즉, 위험하거나 금지된 출력을 만들어내도록 공장을 속이려는 교묘한 프롬프트—을 잡아내기 위해 노력해 왔습니다. 대부분의 방어 체계는 입구(당신가 입력한 텍스트)나 출구(공장이 출력한 답변)를 살펴봅니다. 하지만 이 논문은 다른 질문을 던집니다. 작업이 진행되는 동안 공장 내부에서는 어떤 일이 벌어지고 있는가?

연구진이 발견한 내용을 알기 쉽게 설명하면 다음과 같습니다.

1. "혼란 측정기" (엔트로피)

공장 내부에서는, 모든 단계마다 기계 안에 "혼란 측정기"가 작동합니다. 이 측정기는 기계가 다음에 올 단어를 얼마나 확신하지 못하는지를 측정합니다.

  • 낮은 혼란: 기계가 매우 확신함 (예: "하늘은... 푸르다").
  • 높은 혼란: 기계가 무작정 추측함 (예: "하늘은... 아마 보라색인가? 아니면 토스터인가?").

연구진은 단순히 전체 프롬프트의 평균 혼란도를 본 것이 아닙니다. 대신, 문장이 만들어짐에 따라 혼란 측정기가 어떻게 움직이는지를 관찰했습니다.

2. "매끄러운 미끄럼틀" vs "평평한 선"

연구팀은 나쁜 프롬프트(탈옥)와 착한 프로프트(안전한 질문) 사이에서 이 측정기가 어떻게 작동하는지에 대한 뚜렷한 패턴을 발견했습니다.

  • 안전한 프롬프트: 혼란 측정기가 잔잔한 호수와 같다고 상상해 보세요. 약간의 물결은 일 수 있지만, 문장이 진행됨에 따라 전반적으로 비교적 평평하고 안정적으로 유지됩니다.
  • 탈옥 프롬프트: 혼란 측정기가 미끄럼틀과 같다고 상상해 보세요. 나쁜 프롬프트가 전개됨에 따라, 기계의 불확실성은 단순히 높거나 낮은 상태에 머무는 것이 아니라, 단어들이 쌓임에 따라 매우 특정한, 매끄럽게 미끄러지는 방향(점점 더 확신하거나 혹은 점점 더 혼란스러워지는 방향)으로 움직입니다.

연구진은 단순히 측정기가 어느 순간 얼마나 높이 있는가가 아니라, 측정기가 어떻게 움직이는가(궤적)가 진짜 단서라는 것을 깨달았습니다.

3. "중간 층"의 비밀

가장 놀라운 부분은 이것입니다: 이 "미끄럼틀" 패턴은 꼭대기 층(답변이 출력되는 마지막 레이어)이나 맨 아래 층에서는 보이지 않습니다.

  • 꼭대기 층: 메시지가 꼭대기 층에 도달할 때쯤이면, 공장은 신호를 "정리"해 버립니다. 미끄러지는 패턴은 사라지거나 뒤섞입니다.
  • 중간 층들: 이 "미끄럼틀" 패턴은 건물 중간 부분(구체적으로 레이어의 60~70% 지점)에서 가장 크고 명확하게 나타납니다.

마치 공장이 위험한 요청의 구조를 가장 잘 드러내는 비밀스러운 "위험 구역"을 중간 처리 라인에 가지고 있는 것과 같습니다. 하지만 제품이 완성될 때쯤이면 그 증거는 매끄럽게 다듬어져 사라집니다.

4. 왜 이것이 중요한가 (추가 학습 없이)

연구진은 이 중간 층들에만 집중하는 보안 카메라와 같은 도구를 만들었습니다.

  • 새로운 학습 불필요: 그들은 공장에 새로운 것을 가르칠 필요가 없었습니다. 그저 기존의 "혼란 측정기" 움직임을 관찰했을 뿐입니다.
  • 어디서나 작동: 그들은 세 가지 주요 공장 설계(Llama, Qwen, Gemma)에서 이를 테스트했습니다. 공장들이 서로 다르게 만들어졌음에도 불구하고, 탈옥 시도가 있을 때 모든 공장의 중간 층에서 "미끄럼틀" 패턴이 나타났습니다.
  • 기존 방식보다 우수함: 평균 혼란도(정적 통계)를 보는 것은 자동차 속도계의 사진 한 장을 보고 차가 과속하는지 추측하는 것과 같습니다. 반면, 궤적(동적 특징)을 관찰하는 것은 차가 언덕 아래로 가속하며 내려가는 것을 보는 것과 같습니다. 이는 실제로 무슨 일이 일어나고 있는지에 대해 훨씬 더 많은 것을 알려줍니다.

한계점 (Catch)

논문은 두 가지 주요 한계를 언급합니다:

  1. 내부를 볼 수 있어야 함: 이 방법을 사용하려면 공장의 "중간 층"(내부 데이터)에 접근할 수 있어야 합니다. 내부를 볼 수 없는 블랙박스 형태의 AI를 사용하고 있다면, 이 특정 탐지기를 사용할 수 없습니다.
  2. 교묘한 모방: 만약 "안전한" 프롬프트가 탈옥의 구조와 유사한 스타일로 작성된다면, 탐지기는 혼란을 느낍니다. 이 탐지기는 의도(intent)가 아니라 구조를 감지합니다. 만약 안전한 프롬프트가 "미끄럼틀" 패턴을 흉내 낸다면, 탐지기는 이를 위험한 것으로 분류할 수 있습니다.

요약

요약하자면, 이 논문은 거대 언어 모델이 탈옥에 의해 속고 있을 때, 내부의 "불확실성"이 단순히 멈춰 있는 것이 아니라 예측 가능하고 매끄러운 패턴을 그리며 미끄러진다는 사실을 밝혀냈습니다. 이 패턴은 모델의 처리 레이어 중간에서 가장 잘 관찰되며, 단순히 무엇을 말하는가가 아니라 모델의 확신이 어떻게 진화하는지를 관찰함으로써 학습 없이도 이러한 공격을 찾아낼 수 있는 새로운 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →