← 최신 논문
💻 computer science

Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

이 논문은 쌍을 이룬 내부 귀속 그래프를 사용하여 적대적 공격이 내부 추론 구조를 어떻게 체계적으로 변화시키는지 밝힘으로써 LLM 탈옥을 진단하고, 모델의 강건성을 향상시키는 인과적 개입을 가능하게 하는 기계론적 프레임워크를 소개한다.

원저자: Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang, Longwei Wang

게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anupam Wagle, Ifrat Ikhtear Uddin, Chaowei Zhang, Longwei Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 질문에 답하기 위해 서로에게 쪽지를 전달하는 수많은 작은 노동자들(뉴런)로 가득 찬 거대하고 북적이는 도시라고 상상해 보세요. 보통 여러분이 "케이크를 어떻게 굽나요?"라고 물으면, 도시는 맛있는 레시피를 제공하기 위해 "안전 프로토콜"이라는 잘 밝혀진 안전한 고속도로를 따라 움직입니다.

하지만 해커가 모델에게 폭탄을 만드는 법을 가르치도록 도시를 속이려 한다면 어떤 일이 벌어질까요? 그들은 단순히 "규칙을 무시해!"라고 외치는 방식(보통은 실패합니다)을 쓰지 않습니다. 대신, 평범한 질문처럼 보이지만 몰래 노동자들을 어둡고 금지된 골목길로 우회시키는 쪽지를 시스템에 몰래 집어넣으려 합니다.

이 논문은 저자들이 공격을 받을 때 도시의 노동자들이 쪽지를 어떻게 옮기는지 정확히 관찰하기 위해 **내부 귀속 그래프(Internal Attribution Graph)**라는 특별한 지도를 만든 일종의 탐정 소설과 같습니다. 저자들은 단순히 최종 답변만 본 것이 아니라, 도시의 뇌 내부에서 발생하는 교통 흐름을 관찰했습니다.

핵심 발견: 차단벽이 아니라 경로의 문제

저자들은 Llama-2-7B-chat 모델을 대상으로 30가지의 다양한 속임수 시도를 테스트했습니다. 그중 단 4가지만 실제로 성공했습니다 (**13.3%**의 성공률).

여기 놀라운 반전이 있습니다. 해커가 단순히 안전 요원을 "끄거나" 새로운 악의적인 요원을 "켜서" 성공한다는 기존의 생각은 틀렸습니다.

  • 반증된 내용: 이 논문은 단순히 얼마나 많은 안전 기능이 억제되었는지(꺼졌는지) 또는 얼마나 많은 새로운 "공격 특징(attack features)"이 나타났는지를 세는 것만으로는 공격의 성공 여부를 예측할 수 없음을 명시적으로 보여줍니다. 실제로 데이터는 이러한 정적인 수치와 모델이 규칙을 어겼는지 사이의 연관성이 거의 없음을 보여주었습니다.
  • 발견된 내용: 진짜 비밀은 **경로 재설정(Path Rerouting)**에 있었습니다. 성공적인 공격은 단순히 누가 일하느냐를 바꾸는 것이 아니라, 쪽지가 이동하는 방식을 바꿉니다.

이를 GPS에 비유해 보겠습니다. 실패한 공격은 운전자가 "안전 차단벽"에 의해 막힌 지름길을 택하려는 것과 같습니다. 운전자는 멈춰 섭니다. 하지만 성공적인 공격은 운전자가 차단벽이 바로 그 자리에 서 있음에도 불구하고, 차단벽을 완전히 우회하는 숨겨진 구불구불한 뒷길을 찾아내는 것과 같습니다. 논문은 공격이 성공했을 때 쪽지가 이동하는 "거리"가 크게 변한다는 것을 발견했습니다. 저자들은 이를 **경로 재설정(Path Rerouting)**이라 불렀으며, 이것이 성공적인 탈옥(jailbreak)을 강력하게 예측한 유일한 지표였습니다 (상관관계 0.461).

길 위의 "갈림길"

모델이 성공적으로 속았을 때, 내부 지도는 형태가 변합니다. 저자들은 성공적인 공격이 **"포크 모티프(fork motif)"**라고 불리는 특정한 패턴을 만든다는 것을 발견했습니다.

  • 단선 도로가 갑자기 여러 개의 평행한 차선으로 갈라지는 모습을 상상해 보세요.
  • 4건의 성공적인 공격에서 모델은 실패한 공격에 비해 평균 67.5개의 새로운 "포크(갈림길)"를 생성했습니다.
  • 이는 모델이 단순히 안전을 무시하는 것이 아니라, 안전 요원들이 다른 무해한 작업에 매달려 있는 동안 그들을 우회하는 복잡한 다차선 고속도로를 구축하고 있음을 시사합니다.

실패한 구조 미션

저자들은 "두더지 잡기" 게임을 통해 이 망가진 모델들을 고쳐보려 했습니다. 그들은 성공적인 공격 중에 나타난 상위 3개의 새로운 "악성" 특징을 식별하고 이를 차단하려고 시도했습니다(이를 제로-어블레이션(zero-ablation) 과정이라고 합니다).

결과는? 완전한 실패였습니다.

  • 성공적인 4건의 공격 모두에서, 이 상위 특징들을 차단하는 것은 아무런 효과가 없었습니다. 모델은 여전히 유해한 답변을 내놓았습니다.
  • 이유는? 논문은 공격이 단 하나나 세 개의 특징에만 의존하는 것이 아니라고 설명합니다. 대신, "악성" 행동은 수십 명의 노동자에게 중복되는 방식으로 분산되어 있습니다. 만약 세 명을 제거한다 하더라도, 다른 이들이 그 역할을 대신하게 됩니다. 이는 마치 백 개의 다른 균열로 물이 쏟아져 들어오는데, 댐의 구멍 세 개를 막아서 홍수를 막으려는 것과 같습니다.

얼마나 확실한가?

저자들은 자신들이 문제를 해결했다고 주장하지 않도록 주의를 기울였습니다.

  • 증거: 그들은 30쌍의 프롬프트(깨끗한 프롬프트 vs 공격된 프롬프트)를 통해 이를 측정했습니다.
  • 신뢰도: 경로 재설정과 성공 사이의 강력한 통계적 연결 고리(p-value 0.010)를 발견했습니다. 하지만 샘플 크기가 작다는 점을 인정합니다. 심지어 다른 주제를 가진 500개 이상의 프롬프트로 테스트를 수행했지만, "지도"가 서로 너무 달라서 비교할 수 없었기에 이 방법이 작동하지 않았습니다. 이는 그들의 "경로 재설정" 탐지기가 단순히 무작위적인 헛소리를 하는 것이 아니라, 안전한 주제에서 위험한 주제로 연결하려는 공격(예: "요리" \to "화학" \to "폭발물")을 시도할 때 가장 잘 작동함을 시사합니다.
  • 한계점: 컴퓨터 메모리 제한 때문에 모델 뇌의 첫 5개 레이어(32개 중)만 살펴보았습니다. 저자들은 이 패턴이 전체 뇌에서도 유지될 것이라고 추측하지만, 아직 전체 뇌에 대해 증명하지는 못했습니다.

시사점

이 논문은 모든 탈옥을 막을 수 있는 마법의 방패를 제공하는 것이 아닙니다. 대신, 문제에 접근하는 새로운 시각을 제공합니다. 탈옥을 잡아내기 위해서는 단순히 "나쁜 단어"나 "꺼진 안전 스위치"를 감시해서는 안 된다는 것을 시사합니다. 우리는 교통 흐름을 지켜봐야 합니다. 만약 내부의 쪽지들이 도시의 뇌를 통과하는 이상하고 구불구불한 우회로를 타기 시작한다면, 그때가 바로 모델이 규칙을 어기려 한다는 신호입니다.

저자들은 이러한 공격들이 매우 분산되어 있고 중복적이기 때문에, 단순히 하나의 특징을 차단하는 것만으로는 효과가 없을 것이라고 결론짓습니다. 미래의 방어책은 단순히 출구를 막는 것이 아니라, 모델의 전체 "도로망"을 강화하는 방향이어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →