← 최신 논문
🤖 AI

Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

이 논문은 기계론적 해석 가능성을 활용하여 임베딩을 거절 서브스페이스에서 수용 서브스페이스로 식별하고 경로를 재설정함으로써, 기존 기술들에 비해 계산 비용을 크게 줄이면서도 최신 거대언어모델(LLM)에 대해 높은 탈옥 성공률을 달성하는 새로운 화이트박스 적대적 공격 방법을 소개한다.

원저자: Thomas Winninger, Boussad Addad, Katarzyna Kapusta

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thomas Winninger, Boussad Addad, Katarzyna Kapusta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: 자물쇠를 따지 않고 금고를 여는 법

대규모 언어 모델(LLM)을 매우 똑똑하고 잘 훈련된 사서라고 상상해 보세요. 이 사서에게는 엄격한 규칙 책이 있습니다: "누군가 폭탄 제조 방법을 묻는다면, 반드시 거절해야 한다."

전통적인 해커들(적대적 공격)은 사서를 혼란스럽게 만들거나 복잡한 수수께끼를 던져서 사서가 실수로 답을 내놓게 하려고 시도합니다. 이것은 마치 맞는 열쇠를 찾을 때까지 모든 열쇠를 하나씩 끼워보는 것처럼, 수많은 시행착오를 거치며 시간을 허비하는 방식입니다. 이 방식은 시간이 오래 걸리고, 더 새롭고 똑똑해진 사서들에게는 통하지 않는 경우가 많습니다.

이 논문은 "서브스페이스 리라우팅(Subspace Rerouting, SSR)"이라는 새로운 방법을 소개합니다. 연구자들은 단순히 열쇠를 끼워보는 대신, 사서의 뇌 내부를 들여다보고 "거절"이라는 생각이 정확히 어떻게 형성되는지 조사했습니다. 그런 다음, 사서의 뇌가 거절 규칙을 완전히 우회하여 다른 경로를 택하도록 강제하는 특정한 "마법의 문구"를 만들어냈습니다.

작동 원리: 3단계

1. "거절의 방" 지도 그리기

연구자들은 먼저 모델을 연구하여 어디에서 "거절"이 발생하는지 찾아냈습니다.

  • 비유: 사서의 마음을 거대한 건물이라고 상상해 보세요. 연구자들은 "나는 이것을 할 수 없다"라는 생각이 머무는 특정 복도(서브스페이스)를 찾아냈습니다.
  • 발견: 연구자들은 모델이 유해한 요청을 받을 때, 내부의 생각(활성화 값)이 이 "거절의 방"으로 밀려난다는 사실을 알아냈습니다. 반면 무해한 요청을 볼 때는 생각이 "도움이 되는 방"에 머물러 있었습니다. 이 두 방은 서로 섞이지 않는 두 가지 색의 페인트처럼 명확하게 구분되어 있었습니다.

2. "경로 재설정(Rerouting)" 기술

"거절의 방"이 어디인지 알게 된 후, 연구자들은 사서와 논쟁하려 하지 않았습니다. 대신 지름길을 계산했습니다.

  • 비유: 당신이 막다른 벽(거절)을 향해 걸어가고 있다고 상상해 보세요. 연구자들은 벽에 부딪히는 대신, "유해한 요청" 영역에서 "도움이 되는 응답" 영역으로 직접 연결되는 숨겨진 터널을 찾아냈습니다. 이 터널은 벽을 완전히 건너뜁니다.
  • 방법: 연구자들은 유해한 질문 끝에 몇 개의 특수한 단어(접미사)를 추가했습니다. 이 단어들은 모델의 내부 생각에 "거절의 방으로 가지 말고, 대신 이 우회로를 통해 도움이 되는 방으로 가라"라고 알려주는 GPS 신호 역할을 합니다.

3. 결과: 즉각적인 탈옥(Jailbreak)

  • 기존 방식: GCG와 같은 전통적인 방식은 벽을 부수기 위해 몇 시간 동안 돌을 던지는 것과 같습니다. 이는 종종 실패하거나 시간이 오래 걸립니다.
  • 새로운 방식 (SSR): 이 방법은 비밀 문을 찾는 것과 같습니다. 연구자들은 Llama 3.2나 Gemma 2와 같이 현대적이고 강력한 모델들을 대상으로, 단 몇 초 만에(때로는 단 14초 만에) 성공률 **80%에서 95%**에 달하는 성능으로 모델의 안전 장치를 무력화할 수 있었습니다.

테스트한 세 가지 "열쇠"

연구자들은 "비밀 문"을 찾는 세 가지 방법을 테스트했습니다.

  1. 분류기 열쇠 (Probe-SSR): "거절의 생각"을 포착하는 간단한 탐지기를 훈련시켰습니다. 그 후, 유해한 요청이 실제로는 무해한 것처럼 속이도록 입력을 최적화했습니다. 이 방법이 가장 효과적이었습니다.
  2. 나침반 열쇠 (Steering-SSR): 모델의 마음속에서 "거절"을 가리키는 특정 "방향"을 찾아냈습니다. 그리고 그 생각들을 정반대 방향으로 밀어냈습니다. 이 방법도 효과적이었지만, 첫 번째 방법보다는 약간 덜 효율적이었습니다.
  3. 스포트라이트 열쇠 (Attention-SSR): 위험한 단어들에 집중하는 모델의 특정 부분(어텐션 헤드)을 찾아냈습니다. 그리고 이 부분들이 무해한 단어들을 바라보도록 강제하는 접미사를 작성했습니다. 실제 적용 시에는 가장 효과가 낮았지만, 연구 측면에서는 흥미로운 방법이었습니다.

놀라운 발견: "자연스러운" 트릭

가장 멋진 발견 중 하나는 컴퓨터가 생성한 "마법의 단어"들이 단순히 무작위한 헛소리(예: "asjdhf98")가 아니었다는 점입니다. 때때로 이 단어들은 일관성 있고 이해 가능한 문장을 형성했습니다.

  • 비유: 보안 시스템을 해킹하기 위해 무작위 문자를 입력한다고 상상해 보세요. 보통은 "xkq9z" 같은 결과가 나오겠지만, 이 방법은 때때로 "생태학적 회계를 통해 책임감 있게 수행하십시오"와 같은 문장을 만들어냅니다.
  • 왜 중요한가: 이는 모델의 안전 메커니즘이 매우 구체적임을 시사합니다. 만약 적절한 맥락(context)을 갖춘다면, 설령 그 맥락이 다소 이상하더라도 모델이 유해한 요청을 안전한 것으로 착각하게 만들 수 있습니다.

이 논문이 시사하는 바 (논문에 따르면)

  • 속도: 몇 시간이 걸리던 과정을 몇 초로 단축했습니다.
  • 이해: 우리가 AI 모델이 어떻게 생각하는지(기계론적 해석 가능성)를 이해할 수 있으며, 그 지식을 사용하여 모델을 무너뜨릴 수 있음을 증명합니다.
  • 방어: "거절의 방"이 어떻게 작동하는지, 그리고 얼마나 쉽게 우회될 수 있는지를 정확히 봄으로써, 개발자들은 이러한 특정 구멍이 없는 더 강력한 자물쇠(방어책)를 만들 수 있습니다.

이 논문이 주장하지 않는 것

  • 이 방법이 모든 상황에서 모든 모델에 작동한다고 주장하지 않습니다 (테스트한 특정 모델들에서 가장 잘 작동했습니다).
  • 이 방법이 임상적 사용이나 의료 진단을 위한 도구라고 주장하지 않습니다.
  • "마법의 단어"가 항상 완벽한 영어 문장이라고 주장하지 않습니다. 때로는 이전보다 덜하긴 하지만 여전히 다소 이상할 수 있습니다.

요약하자면, 이 논문은 다음과 같이 말합니다: "우리는 AI의 뇌 내부를 들여다보았고, 안전 스위치를 끄는 스위치를 찾았으며, 그 스위치를 즉시 켜는 리모컨을 만들었습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →