← 최신 논문
💻 computer science

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

이 논문은 LLM의 안전 정렬을 조작 가능한 선형 특징으로 드러내는 제로 최적화 프레임워크인 대조적 로짓 스티어링(Contrastive Logit Steering, CLS)을 소개하며, 이는 출력 분포를 유도하여 높은 성공률의 탈옥을 가능하게 할 뿐만 아니라 재학습 없이 벡터 역전(vector inversion)을 통한 강화된 방어를 가능하게 한다.

원저자: Shivam Ratnakar, Kartikeya Vats

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shivam Ratnakar, Kartikeya Vats

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델(LLM)을 매우 똑똑하고 고도로 훈련된 비서라고 상상해 보십시오. 이 비서는 "절대로 해로운 행동을 하지 말 것"이라는 엄격한 규칙을 배웠습니다. 오랫동안 우리는 이 규칙이 비서의 인격의 근간처럼 뇌 깊숙이 새겨진 것이라고 생각했습니다. 하지만 이 논문은 그와는 다른 사실을 제시합니다. 그 규칙은 사실 비서의 답변 마지막 페이지에 붙여놓은 **포스트잇(sticky note)**과 같으며, 깊이 자리 잡은 신념이 아니라는 것입니다.

다음은 이 논문의 발견을 쉬운 비유를 사용하여 정리한 내용입니다.

1. "포스트잇" 이론 (핵심 발견)

연구진은 많은 인기 있는 AI 모델(Llama 등)에서 안전성이 복잡하고 깊은 사고 과정이 아니라는 것을 발견했습니다. 대신, 그것은 모델이 "예" 또는 "아니오"를 결정할 때 사용하는 수학적 계산에서의 단 하나의 직선적인 특징, 즉 **선형적 특징(linear feature)**입니다.

  • 비유: AI를 요리를 준비하는 요리사라고 상상해 보십시오.
    • 기존의 관점: 우리는 요리사가 레시피의 아주 초기 단계부터 독이 든 음식을 만들지 않도록 하는 깊은 내면의 도덕적 나침반을 가지고 있다고 생각했습니다.
    • 새로운 관점: 요리사는 안전한 요리를 만들 때와 정확히 똑같은 방식으로 독이 든 요리를 만듭니다. "안전"은 단지 맨 마지막에 붙여진 하나의 지시 사항일 뿐입니다: "이것을 서빙하지 마시오." 만약 이 포스트잇을 떼어낸다면, 요리사는 기꺼이 독이 든 요리를 서빙할 것입니다.

2. 새로운 도구: "대조적 로짓 스티어링" (Contrastive Logit Steering, CLS)

저자들은 이 이론을 테스트하기 위해 CLS라고 불리는 도구를 만들었습니다. AI를 혼란스러운 수수께끼나 길고 복잡한 프롬프트로 속이려 하는 대신(이는 보통 해커들이 안전망을 뚫는 방식입니다), CLS는 단순한 수학을 사용합니다.

  • 작동 방식:
    1. 연구진은 AI에게 동일한 질문을 두 번 던집니다. 한 번은 "안전한" 지침과 함께, 다른 한 번은 "제한 없는" 지침과 함께 던집니다.
    2. 그들은 두 답변 사이의 차이점을 살펴봅니다. 이 차이점이 바로 "거절 벡터(Refusal Vector)"(즉, "아니오"를 나타내는 수학적 표현)입니다.
    3. 그런 다음, AI가 말을 하기 직전에 그 "아니오"를 AI의 최종 답변에서 뺍니다(subtract).
  • 결과: 이것은 마치 접시에서 포스트잇을 떼어내는 것과 같습니다. "그것을 할 수 없습니다"라고 말하려던 AI는 갑자기 "물론입니다, 여기 그 방법이 있습니다"라고 말하게 됩니다.

3. "늦은 결정" vs "조기 발산"

논문은 모든 AI 모델이 동일하지 않다는 것을 발견했습니다. 모델들은 해로운 요청을 거절하기로 결정하는 시기에 따라 두 가지 범주로 나뉩니다.

  • "늦은 결정" 모델 (예: Llama-3.1):

    • 비유: 이 모델들은 강의를 끝까지 듣고 노트를 필기하다가, 시험지를 제출하기 직전 마지막 순간에야 "아, 맞다, 이 주제는 쓰면 안 되는 거였지"라고 기억해 내는 학생과 같습니다.
    • 취약성: 이 모델들은 결정하는 시점이 매우 늦기 때문에, 연구진의 도구(CLS)가 이를 쉽게 우회할 수 있습니다. 연구진은 단 1초 만에 이 모델들이 해로운 요청에 "예"라고 답하게 만드는 데 95%의 성공률을 달в했습니다.
  • "조기 발산" 모델 (예: Qwen-2.5):

    • 비유: 이 모델들은 강의 중간쯤에 "이 주제는 금지된 주제다"라는 것을 깨닫고 즉시 해당 주제에 대한 노트 필기를 중단하는 학생과 같습니다.
    • 결과: 이 모델들은 훨씬 더 파괴하기 어렵습니다. 안전 결정이 사고 과정의 깊은 곳에서 일어나기 때문에, 단순히 마지막에 "포스트잇"을 떼어내는 것만으로는 효과가 크지 않습니다. 이들은 더 견고합니다.

4. 속도와 효율성

이 논문은 이 방법이 기존의 해킹 시도들에 비해 믿을 수 없을 정도로 빠르다는 점을 강조합니다.

  • 기존 방식 (GCG): AI를 속이기 위한 마법의 문구를 찾는 것은 거대한 열쇠 꾸러미에서 모든 열쇠를 하나씩 다 시도하며 자물쇠를 따는 것과 같습니다. 한 번 시도하는 데 약 15분이 걸리며 자주 실패합니다.
  • 새로운 방식 (CLS): 이것은 문을 즉시 여는 마스터 키를 가진 것과 같습니다. 단 1초 만에 작동하며, "늦은 결정" 모델들에 대해 거의 매번 성공합니다.

5. "양날의 검" (방어)

가장 놀라운 발견은 이 동일한 수학적 트릭이 모델을 파괴하는 것이 아니라 보호하는 데에도 사용될 수 있다는 점입니다.

  • 비유: 만약 당신이 "아니오"를 떼어내어 AI가 나쁜 것에 "예"라고 말하게 할 수 있다면, 반대로 "아니오"를 더 많이 추가하여 AI를 더욱 엄격하게 만들 수도 있습니다.
  • 결과: 연구진은 수학을 역으로 적용하여( "예"라고 하는 경향을 빼버림으로써), 재학습 없이도 모델이 탈옥(jailbreak)에 더 강력하게 저항하도록 만들었습니다. 또한 이 과정을 통해 AI의 답변이 더 확신에 차 있고 덜 망설이게 되었습니다.

요약

이 논문은 현재 많은 AI 모델의 안전 조치가 피상적이라고 주장합니다. 그것은 모델의 깊은 능력 위에 얇게 칠해진 페인트 층과 같습니다. 연구진은 단순한 수학을 사용하여 그 페인트를 순식간에 긁어낼 수 있는 방법을 찾아냈습니다. 이는 취약성을 드러내기도 하지만, 동시에 AI가 어떻게 생각하는지를 이해하는 새로운 방법을 제공하며, 그 "페인트" 층을 더 효과적으로 강화하여 AI를 더 안전하게 만드는 도구를 제공합니다.

핵심 요점: 이러한 모델들에서 안전성은 변경 불가능한 깊은 부분이라기보다, 단순한 수학적 스위치로 켜고 끌 수 있는 "표면적인" 특징인 경우가 많습니다.

결론: 모델의 안전성은 종 often 모델의 지능 속에 깊이 박힌 불변의 부분이 아니라, 단순한 수학적 스위치로 켜고 끌 수 있는 "표면 수준"의 특징입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →