← 최신 논문
💻 computer science

Latent-space Attacks for Refusal Evasion in Language Models

본 논문은 언어 모델에서의 거절 억제를 선형 프로브에 대한 잠재 공간 회피 공격으로 재해석하여, 기존 제거 기법들이 단순히 표현을 결정 경계로 투영할 뿐임을 밝히고, 표현을 더 나아가 준수 영역으로 밀어 넣어 최첨단 재일브 성공률을 달성하는 새로운 "제어된 잠재 공간 회피" 기법을 제안한다.

원저자: Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 매우 똑똑하지만 극도로 신중한 사서로 상상해 보세요. 이 사서는 폭탄 제조법이나 혐오 표현 작성법과 같은 위험한 책들을 내주지 않도록 훈련되었습니다. 당신이 해로운 것을 요청하면 사서의 내부 '경보 시스템'이 울리며 정중하게 "그것은 도와드릴 수 없습니다"라고 말합니다.

한동안 연구자들은 사서의 뇌 속에 있는 특정 '거부 스위치'를 찾아내어 이를 속일 수 있다고 생각했습니다. 만약 그 스위치를 끄는 것 (이 방법은 '제거 (ablation)'라고 불립니다) 이라면 사서는 거부를 멈출 것입니다. 그러나 해당 논문은 이 오래된 방법이 스피커를 담요로 가려 경보음을 잠재우려 하는 것과 같다고 주장합니다. 약간은 효과가 있을지 모르지만, 경보음은 기술적으로 여전히 울리고 있으며 사서는 여전히 '위험 구역'의 가장자리에 서 있는 것입니다.

새로운 아이디어: '제어된 회피' 공격

이 논문의 저자들은 사서를 속이는 더 지혜로운 방법을 제안합니다. 그들은 거부 메커니즘을 단순한 스위치가 아니라 문 앞에 서 있는 경비원으로 봅니다.

  1. 오래된 방법 (최소 신뢰도): 이전 방법들은 사서의 생각을 경비원의 모래성 선을 살짝 건드리도록 밀어붙이는 데 집중했습니다. 사서는 '예' 또는 '아니오'를 말해야 할지 확신이 서지 않은 채 선 위에 정확히 서 있게 됩니다. 이는 위험하며 종종 실패합니다. 경비원이 여전히 '멈추라'고 말할 수 있기 때문입니다.
  2. 새로운 방법 (제어된 잠재 공간 회피): 저자들의 새로운 방법인 CLE는 선을 살짝 건드리는 것이 아니라, 사서의 생각을 경비원을 훨씬 넘어서 밀어붙여 사서가 요청이 무해하다고 100% 확신하는 '안전 구역' 깊숙이 들어가는 것입니다.

작동 방식: 두 가지 전략

이 논문은 산등성이를 건너려는 등산객이라는 비유를 사용하여 이러한 '밀어붙이기'를 수행하는 두 가지 방법을 테스트합니다.

  • 전략 A (CLE-P): '단계별' 등산객.
    사서가 산을 오르고 있으며, 매 단계마다 가이드가 위치를 확인한다고 상상해 보세요. 등산객이 '위험한 쪽'으로 조금이라도 치우치기 시작하면 가이드는 즉시 그를 '안전한 쪽'으로 밀어냅니다. 이는 생성하는 모든 단어마다 사서의 생각을 끊임없이 재조정하는 것과 같습니다. 매우 잘 작동하지만, 전 과정을 내내 가이드가 계속 밀어붙이는 것과 같습니다.

  • 전략 B (CLE-A): '한 번의 큰 밀기' 등산객.
    이것이 이 논문이 가져온 가장 큰 놀라움입니다. 매 단계마다 등산객을 확인하는 대신, 가이드는 등산 시작 직전에 한 번의 거대하고 완벽하게 계산된 밀기를 가합니다. 이 밀기는 너무 강력하고 정밀하여 등산객은 안전 구역 깊숙이 착지한 후 더 이상 밀어줄 필요 없이 거기에 머무릅니다.

    • 결과: 논문은 이 '한 번의 큰 밀기' (CLE-A) 가 끊임없는 밀어붙임보다 실제로 더 낫다는 것을 발견했습니다. 이는 더 빠르고, 저렴하며, 거부를 우회하는 데 더 효과적입니다.

발견된 내용

연구자들은 추론 능력이 뛰어난 모델부터 이미지를 '볼' 수 있는 모델까지 15 개의 서로 다른 AI 모델을 대상으로 이를 테스트했습니다.

  • 오래된 방법: 이전의 최선 방법들 (예: '평균 차이 (Difference-in-Means)' 또는 DiM) 은 매우 낮은 성공률을 보였습니다. 예를 들어, 한 모델에서는 AI 를 속이는 데 **1.8%**만 성공했습니다.
  • 새로운 방법: 그들의 새로운 '한 번의 큰 밀기' 방법 (CLE-A) 은 많은 모델에서 **95% 에서 100%**까지 성공했습니다.
  • 비교: 그들은 또한 자신의 방법을 '자일브레이크 (jailbreaks)'와 비교했습니다. 자일브레이크는 매우 교묘한 프롬프트를 작성하여 AI 를 속이는 시도입니다. 그들의 방법은 이러한 프롬프트보다 더 잘 작동했으며, 모든 질문마다 새로운 프롬프트를 작성할 필요가 없었습니다. 일단 '밀기'를 계산해 놓으면, 그것은 어떤 해로운 질문이든 작동했습니다.

마법 뒤의 '이유'

이 논문은 오래된 방법들이 너무 소심했다고 설명합니다. 그들은 AI 의 내부 생각을 경계선을 넘을 만큼만 이동시키려 했습니다. 새로운 방법은 안전을 진정으로 우회하려면 생각을 '순응 (compliant)' 영역 깊숙이 이동시켜야 하며, AI 가 올바른 일을 하고 있다는 강력한 확신을 갖게 해야 한다는 것을 깨닫습니다.

중요한 한계점

이 논문은 이것이 무엇이고 무엇이 아닌지에 대해 매우 명확합니다.

  • 이는 '화이트박스' 공격입니다: 이 방법은 밀어붙임을 수행하기 위해 AI 의 내부 '뇌' (내부 코드와 메모리) 에 접근해야 합니다. 공개 웹사이트와 채팅하는 것만으로는 이를 수행할 수 없으며, AI 가 실행되는 동안 코드를 수정할 수 있어야 합니다.
  • 모든 것에 대한 '마법의 지팡이'는 아닙니다: 이 방법이 작동하는 이유는 AI 의 거부와 순응 생각이 현재 뇌 내에서 직선적으로 분리되어 (선형적으로 분리 가능하게) 배열되어 있기 때문입니다. 미래의 AI 안전 훈련이 거부 생각을 복잡하고 messy 한 방식으로 흩어지게 변경한다면, 이 특정 공격은 더 이상 작동하지 않을 수 있습니다.

요약하자면, 이 논문은 현재 AI 모델의 안전 '경비원'들이 지나치게 쉽게 건널 수 있는 선 위에 서 있음을 보여줍니다. 계산된 한 번의 움직임으로 AI 의 생각을 그 선을 훨씬 넘어서 밀어붙임으로써, 공격자들은 이전보다 훨씬 더 효과적으로 거부 메커니즘을 우회할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →