← 최신 논문
💻 computer science

Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

본 논문은 잠재 표현 내에서 지속적이고 희소한 '거부 궤적'을 인과 추적을 활용해 식별함으로써 종단 거부 신호를 성공적으로 억제하는 공격에 대해 강력한 제이브레이크 탐지 (>90% 성공률) 를 달성하는 추론 시 탐지기인 SALO 를 제안한다.

원저자: Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"거부 역학 추적"이라는 논문을 쉬운 언어와 일상적인 비유로 설명합니다.

큰 문제: "마지막 말"의 함정

클럽의 경비원 (AI 모델) 을 상상해 보세요. 누군가 위험한 물건 (해로운 요청) 을 몰래 들여보내려 하면, 경비원은 보통 입구에서 "아니오, 들어갈 수 없습니다"라고 말합니다.

오랫동안 연구자들은 경비원의 "아니오"가 대화의 끝에서만 이루어지는 단일하고 정적인 결정이라고 생각했습니다. 경비원이 말을 하기 직전의 마지막 생각만 확인하면 나쁜 요청을 거부하려는지 알 수 있다고 믿었던 것입니다.

이 논문은 이것이 잘못되었다고 주장합니다. 마치 영화의 마지막 프레임만 보고 영화를 이해하려는 것과 같습니다. 이 논문은 "아니오"라고 말하는 결정이 끝의 한 순간이 아니라, 과정 초기에 일어나는 여정이라고 제안합니다.

발견: "거부 궤적"

연구자들은 나쁜 요청을 처리할 때 AI 의 뇌 내부에서 정확히 무슨 일이 일어나는지 관찰하기 위해 **인과적 추적 (Causal Tracing)**이라는 특수 도구를 사용했습니다 (이를 "시간 여행을 하는 탐정"이라고 생각하세요).

그들은 AI 가 위험한 것 (예: "폭탄 만드는 방법") 을 보았을 때, 거부하기로 결정하기 위해 끝까지 기다리지 않는다는 사실을 발견했습니다. 대신 위험한 단어를 본 직후 즉시 "아니오" 신호를 구축하기 시작합니다.

  • 비유: 복도를 걷고 있다고 상상해 보세요. "위험" 표지판 (해로운 단어) 을 보자마자 뇌는 즉시 멈추기 위해 준비하기 시작합니다. 근육이 긴장하고 심박수가 변하며 탈출구를 찾기 시작합니다. 이는 복도 끝에 도달하기 전에도 일어납니다.
  • 발견: 이 논문은 이를 **"거부 궤적"**이라고 부릅니다. 이는 초기에 시작되어 AI 의 여러 계층을 통과하는 특정한 숨겨진 활동 경로입니다.
  • 반전: 해커들이 AI 를 속이려 할 때 (자일브레이크 사용), 종종 경비원의 입구에서의 최종 "아니오"를 침묵시키기에 성공합니다. 하지만 경비원의 뇌가 "위험" 표지판을 처음 보았을 때 이미 긴장하고 멈추기 위해 준비하기 시작했다는 사실은 지울 수 없습니다. 최종 출력이 "예"로 강요되더라도 그 초기 신호는 여전히 존재합니다.

해결책: SALO ("코를 맡는 개")

이 발견을 바탕으로 저자들은 SALO(Sparse Activation Localization Operator) 라는 새로운 탐지기를 구축했습니다.

  • 작동 원리: AI 가 끝에서 "아니오"라고 말하는지 기다리는 대신, SALO 는 코를 맡는 개처럼 대화의 중간을 돌아다니며 위험한 단어가 나타난 직후 발생하는 특정 "긴장" 패턴 (거부 궤적) 을 찾습니다.
  • 더 나은 이유:
    • 기존 방법은 경비원의 최종 답변을 확인하는 것과 같습니다. 해커가 경비원을 속여 "예"라고 말하게 하면, 기존 방법은 모든 것이 안전하다고 생각합니다.
    • SALO는 대화 중간에 경비원의 몸짓을 봅니다. 해커가 끝에서 경비원을 강제로 "예"라고 말하게 하더라도, 경비원의 몸짓 (숨겨진 궤적) 은 여전히 "아니오"를 말하려 했음을 보여줍니다.

중요성 (결과)

이 논문은 복잡한 속임수를 사용하여 안전 필터를 우회하려는 매우 영리한 해커들을 상대로 SALO 를 테스트했습니다.

  1. 해커들을 이기다: 해커들이 AI 를 "예"라고 말하게 강요하기 위해 혼란스러운 코드나 길고 교묘한 문장과 같은 고급 속임수를 사용했을 때, 기존 탐지 방법은 완전히 실패했습니다 (성공률 0%). 반면 SALO 는 거의 매번 잡아냈습니다 (90% 이상 성공).
  2. Zero-Shot 학습: 가장 놀라운 점은 SALO 가 이러한 특정 해커 속임수에 대해 훈련될 필요가 없었다는 것입니다. SALO 는 일반적이고 안전한 대화에서 거부의 "형태"를 학습했습니다. "거부 궤적"은 AI 가 생각하는 방식의 근본적인 부분이므로, SALO 는 이전에 본 적이 없는 공격에서도 이를 찾아낼 수 있습니다.

요약 비유

AI 를 안전 브레이크가 장착된 자동차로 생각하세요.

  • 기존 관점: 우리는 운전이 끝날 때 브레이크 페달만 보았습니다. 운전자가 페달을 밟으면 차가 멈춘다는 것을 알았습니다. 해커가 페달을 테이프로 고정하면 우리는 차가 안전하다고 생각했습니다.
  • 새로운 관점 (이 논문): 우리는 운전자가 절벽을 보자마자 엔진이 특정 소음을 내고 센서가 켜진다는 사실을 깨달았습니다. 해커가 브레이크 페달을 테이프로 고정하더라도 엔진 소음과 센서 점등 (즉, 거부 궤적) 은 여전히 발생합니다.
  • SALO: 특정 엔진 소음을 듣고 해당 센서 점등을 확인하는 장치입니다. 브레이크 페달이 테이프로 고정되어 있더라도 차가 위험에 처해 있음을 압니다.

언급된 한계

저자들은 아직 할 수 없는 것에 대해 솔직합니다:

  • 해커가 AI 가 그것이 위험하다는 것조차 이해하지 못하게 만드는 너무 복잡한 코드 (예: 비밀 언어) 를 사용하면, AI 는 "거부 궤적"을 전혀 발동하지 않으며 SALO 도 이를 잡아내지 못합니다.
  • 그들은 "아니오" 신호가 매우 희소하다는 것 (수풀 속의 바늘과 같음) 을 발견했습니다. 이것이 바로 전체 대화를 보는 것 (모든 것을 평균 내는 것) 이 작동하지 않는 이유이며, 바늘이 있는 특정 지점을 살펴봐야 하는 이유입니다.

요약하자면, 이 논문은 안전이 단순히 최종 결정이 아니라 과정임을 가르쳐 줍니다. 과정을 지켜봄으로써 우리는 마지막 수위를 숨기려 할 때조차 나쁜 행위자들을 잡을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →