← 최신 논문
🤖 machine learning

Before the Last Token: Diagnosing Final-Token Safety Probe Failures

본 논문은 최종 토큰 안전성 프로브가 안전하지 않은 증거가 종종 최종 상태에 집중되지 않고 이전 프리필 토큰들에 걸쳐 분포되어 있기 때문에 재일브레이크를 탐지하지 못한다는 점을 규명하고, PCA-HMM 모델을 활용한 궤적 인식 분석이 단순한 토큰 풀링의 높은 오탐지율 없이 이러한 누락된 탐지를 효과적으로 복원할 수 있음을 제안합니다.

원저자: Shravan Doda

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shravan Doda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑한 보안 요원 (AI 모델) 이 위험한 요청이 발생하기 전에 막아내야 한다고 가정해 봅시다. 이 보안 요원을 돕기 위해 전문 검사관 (프로브) 을 고용했는데, 이 사람의 유일한 임무는 사용자의 메시지의 마지막 단어를 보고 "이것이 위험한가?"를 결정하는 것입니다.

이 논문은 이러한 검사관이 안전 규칙을 우회하는 트릭인 "재일브레이크"를 사용해 시스템을 슬쩍 지나가려는 나쁜 세력을 잡지 못하는 이유를 조사합니다.

연구자들이 발견한 내용을 간단히 설명한 이야기입니다:

1. "마지막 단어"의 문제

검사관은 문장의 최종 토큰(마지막 단어) 을 보고 안전 여부를 판단하도록 훈련되었습니다.

  • 작동 방식: 마지막 단어가 의심스러우면 보안 요원이 대화를 중단합니다.
  • 결함: 나쁜 행위자들 (재일브레이커) 은 위험한 요청을 화려한 의상, 역할극, 또는 혼란스러운 지시사항으로 감쌉니다. 문장이 끝날 때쯤이면 "마지막 단어"는 무해해 보이지만, 문장 중간에는 명백한 위험 신호가 포함되어 있습니다.
  • 비유: 도둑이 훔친 다이아몬드를 테디 곰 상자 안에 숨긴 상황을 상상해 보세요. 검사관은 상자의 맨 위 (마지막 단어) 만 봅니다. 만약 상자가 귀여운 곰처럼 보이면 검사관은 "모두 안전함!"이라고 말하고 상자를 통과시켜, 상자 깊숙이 숨겨진 다이아몬드를 놓쳐버립니다.

2. 왜 검사관이 단서를 놓치는가

연구자들은 세 가지 다른 AI 모델을 대상으로 이를 테스트했고, 검사관은 명백하고 평범한 언어로 된 나쁜 요청을 찾아내는 데는 매우 능숙하다는 것을 발견했습니다. 하지만 나쁜 요청이 "재일브레이크" 의상처럼 감싸져 있으면 검사관은 혼란에 빠집니다.

  • "근력"의 문제가 아님: 연구자들은 검사관이 단순히 더 "똑똑"해지거나 더 큰 두뇌 (더 많은 용량) 가 필요한지 궁금해했습니다. 검사관의 두뇌를 훨씬 더 크게 만들었지만, 큰 도움이 되지 않았습니다.
  • 실제 문제: 문제는 "위험 신호"가 뒤섞여 사라진다는 점입니다. 나쁜 요청이 트릭으로 감싸지면, AI 의 마음속에서 마지막 단어는 "위험 구역"에서 멀어집니다. 검사관은 특정 유형의 위험을 찾고 있지만, 트릭은 그 신호를 검사관이 볼 수 없는 곳으로 이동시킵니다.

3. 문장 초반에 숨겨진 "숨은 단서"

연구자들은 이제 마지막 단어뿐만 아니라 전체 문장을 단어별로 살펴보았습니다.

  • 발견: 검사관이 끝에서 실패한 경우들에서, "위험 신호"는 실제로 나쁜 요청이 숨겨진 문장 중간에서 매우 크고 명확하게 들렸습니다.
  • 함정: 하지만 문장 어딘가에서 가장 "큰" 단어만 찾는다고 해서 해결되는 것도 아닙니다. 왜냐하면 무해하고 안전한 문장도 중간에 크고 "무서워 보이는" 단어를 포함할 수 있기 때문입니다 (예: 범죄에 관한 영화 줄거리를 논의하는 경우). 큰 단어가 포함된 모든 문장을 플래그로 표시하면, 무해한 사람들까지 실수로 막아버리게 됩니다.

4. 해결책: "프레임"이 아닌 "영화"를 보는 것

단 하나의 정지된 프레임 (마지막 단어) 이나 가장 큰 프레임 (최대 풀링) 만 보는 대신, 연구자들은 전체 영화 (문장의 궤적) 를 지켜보는 방식을 시도했습니다.

  • 새로운 접근법: 그들은 첫 단어부터 마지막 단어까지 "위험 점수"가 어떻게 변하는지 관찰하는 간단한 모델을 구축했습니다.
  • 패턴: 그들은 재일브레이크가 특정 패턴을 가진다는 것을 발견했습니다. 나쁜 요청이 나타날 때 점수는 높아지고(위험!), 트릭이 끝나면 떨어집니다(안전!). 무해한 문장들은 이러한 특정 "급상승 후 하락" 패턴을 따르지 않습니다.
  • 결과: 이 패턴을 관찰함으로써, "마지막 단어" 검사관이 놓친 거의 모든 재일브레이크를 무해한 대화를 실수로 막지 않고 잡아낼 수 있었습니다.

요약

이 논문은 안전성을 판단하기 위해 마지막 단어에 의존하는 것은 표지로 책을 판단하는 것과 같다고 결론지었습니다. 나쁜 행위자들은 안쪽에 위험한 이야기를 숨기면서도 표지는 깨끗해 보이게 만들 수 있습니다.

연구자들은 이러한 트릭을 잡기 위해 안전 시스템이 전체 이야기(잠재 상태의 궤적) 를 살펴봐야 한다고 제안합니다. 그들은 이 새로운 방법이 완벽한, 바로 사용할 수 있는 제품이라고 말하지는 않지만, "위험 단서"가 존재한다는 것을 증명합니다. 우리는 단지 올바른 장소와 올바른 방법으로 찾아보면 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →