← 최신 논문
🤖 machine learning

Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes

본 논문은 토큰 수준의 엔트로피 스트림에 순차적 변화점 탐지를 적용하여 유창한 최적화 기반 적대적 프롬프트를 식별하는 훈련이 불필요하고 모델에 구애받지 않는 탐지기인 CPD Online 을 소개하며, 기존 퍼플렉시티 기반 방법보다 우수한 정확도와 정밀한 국소화를 달성하면서 하위 안전 필터에 대한 계산 오버헤드를 줄입니다.

원저자: Mohammed Alshaalan, Miguel R. D. Rodrigues

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohammed Alshaalan, Miguel R. D. Rodrigues

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑한 로봇 비서 (대형 언어 모델, 즉 LLM) 가 유용하고 안전하도록 훈련되어 있다고 가정해 봅시다. 그러나 교활한 해커들은 이 로봇을 해로운 말을 하도록 속일 방법을 찾아냈습니다. 그들은 일반적인 질문의 맨 끝에 비밀스럽고 보이지 않는 "코드"를 추가하여 이를 수행합니다. 이 코드는 **적대적 접미사 (adversarial suffix)**라고 불립니다.

문제는 이러한 해커들이 그들의 코드가 완벽하게 자연스럽고 자연스럽게 보이도록 만드는 데 매우 능숙해지고 있다는 점입니다. 이는 마치 당신의 언어를 유창하게 구사하고 당신의 옷을 입은 스파이와 같습니다. 단순한 눈길 (또는 단어들이 얼마나 "기묘하게" 들리는지에 대한 기본적인 확인) 로는 정상인과 스파이를 구별할 수 없습니다.

이 논문은 로봇이 메시지를 읽는 동안 생각하는 방식을 관찰함으로써 이러한 스파이들을 포착하는 새로운 보안 요원인 CPD Online을 소개합니다. 단순히 단어 자체를 보는 것이 아니라 말입니다.

간단한 비유를 사용하여 작동 원리를 설명해 보겠습니다.

1. 문제: "매끄러운" 스파이

전통적인 보안 점검은 메시지의 "퍼플렉시티 (perplexity)"를 확인합니다. 퍼플렉시티를 로봇이 단어에 대해 얼마나 놀라는지를 측정하는 지표로 생각하세요.

  • 정상 메시지: 로봇은 보통 크게 놀라지 않습니다.
  • 구식 공격: 해커들은 뜻모를 말이나 기이한 단어를 사용했습니다. 로봇은 매우 놀랐고, 보안 요원은 "그건 이상해! 멈춰!"라고 외쳤습니다.
  • 신식 공격: 이제 해커들은 AI 를 사용하여 비밀 코드를 완벽하게 작성하므로 로봇이 전혀 놀라지 않습니다. "놀라움 게이지"는 낮게 유지되므로, 구식 보안 요원들은 이를 놓쳐버립니다.

2. 해결책: "심장 박동" 관찰

저자들은 단어가 정상적으로 보이더라도 비밀 코드를 만나면 로봇의 생각 패턴이 변한다는 사실을 깨달았습니다.

로봇이 당신의 메시지를 읽으며 길을 걷는다고 상상해 보세요.

  • 정상 경로: 로봇의 "불확실성 심장 박동 (엔트로피라고 함)"은 차분한 산책처럼 안정적이고 리듬감 있게 유지됩니다. 약간 요동치기는 하지만 편안한 범위 내에 머뭅니다.
  • 스파이의 경로: 로봇이 문장 끝에 있는 비밀 코드를 만나면 생각 패턴이 바뀝니다. "상승"하기 시작합니다. 마치 로봇이 갑자기 평지를 걷다가 언덕을 오르거나 평소 리듬과 맞지 않는 속도로 가속하는 것과 같습니다.

3. 탐정: "CUSUM" 게이지

이 논문은 **CUSUM (누적 합)**이라는 수학적 도구를 사용합니다. 이를 민감한 저울이나 이동 감지기로 생각하세요.

  • 기준선: 먼저 시스템은 로봇이 표준적이고 안전한 지시문 (시스템 프롬프트) 을 읽는 것을 관찰합니다. 이를 통해 해당 특정 로봇의 "정상 심장 박동"이 어떻게 보이는지 학습합니다.
  • 테스트: 로봇이 당신의 메시지를 읽는 동안, 감지기는 매 새로운 단어의 "심장 박동"을 그 기준선과 비교합니다.
  • 경보:
    • 심장 박동이 약간 흔들렸다가 다시 정상으로 돌아오면, 저울은 초기화됩니다. (이는 정상적인 문장입니다).
    • 심장 박동이 상승하기 시작하여 그 상태로 유지되면, 저울은 계속 무게를 더합니다. 무게가 너무 무거워지면 경보가 울립니다.

이는 단순히 하나의 큰 소음을 찾는 구식 방법과 다릅니다. 이 방법은 로봇의 생각 패턴에서 발생하는 지속적인 변화를 감지합니다.

4. 왜 더 나은가

이 논문은 여섯 가지 다른 유형의 로봇 모델과 수천 건의 공격에 대해 이를 테스트했습니다. 그들이 발견한 내용은 다음과 같습니다.

  • 매끄러운 스파이를 잡습니다: 단어의 "기이함"이 아니라 변화의 패턴을 보기 때문에, 다른 감지기를 속이는 새로운 유창한 공격들을 포착합니다.
  • 스파이가 어디에 있는지 압니다: 구식 감지기는 단순히 "이 전체 메시지가 나쁘다"고 말할 뿐입니다. CPD Online 은 비밀 코드가 시작된 정확한 순간을 가리킬 수 있습니다. 이는 "건물 안에 도둑이 있다"고 말하는 것이 아니라, "도둑이 오후 3 시 05 분에 뒷문으로 들어왔다"고 손으로 가리키며 말하는 보안 요원과 같습니다.
  • 빠르고 무료입니다: 실행하기 위해 새로운 무거운 컴퓨터가 필요하지 않습니다. 로봇이 이미 생각하기 위해 생성하는 데이터를 사용하므로 거의 지연을 추가하지 않습니다.

5. "문지기" 전략

이 논문은 또한 이를 현실 세계에서 사용할 현명한 방법을 제안합니다. 매우 비싸고 고도로 훈련된 보안 책임자 ( LLaMA Guard라고 함) 가 있는 바쁜 사무실을 상상해 보세요. 이 책임자는 복잡한 결정을 내릴 수 있지만 방문객을 하나씩 확인하는 데 시간이 오래 걸립니다.

  • 구식 방식: 책임자가 모든 사람을 확인합니다. 이는 느리고 비용이 많이 듭니다.
  • 신식 방식: CPD Online 감지기가 정문에서 문지기 역할을 합니다.
    • 문지기가 차분하고 정상적인 심장 박동을 보이면, 책임자를 귀찮게 하지 않고 방문객을 통과시킵니다.
    • 문지기가 "이동"하는 심장 박동을 보이면 방문객을 막아 세우고 심층 검사를 위해 책임자를 부릅니다.

이는 나쁜 사람들이 슬며시 통과하지 못하게 하면서도 많은 시간을 절약합니다 (테스트에서 책임자의 작업량을 약 20~40% 줄임).

요약

간단히 말해, 이 논문은 잘 섞여 있는 스파이를 잡으려면 그들의 옷 (단어) 만 보면 안 되며, 그들이 어떻게 걷는지 (불확실성의 패턴) 를 관찰해야 한다고 가르쳐 줍니다. 로봇의 "생각 리듬"을 추적함으로써 이 새로운 감지기는 그 속임수가 완벽하게 정중하게 들리더라도 정상적인 대화가 속임수로 변하는 순간을 포착할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →