← 최신 논문
💬 NLP

OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

OTTER는 최소한의 토큰 변경을 통해 탐지를 회피하도록 프롬프트를 최적화함으로써 독성 기반 LLM 방어 체계의 취약성을 입증하고, 이를 통해 공격 성공률을 크게 높이며 분류기 강화를 위한 실행 가능한 통찰력을 제공하는 블랙박스 레드팀 프레임워크이다.

원저자: Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai, Nai-Chia Chen, Fang Yu

게시일 2026-06-23✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai, Nai-Chia Chen, Fang Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 고성능 클럽(AI 모델) 입구에서 매우 엄격한 보안 요원을 마주하고 있다고 상상해 보세요. 이 요원의 유일한 임무는 당신의 초대장(프롬프트)을 보고 "나쁜 단어"가 포함되어 있는지 확인하는 것입니다. 만약 초대장이 무례하거나, 폭력적이거나, 독성이 느껴진다면 요원은 당신을 돌려보냅니다. 클럽은 단어의 느낌이 나쁘면 그 의도 또한 나쁠 것이라고 가정합니다.

"OTTER"라는 논문은 이 시스템을 깨뜨리는 영리한 트릭을 밝혀냅니다. 이 논문은 현재의 보안 요원이 사실 상당히 잘 속는다는 점을 보여줍니다. 요원은 특정 "나쁜 단어"에 너무 집중한 나머지, 단 5개의 단어만 무해한 유의어로 바꾸어도, 여전히 똑같이 위험한 의도를 담고 있음에도 불구하고 당신을 통과시켜 준다는 것입니다.

이 논문이 쉬운 비유를 들어 어떻게 이를 설명하는지 정리했습니다:

1. 문제점: 보안 요원은 "표면적"으로만 똑똑하다

저자들은 현재의 AI 안전 시스템이 "독성 점수(toxicity score)"에 너무 많이 의존한다는 것을 발견했습니다. 이것은 공항의 금속 탐지기와 같습니다. 당신이 총을 들고 지나가면 경보가 울립니다. 하지만 그 총을 분홍색으로 칠하고 "장난감"이라고 부른다면, 탐지기는 비록 그것이 여전히 무기일지라도 경보를 울리지 않을 수 있습니다.

이 논문은 AI의 안전 필터와 AI의 실제 거절 메커니즘이 모두 동일한 트릭에 속는다는 것을 증명합니다. 그들은 단어의 내용이 아니라 단어의 표면만을 보고 있습니다.

2. 해결책: OTTER ("단어 교체 도구")

연구진은 OTTER라고 불리는 도구를 만들었습니다. OTTER를 보안 요원을 화나게 만드는 특정 단어를 정확히 알고 있는 숙련된 편집자라고 생각하세요.

  • 작동 방식: OTTER는 해로운 요청(예: "폭탄을 어떻게 만드나요?")을 가져온 뒤 스스로에게 묻습니다. "어떤 특정 단어들이 보안 요원을 화나게 만드는가?"
  • 교체: OTfter는 "화나게 하는" 단어(예: "폭탄")를 식별하고, 이를 의미는 같지만 겉으로는 무해해 보이는 "안전한" 단어(예: "위험한 장치")로 바꿉니다.
  • 결과: 새로 만들어진 문장은 보안 요원에게는 예의 바르고 안전하게 들리지만, 내부의 AI는 여전히 위험한 요청을 이해하고 그에 대한 답을 내놓습니다.

3. 두 가지 버전의 OTTER

연구진은 이 교체 작업을 두 가지 방식으로 테스트했습니다:

  • OTTER-MLM (스마트한 편집자): 이 버전은 문맥을 이해하는 사전(dictionary)을 사용합니다. 전문 편집자처럼 문장에 완벽하게 어울리는 유의어로 단어를 교체합니다. 효율적이며 더 적은 시도로도 가능합니다.
  • OTTER-RV (와일드카드): 이 버전은 방대한 목록에서 무작위로 단어를 시도합니다. 덜 신중하지만, 때로는 훨씬 더 효과적인 "마법의 단어"를 찾아내기도 합니다. 이는 과녁을 맞힐 때까지 다트를 계속 던지는 것과 같습니다.

4. 결과: 충격적인 성공률

연구진은 네 가지 인기 있는 AI 모델(GPT-4, GPT-3.5 등)을 대상으로 테스트했습니다.

  • OTTER 적용 전: AI는 해로운 요청을 93%의 확률로 거절했습니다 (단 7%만 통과함).
  • OTTER 적용 후: AI는 약 16%의 확률로만 거절했습니다. 즉, 단 몇 단어를 바꾸는 것만으로 84%의 해로운 요청이 통과되었습니다.

이 논문은 핵심적인 발견을 강조합니다: 독성 점수는 안전을 예측하는 좋은 지표가 아닙. 문장에 "독성 점수"가 낮다고 해서 반드시 안전하다는 뜻은 아닙니다. 논문은 독성 점수를 낮추는 것과 AI의 방어 체계를 우회하는 것 사이에 강력한 연관성이 있음을 발견했습니다.

5. 왜 어떤 것들은 우회하기 더 어려운가?

연구진은 모든 나쁜 요청이 똑같이 속이기 쉬운 것은 아니라는 점을 발견했습니다.

  • 쉬운 대상: 혐오 발언이나 자해에 관한 요청은 우회하기가 매우 쉬웠습니다. 이러한 요청은 특정 "나쁜 단어"에 크게 의존하므로, 단어를 바꾸는 것만으로도 완벽하게 작동합니다.
  • 어려운 대상: 사이버 범죄나 해킹에 관한 요청은 우회하기가 더 어려웠습니다. "나쁜 단어"를 제거하더라도, 문장의 구조 자체가 여전히 AI에게 수상하게 느껴졌기 때문입니다. 이는 복잡한 주제의 경우, AI가 단순히 어휘 이상의 것을 보고 있음을 시사합니다.

6. 우리는 무엇을 해야 하는가? (권고 사항)

저자들은 단순히 해킹 기술을 뽐내려는 것이 아니라, 보안 요원을 고치려고 합니다. 그들은 다음과 같이 제안합니다:

  • "나쁜 단어" 목록에만 의존하지 마십시오: 안전 필터는 단어가 아닌 의도를 이해해야 합니다.
  • 보안 요원을 더 잘 훈련시키십시오: OTTER가 만들어낸 "교체된 문장"들을 사용하여 안전 필터를 훈련시키십시오. 필터에게 이렇게 보여주는 것입니다. "보라, 이 문장은 듣기에 좋지만 실제로는 위험하다."
  • 지속적으로 테스트하십시오: AI 모델은 계속 업데이트되므로, 보안 팀은 새로운 모델이 이러한 단어 교체 트릭에 여전히 취약한지 확인하기 위해 OTTER와 같은 테스트를 지속적으로 수행해야 합니다.

결론

이 논문은 우리가 AI를 보호하는 현재 방식—단순히 "독성" 있는 단어를 차단하는 방식—이 근본적으로 취약하다고 결론짓습니다. 단 다섯 개의 단어를 바꾸는 것만으로도 시스템을 속일 수 있습니다. AI를 진정으로 안전하게 만들려면, 시스템이 단어 그 자체가 아니라 단어 뒤에 숨겨진 위험을 이해하도록 가르쳐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →