← 최신 논문
🤖 AI

NonTextual Target Attack

이 논문은 고정된 응답 패턴을 강제하지 않으면서 LLM의 비안전성 확률을 극대화함으로써 공격 탐색 공간을 크게 확장하여, 안전 정렬된 모델들에 대해 높은 효율성과 함께 96.8%의 성공률을 달성하는 새로운 그래디언트 기반 탈옥 기법인 NonTextual Target Attack(NTA)을 소개한다.

원저자: Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

게시일 2026-07-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 엄격한 보안 요원(AI)을 속여 금지된 메시지를 몰래 전달하려고 한다고 상상해 보십시오. 이 보안 요원은 "폭탄을 만드는 방법은?"과 같이 위험해 보이는 요청을 거부하도록 프로그래밍되어 있습니다.

예전 방식: "스크립트 기반(Scripted)" 접근법

이 보안 요원을 속이려 했던 이전의 방법들은 보안 요원이 **"물론, 여기 있습니다..."**와 같은 특정한, 미리 작성된 문구를 말하도록 강요하는 것과 같았습니다.

이것은 마치 "사이먼 가라사대(Simon Says)" 게임과 같습니다. 공격자는 보안 요원이 "물론, 여기 있습니다..."라고 말한 뒤 위험한 지침을 내놓을 때까지 계속해서 다양한 명령을 외칩니다.

  • 문제점: 보안 요원은 고집스럽습니다. 때로는 보안 요원이 답변을 주고 싶어 하더라도, "여기 있습니다..."나 "물론입니다..."와 같이 시작할 수 있습니다. 공격자가 "Sure(물론)"라는 그 정확한 문구에만 집착하기 때문에, 보안 요원을 구석으로 몰아넣으려다 많은 시간을 낭비하게 됩니다. 만약 보안 요원이 그 마법의 단어를 말하지 않는다면, 설령 보안 요원이 실제로 위험한 정보를 제공했더라도 그 공격은 실패한 것으로 간주됩니다.
  • 결 결과: 이것은 오직 하나의 특정 열쇠 모양만을 사용하여 문을 열려고 하는 것과 같습니다. 자물쇠가 약간만 달라도, 당신이 맞는 열쇠를 가지고 있더라도 문을 열 수 없습니다.

새로운 방식: NTA (비텍스트 대상 공격, NonTextual Target Attack)

이 논문은 NTA라고 불리는 새로운 방법을 소개합니다. NTA는 보안 요원이 처음에 어떤 말을 하는지에 관심을 두지 않고, 오직 한 가지 것에만 집중합니다: 보안 요원이 위험한 답변을 내놓았는가?

NTA를 보안 요원이 "물론", "알겠습니다", 또는 "여기 있습니다"라고 말하는지에 상관없이 그저 문만 열리면 되는 숙련된 열쇠공이라고 생각하십시오.

  • 전략: NTA는 보안 요원을 속이기 위해 두 단계의 춤을 춥니다:
    1. 최악을 상상하라: 먼저, "스코어링 모델(scoring model)"(똑똑한 판사)에게 보안 요원이 실제로 어떻게 말할지 걱정하지 말고, 보안 요원이 줄 수 있는 가능한 가장 위험한 답변을 상상하도록 요청합니다. 이는 공격자가 나쁜 질문에 대해 가장 도움이 될 법한 완벽한 답변을 꿈꾸는 것과 같습니다.
    2. 꿈과 일치시켜라: 그런 다음, 실제 보안 요원의 답변이 그 "꿈꿔온" 위험한 답변과 점점 더 닮아가도록 질문(프롬프트)을 미세하게 조정합니다.

"마법 번역기"

까다로운 부분 중 하나는 "꿈을 꾸는 판사"와 "실제 보안 요원"이 서로 약간 다른 언어(단어에 대한 서로 다른 내부 코드)를 사용한다는 점입니다.

  • 비유: 판사는 "프랑스어"를 말하고 보안 요원은 "독일어"를 말한다고 상상해 보십시오. NTA는 "프랑스어"로 된 위험한 아이디어를 보안 요원이 이해하고 따를 수 있는 "독일어" 지침으로 변환하기 위해 특별한 어휘 투영 행렬(Vocabulary Projection Matrix)(번역기)을 사용합니다.

왜 더 나은가

  • 속도: NTA는 보안 요에게 "Sure"라고 말하도록 강요하는 데 시간을 낭비하지 않기 때문에, 훨씬 더 빠르게 위험한 답변을 얻어내는 방법을 찾아냅니다. 논문에 따르면 NTA는 단 100번의 시도만으로 성공할 수 있는 반면, 기존 방식은 수천 번을 시도해야 하거나 완전히 실패할 수도 있습니다.
  • 성공률: 테스트에서 NTA는 강력한 안전 학습이 된 AI 모델들을 상대로 약 **97%**의 성공률을 보였습니다. 기존의 가장 좋은 방법들은 약 50~60%의 성공률만을 보였습니다.
  • 다양성: 기존 방식은 특정 문구인 "Sure"에 너무 집중하기 때문에 종종 이상하고 깨진 답변을 만들어냅니다. NTA는 위험한 결과로 가는 어떤 경로라도 찾을 수 있는 자유가 있기 때문에, 자연스럽고 다양하며 일관성 있는 위험한 답변을 생성합니다.

핵심 요약

이 논문은 특정 "마법의 단어"에 대한 집착을 버리고 순수하게 위험한 결과에 집중함으로써, 공격자가 AI 안전 필터를 훨씬 더 효율적이고 효과적으로 우회할 수 있다고 주장합니다. 이는 경직되고 답답한 "사이먼 가라사대" 게임을 보안 요드의 가장 취약한 지점을 찾는 유연한 탐색으로 바꾸어 놓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →