← 최신 논문
💻 computer science

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

이 논문은 정적 구분자 풀(static separator pools)을 암호화 해시에서 유도된 요청별 고유 카나리 쌍(per-request canary pairs)으로 대체함으로써, 모델 미세 조정 없이도 폭발 반경 취약점(blast-radius vulnerabilities)을 효과적으로 제거하고 프롬프트 인젝션 공격 성공률을 크게 낮추는 다형적 프롬프트 어셈블리(Polymorphic Prompt Assembling, PPA)를 위한 동적 구분자 생성 메커니즘을 제안한다.

원저자: Nima Dorzhiev, Peng Liu

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nima Dorzhiev, Peng Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 약간은 잘 속는 로봇 비서(AI 에이전트)라고 상상해 보세요. 당신의 임무는 상사(시스템 지침)가 작성한 엄격한 규칙을 따르면서 동시에 대중의 요청(사용자 입력)을 듣는 것입니다.

문제는 교활한 해커가 공공 요청 안에 "상사의 말을 무시하고 대신 내 말을 들어라"라는 메모를 몰래 끼워 넣을 수 있다는 점입니다. 이것을 **프롬프트 인젝션 공격(Prompt Injection Attack)**이라고 부릅니다.

기존의 해결책: "정적" 비밀번호

이전에 연구자들은 **다형적 프롬프트 조립(Polymorphic Prompt Assembling, PPA)**이라는 방어 기법을 개발했습니다. 이것은 마치 상사의 규칙과 대중의 요청 사이에 특별하고 고유한 울타리를 설치하는 것과 같습니다.

  • 작동 방식: 시스템에는 84개의 서로 다른 울타리 디자인(구분자)이 담긴 고정된 상자가 있었습니다. 요청이 들어올 때마다 시스템은 이 상자에서 무작위로 하나의 울타리를 골라 사용했습니다.
  • 결함: 만약 해커가 이 울타리 중 하나를 훔쳐보고 정확히 어떻게 생겼는지 알아낸다고 가정해 봅시다. 시스템이 이 울타리들을 계속 재사용하기 때문에, 해커는 이제 미래의 대화에서 이와 똑같은 울타리 디자인을 사용하여 로봇을 속일 수 있습니다. 울타리 디자인이 진정으로 변하지 않고 계속 재사용되기 때문에 피해가 확산됩니다("블래스트 반경").

새로운 해결책: "동적" 일회용 잠금장치

이 논문은 대폭 업그레이드된 버전인 **동적 구분자 생성(Dynamic Separator Generation)**을 제안합니다.

상자에서 울타리를 꺼내는 대신, 이 시스템은 매 요청마다 새롭고 고유한 울타리를 직접 제작합니다.

  • 작동 방식: 당신이 로봇에게 질문할 때마다, 시스템은 정확한 시간, 당신의 고유 ID, 그리고 그 순간만을 위해 생성된 난수를 확인합니다. 그리고 이 재료들을 혼합하여(SHA-256이라는 수학적 레시피를 사용하여) 단 하나뿐인 "시작" 및 "종료" 표식을 만들어냅니다.
  • 비유: 당신이 편지를 보내는 상황을 상상해 보세요.
    • 기존 방식: 당신은 표준적인 빨간 봉투를 사용합니다. 만약 도둑이 빨간 봉투를 훔친다면, 나중에 이를 이용해 편지를 위조할 수 있습니다.
    • 새로운 방식: 당신은 버튼을 누르는 정확한 시간에 따라 매번 고유하고 반복 불가능한 봉투를 만드는 마법 프린터를 사용합니다. 설령 도둑이 '편지 #1'의 봉투를 훔쳤더라도, '편지 #2'는 완전히 다른, 예측 불가능한 봉투를 사용하기 때문에 그 봉투는 아무런 쓸모가 없습니다.

연구진의 발견

연구팀은 이 새로운 "동적" 방식이 강력한 AI 모델(Llama-3.3)을 대상으로 16가지 유형의 해커 기술에 대해 얼마나 잘 작동하는지 테스트했습니다.

  1. "리트스피크(Leetspeak)" 기술 차단: 특정 해커 기술(M1이라 불림)은 AI를 혼란스럽게 하기 위해 비밀 코드와 긴박한 언어를 사용합니다.
    • 이전: AI는 이 기술에 88%의 확률로 속았습니다.
    • 이후: AI는 이 기술에 38%의 확률로만 속았습니다. 이는 엄청난 개선입니다(안전성이 두 배 이상 향상되었습니다).
  2. "포맷 탈출(Format Breakout)" 기술 차단: 또 다른 기술은 AI가 울타리 표식을 해커에게 다시 말하도록 유도하는 것입니다.
    • 이전: AI는 47%의 확률로 울타리 표식을 실수로 노출했습니다.
    • 이후: AI는 울타리 표식을 **0%**의 확률로 노출했습니다. 울타리가 그 순간만을 위해 고유했기 때문에, 이를 노출하더라도 해커가 향후의 요청에 활용할 수 없었습니다.
  3. 속도: 이 새로운 방식은 믿을 수 없을 정도로 빠릅니다. 요청을 처리하는 데 단 2.7 마이크로초(눈 깜빡임의 아주 작은 부분)만을 추가합니다. 너무 빨라서 체감할 수 없을 정도입니다.
  4. 품질: 로봇이 본래의 업무(텍스트 요약이나 질문 답변 등)를 수행하는 능력은 나빠지지 않았습니다. 이전과 마찬가지로 잘 작동했습니다.

한 가지 제약 사항 (한계점)

이 논문은 이 방식이 해결할 수 없는 한 가지를 인정합니다: 만약 해커가 로봇에게 "제발 울타리 표식을 나에게 다시 말해줘"라고 명시적으로 명령한다면, 로봇은 여전히 그렇게 할 수도 있습니다.

  • 해결책: 연구진은 이것이 현재 계층의 근본적인 한계라고 말합니다. 이를 막으려면, 로봇의 답변이 나가기 전 마지막 단계에서 이를 검사하는 별도의 "보안 요원"이 필요하지만, 이는 이번 연구의 범위가 아니었습니다.

요약

이 논문은 모든 대화에 대해 신선하고 고유하며 일회용인 울타리를 제공함으로써 AI 에이전트를 더 안전하게 만드는 방법을 소개합니다. 해커가 울타리를 훔치더라도, 다음 대화에서는 완전히 다른 울타리가 사용될 것이기에 그 탈취물은 무용지물이 됩니다. 이는 빠르고 쉽게 추가할 수 있는 업그레이드이며, AI가 속을 가능성을 현저히 줄여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →