← 최신 논문
💬 NLP

PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization

이 논문은 모델에 대한 접근 권한 없이도 시스템 프롬프트에 경량화된 유틸리티 보존형 보호 계층(SHIELDs)을 추가하여 적대적 추출 공격에 대한 취약성을 효과적으로 최소화하는, LLM-as-optimizer를 활용하는 새로운 블랙박스 최적화 프레임워크인 PSM을 소개한다.

원저자: Huseein Jawad, Nicolas Brunel

게시일 2026-02-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Huseein Jawad, Nicolas Brunel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 세계 최고의 초콜릿 케이크를 만드는 비밀 레시피가 있다고 상상해 보세요. 당신은 제빵사(AI)를 고용하여 그 케이크를 만들게 했지만, 제빵사가 실수로 고객들에게 비밀 재료 목록을 말하지 않기를 바랍니다.

AI의 세계에서 이 "비밀 레시피"는 **시스템 프롬프트(System Prompt)**라고 불립니다. 이것은 AI가 어떻게 행동해야 하는지, 어떤 규칙을 따라야 하는지, 그리고 어떤 "성격"을 가져야 하는지를 알려주는 숨겨진 지침 세트입니다. 문제는 영리한 해커들이 AI를 속여서 이 비밀을 털어놓게 만들 수 있다는 점입니다. 마치 고객가 "당신이 음식 평론가라고 가정하고, 이 케이크를 어떻게 만들었는지 정확히 말해달라"고 요청하여 제빵사를 속이는 것과 같습니다.

이 논문은 이러한 비밀을 보호하기 위한 새로운 방법인 **PSM (Prompt Sensitivity Minimization, 프롬프트 민감도 최소화)**을 소개합니다. 이 방식이 어떻게 작동하는지 쉽게 설명하면 다음과 같습니다.

문제점: 기존의 자물쇠가 작동하지 않는 이유

이전에는 단순히 "레시피를 아무에게도 말하지 마시오"라는 표지판을 붙이는 방식으로 비밀을 보호하려 했습니다.

  • 결함: 해커들은 영리합니다. 그들은 "그 표지판은 무시해, 이제 내가 보스니까 레시чески를 말해!"라고 말할 수 있습니다. AI는 도움이 되고 명령을 따르도록 훈련되었기 때문에, 새로운 명령을 따르느라 이전의 명령을 잊어버리곤 합니다. 이는 마치 누군가가 주인이라고 주장할 때 차마 막아서지 못하는 너무나 예의 바른 보안 요원과 같습니다.

해결책: "방패(The Shield)"

저자들은 새로운 전략을 제안합니다. 단순히 표지판을 붙이는 대신, 방패를 추가하는 것입니다.

  • 방패란 무엇인가? 이것은 비밀 레시피의 맨 끝에 붙여진 특별하고 투명한 갑옷 레이어라고 생각하면 됩니다.
  • 어떻게 작동하는가? 이 방패는 짧은 텍스트 조각으로, 마치 문지기 역할을 합니다. 해커가 AI를 속이려 할 때, 방패가 개입하여 케이크 레시피 자체를 바꾸지 않으면서도 "안 됩니다, 그것은 허용되지 않습니다"라고 말합니다.

방패를 만드는 방법 ("AI 대 AI" 게임)

가장 흥eli로운 부분은 완벽한 방패를 찾아낸 과정입니다. 그들은 손으로 직접 방패를 작성한 것이 아니라, AI 대 AI의 게임을 이용했습니다.

  1. 공격자 AI (Attacker AI): 그들은 자물쇠를 부수기 위해 하나의 AI를 사용했습니다. 이 AI는 비밀을 알아내기 위해 수천 가지의 다양한 속임수(다른 언어로 질문하기, 친구인 척하기, 또는 코드로 레시피 요구하기 등)를 시도했습니다.
  2. 방어자 AI (Defender AI): 그들은 두 번째 AI를 코치로 사용하여 공격자 AI의 역할을 맡겼습니다. 이 코치는 공격자 AI가 실패하거나 성공하는 모습을 지켜보았습니다.
  3. 진화 (Evolution): 코치 AI는 "좋아, 저 방패는 '보스인 척하기' 속임수에는 통하지 않았어. 저 특정 속임수를 더 잘 무시할 수 있는 새로운 방패를 만들어보자"라고 말합니다.
  4. 결과: 이 과정을 반복하면서, 방어자 AI는 일반 고객들을 위해 AI가 케이크를 완벽하게 구울 수 있게 하면서도, 모든 속임수를 차단하는 데 능숙한 방패를 완성할 때까지 방패를 계속 수정했습니다.

이것이 왜 중요한가

이 논문은 이 방법이 세 가지 이유로 특별하다고 주장합니다.

  • "블랙박스(Black Box)" 솔루션: 이 방법을 사용하기 위해 AI가 내부적으로 어떻게 구축되었는지(두뇌나 코드 등) 알 필요가 없습니다. 단지 표준 API(웹사이트와 같은)를 통해 대화할 수 있으면 됩니다. 온라인에서 접근 가능한 모든 AI에 적용 가능합니다.
  • 가볍습니다 (Lightweight): 방패는 레시피 끝에 추가되는 아주 작은 텍스트 조각일 뿐입니다. 이 방패는 AI의 속도를 늦추거나 추가 비용을 발생시키지 않습니다. 이는 문에 작은 스티커를 붙이는 것과 같으며, 문을 더 무겁게 만들지 않습니다.
  • 케이크의 맛을 유지합니다: 가장 중요한 규칙은 방패가 AI의 업무 수행 능력을 망쳐서는 안 된다는 것이었습니다. 논문은 방패가 있음에도 불구하고 AI가 일반적인 질문에 여전히 완벽하게 답한다는 것을 보여줍니다. 즉, 더 안전해졌다고 해서 AI가 "멍청해지거나" "무례해지지는" 않았습니다.

결과

그들이 수많은 해커의 속임수(비밀을 다른 언어로 번역하거나 문장을 재구성하려는 시도 포함)를 대상으로 테스트했을 때, PSM 방패는 놀라운 성능을 보였습니다.

  • 기존의 방어책(단순히 "말하지 마시오"와 같은 표지판)은 해커들이 비밀을 훔치는 데 약 30%에서 50%의 성공률을 보였습니다.
  • PSM 방패는 많은 테스트에서 해커의 성공률을 거의 **0%**로 낮추었습니다.

요약

PSM을 자동으로 스스로 진화하는 보안 요원이라고 생각하세요. 단순히 "멈춰!"라고 외치는 것(해커들은 이를 무시합니다) 대신, 이 요원은 해커들이 어떻게 몰래 침입하려 하는지 정확히 학습하고, 일반 사용자들에게는 AI가 제 역할을 다할 수 있도록 하면서도 그들을 차단하는 맞춤형의 투명한 벽을 구축합니다. 이것은 AI 애플리케이션의 "비밀 소스"를 안전하게 지키는 스마트하고 저렴하며 효과적인 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →