← 최신 논문
💻 computer science

Defense Against Prompt Inversion Attacks: An Information-Theoretic Approach for LLM Collaborative Inference

본 논문은 프롬프트 역전 공격에 대해 우수한 개인정보 보호-유용성-지연 시간 트레이드오프를 달리는 것을 목표로, 중간 활성화 값과 입력 프롬프트 사이의 상호 정보를 최소화하기 위해 프라이버시 어댑터와 저차원 정보 병목 현상을 활용하는 협업적 LLM 추론을 위한 정보 이론적 방어 프레임워크를 제안한다.

원저자: Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

게시일 2026-06-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 그림: "클라우드 키친(Cloud Kitchen)" 문제

당신에게 아주 작고 성능이 낮은 주방(당신의 스마트폰이나 노트북)이 있고, 이 주방은 세계적인 수준의 레시피 북(거대 언어 모델, 즉 LLM)을 사용하여 복잡한 요리를 만들고 싶어 한다고 상상해 보세요. 당신의 주방은 요리 전체를 완성하기에 공간과 도구가 부족해서, 요리 과정 중간에 재료를 거대한 전문 "클라우드 키친"으로 보내 마무리를 맡기기로 결정했습니다.

문제점:
당신이 중간 단계의 재료(중간 활성화 값, "intermediate activations")를 클라우드 키친으로 보낼 때, 그곳의 참견하기 좋아하는 요리사가 재료의 상태를 보고 원래의 비밀 레시피가 무엇이었는지 정확히 알아낼 수 있습니다. 이것을 **프롬프트 역전 공격(Prompt Inversion Attack)**이라고 합니다. 설령 당신이 몇 가지 단서만 보낸다 하더라도, 영리한 공격자는 요리 과정의 중간 지점을 살펴보는 것만으로 당신의 사적인 입력값(예: 의료 진단 결과나 법적 비밀)을 재구성할 수 있습니다.

기존의 해결책들:
이 문제를 막기 위한 이전의 시도들은 재료를 보내기 전에 소금이나 후추를 약간 뿌리는 것(노이즈 추가)이나, 더 작은 상자에 담아 숨기는 것(크기 축소)과 같았습니다. 문제는 이러한 방법들이 종종 효과가 불확실하다는 점입니다. 이 방법들은 요리의 맛(AI의 답변 품질)을 망치면서도, 정작 비밀 재료를 제대로 숨기지는 못하는 경우가 많습니다.

새로운 해결책: "스마트 필터" (프라이버시 어댑터)

저자들은 당신의 비밀을 보호하기 위한 더 똑똑한 방법을 제안합니다. 그들은 이를 **정보 이론적 방어(Information-Theoretic Defense)**라고 부릅니다.

이것은 재료를 클라우드 키친으로 보내기 직전에 바로 설치하는 스마트 필터(이름하여 "프라이버시 어댑터")를 설치하는 것과 같습니다.

  1. 압착하기 (정보 병목 현상, Information Bottleneck):
    당신의 재료가 엄청나게 크고 화려한 채소, 향신료, 고기 더미라고 상상해 보세요. 스마트 필터는 이 거대한 더미를 아주 작고 좁은 빨대를 통해 통과하도록 강제합니다.

    • 무엇이 통과하는가? 요리의 필수적인 구조(문법 또는 구문). 클라우드 키친은 문장을 올바르게 완성할 수 있을 만큼 충분한 정보를 여전히 전달받습니다.
    • 무엇이 남겨지는가? 구체적이고 민감한 세부 사항(의미 또는 비밀 단어). 빨대가 너무 좁기 때문에, 독특하고 희귀한 재료들(예: 특정 약품 이름이나 사람의 ID)은 압착 과정에서 찌그러지거나 사라지게 됩니다.
  2. "잔여물 없는" 규칙 (No-Residual Rule):
    논문은 매우 중요한 점을 지적합니다. 단순히 재료 위에 노이즈를 조금 더한다고 해서 잘 될 것이라고 기대해서는 안 됩니다. 만약 원래의 재료 위에 노이즈를 추가하기만 한다면, 영리한 요리사는 수학적으로 그 노이즈를 "빼버림"으로써 원래의 재료를 다시 볼 수 있습니다.

    • 해결책: 저자들의 필터는 재료를 압축된 버전으로 완전히 교체합니다. 이는 재료 더미 위에 무언가를 더하는 것이 아니라, 원래의 더미를 버리고 오직 압착되고 압축된 버전만을 보냅니다. 이렇게 하면 원래의 비밀을 역설계하는 것이 수학적으로 불가능해집니다.

필터를 학습시키는 방법

저자들은 단순히 이 필터를 만드는 법을 추측한 것이 아닙니다. 그들은 "훈련 캠프" 접근 방식을 사용했습니다.

  • 방어자 (당신): 비밀을 숨기기 위해 재료를 최대한 강하게 압착하려고 노력합니다.
  • 공격자 (클라우드 요리사): 압착된 재료를 보고 원래의 레시피를 맞추려고 노력합니다.
  • 게임: 그들은 서로 번갈아 가며 게임을 합니다. 방어자는 공격자가 실패하도록 만들려 하고, 공격자는 예측 능력을 높이려 합니다. 목표는 클라우드 요리사가 요리를 완성할 수 있으면서도(높은 유용성), 당신의 비밀 재료는 알아낼 수 없는(높은 프라이버시) 완벽한 균형점을 찾는 것입니다.

"선택적 보호"의 놀라운 발견

이 필터의 가장 멋진 발견 중 하나는 이 필터가 본질적으로 선택적이라는 점입니다.

  • 흔한 단어들(예: "그", "이다", "그리고" 또는 문장 부호)은 밀가루나 물과 같습니다. 이들은 흔하며 좁은 빨대를 통해서도 쉽게 설명될 수 있습니다. 필터는 문장이 문법적으로 성립할 수 있도록 이들을 쉽게 통과시킵 most니다.
  • 민감한 단어들(예: "암", "SSRI" 또는 "항공편 번호 621")은 희귀하고 이국적인 향신료와 같습니다. 이들은 제한된 공간 내에서 설명하기가 매우 어렵습니다. 필터가 데이터를 압착하면, 이러한 희귀하고 민감한 단어들이 가장 먼저 사라지게 됩니다.

결과: 클라우드 키친은 "비행은 좋았고, 승무원은 친절했다"라고 말할 수는 있지만, 구체적인 항공편 번호, 경로 또는 의료 상태는 완전히 놓치게 됩니다. 공격자는 당신이 리뷰를 썼다는 사실은 알 수 있어도, 그 리뷰가 무엇에 관한 것인지는 알 수 없습니다.

쉬운 언어로 설명한 결과

저자들은 강력한 AI 모델을 사용하여 실제 환경(의료 기록, 법률 문서, 항공 리뷰)에서 이를 테스트했습니다.

  • 프라이버시: 다른 방법들과 비교했을 때, 당신의 비밀을 맞출 수 있는 공격자의 능력을 15%에서 35% 감소시켰습니다. 어떤 경우에는 공격자의 성공률이 거의 90%에서 약 50%(사실상 동전 던지기 확률)까지 떨어졌습니다.
  • 품질: AI의 답변은 여전히 매우 훌륭했습니다. 요리의 "맛"은 망쳐지지 않았습니다.
  • 속도: 필터가 매우 가볍기 때문에 프로세스를 약 6%에서 8% 정도만 느리게 만들었습니다. 이는 스마트폰에서 기다림 없이 사용할 수 있을 만큼 빠릅니다.

요약

이 논문은 당신의 데이터를 클라우드로 보내기 전에 압착하는 AI를 위한 "스마트 필터"를 소개합니다. 이 필터는 민감한 비밀은 으깨버리면서도 유용한 구조는 그대로 유지한다는 것을 수학적으로 보장합니다. 이는 마치 봉투가 너무 작아서 일반적인 주제만 들어갈 수 있고, 구체적인 이름이나 숫자는 남겨진 채로 편지를 보내는 것과 같으며, 이 모든 과정이 우편 배달 속도를 늦추지 않고 이루어집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →