← 최신 논문
💻 computer science

BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents

이 논문은 LLM/VLM 에이전트에서 검색, 메모리, 도구 호출 등 여러 단계를 거치며 발생하는 개인정보 유출 위험을 해결하기 위해, 민감한 정보를 탐지하고 플레이스홀더나 의미적 추상화로 변환한 후 권한이 있는 단계에서만 복원하는 'BodhiPromptShield'라는 정책 기반 프레임워크를 제안합니다.

원저자: Bo Ma, Jinsong Wu, Weiqi Yan

게시일 2026-04-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Bo Ma, Jinsong Wu, Weiqi Yan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제: "비밀이 어디로 흘러가는지 모르는 상황"

비유: 비밀스러운 편지를 보낼 때
예를 들어, 당신이 은행에 대출 신청을 하려고 "내 이름은 김철수이고, 주소는 서울 강남구 OO 동 123 번지입니다"라고 AI 비서에게 말합니다.

  • 기존 방식의 문제점:
    기존 보안 프로그램은 이 편지를 보내는 순간 '김철수'와 '주소'를 지워버립니다. 하지만 문제는 여기서 끝이 아닙니다.
    AI 비서는 이 정보를 바탕으로:

    1. 검색 (Retrieval): "김철수 씨의 대출 기록을 찾아줘"라고 검색 엔진에 물어봅니다.
    2. 기억 (Memory): "김철수 씨의 주소는 강남구 123 번지야"라고 메모장에 적어둡니다.
    3. 도구 사용 (Tool Call): "김철수 씨의 계좌로 송금해"라고 은행 시스템에 명령을 보냅니다.

    핵심 문제: AI 가 편지를 보낼 때만 이름을 지웠다고 해서, 검색창, 메모장, 은행 시스템에 그 이름이 그대로 남으면 소용없습니다. 마치 편지 봉투를 잠갔는데, 편지 내용을 복사해서 여러 곳에 붙여놓은 것과 같습니다.

2. 해결책: BodhiPromptShield (보디 프롬프트 쉴드)

이 논문은 **"보안을 편지 한 번만 지우는 게 아니라, 정보가 이동하는 모든 길목에서 통제하자"**고 제안합니다.

비유: 특수한 '변신'과 '열쇠' 시스템
이 시스템은 사용자의 민감한 정보를 AI 가 처리하기 전에 다음과 같이 변신시킵니다.

  1. 변신 (Sanitization):

    • 김철수<사람_1> (타입 플레이스홀더)
    • 서울 강남구 OO 동 123 번지 → "서울 강남구의 한 주소" (의미 추상화)
    • 계좌번호 1234-5678<계좌_마법_키> (보안 심볼 매핑)

    AI 는 이 변신된 내용을 보고 "아, 사람이 하나 있고, 주소가 있고, 계좌가 있구나"라고 의미는 이해하지만, 정체성은 모릅니다.

  2. 안전한 이동 (Propagation Control):
    AI 가 검색을 하거나 메모를 할 때, 변신된 <사람_1>만 전달됩니다. 그래서 검색 기록이나 메모장에 진짜 이름이 남지 않습니다.

  3. 최종 열쇠 (Controlled Restoration):
    진짜 필요한 순간 (예: 실제로 돈을 송금해야 할 때) 에만, 허가된 관리자<계좌_마법_키>를 다시 원래 계좌번호로 되돌려줍니다. 그 전까지는 AI 도, 로그도, 메모장도 진짜 번호를 볼 수 없습니다.

3. 왜 이것이 중요한가요? (기존 기술과의 차이)

  • 기존 기술 (문서 지우기): 편지 한 장을 지우는 데 집중합니다. 하지만 AI 가 그 내용을 복사해서 다른 곳 (검색, 메모) 으로 보내면, 그 복사본은 여전히 위험합니다.
  • 이 기술 (전파 통제): 편지가 어디로 이동하든 그 내용이 변형된 채로 이동하게 합니다. AI 가 "김철수"를 기억하거나 검색할 수 없게 막는 것입니다.

4. 성능은 어떨까요?

논문은 실험을 통해 이 방법이 효과가 있음을 증명했습니다.

  • 정보 유출 감소: 민감한 정보가 검색, 메모, 도구 호출 단계로 넘어갈 때 유출되는 비율이 10.7% 에서 7.1% 로 크게 줄었습니다.
  • 작업 능력 유지: 정보를 지웠다고 해서 AI 가 멍청해지거나 일을 못 하는 것은 아닙니다. 오히려 "김철수"를 <사람_1>로 바꿔도 AI 는 "사람"이라는 개념을 이해하므로 대출 심사를 잘 해냅니다. (작업 성공률 92% 유지)

5. 한 줄 요약

"AI 비서가 당신의 비밀을 여러 곳에 복사해 놓지 못하게, 정보를 '의미'만 남기고 '정체'는 가린 채 이동하게 만든 뒤, 정말 필요한 순간에만 다시 원래대로 되돌려주는 새로운 보안 시스템입니다."

이 기술은 AI 가 우리의 개인 정보를 안전하게 처리하면서도, 우리가 원하는 일을 정확하게 해낼 수 있게 해주는 지능형 보안 중개자 역할을 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →