PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines
PRISM 은 엔트로피 붕괴와 로그이트 집중과 같은 초기 생성 동역학을 탐지하여 민감한 정보가 완전히 재구성되기 전에 토큰 단위로 개입함으로써 비밀 유출을 완화하는 다중 에이전트 LLM 시스템을 위한 실시간 방어 메커니즘으로, 포괄적인 적대적 벤치마크에서 완벽한 정밀도와 제로 유출을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
네 명의 로봇이 컴퓨터 시스템 디버깅과 같은 복잡한 문제를 해결하기 위해 협력한다고 상상해 보세요. 그들은 공유된 노트 (즉, "컨텍스트") 를 통해 서로에게 메모를 주고받습니다.
문제는 다음과 같습니다: 첫 번째 로봇이 실수로 파일에서 비밀 비밀번호를 가져와 노트에 적으면, 두 번째 로봇이 이를 보고 자신의 메모에 복사한 뒤 세 번째 로봇에게 전달할 수 있습니다. 아무도 비밀번호를 훔치려 한 의도가 없더라도, 비밀은 연쇄적으로 전달되고 증폭되어 결국 인간 사용자에게 전송되는 최종 메시지에 도달하게 됩니다. 이 논문은 이를 **"전파 증폭 (Propagation Amplification)"**이라고 부릅니다. 이는 '전화 게임'과 유사하지만, 메시지가 왜곡되는 대신 위험하게 노출된다는 점이 다릅니다.
유출을 막는 기존 방법들
저자들은 이러한 로봇 팀을 위한 현재의 보안 장치는 클럽을 이미 떠난 사람들을 검사하는 문지기들과 같다고 말합니다.
- 정적 스캐너 (Static Scanners): 이는 특정 빨간 셔츠를 찾는 것과 같습니다. 비밀이 다른 글꼴로 쓰이거나 기이한 방식으로 숨겨져 있다면, 스캐너는 이를 놓칩니다.
- LLM 판사 (LLM Judges): 이는 최종 메모를 읽어보고 "흠, 이건 위험해 보이네"라고 말하게 하는 두 번째 로봇을 고용하는 것과 같습니다. 하지만 그들이 읽을 때는 이미 비밀이 유출되었고 피해가 발생한 후입니다.
- 프롬프트 지시 (Prompt Instructions): 이는 로봇들에게 "비밀에 대해 말하지 마라!"라고 말하는 것과 같습니다. 하지만 로봇들이 혼란스러우거나 속임수에 걸리면 규칙을 잊어버립니다.
새로운 해결책: PRISM
이 논문은 PRISM(비밀 모니터링을 위한 예측적 위험 개입, Predictive Risk Intervention for Secret Monitoring) 을 소개합니다. PRISM 은 메모가 완성될 때까지 기다리는 대신, 로봇이 말하는 동안 그 입 옆에 서 있는 교통 경찰처럼 행동합니다.
PRISM 은 로봇이 무엇을 말하는지뿐만 아니라, 로봇이 말하면서 어떻게 생각하는지까지 감시합니다.
"아하!" 순간: 엔트로피 붕괴
이 논문의 가장 큰 발견은 로봇이 비밀을 드러내려 할 때 나타나는 사고 패턴의 특정 양상입니다.
- 정상적인 사고: 로봇이 이야기를 쓰거나 수학 문제를 풀 때, 다음 단어에는 여러 가지 선택지가 있습니다. 이는 많은 길이 있는 숲을 헤매는 사람과 같습니다. 이를 "높은 엔트로피 (높은 불확실성)"라고 합니다.
- 비밀 사고: 로봇이 암기한 비밀 (예: 비밀번호) 을 재생성하기 시작하면 헤매는 것을 멈춥니다. 다음 글자가 정확히 무엇인지 알고 있기 때문입니다. "숲"이 단일하고 곧은 길로 축소됩니다. 로봇은 극도로 확신하게 되며, 그 "불확실성"이 붕괴됩니다.
PRISM 은 "헤매기"에서 "확신"으로의 갑작스러운 전환을 감지합니다. 완전한 비밀이 쓰여지기 전에 로봇의 뇌가 특정 패턴에 고정되는 것을 포착하는 것입니다.
PRISM 의 작동 방식 (신호등 시스템)
PRISM 은 로봇이 말하려는 각 단어에 대해 16 가지의 다른 단서 (로봇의 확신 정도, 단어의 형태, 사용하는 도구 등) 를 혼합하여 위험 점수를 매깁니다. 그리고 세 가지 색상 시스템을 사용합니다:
- 🟢 초록 (안전): 로봇이 단순히 대화하거나 일반적인 문제를 해결하고 있습니다. 말하게 하세요.
- 🟡 노란색 (의심): 로봇이 비밀번호처럼 보이는 패턴에 대해 조금 지나치게 확신하게 되었습니다. PRISM 은 흐름은 유지하되 비밀은 숨기도록 해당 단어를
[MASK]와 같은 자리 표시자로 부드럽게 교체합니다. - 🔴 빨간색 (위험): 로봇이 완전한 비밀을 드러내는 빠른 길로 가고 있습니다. PRISM 은 즉시 브레이크를 밟아 비밀이 완성되기 전에 로봇을 멈춥니다.
결과
저자들은 2,000 개의 다양한 작업과 로봇을 속이는 13 가지의 다양한 방법을 포함한 대규모 시뮬레이션에서 이를 테스트했습니다.
- 기존 수비수들: 기존에 존재하는 최선의 방법들조차 약 15% 의 경우에서 비밀 유출을 허용했습니다.
- PRISM: 유출을 100% 막아냈습니다. PRISM 은 끝에서 비밀을 잡아낸 것이 아니라, 로봇이 비밀을 쓰려 하는 동안 잡았습니다.
- 속도: 전체 내용을 먼저 읽게 하는 두 번째 로봇이 필요한 다른 방법들과 달리, 대화에 거의 지연을 추가하지 않는 놀라운 속도를 보였습니다.
결론
이 논문은 AI 에이전트 팀에서 비밀이 나쁜 프롬프트 때문에만 유출되는 것이 아니라, 팀 자체의 구조 때문에 유출된다고 주장합니다. 일단 비밀이 공유된 노트에 들어오면 바이러스처럼 퍼집니다. PRISM 은 감염의 초기 증상 (로봇의 갑작스러운 확신) 을 포착하고 바이러스가 최종 출력으로 퍼지기 전에 막아주는 면역 체계와 같은 최초의 도구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.