SlotGuard: Stop Oversharing Private Local Context in LLM Agent Transcri
SlotGuard는 민감한 데이터를 세션 그래프를 통해 연결된 형식 보존형 합성 슬롯으로 재작성함으로써, 기존 레드액션 방식의 취약성을 극복하고 제로 수준의 자격 증명 유출과 완벽에 가까운 작업 성공을 달성하며 LLM 에이전트가 개인적인 컨텍스트와 자격 증명을 유출하는 것을 안전하게 방지하는 로컬 트랜스크립트 경계 시스템입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 거의 무엇이든 할 수 있는 아주 똑똑한 로봇 비서가 있다고 상상해 보세요. 이 로봇은 당신의 컴퓨터에 있는 파일을 읽고, 이메일을 보내고, 코드를 실행하며, 심지어 다른 소프트웨어와 대화할 수도 있습니다. 이러한 업무를 수행하기 위해 로봇은 당신의 파일 경로, 이메일 주소, 심지어 비밀번호와 같은 개인 정보까지도 보아야 합니다. 하지만 여기 함정이 있습니다. 다음 단계에서 무엇을 할지 결정하기 위해, 로봇은 종종 자신이 한 일의 요약본을 기술 기업이 소유한 거대한 클라우드 기반의 "두뇌"(대규모 언어 모델)로 보내야 합니다. 이 요약본을 "트랜스크립트(transcript)"라고 부릅니다.
문제는 이 트랜스크립트가 마치 낯선 사람에게 보내는 일기장과 같다는 점입니다. 만약 로봇이 실수로 당신의 비밀번호나 집 주소를 이 일기장에 적는다면, 클라우드 기업은 그것을 볼 수도 있고, 저장할 수도 있으며, 심지어 미래의 로봇을 훈련시키는 데 사용할 수도 있습니다. 이것은 친구에게 케이크 굽는 것을 도와달라고 부탁하면서, 케이크를 만드는 법을 알려주기 위해 주방 사진을 보내는 것과 같습니다. 하지만 그 사진 속에 당신의 집 열쇠가 밀가루 바로 옆에 놓여 있는 것을 친구가 보게 해서는 안 됩니다. 당신은 친구가 주방을 보기를 원하지만, 당신의 열쇠는 절대 보여주고 싶지 않은 것입니다. 이 논문은 당신의 개인적인 세계를 로봇에게 보여주면서도, 클라우드 두뇌가 당신의 비밀을 엿보지 못하게 하는 까다로운 문제를 다룹니다.
여기 SlotGuard가 등장합니다. 이는 당신의 컴퓨터 내부에서 작동하는 영리한 "프라이버시 경호원" 역할을 하도록 설계된 새로운 시스템입니다. SlotGuard를 당신의 로봇 비서와 클라우드 두뇌 사이에 앉아 있는 마법 같은 번역기라고 생각해보세요. 이의 역할은 로봇의 일기가 집 밖으로 나가기 전에 이를 다시 쓰는 것입니다. 로봇이 실제 비밀번호(예: SuperSecret123!)를 그대로 적게 하는 대신, SlotGuard는 그것을 가짜이지만 형태는 완벽하게 유지하는 자리 표시자(예: 🔑-SYNTHETIC-KEY-99)로 교체합니다.
여기에는 마법 같은 기술이 숨어 있습니다. 이 가짜 자리 표시자는 클라우드 두뇌에게 실제 것과 똑같이 보이고 느껴집니다. 만약 실제 비밀번호가 긴 글자와 숫자의 조합이었다면, 가짜 역시 긴 글자와 숫자의 조합입니다. 만약 실제 파일 경로가 /Users/Alice/Secrets/Plan.pdf였다면, 가짜는 [REPO_ROOT_1]/Secrets/Plan.pdf처럼 보일 수 있습니다. 클라우드 두뇌는 여전히 구조를 읽을 수 있습니다. 즉, 그것이 파일이라는 것을 알고, 그것이 비밀이라는 것을 알며, 그것에 대해 이야기하는 법을 알지만, 실제 비밀이 무엇인지는 전혀 알지 못합니다. 이것은 보물 위치를 실제 좌표 대신 일반적인 "X"로 표시한 지도를 클라우드 두뇌에게 주는 것과 같습니다.
하지만 마법은 여기서 끝나지 않습니다. 클라우드 두뇌가 "그 파일을 열어라"와 같은 지침을 보내오면, SlotGuard는 그 메시지가 당신의 로봇에게 도달하기 전에 가로챕니다. SlotGuard는 자신의 비밀 목록을 확인하여 [REPO_ROOT_1]이 실제로 /Users/Alice/Secrets/Plan.pdf를 의미한다는 것을 파악하고, 오직 신뢰할 수 있는 당신의 컴퓨터 내부에서만 가짜를 진짜로 다시 바꿉니다. 로봇은 실제 파일을 열게 되며, 클라우드 두뇌는 실제 이름이 존재했다는 사실조차 모르게 됩니다.
연구진은 이 시스템을 테스트하기 위해 진지한 숙제를 수행했습니다. 그들은 로봇이 개인 문서를 읽거나 비밀 키를 사용하는 등 민감한 데이터를 다루는 수천 개의 가짜 시나리오를 만들었습니다. 그 결과, SlotGuard가 없다면 로봇은 거의 모든 것을 유출한다는 것을 발견했습니다(100% 유출). 단순히 비밀을 [PASSWORD]와 같은 단어로 바꾸는 간단한 "비식별화(redaction)" 방식조차 재앙이었습니다. 로봇이 누락된 세부 정보 때문에 혼란을 겪어 97.5%의 확률로 실패했기 때문입니다.
반면, SlotGuard는 게임 체인저였습니다. 스마트한 추적 그래프를 포함한 전체 버전의 시스템은 심어진 모든 자격 증명(credentials)을 숨겼고 모든 자격 증명 유출을 차단했습니다(유출률 0.0%). 경로 및 이메일과 같은 구조적 데이터의 경우, 가시적인 민감한 문자를 100% 제거했습니다(현재 프로토타입에서 미미한 격차로 남아 있는 루트 소유의 절대 경로라는 특정 예외 케이스 제외). 더욱 중요한 것은, SlotGuard가 로봇의 두뇌를 망가뜨리지 않았다는 점입니다. SlotGuard를 사용하는 로봇은 실제 비밀을 보았을 때와 거의 유사한 높은 성공률을 유지하며 업무를 수행했습니다. 또한 이 시스템은 매우 빨라서, 대화 한 차례를 다시 쓰는 데 14 마이크로초(눈 깜빡임보다 짧은 시간)도 걸리지 않아 성능을 저하시키지 않습니다.
또한 이 논문은 SlotGuard가 하지 못하는 일에 대해서도 명시하고 있습니다. 이것은 독심술 방패가 아닙니다. 만약 클라우드 두뇌가 대화의 맥락만으로 당신의 비밀을 추측할 수 있을 만큼 똑똑하다면, SlotGuard는 이를 막을 수 없습니다. 또한 당신의 컴퓨터가 이미 해킹당한 상태라면 보호해주지 않습니다. 하지만 당신의 개인 데이터를 클라우드 트랜스크립트로 유출하는 특정 문제를 해결하는 데 있어, SlotGuard는 당신의 비밀을 안전하게 지키면서도 로봇이 업무를 수행할 수 있게 해주는 견고하고 빠르며 스마트한 솔루션을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.