← 최신 논문
💻 computer science

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

본 논문은 텍스트 수준의 출력 필터링에만 의존하는 한계를 극복하기 위해, 출력 전 활성화 프로빙(pre-output activation probing), 공형 예측(conformal prediction)을 결합한 형식 특정적 허니토큰 탐지, 그리고 누적 다회차 유출 계측(cumulative multi-turn leakage accounting)을 결합하여 LLM 에이전트 자격 증명 탈취에 대응하는 다층적 방어 전략을 제안한다.

원저자: Kargi Chauhan, Pratibha Revankar

게시일 2026-06-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kargi Chauhan, Pratibha Revankar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑하고 유능한 로봇 비서(LLM 에이전트)가 있다고 상상해 보세요. 이 로봇은 당신의 디지털 삶을 관리하기 위해 비밀 키(비밀번호, API 키, 은행 토큰 등)를 메모리에 보유해야 합니다.

문제는 이 로봇이 낯선 이들의 이메일, 웹 페이지, 메모 등을 읽는다는 점입니다. 만약 악의적인 공격자가 낯선 이의 메모 안에 교묘한 지시 사항(프롬프트 인젝션)을 숨겨 놓는다면, 로봇을 속여 당신의 비밀 키를 뱉어내게 만들 수 있습니다.

현재의 보안 요원들은 주로 문 앞(들어오는 메모 확인)이나 출구(로봇이 하는 말 확인)에서 감시합니다. 하지만 악의적인 공격자들은 영리합니다. 그들은 요청을 위장하거나, 여러 번의 대화에 걸쳐 비밀을 한 글자씩 아주 조금씩 흘리는 방식으로 보안 요원들을 통과할 수 있습니다.

이 논문은 **에이전틱 면역 체계(Agentic Immune System, AIS)**라는 새로운 세 부분으로 구성된 보안 시스템을 소개합니다. 이것은 단 한 명의 경비원이 아니라, 사건이 발생하기 전, 발생하는 중, 그리고 발생한 후에 이를 잡아내기 위해 협력하는 세 명의 전문 형사 팀이라고 생각하면 됩니다.

세 명의 형사가 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다.

1. "독심술사" (CIFT): 말이 나오기 전 생각을 포착하다

문제점: 전통적인 경비원들은 로봇이 '말하는 것'만 듣습니다. 하지만 로봇이 말을 할 때쯤이면, 이미 비밀번호를 암호화하거나(예: "password123"을 "cGFzc3dvcmQxMjM="로 변환), 보안 요원이 알아채지 못하도록 위장했을 수 있습니다.
해결책: 이 형사는 로봇의 목소리를 듣지 않습니다. 대신 로봇이 입을 열기도 전의 뇌 활동(내부 "활성화" 신호)을 관찰합니다.

  • 비유: 마술사가 모자에서 토끼를 꺼내려는 순간을 상상해 보세요. 일반적인 경비원은 토끼가 나타나기를 기다립니다. 하지만 이 "독심술사"는 마술사의 손이 움찔거리거나 모자 안에서 토끼의 귀가 씰룩거리는 것을 관찰합니다. 만약 로봇의 뇌가 비밀 키를 향해 손을 뻗으려는 특정한 방식으로 빛난다면, 이 시스템은 로봇이 한 마디도 내뱉기 전에 즉시 차단합니다.
  • 제약 사항: 로봇의 뇌 내부를 들여다볼 수 있어야 합니다(화이트박스 접근 권한). 만약 블랙박스 API를 통해서만 로봇과 대화한다면 이 형사를 사용할 수 없습니다.

2. "가짜 쿠키" (DP-HONEY): 통계적 함정

문제점: 때때로 로봇이 정말로 비밀번호처럼 보이는 것을 말할 수도 있습니다. 하지만 그것이 진짜 비밀번호인지, 아니면 그냥 비밀번호처럼 보이는 무작위 문자열인지 어떻게 알 수 있을까요? 만약 비밀번호처럼 보이는 모든 것을 차단한다면, 로봇이 수행해야 할 실제 업무를 방해할 수도 있습니다.
해결책: 이 형사는 실제 비밀번호와 섞여 있는 허니토큰(가짜이지만 현실적인 비밀번호, 키, 또는 비밀번호)을 심어둡니다.

  • 비유: 당신의 책상 위에 진짜 지갑 옆에 가짜 20달러 지폐를 놓아두었다고 상상해 보세요. 누군가 가짜 지폐를 가져간다면, 당신은 즉시 방 안에 도둑이 있다는 것을 알게 됩니다. 이 시스템은 가짜 지폐가 너무 완벽하게 보이도록 생성하며, 동시에 특수한 통계적 방법(예: "프라이버시 보호막")을 사용하여 그것들이 적절하게 유지되도록 합니다. 만약 로봇이 실수로 가짜 지폐를 건네준다면, 시스템은 "아하! 침해되었다!"라고 판단합니다.
  • 제약 사항: 이는 악의적인 공격자가 어떤 지폐가 가짜인지 모를 때만 작동합니다. 만약 그들이 어떤 것이 진짜 키인지 알아낼 수 있다면, 가짜는 무시하고 지나갈 것입니다.

3. "누출 측정기" (NIMBUS): 느린 유출을 포착하다

문제점: 악의적인 공격자는 비밀번호 전체를 한꺼번에 요구하지 않을 수도 있습니다. 대신 "첫 번째 글자", "두 번째 글자"를 요청하는 식으로 20번의 서로 다른 대화에 걸쳐 요청할 수 있습니다. 각각의 답변은 무해해 보이지만, 이들을 합치면 전체 비밀을 드러낼 수 있습니다.
해결책: 이 형사는 단일 문장을 보는 것이 아니라, 전체 대화 기록을 관찰합니다. 시간이 지남에 따라 얼마나 많은 "비밀 정보"가 유출되었는지 계속해서 점수를 매깁니다.

  • 비유: 작은 구멍이 난 양동이를 상상해 보세요. 물 한 방울이 떨어지는 것은 문제가 되지 않습니다. 하지만 떨어지는 방울들을 계속 추적하다 보면, 양동이가 천천히 비워지고 있다는 사실을 깨닫게 됩니다. 이 시스템은 유출되는 "비트(bits)"의 양을 계산합니다. 각 턴이 안전해 보이더라도, 전체 "누출 점수"가 너무 높아지면 시스템은 양동이를 꽉 닫아버립니다.
  • 제약 사항: 이것은 추정치이지 완벽한 물리 법칙이 아닙니다. 느리고 은밀한 유출을 잡아내는 데는 뛰어나지만, 한꺼번에 발생하는 거대한 유출은 잡지 못할 수도 있습니다.

종합적인 관점

이 논문은 하나의 방법론에만 의존해서는 안 된다고 주장합니다.

  • 텍스트 필터(출력을 검사하는 것)는 위장에 너무 취약합니다.
  • 입력 필터(입력을 검사하는 것)는 악의적인 공격자가 사용할 수 있는 모든 영리한 트릭을 예측할 수 없습니다.

대신, 이 논문은 계층적 방어를 제안합니다.

  1. 로봇의 를 관찰하여 말을 하기 전에 차단합니다.
  2. 가짜 키를 심어 로봇이 말을 하려고 할 때 잡아냅니다.
  3. 시간에 따른 누출을 계산하여 느리고 은밀한 공격을 잡아냅니다.

저자들은 오픈 소스 로봇들을 대상으로 테스트를 진행했으며, 이 세 가지 방법을 결합하는 것이 단순히 텍스트 필터를 사용하는 것보다 훨씬 효과적이라는 것을 발견했습니다. 그러나 이들은 이것이 여전히 "프로토타입"(연구용 모델)임을 인정합니다. 실험실에서는 잘 작동하지만, 실제 환경에 배포하기 위해서는 특히 로봇이 단순히 문장을 말하는 것이 아니라 도구(API 등)를 사용하는 경우에 대한 더 많은 테스트가 필요합니다.

요약하자면: 로봇이 당신의 비밀을 훔치는 것을 막으려면, 단순히 로봇이 하는 말을 듣는 것이 아니라, 로봇의 생각을 읽고, 가짜로 함정을 파고, 느린 유출을 계산해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →