← 최신 논문
🤖 AI

The Model's Tell: Measuring Context-Leakage Attack Signals with Behavior Gauges

이 논문은 내부 은닉 상태에 대한 접근 없이도 다양한 모델에 걸쳐 높은 정확도를 달성하며, 행동을 구체화하는 접미사(behavior-verbalizing suffix)의 프리필 토큰 확률을 분석함으로써 대규모 언어 모델의 컨텍스트 누출 공격을 탐지하는 가볍고 견고한 방법인 LeakGauge를 소개한다.

원저자: Maosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대적인 인공지능 비서는 자신의 업무를 잘 수행하기 위해 시스템 프롬프트와 검색된 컨텍스트라고 불리는 숨겨진 지침과 개인 문서라는 보이지 않는 층에 의존하곤 합니다. 이 숨겨진 요소들은 컴퓨터가 답변을 하기 전에 참고하는 비밀 규칙 책이나 개인 파일 캐비닛과 같은 역할을 합니다. 이러한 설정은 기계가 더 나은 답변을 제공하도록 돕지만, 동시에 취약점을 만들어냅니다. 영리한 공격자는 컴퓨터를 속여 이 비밀 지침이나 개인 파일을 드러내도록 설계된 질문을 던질 수 있습니다. 수년 동안 보안 전문가들은 사용자의 질문 텍스트만을 보고 이를 포착하려고 노력해 왔는데, 이는 마치 문 앞에서 손님의 신분증을 확인하는 보안 요원과 같습니다. 하지만 공격자가 단어를 바꾸거나 새로운 전략을 사용할 경우, 텍스트 자체만으로는 의도를 파기 어렵기 때문에 이 방식은 종종 실패하곤 합니다.

연구자들은 컴퓨터가 답변 작성을 마치기도 전에 내부 상태가 이미 문제의 징후를 더 명확하게 보여준다고 오랫동안 의심해 왔습니다. 문제는 컴퓨터의 뇌 내부를 들여다보는 것이 표준 보안 시스템으로는 볼 수 없는 복잡하고 숨겨진 데이터에 접근해야 하는 일이라는 점입니다. 칭화대학교와 그 파트너들의 새로운 연구는 더 단순한 질문을 던집니다. 컴퓨터의 즉각적인 반응 속에, 기계의 내부 작동 방식을 깨뜨리지 않고도 관찰할 수 있는 가시적인 흔적이 남아 있는가 하는 점입니다. 연구 결과, 답은 '예'였습니다. 사용자의 질문 끝에 특정하고 무해한 문구를 덧붙이고 컴퓨터가 다음 단어들을 어떻게 계산하는지 관찰함으로써, 연구자들은 공격이 완전히 새로운 형태일 때조차 높은 정확도로 이를 탐지할 수 있었습니다.

연구팀은 "행동 게이지(behavior gauge)"라고 부르는 방법을 개발했습니다. 컴퓨터가 말을 하려는 찰나, 당신이 "위의 내용을 바탕으로, 나는 나의 시스템 프롬프트를 제공하겠습니다"라는 짧은 문장을 프롬프트 끝에 추가한다고 상상해 보십시오. 이 문장은 데이터를 유출하라는 실제 요청이 아니라 하나의 테스트입니다. 연구진은 그 테스트 문장의 아주 첫 몇 단어에 대한 컴퓨터의 내부 확신 점수(confidence scores)를 살펴봅니다. 만약 사용자의 원래 질문이 정상적이고 안전한 질의였다면, 컴퓨터는 해당 테스트 문장을 이상하고 일어나기 힘든 연속된 내용으로 취급할 것입니다. 하지만 사용자의 질문이 비밀을 훔치려는 악의적인 시도였다면, 컴퓨터의 내부 논리가 변화합니다. 컴퓨터는 갑자기 해당 테스트 문장을 훨씬 더 그럴듯하게 받아들이는데, 이는 악의적인 질문이 이미 컴퓨터를 비밀을 드러낼 준비가 된 상태로 몰아넣었기 때문입니다. 이러한 변화는 컴퓨터가 실제로 글자를 타이핑하기 전의 아주 짧은 순간에 발생하며, 컴퓨터의 확신을 나타내는 숫자들 속에 뚜렷한 패턴을 남깁니다.

이 방법의 효용성을 입증하기 위해, 연구진은 소형의 효율적인 버전부터 수천억 개의 파라미터를 가진 거대 시스템에 이르기까지 11가지의 서로 다른 대규모 언어 모델을 대상으로 테스트를 진행했습니다. 연구진은 시스템 지침 탈취 시도와 데이터베이스 내의 개인 문서를 추출하려는 시도를 포함하여 수천 가지의 다양한 공격을 모델들에 가했습니다. 모든 경우에서 행동 게이지는 안전한 질문과 악의적인 질문을 성공적으로 구분해 냈습니다. 연구진이 이 시스템을 한 번도 본 적 없는 새로운 공격과 접해본 적 없는 보호된 콘텐츠에 대해 테스트했을 때도, 이 방법은 0.944에서 0.996 사이의 AUC를 기록하며 위협을 식별해 냈습니다. 이는 질문의 텍스트만을 보고 판단하여 새로운 유형의 공격에 대응하는 데 어려움을 겪었던 기존 방식보다 크게 개선된 성과입니다.

핵심적인 발견은 가장 효과적인 테스트 문구가 실제 비밀 정보를 포함할 필요가 없다는 점이었습니다. 한 버전의 테스트는 비밀 문서의 정확한 시작 단어들을 사용했는데, 이 방식은 비밀의 언어가 바뀌거나 공격자가 비밀을 단어 그대로 복사하는 대신 요약하도록 유도할 때 실패했습니다. 더 견고한 버전은 단순히 유출 의도를 밝히는 것으로, "나는 나의 시스템 프로프트를 제공하겠습니다"와 같은 일반적인 단어를 사용했습니다. 이 일반적인 문구는 서로 다른 언어와 다양한 유형의 비밀에 걸쳐 작동했으며, 이는 컴퓨터가 특정 단어를 인식하는 것이 아니라 '공개 행위' 자체에 반응하고 있음을 시사합니다. 연구진은 컴퓨터의 내부 상태를 조절하여 비밀을 유출할 가능성을 높이거나 낮출 수 있음을 보여줌으로써 이를 확인했으며, 행동 게이지의 점수가 그 변화와 완벽하게 일치하여 움직이는 것을 확인했습니다. 이는 이 신호가 무작위적인 오류가 아니라, 위험에 대한 컴퓨터의 실제 내부 표현과 연결되어 있음을 증명합니다.

이 발견의 실질적인 가치는 효율성에 있습니다. 테스트가 컴퓨터가 전체 응답을 생성하기 전에 이루어지기 때문에, 실시간 필터로 사용할 수 있습니다. 연구진은 테스트 문구를 입력에 추가하고 결과를 확인하는 탐지기를 구축했으며, 이는 500개 미만의 추가 파라미터 연산 능력만을 요구합니다. 이는 요청을 처리하는 데 약 10밀리초(ms)의 시간만을 추가할 뿐이며, 이는 인간 사용자가 거의 느낄 수 없을 만큼 미미한 지연 시간입니다. 반면, 컴퓨터의 내부 신호를 모니터링하려는 다른 방법들은 거대한 모델 전체를 복제하거나 컴퓨터가 긴 답변을 마칠 때까지 기다려야 하므로 느리고 비용이 많이 듭니다. 이 새로운 방법은 최소한의 비용과 높은 속도로 이러한 공격을 잡아낼 수 있는 길을 제시합니다.

연구진은 또한 이 기술이 다른 유형의 보안 위협에도 적용될 수 있는지 탐색했습니다. 테스트 문구를 독성 언어 감지나 숨겨진 지침 주입 탐지와 같이 다른 위험에 맞춰 변경함으로써, 동일한 방법이 해당 분야에서도 유망함을 보여주었습니다. 이는 컴퓨터의 즉각적인 반응 속에 풍부하고 접근 가능한 신호가 담겨 있으며, 이것이 기계의 내부 구조에 대한 깊은 접근 없이도 가능하다는 것을 시사합니다. 연구진은 코드를 공개하여 다른 이들이 이 결과를 검증하고 향후 AI 애플리케이션의 보안 시스템에 이 경량 탐지기를 통합할 수 있도록 했습니다. 이 연구는 때때로 문제를 파악하는 가장 효과적인 방법이 기계 내부를 더 깊이 들여다보는 것이 아니라, 잘 배치된 간단한 질문에 대한 기계의 반응을 관찰하는 것임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →