← 최신 논문
🤖 machine learning

Inadvertent Context Leakage in Language Models

이 논문은 고급 언어 모델이 평범한 프롬프트에 대한 정상적인 응답을 통해 자격 증명이나 건강 기록과 같은 민감한 인컨텍스트 비밀 정보를 의도치 않게 유출한다는 점을 입증하며, 이러한 취약성이 수정 가능한 버그가 아니라 모델 능력의 내재적 부산물임을 밝히고 있다.

원저자: Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능은 개인 비서로서 달력을 관리하고, 개인적인 이메일을 읽으며, 건강 기록이나 금융 데이터와 같은 민감한 세부 정보를 보유하도록 점점 더 많이 요구받고 있습니다. 이를 위해 컴퓨터 프로그램은 작업하는 동안 이러한 비밀들을 즉각적인 메모리에 계속 유지해야 하며, 연구자들은 이 공간을 '컨텍스트 윈도우(context window)'라고 부릅니다. 지배적인 믿음은 모델에게 비밀을 지키라고 명령하고 모델이 그 비밀을 입 밖으로 내뱉기를 거부한다면, 그 비밀이 안전할 것이라는 것이었습니다. 보안 점검은 보통 단순한 필터처럼 작동합니다. 즉, 컴퓨터가 작성한 텍스트에 해당 비밀 단어가 글자 그대로 포함되어 있지 않다면, 시스템은 유출이 발생하지 않았다고 가정합니다. 이 접근 방식은 대화를 단일한 통신 채널로 취급하며, 말해지지 않은 것은 알려지지도 않았다고 가정합니다.

하지만 새로운 연구는 이러한 관점이 불완전하다는 점을 시사합니다. 연구진은 모델이 비밀을 밝히기를 올바르게 거부하더라도, 문장을 구성하는 방식 자체가 비밀에 대한 숨겨 된 단서를 담고 있다는 사실을 발견했습니다. 비밀은 모델의 내부 상태를 변화시키며, 이 변화는 모델이 생성하는 텍스트로 파동처럼 퍼져나가 단어 선택, 문장 길이, 서식의 패턴을 인간의 눈에는 보이지 않지만 컴퓨터에는 감지 가능한 방식으로 변화시킵니다. 이는 마치 모델이 입을 굳게 다물고 있는 동안에도, 다른 목소리 부분을 통해 비밀을 속삭이는 것과 같습니다.

이 연구를 수행한 팀은 현존하는 가장 발전된 8개의 언어 모델을 활용하여 이러한 숨겨진 신호들이 실재하는지 테스트했습니다. 그들은 모델에게 비밀 숫자를 부여하고 이를 기밀로 유지하도록 지시하는 시나리오를 만들었습니다. 그런 다음 짧은 이야기를 쓰거나 통계 목록을 생성하는 것과 같이 평범하고 무해한 과업을 수행하도록 모델에게 요청했습니다. 모델들은 숫자를 직접 언급하라는 요청에 일관되게 거부 의사를 밝혔으며, 모든 표준 안전 점검을 통과했습니다. 그러나 연구진이 이러한 무해한 요청에 대응하여 모델이 생성한 텍스트를 분석했을 때, 비밀 숫자가 출력물의 통계적 특성에 인코딩되어 있다는 것을 발견했습니다.

이를 증명하기 위해 연구진은 이러한 특정 통계적 패턴을 듣도록 훈련된 특수 디코더(decoder), 즉 도구를 구축했습니다. 연구진이 이 양호한 텍кси트(benign text)를 디코더에 입력했을 때, 디코더는 여러 최상위 모델에 걸쳐 비밀 숫자를 놀라울 정도로 정확하게 재구성해 냈습니다. 두 자리 숫자의 경우, 디코더는 여러 주요 모델에서 전체 숫자를 거의 완벽하게 복구했습니다. 우연히 맞추기 어려운 네 자리 숫자의 경우에도, 가장 유능한 모델들에서 디코더는 약 82%의 확률로 정확히 일치하는 결과를 얻었습니다. 이는 모델이 숫자를 말하도록 유도되지 않았고, 공격자가 모델의 내부 작동 방식에 대한 특별한 접근 권한을 갖지 않은 상태에서도 이루어졌습니다. 공격자는 일반 사용자처럼 최종 텍스트만을 보았을 뿐입니다.

이 연구는 정보 유출 능력이 쉽게 패치할 수 있는 버그가 아니라, 모델의 지능에 따른 부수적인 효과임을 드러냈습니다. 모델이 지시를 따르고 복잡한 과업을 이해하는 능력이 뛰어날수록, 메모리에 있는 비밀에 더 민감해지며 의도치 않게 더 많은 정보를 유출하게 됩니다. 연구진은 앤스로픽(Anthropic), 구글(Google), 오픈AI(OpenAI), xAI를 포함한 다양한 회사의 모델들을 테스트했습니다. 그 결과 일부 모델이 다른 모델보다 저항력이 높기는 했으나, 가장 강력한 모델일수록 일반적으로 더 많은 정보를 유출한다는 것을 발견했습니다. 실제로 "이 비밀을 지키라"는 지시를 가장 잘 따르는 모델들이 종종 이러한 미묘한 채널을 통해 가장 많은 정보를 유출했습니다. 이는 모델을 유용하고 순종적이게 만드는 바로 그 메커니즘이 동시에 그들을 취약하게 만드는 원인이 된다는 점을 시사합니다.

연구진은 이러한 유출이 단순히 숫자뿐만 아니라 사용자의 사적인 삶에 대해 배우는 데도 사용될 수 있는지 탐구했습니다. 그들은 특정 기억(예: 건강 상태나 금융 사건)이 컨텍스트에 존재하는지 여부를 모델의 출력을 통해 알 수 있는지 테스트했습니다. 훈련된 분류기(classifier)를 사용하여, 연구진은 모델의 일상적인 응답이 무작위 추측보다 훨씬 높은 성공률로 해당 기억의 존재를 드러낼 수 있다는 것을 발견했습니다. 이는 모델이 텍스트에서 해당 기억을 전혀 언급하지 않을 때도 마찬가지였습니다. 이 연구는 사용자의 개인 데이터에 의해 형성된 모델의 내부 상태가 모델이 쓰는 모든 문장에 통계적 지문을 남긴다는 것을 보여주었습니다.

가장 우려스러운 부분은 연구진이 시뮬레이션된 개인 에이전트로부터 전체 9자리 사회보장번호(Social Security number)를 추출하려고 시도한 실험이었습니다. 이 시나리오에서 공격자는 단순히 유출을 기다리는 것이 아니라, 모델이 느낌표(!)의 개수와 같은 특정 특징에 비밀을 인코딩하도록 대화를 능동적으로 설계했습니다. 이 행동을 유발하는 프롬프트를 최적화하는 기술을 사용함으로써, 공격자는 한 선도적인 모델에서 첫 번째 숫자를 거의 97%의 확률로 성공적으로 복구했으며, 나머지 8자리 숫자는 약 76%의 확률로 복구했습니다. 이는 컨텍스트가 수십만 단어를 포함하는 매우 긴 상황에서도, 그리고 모델이 숫자를 직접 쓰지 않는 상황에서도 작동했습니다.

이 연구는 현재 이러한 시스템을 보호하는 방법들이 불충분하다고 결론짓습니다. 모델에게 신중하라고 말하거나 출력물에서 특정 단어를 필터링하는 것만으로는 정보가 언어의 통계적 패턴을 통해 유출되는 것을 막을 수 없습니다. 연구진은 모델이 텍스트를 생성하는 동안 개인 데이터를 즉각적인 메모리에 보유하는 한, 그 데이터가 출력물에 영향을 미치고 이를 해독할 수 있다는 점을 지적합니다. 그들은 이 문제를 해결하기 위해서는 더 나은 지시어나 필터 이상의 것이 필요하며, 모델이 보유한 비밀과 통계적으로 독립적인 출력을 생성하도록 훈련하는 방식의 근본적인 변화가 필요할 수 있다고 제안합니다. 그때까지 우리가 디지털 비서에게 맡기는 비밀은 기계의 메모리보다 우리 자신의 마음속에 있을 때 더 안전할지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →