← 최신 논문
🤖 machine learning

Leak It: A Probabilistic Approach to Training-Data Extraction from Black-Box Language Models

이 논문은 ROC-AUC와 같은 집계된 멤버십 추론 지표가 블랙박스 언어 모델로부터의 구절 단위 훈련 데이터 추출이라는 용량 의존적인 심각한 위험을 가린다는 점을 주장하며, 식별자나 코드가 포함된 특정 문서들이 블라인드 베이스라인이나 중복 제거와 관계없이 빈번하게 유출됨을 입증하고, 이러한 프라이버시 피해를 정확하게 측정하기 위해 "leakit" 도구를 통한 문서별 확률적 감사 프레임워크를 제안한다.

원저자: Victor Maricato

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Victor Maricato

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 신비로운 케이크를 만드는 데 특정 비밀 레시피가 사용되었는지 알아내려고 노력 중이라고 상상해 보세요. 당신은 주방을 볼 수도 없고, 제빵사에게 재료 목록을 물어볼 수도 없습니다. 당신이 할 수 있는 일이라고는 이전에 발견한 아주 작은 케이크 부스러기를 토대로 제빵사에게 케이크를 몇 조각 더 만들어 달라고 요청하는 것뿐입니다. 만약 당신이 요청할 때마다 제빵사가 똑같은 비밀 재료 목록을 계속해서 내뱉는다면, 당신은 그 비밀 레시피가 정말로 그들의 기억 속에 들어있다고 추측할 수 있을 것입니다. 이것이 바로 "언어 모델(Language Models)"의 세계입니다. 언어 모델은 인터넷에서 방대한 양의 텍스트를 읽으며 학습하는 매우 똑똑한 컴퓨터 프로그램입니다. 이들은 케이크 대신 문장에서 다음에 올 단어를 예측한다는 점에서 마치 그 제빵사들과 같습니다.

과학자들이 던지는 큰 질문은 "이 디지털 제빵사들이 자신이 먹었던 특정 책들을 기억하고 있는가?" 하는 점입니다. 이를 "멤버십 추론(Membership Inference)"이라고 부릅니다. 만약 모델이 특정 문서를 기억하고 있다면, 그 문서 안에 숨겨져 있던 이메일 주소나 전화번호 같은 개인적인 세부 정보를 실수로 내뱉을 수도 있습니다. 오랫동안 연구자들은 이 문제를 측정하기 위해 테스트의 "평균" 성능을 살펴보는 방식을 시도해 왔습니다. 그들은 "우리 테스트의 정확도는 90%입니다!"라고 말하곤 했습니다. 하지만 갑작스럽고 위험한 폭풍우를 놓치면서도 "대체로 맑음"이라고 예보하는 일기예보처럼, 이러한 평균 점수는 운 나쁜 소수의 사람들에게 정보가 유출되는 사실을 가릴 수 있습니다.

"LEAK IT"이라는 제목의 이 논문은 이러한 디지털 유출을 잡아내는 방식에 대해 새로운 시각을 제시합니다. 빅터 마리카토(Victor Maricato)가 이끄는 저자진은 기존의 프라이버시 측정 방식이 오해의 소지가 있다고 주장합니다. 그들은 특정 문서가 훈련 데이터에 포함되었는지 감지한다고 주장하는 많은 "똑똑한" 테스트들이, 실제로는 모델의 기억이 아니라 텍스트 자체의 스타일을 바탕으로 추측하고 있었음을 발견했습니다. 이는 마치 프로스팅의 색깔만 보고 케이크가 비밀 레시피로 만들어졌는지 맞히려는 것과 같습니다. 프로스팅의 색깔은 사실 우연히 결정된 것일 뿐인데 말이죠.

하지만 이 논문은 더 위험한 진실을 밝혀냅니다. "평균적인" 테스트는 무해해 보일지 모르지만, 모델은 매우 특정한 소수의 문서들에 대해서는 실제로 정보를 유출하고 있다는 것입니다. 연구자는 만약 모델에게 코드 조각이나 실제 이메일 주소가 포함된 문서로부터 문장을 이어가라고 요청하면, 모델이 가끔 그 정확하고 사적인 정보를 그대로 내뱉는다는 것을 발견했습니다. 이는 마치 제빵사에게 특정하고 희귀한 향신료에 대해 이야기하며 문장을 완성해 달라고 하면, 밀가루 같은 흔한 재료에 대해서는 그러지 않으면서도 갑습니다, 그 특정 향신료의 정확한 브랜드와 배치 번호까지 외쳐버리는 것과 같습니다.

연구 결과, 이러한 "축자적 추출(verbatim extraction)"은 모델이 커질수록 더 심해지는 것으로 나타났습니다. 69억 개의 파라미터를 가진 모델의 경우, 실제 식별자(이메일이나 전화번호 등)를 포함한 문서의 약 16.6%가 이런 방식으로 유출되었습니다. 놀랍게도 저자는 훈련 데이터에서 중복된 텍스트를 제거하는 것(흔히 쓰이는 안전 조치)이 이 현상을 막는 데 별로 도움이 되지 않는다는 것을 발견했습니다. 또한 이 위험이 고르게 퍼져 있지 않다는 것도 보여주었습니다. 즉, 일반적인 이야기나 기사보다 컴퓨터 코드에서 훨씬 더 높게 나타납니다.

이 연구의 핵심 요점은 우리가 "평균적인" 프라이버시 점수를 보는 것을 멈추고, 이러한 구체적이고 고위험인 유출을 확인하기 시작해야 한다는 것입니다. 저자는 감사자들이 이러한 정확한 유출 순간을 찾을 수 있도록 돕기 위해 "leakit"이라는 새로운 도구를 공개했습니다. 그들은 단순히 "모델이 대체로 안전하다"라고 말하는 대신, 특정 문서들에 대해서는 모델이 매우 효과적인 메모리 유출 도구가 될 수 있음을 인정해야 하며, 이를 해결하기 위해 "차분 프라이버시(differential privacy)"라는 특별한 프라이버시 보호막과 같은 더 강력한 보호책이 필요하다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →