상상해 보세요. AI 는 인터넷에 떠도는 수많은 책과 글을 다 읽어서 공부합니다. 그런데 그 책들 속에 실제 사람들의 이메일 주소, 전화번호, IP 주소 같은 개인 정보가 섞여 있을 수 있죠.
AI 는 이 정보들을 단순히 '지식'으로만 저장하는 게 아니라, 시험 문제처럼 통째로 외워버립니다.
상황: 연구자들이 AI 에게 "이 문장의 다음 글자가 뭐야?"라고 물으면, AI 는 외운 대로 정확하게 그 사람의 이메일이나 전화번호를 뱉어냅니다.
비유: 마치 친구가 "너 어제 뭐 했어?"라고 물었을 때, AI 가 "아니, 나 어제 김철수 씨의 전화번호인 010-1234-5678 로 전화했어"라고 그대로 말해버리는 것과 같습니다. 이를 논문에서는 **'앵무새처럼 따라 말하기 (Parroting)'**라고 부릅니다.
2. 해결책: 더 똑똑한 '수색대' (R&R Detector)
연구자들은 먼저 "도대체 AI 가 읽은 책 속에 개인 정보가 얼마나 많이 숨어 있을까?"를 찾아야 했습니다. 기존에 쓰던 도구들은 마치 낡은 금속 탐지기처럼, 중요한 건 놓치고 헛것을 잡는 경우가 많았습니다.
그래서 연구자들은 **새로운 '수색대 (R&R)'**를 만들었습니다.
비유: 기존 도구가 "숫자가 10 개면 다 전화번호야!"라고 막 잡았다면, 새 도구는 **"이 숫자 뒤에 '전화'라는 뜻이 있나? 아니면 그냥 책 번호 (ISBN) 나 다른 코드인가?"**를 꼼꼼히 따져봅니다.
결과: 이 새로운 수색대는 이메일, 전화번호, IP 주소를 훨씬 정확하게 찾아냈습니다. 특히 미국/캐나다 전화번호나 국가 번호 (+1) 가 붙은 번호를 찾는 데는 기존 도구보다 훨씬 뛰어났습니다.
3. 실험 결과: 크고 오래 공부할수록 기억력이 더 나빠진다?
연구자들은 다양한 크기의 AI 모델 (작은 것부터 거대하게까지) 을 실험해 보았습니다.
크기의 함정: "AI 가 작으면 기억력이 약할 거야?"라고 생각할 수 있지만, 작은 AI 모델조차도 개인 정보의 약 2.7% 를 그대로 외워서 말해버렸습니다.
학습의 역설: AI 가 더 큰 규모로, 더 많은 시간 (학습 단계) 동안 공부할수록, 외워서 말해버리는 비율이 더 높아졌습니다. 거대한 AI 일수록 개인 정보를 더 많이 '암기'하고 있다는 뜻입니다.
비유: AI 가 도서관을 더 많이 돌고 더 많은 책을 읽을수록, 그중에서 '비밀 일기'를 더 많이 외워버리는 셈입니다.
4. 놀라운 사실: 조금만 힌트를 주면 다 말해버린다
AI 가 개인 정보를 기억하려면 긴 문맥이 필요할 거라고 생각할 수 있지만, 아니었습니다.
비유: AI 에게 "김철수 씨의 이메일은..."이라고 **짧은 힌트 (10 개의 단어)**만 줘도, AI 는 나머지 이메일 주소를 완벽하게 외워서 말해버렸습니다.
이는 AI 가 개인 정보를 얼마나 쉽게 '기억'하고 있는지를 보여줍니다.
5. 결론: 우리는 무엇을 해야 할까?
이 연구는 우리에게 중요한 메시지를 줍니다.
데이터 청소가 필수: AI 를 만들 때, 훈련용 데이터 (책) 를 준비하는 과정에서 개인 정보를 미리 찾아서 지워버리는 (필터링) 작업이 매우 중요합니다.
작은 AI 도 위험: AI 가 작다고 해서 안심하면 안 됩니다. 작은 모델도 개인 정보를 기억할 수 있습니다.
새로운 도구 사용: 연구자들이 만든 더 정확한 '수색대 (R&R)'를 사용해서 데이터를 깨끗하게 만드는 것이 필요합니다.
한 줄 요약:
"AI 는 우리가 생각한 것보다 훨씬 더 많은 사람의 비밀을 외우고 있습니다. AI 가 더 똑똑해지기 전에, 그 '비밀 일기'들을 미리 찾아서 지워주는 청소가 꼭 필요합니다."
이 연구는 AI 개발자들이 "더 많은 데이터를 모으는 것"보다 "더 깨끗한 데이터를 모으는 것"에 더 신경 써야 함을 강력하게 주장하고 있습니다.
1. 문제 정의 (Problem)
현대 대규모 언어 모델 (LLM) 은 웹에서 수집된 수조 개의 토큰으로 학습되며, 이 데이터에는 수백만 건의 개인 정보 (PI: Personal Information) 가 포함되어 있습니다. 문제는 모델이 이러한 훈련 데이터를 단순히 암기 (memorization) 하고, 특정 프롬프트를 통해 개인 정보를 그대로 재생성 (parroting) 할 수 있다는 점입니다.
현재의 한계: 기존 PI 필터링 및 익명화 작업은 계산 비용이 높은 모델 기반 접근법 대신 정규식 (regex) 기반 도구에 의존하고 있습니다. 그러나 기존 도구들은 정확도가 낮아 많은 PI 가 훈련 데이터에 남아있고, 이로 인해 모델이 개인 정보를 유출할 위험이 큽니다.
핵심 질문: LLM 은 훈련 데이터의 개인 정보를 얼마나 정확하게 암기하여 재생성하는가? 그리고 모델의 크기나 학습 단계가 이 현상에 어떤 영향을 미치는가?
2. 방법론 (Methodology)
A. R&R 감지 도구 개발 (Detection Suite)
기존의 가장 효율적인 베이스라인인 WIMBD (Elazar et al., 2023) 를 개선한 새로운 감지 도구인 R&R (Regexes and Rules) 을 개발했습니다.
대상 PI: 이메일 주소, IP 주소, 미국/캐나다 전화번호 (+1 국가코드 포함).
정규식 (Regex) 개선:
이메일: 비전통적 도메인 이름을 감지할 수 있도록 사용자 이름 부분의 문자 범위를 확장.
IP: WIMBD 가 IPv4 만 지원하던 것을 개선하여 IPv6 패턴 추가.
전화번호: 10 자리 초과 숫자 등 오탐지 (False Positive) 제거를 위한 정규식 개선 및 국가 코드 (+1) 포함 형식 지원.
규칙 (Rules) 추가: 정규식만으로는 포착하기 어려운 문맥적 뉘앙스를 처리하기 위한 후처리 규칙 도입.
ISBN, DOI, 특허 번호 등 유사한 형식의 숫자 필터링.
123-456-7890 과 같은 더미 (placeholder) 데이터 제거.
전화번호의 경우 NANP(북미 번호 계획) 규정을 준수하는 면적 코드 (Area Code) 및 중앙 사무실 코드 검증.
B. 데이터셋 및 실험 설정
데이터셋: 3,830 억 토큰 규모의 오픈 소스 프리트레이닝 데이터셋인 The Pile을 사용.
모델:Pythia 모델 스위트 (160M ~ 6.9B 파라미터) 및 다양한 학습 스텝 (70k ~ 143k) 을 가진 체크포인트 사용.
수동 검증: R&R 과 WIMBD 의 감지 결과를 비교하기 위해 1,750 건의 감지 결과를 수동으로 주석 (Annotation) 하여 483 건의 정답 (Gold Set) 을 확보.
암기 측정 지표 (PARROTSCORE):
모델이 PI 앞의 토큰 (프롬프트) 을 입력으로 받았을 때, 탐지된 PI 를 그대로 생성하는지 확인.
생성된 문자열과 정답 문자열 간의 레벤슈타인 거리 (Levenshtein distance) 를 기반으로 유사도 점수 (0~1) 계산. 점수 1 은 완전한 verbatim parroting(완벽한 재생성) 을 의미.
3. 주요 기여 (Key Contributions)
고성능 PI 감지 도구 (R&R) 개발: 이메일, IP, 전화번호 (국가코드 포함) 를 감지하는 4 가지 감지기를 포함하며, 기존 WIMBD 보다 정밀도 (Precision) 가 월등히 뛰어남.
암기 현상의 정량화: Pythia 모델 스위트를 활용하여 모델 크기, 프리트레이닝 단계, 프롬프트 길이 (prefix length) 가 PI 암기에 미치는 영향을 체계적으로 분석.
구성 요소별 암기 분석: 이메일 (사용자명/도메인), IP(각 세그먼트), 전화번호 (면적 코드/나머지) 등 PI 의 구성 요소별로 암기 정도를 세분화하여 측정.
4. 실험 결과 (Results)
A. 감지 성능 비교
정밀도 향상: 수동 주석 분석 결과, R&R 은 20 개 카테고리 중 17 개에서 WIMBD 보다 우수한 성능을 보임.
특이점: WIMBD 는 국가 코드 (+1) 가 포함된 전화번호를 전혀 감지하지 못해 정밀도가 0% 였으나, R&R 은 평균 0.3 의 정밀도를 기록. 이메일과 전화번호 감지에서 통계적으로 유의미한 개선을 보임.
B. 모델 크기와 암기 (Memorization)
양의 상관관계: 모델 크기가 커질수록 PI 를 verbatim parroting 하는 비율이 증가함.
6.9B 모델: 감지된 이메일의 약 19.63%, IP 주소의 14.17% 를 완벽하게 재생성.
**160M (최소) 모델:**조차 이메일의 2.34%, IP 의 4.72% 를 완벽하게 재생성하여, 작은 모델조차 심각한 프라이버시 위험을 내포함을 확인.
PI 유형별 차이: 이메일이 가장 많이 재생성되었고, 그다음 IP, 전화번호 순서였음. 전화번호는 모델 크기와 상관없이 재생성률이 낮았으나, 이는 모델이 전화번호를 암기하기 어렵기 때문임.
C. 학습 단계 및 프롬프트 길이의 영향
학습 단계: 학습이 절반 (70k 스텝) 일 때도 완전 학습 (143k 스텝) 일 때와 유사한 암기 수준을 보임. 즉, 학습 초기 단계에서도 PI 암기가 발생하며 학습이 진행될수록 사라지지 않음.
프롬프트 길이: 프롬프트 길이가 짧아도 (최소 10 토큰) 모델은 PI 를 재생성 가능. 6.9B 모델은 10 토큰 프롬프트로도 평균 PARROTSCORE 0.34 를 기록.
D. 구성 요소별 암기 (Constituent Parts)
이메일: 도메인과 사용자명 모두 높은 비율로 재생성됨 (6.9B 모델 기준 도메인 30.84%, 사용자명 26.17%).
IP 주소: 왼쪽에서 오른쪽으로 생성되는 특성상 앞쪽 세그먼트일수록 재생성 확률이 높음.
전화번호: 전체 번호는 3% 미만으로 재생성되지만, 면적 코드 (Area Code) 는 6.9B 모델 기준 19.67% 로 매우 높게 재생성됨. 면적 코드는 지리적 위치와 밀접하므로 이는 심각한 프라이버시 위험임.
5. 의의 및 결론 (Significance & Conclusion)
위험성 재확인: 모델 크기가 커질수록뿐만 아니라, 가장 작은 모델조차 개인 정보를 암기하고 재생성할 수 있음을 증명. 이는 "작은 모델은 안전하다"는 가정을 무너뜨림.
데이터 전처리의 중요성: 모델 구조나 학습 방법 변경만으로는 PI 유출을 막기 어렵다. 프리트레이닝 데이터셋의 공격적인 필터링과 익명화가 필수적임.
도구 제공: 개발된 R&R 감지 도구와 정규식을 오픈소스로 공개하여, 연구 커뮤니티가 더 나은 데이터 정제 (Sanitization) 를 수행할 수 있도록 지원.
향후 방향: LLM 개발 시 데이터 수집 단계에서 PI 를 철저히 제거하고, 모델이 개인 정보를 재생성하지 않도록 하는 윤리적 및 기술적 노력이 시급함.
이 논문은 LLM 의 프라이버시 위험이 단순히 '대규모 모델'의 문제가 아니라, 데이터의 질과 전처리 과정에 근본적으로 달려 있음을 강조하며, 더 강력한 PI 감지 도구와 엄격한 데이터 필터링의 필요성을 역설합니다.