Extracting Training Data from Diffusion Language Models via Infilling
본 논문은 양방향 노이즈 제거 기능이 적대적 공격자가 가장자리 조건 마스크를 사용하여 편집된 개인 식별 정보를 포함한 3 배 이상의 정확한 문구를 추출할 수 있게 함으로써 확산 언어 모델이 자기회귀 모델보다 훈련 데이터 암기에 훨씬 더 취약함을 입증하기 위해 '인필링 추출'을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 초지능 도서관 보조원 (대형 언어 모델) 이 수백만 권의 책, 이메일, 문서를 읽었다고 상상해 보세요. 당신은 알고 싶습니다: 누군가 이 보조원에게 기억에서 특정 문장을 반복해 말하도록 요청한다면, 비밀을 누설할 가능성은 얼마나 될까요?
오랫동안 연구자들은 이 보조원에게 처음부터 시작해 "문장을 완성하라"고 요청하는 방식으로만 이를 테스트했습니다. 이는 이야기의 앞부분만 보여주고 나머지를 추측해 보라고 하는 것과 같습니다. 이는 인간이 책을 읽듯 왼쪽에서 오른쪽으로 읽는 표준 AI 모델에는 잘 작동합니다.
하지만 이 논문은 **확산 언어 모델 (Diffusion Language Model, DLM)**이라는 새로운 유형의 AI 를 소개합니다. DLM 을 독서가 아니라 손상된 그림을 복원하는 사람으로 생각하세요. 만약 걸작의 무작위 부분을 흰색 페인트 (마스크) 로 가린다면, DLM 의 임무는 전체 그림—왼쪽, 오른쪽, 그리고 중간에 무엇이 있는지—을 보고 숨겨진 부분이 무엇인지 추측하는 것입니다.
이 논문의 저자들은 말합니다: "이봐요, 우리는 그동안 이 그림 복원가들을 잘못된 방식으로 테스트해 왔어요!"
간단한 비유를 사용하여 그들의 발견을 다음과 같이 정리해 봅니다:
1. 구식 방식 vs. 신식 방식
- 구식 방식 (접두어 조건부): 그림 복원가에게 그림의 왼쪽 가장자리만 보여주고 "다음은 무엇인가?"라고 묻는다고 상상해 보세요. 논문은 오직 이 방법만 사용할 경우 DLM 은 꽤 안전해 보인다고 밝혔습니다. 비밀 정보를 많이 누설하지 않습니다.
- 신식 방식 (채우기 추출): 저자들은 DLM 이 간격의 양쪽을 모두 볼 수 있기 때문에, 교활한 공격자가 문장의 중간을 가리고 "빈칸을 채워라"고 요청할 수 있음을 깨달았습니다. 또는 끝을 가리고 "중간에는 무엇이 있나?"라고 요청할 수도 있습니다.
- 비유: 이는 "매드립스 (Mad Libs)" 게임을 하는 것과 같습니다. AI 에게 문장의 시작과 끝을 주면, 시작만 주어졌을 때 끝을 추측하지 못했더라도 중간 단어를 완벽하게 추측할 수 있을지도 모릅니다.
2. 대발견: "가장자리"가 위험 지대입니다
연구자들은 텍스트의 일부를 숨기는 (마스크 처리하는) 다양한 방법을 테스트했습니다. 그들은 텍스트를 숨기는 방식이 생각보다 더 중요하다는 것을 발견했습니다.
- "가장자리" 효과: 문장의 아주 시작과 아주 끝을 드러내고 (중간을 숨기고) 있다면, 시작 부분만 드러낸 경우보다 DLM 이 정확한 단어를 누설할 가능성이 세 배 더 높습니다.
- 왜 그럴까요? DLM 은 양쪽의 단서를 이용해 중간을 재구성하기 때문입니다. 이는 두 사람이 제삼자에게 비밀의 시작과 끝을 속삭이는 것과 같습니다. 한 사람만 시작을 속삭이는 경우보다 전체 비밀을 훨씬 쉽게 알아낼 수 있습니다.
3. "삭제된 문서" 시나리오
이 논문은 매우 현실적인 무서운 시나리오를 다룹니다:
- 한 회사가 개인 이메일로 AI 를 훈련시킨 후, 데이터나 모델을 공개하기 전에 전화번호와 이름을 모두 검은색으로 가려 (삭제) 놓았다고 상상해 보세요.
- 공격: 해커가 모델을 가져와서 "이름이 검은색으로 가려진 이메일을 가지고 있습니다. 빈칸을 채워 주세요"라고 말합니다.
- 결과: AI 가 삭제된 데이터로 훈련되었음에도 불구하고, 이 그림 복원가 (DLM) 는 주변 문맥을 보는 데 매우 능숙하여 표준적인 "책 읽기" AI 보다 검은색으로 가려진 이름이나 번호를 더 잘 추측할 수 있습니다.
- 교훈: 훈련 데이터에서 민감한 정보를 검은색으로 가렸다고 해서 AI 가 그것을 기억하지 않는다는 뜻은 아닙니다. 사실, 이 유형의 AI 에게는 양쪽의 문맥을 제공하면 비밀을 추측하는 것이 더 쉬울지도 모릅니다.
4. "복원" 설정 조정하기
연구자들은 텍스트를 "복원"하는 데 사용된 설정 (예: AI 가 추측하는 단계 수) 이 누설되는 양을 변화시킨다는 것도 발견했습니다.
- 천천히 그리고 꾸준히: AI 가 빈칸을 채우기 위해 작고 신중한 단계를 많이 거치게 하면, 비밀 정보가 더 많이 누설됩니다.
- 빠르고 느슨하게: 빠르게 추측하게 하면 누설되는 양이 적어집니다.
- 교훈: AI 를 더 빠르거나 똑똑하게 만들기 위해 조절하는 "노브"들은 동시에 얼마나 기억하는지도 통제합니다. 안전성에 영향을 주지 않고 속도만을 위한 노브 하나만 돌릴 수는 없습니다.
5. 미세 조정 (Fine-Tuning) 으로 해결되지 않습니다
마지막으로 그들은 질문했습니다: "나중에 AI 에게 정중한 챗봇이 되도록 가르친다면 (SFT 라는 과정), 비밀을 잊게 될까요?"
- 답변: 아닙니다. 이는 앵무새에게 새로운 단어를 가르쳐서 욕설을 멈추게 하려는 것과 같습니다. 앵무새는 가끔 그 말을 멈출지도 모릅니다. 하지만 올바른 질문 ( "가장자리" 트릭을 사용) 을 하면 여전히 옛날 비밀을 내뱉을 것입니다. 기억은 여전히 존재하며, 단지 재배열되었을 뿐입니다.
요약
이 논문은 확산 언어 모델이 단순히 책을 읽는 독서가 아니라 그림 복원가라는 점을 경고합니다. 문장의 시작부터 끝까지 완성하라고만 요청하여 테스트한다면, 그들이 안전하다고 생각하게 됩니다. 하지만 문장의 중간을 채우도록 요청하여 (양쪽의 단서를 활용) 테스트한다면, 훈련 데이터에서 삭제되었더라도 개인 정보를 누설할 가능성이 훨씬 더 큽니다.
주요 교훈: 우리는 한쪽 눈만 뜨고 (왼쪽에서 오른쪽으로 보며) 이 모델들을 테스트하는 것을 멈추고, 두 눈을 모두 뜨고 (전체 그림을 보며) 테스트하기 시작해야 합니다. 그렇지 않으면 그들이 보유하고 있는 개인 데이터의 양을 과소평가하게 될 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.