Unlearning at Scale: State-Exact Trace-Preserving Deletion in Billion-Parameter Language Models
이 논문은 원래의 실행 과정이 출처를 기록하도록 도구화되었고 오염되지 않은 체크포인트가 유지된다는 전제하에, 특정 예시들을 제외한 토큰 저장소로부터의 재학습을 재현함으로써 수십억 개의 파라미터를 가진 언어 모델이 상태-정확하고 추적 가능하며 보존적인 삭제를 달uc할 수 있음을 입증하지만, 이 방법이 분산된 삭제 요청에 대해 계산 효율성을 보장하지는 않는다는 점을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 층이 여러 개인 파티용 케이크를 굽고 있다고 상상해 보세요. 인공지능의 세계에서 이 케이크는 수 테라바이트의 텍스트를 "먹으며" 글을 쓰고, 대화하고, 문제를 해결하도록 훈련된 컴퓨터 프로그램인 "언어 모델"입니다. 보통, 일단 케이크가 구워지고 나면, 전체를 망치지 않고 특정 종류의 바닐라 빈 같은 단 하나의 재료만 쉽게 빼낼 수 없습니다. 만약 그것을 긁어내려고 시도한다면, 층이 무너지거나 맛이 예측 불가능한 방식으로 변할 수 있습니다. 이것이 바로 "머신 언러닝(machine unlearning)"의 문제입니다. 즉, AI가 훈련에 사용된 특정 데이터를 어떻게 "망각"하게 만들 것인가의 문제이며, 특히 GDPR과 같은 법률이 사람들에게 자신의 데이터를 삭제할 권리를 보장하는 경우 더욱 중요합니다.
과학자들은 전체 케이크를 해당 재료 없이 처음부터 다시 굽거나(느리고 비용이 많이 듭니다), 혹은 특정 풍미를 외과적으로 제거하려고 노력하며(종종 이상한 화학적 흔적을 남깁니다) 이 문제를 해결하기 위해 노력해 왔습니다. 하지만 함정이 있습니다. 컴퓨터는 단순히 무엇을 먹느냐뿐만 아니라, 재료를 넣는 순서, 오븐의 온도, 그리고 반죽을 젓는 정확한 타이밍으로부터도 배웁니다. 만약 재료의 순서를 바꾸면, 설령 나쁜 재료를 제거하더라도, 최종적인 케이크는 처음부터 그 재료를 제외하고 완벽하게 구워진 케이크와는 맛이 달라질 수 있습니다. 이 논문은 AI의 복잡하고 기술적인 주방 속으로 뛰어들어 매우 구체적인 질문을 던집니다: 특정 재료를 제거한 후에 구워진 케이크가, 처음부터 그 재료를 무시할 계획으로 구워진 케이크와 비트 단위로 완전히 동일하다는 것을 증명할 수 있는가?
"시간 여행" 케이크 레시피
"Unlearning at Scale"이라는 제목의 이 논문은 매우 정밀한 레시피를 테스트하기로 결정한 초정밀 제빵사 팀과 같습니다. 그들은 단순히 케이크가 바닐라를 잊은 것처럼 보이게 하려는 것이 아니라, 그 케이크가 애초에 바닐라를 가질 예정이 없었던 것과 수학적으로 동일하다는 것을 증명하고자 합니다.
이를 위해 그들은 특별한 "시간 여행" 시스템을 구축했습니다. 당신이 케이크를 굽고 있는데, 시작하기 전에 매우 상세하고 변경 불가능한 레시피 카드를 작성한다고 상상해 보세요. 이 카드는 단순히 재료 목록만 적는 것이 아니라, 각 달걀을 깨뜨리는 정확한 초 단위, 매 분마다의 정확한 오븐 온도, 그리고 밀가루를 넣는 구체적인 순서까지 기록합니다. 이것이 논문에서 말하는 "추적 보존(trace-preserving)" 실행입니다.
이제, 고객이 전화를 걸어 "제 주문에서 바닐라 빈을 제거하고 싶어요"라고 말한다고 가정해 봅시다. 일반적인 주방이라면 바닐라를 건너뛰고 계속 반죽을 하겠지만, 이 논문의 주방에서 제빵사들은 트릭을 가지고 있습니다. 그들은 레시피 카드를 똑같이 유지합니다. 레시피에 "5단계에서 바닐라 추가"라고 되어 있다면, 제빵사들은 여전히 5단계를 수행하되, 실제 바닐라를 넣는 대신 맛도 없고 무게도 없는 "더미(dummy)" 재료를 넣습니다. 그들은 다른 단계의 순서, 오븐 온도, 또는 젓는 속도를 변경하지 않고 이 작업을 수행합니다.
거대 규모의 테스트: 수십억 개의 파라미터를 가진 케이크
연구진은 다양한 크기의 세 가지 "케이크"(AI 모델)를 대상으로 이 아이디어를 테스트했습니다:
- Pythia 160M이라 불리는 작은 케이크 (1억 6천만 파라미터).
- Pythia 2.8B라는 거대한 케크 (28억 파라미터).
- Llama 3.2 1B라는 다른 종류의 케이크 (10억 파라미터).
그들은 거대한 실험을 수행했습니다. 먼저, 금지된 재료를 위해 "제로 웨이트(zero-weight)" 더미를 사용하여 "완벽한" 케이크를 구웠습니다. 이것이 "오라클(Oracle)"이며, 케이크가 갖춰야 할 황금 표준입니다. 그런 다음, 그들은 "편집된(redacted)" 방식을 사용하여 두 번째 케이크를 구웠습니다. 즉, 저장소(데이터 스토어)에서 금지된 재료를 물리적으로 제거했지만, 레시피 카드는 똑같이 따르되 레시피가 누락된 항목을 호출할 때마다 더미를 대체하여 넣었습니다.
결과: 완벽한 일치
결과는 놀라울 정도로 정밀했습니다. 두 케이크를 비교했을 때, "편집된" 케이크는 "오라클" 케이크와 비트 단위로 동일함을 발견했습니다.
- Pythia 2.8B 모델의 경우, 2,775,208,960개의 개별 숫자(모델 상태)를 확인했으며 차이점을 전혀 발견하지 못했습니다.
- Llama 3.2 1B 모델의 경우, 1,498,482,688개의 숫자를 확인했으며 차이점을 발견하지 못했습니다.
- 심지어 "옵티마이저 상태(optimizer state)"(제빵사가 진행 과정에서 레시피를 어떻게 조정했는지에 대한 기억과 같은 것)도 정확히 일치했습니다.
이는 만약 적절한 "레시피 카드"(실행 계획)를 가지고 있고, 깨끗한 체크포인트(나쁜 재료가 추가되기 전의 케이크 스냅샷)에서 시작한다면, 데이터를 제거하여 결과적으로 그 데이터가 애초에 없었던 것과 수학적으로 구별할 수 없는 결과를 얻을 수 있음을 증명합니다.
함정: 이것은 마법 지팡이가 아닙니다
그러나 이 논문은 이 방법이 데이터를 빠르게 삭제하기 위한 "마법 지팡이"라고 부르는 것에 매우 주의를 기울입니다. 저자는 주요한 한계점을 지적합니다: 시간입니다.
만약 금지된 재료가 베이킹 과정 초기에 추가되었거나, 재료들이 레시피 곳에 무작위로 흩어져 있었다면, 제빵사들은 정확한 결과를 얻기 위해 거의 전체 케이크를 처음부터 다시 구워야 합니다.
- 그들의 테스트에서, 만약 무작위로 5%의 데이터를 제거해 달라고 요청했다면, 그들은 거의 **100%**의 훈련 단계를 다시 재생해야 했습니다.
- 논문은 이 방식이 "저렴한 삭제(cheap deletion)"를 확립하는 것이 아님을 명시적으로 밝히고 있습니다. 이것은 빠른 해결책이 아니라, 느리고 정밀한 재구축입니다.
이것이 의미하지 않는 것
저자는 자신의 결과가 무엇을 증명하지 않는지에 대해 매우 엄격합니다:
- 이는 행동적 보장이 아닙니다: 숫자가 동일하다고 해서 AI가 법적 삭제 요청을 충족하는 방식으로 다르게 "행동"할 것이라는 점이 자동으로 보장되는 것은 아닙니다. 논문은 AI가 어떻게 행동하는지 보기 위해 몇 가지 표준 테스트를 실행했지만, 이를 실제 법적 삭제를 위한 증명이 아닌 단순한 "기술적" 노트로 취급합니다.
- 이는 보편적인 해결책이 아닙니다: 이것은 미리 계획된 경우에만 작동합니다. 이 특별한 "레시피 카드" 없이 만들어진 기존의 AI 모델을 가져와서 나중에 마법처럼 이 방식으로 작동하게 만들 수는 없습니다.
- 이는 프라이버시 보호막이 아닙니다: 논문은 숫자가 재생 저장소에서 사라졌다고 해서, 그것이 우주의 모든 백업, 캐시 또는 하드 드라이브에서 데이터가 삭제되었음을 증명하는 것은 아니라고 인정합니다.
핵심 요약
간단히 말해서, 이 논문은 매우 구체적이고 매우 엄격한 유형의 "망각"에 대한 개념 증명입니다. 만약 당신이 경직되고 변경 불가능한 계획과 모든 단계를 기록할 수 있는 방법을 갖추고 AI 훈련 과정을 구축한다면, 데이터를 외과적으로 제거하여 수학적으로 완벽한 결과를 얻을 수 있음을 보여줍니다. 이는 복잡한 레시피에서 실제 바닐라 빈을 가짜로 교체해도, 바닐라가 아예 없었던 것과 구별할 수 없는 케이크를 만들 수 있음을 증명하는 것과 같습니다.
하지만 논문은 또한 우리에게 경고합니다: 이것은 무겁고 느린 과정입니다. 이는 사전 계획을 필요로 하며, 제거하고 싶은 데이터가 여기저기 흩어져 있다면, 차라리 케이크 전체를 다시 굽는 것이 나을 수도 있습니다. 이것은 과학자들이 컴퓨터 프로그램에서 정확히 어떤 일이 일어났는지 증명해야 할 때 사용하는 강력한 도구이지만, 아직 현실 세계에서 데이터를 삭제하기 위한 빠른 버튼은 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.