Deep Contrastive Unlearning for Language Models
본 논문은 기존 방법들이 샘플의 기하학적 분포를 무시한다는 한계를 해결하기 위해, 특정 학습 데이터를 효과적으로 제거하면서도 예측 품질을 보존하도록 딥 대조 학습(deep contrastive learning)을 사용하여 언어 모델의 잠재 공간을 최적화하는 머신 언러닝 프레임워크인 DeepCUT을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 시대에 우리의 삶은 소셜 미디어 게시물, 의료 기록, 법적 문서, 개인 이메일과 같이 점점 더 텍스트로 기록되고 있습니다. 글을 쓰고, 번역하고, 질문에 답할 수 있는 강력한 컴퓨터 프로그램인 거대 언어 모델은 이러한 인간이 생성한 방대한 데이터의 바다를 학습합니다. 이들은 수백만 개의 사례를 읽음으로써 언어와 지식의 패턴을 흡수하여 믿기지 않을 정도로 유용한 도구가 됩니다. 그러나 이러한 실제 데이터에 대한 의존은 중대한 문제를 야기합니다. 만약 어떤 사람이 자신의 개인 정보가 사용되는 것을 더 이상 원하지 않거나, 특정 데이터가 부정확하거나 민감한 것으로 판명될 경우, 현재 데이터를 삭제하고 전체 학습 과정을 처음부터 다시 시작하는 방법 외에는 대안이 없습니다. 수십억 개의 단어를 학습하는 데 몇 주가 걸리는 모델의 경우, 이는 단 한 권의 책을 제거하기 위해 도서관 전체를 불태우는 것과 같습니다. 이는 너무 느리고 비용이 많이 들며, 사람들이 '잊힐 권리'를 행사할 때 신속하게 수행하는 것이 종종 불가능합니다.
이를 해결하기 위해 연구자들은 '기계 언러닝(machine unlearning)'이라 불리는 분야를 개발해 왔습니다. 이 목표는 모델이 전체를 다시 학습하지 않고도 특정 정보를 잊도록 가르치는 것입니다. 교과서를 암기한 학생을 상상해 보십시오. 기계 언러닝은 그 학생을 새로운 학년으로 다시 보내지 않고도, 다른 모든 것은 기억하면서 특정 단원만을 잊게 만드는 것을 목표로 합니다. 이미지나 단순한 데이터에 대해서는 이를 수행하는 몇몇 방법이 존재하지만, 복잡하고 미묘한 언어의 세계에 적용하는 것은 어려운 일로 증명되었습니다. 기존의 대부분의 시도는 모델이 내놓는 최종 답변에만 초점을 맞추어, 모델이 잊어야 할 주제를 더 이상 언급하지 않도록 출력을 미세하게 조정하려고 합니다. 하지만 이 접근 방식은 데이터에 대한 근본적인 기억을 모델의 내부 계산 깊숙한 곳에 그대로 남겨두어, 다시 나타날 준비를 하게 만듭니다.
RMIT 대학교의 연구진은 모델이 자신의 마음속에 정보를 어떻게 조직하는지를 직접 들여다보는 'DeepCUT'이라는 새로운 방법을 제 제안했습니다. DeepCUT은 모델이 가진 지식의 내부 지도를 재구성함으로써, 단순히 최종 답변을 수정하는 대신 모델의 내부 공간을 재편합니다. 연구진은 노이즈가 섞인 소셜 미디어 게시물부터 정밀한 생물 의학 문헌에 이르기까지 네 가지 서로 다른 실제 데이터 세트를 사용하여 언어 모델을 학습시켰습니다. 그런 다음 모델에게 전체 학습 세트의 1%에서 10%에 이르는 특정 부분의 데이터를 잊으라고 요청했습니다. 망각이 제대로 이루어졌는지 테스트하기 위해, 연구진은 모델이 잊기로 한 데이터에 대한 질문에 얼마나 잘 답할 수 있는지, 그리고 유지해야 하는 데이터에 대한 능력을 얼마나 잘 보유하고 있는지를 측정했습니다.
결과는 기존의 방법들이 종종 비효율적이거나 불완전하다는 것을 보여주었습니다. 단순히 남은 데이터로 모델을 계속 학습시키는 기술인 '파괴적 망각(catastrophic forgetting)'은 제거된 텍스트의 특정 기억을 지우는 데 실패했습니다. 모델은 여전히 금지된 데이터를 높은 정확도로 기억하고 있었습니다. 또한, 데이터를 작은 덩어리로 나누고 영향을 받은 부분만을 다시 학습시키는 흔한 전략은 데이터를 제거하는 데는 효과적이었으나, 모델의 전반적인 지능을 크게 손상시켜 일반적인 작업에서의 정확도를 떨어뜨렸습니다. 반면, DeepCUT 방식은 특정 기억을 성공적으로 지우면서도 모델의 일반적인 성능을 온전히 유지했습니다. 잊기로 한 데이터에 대해 테스트했을 때, DeepCUT 모델의 정확도는 급격히 떨어졌으며, 이는 모델이 해당 정보를 진정으로 잊었음을 나타냈습니다. 동시에, 기억해야 할 데이터에 대해서는 높은 정확도를 유지하며 처음부터 완전히 다시 학습시킨 모델만큼이나 잘 수행했습니다.
이러한 성공의 비결은 모델의 내부 공간을 조작하는 방식에 있습니다. 연구진은 데이터 포인트를 지도 위의 위치로 취급했습니다. 특정 정보를 잊게 만들기 위해, 그들은 해당 데이터 조각을 자신의 그룹으로부터 멀리 밀어내고 다른 그룹들 쪽으로 끌어당김으로써, 모델의 기억 속에서 그 데이터의 고유한 정체성을 효과적으로 뒤섞었습니다. 이 과정은 모델이 해당 데이터를 독특하게 만들었던 특정 특징들을 더 이상 인식할 수 없도록 보장하는 동시에, 나머지 지도는 흐트러뜨리지 않고 그대로 둡니다. 실험을 통해 이 접근 방식이 데이터를 제거하는 데 효과적일 뿐만 아니라, 모델 전체를 다시 학습시키는 것보다 훨씬 빠르다는 것이 입증되었습니다. 정보의 기하학적 배치에 집중함으로써, 연구진은 모델의 기억을 외과적으로 제거하는 방법을 찾아냈으며, 이는 인공지능 시대에 개인 정보를 보호하기 위한 실질적인 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.