Subtract or Replay? Exact Deletion from Language-Model Memory
이 논문은 언어 모델 메모리로부터의 정확한 삭제가 근본적으로 메모리 표현에 의해 결정되며, 주소 지정 가능한 기록은 대수적 뺄셈을 통해 제거될 수 있는 반면 얽힌 쓰기(entangled writes)는 비트 단위의 상태 복원을 달 수 있도록 리플레이 기반의 재구축을 필요로 한다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
절대 잊지 않는 초지능 디지털 비서가 있다고 상상해 보세요. 당신이 비밀을 말하면, 그것은 비서의 뇌 속에 있는 거대하고 보이지 않는 도서관에 그 비밀을 저장합니다. 나중에 당신이 이야기를 쓰거나 조언을 구하면, 비서는 그 비밀을 꺼내어 도움을 줄 것입니다. 하지만 만약 당신이 마음을 바꾼다면 어떨까요? 만약 당신이 "사실, 그런 말 한 적 없어요"라거나 "실수였어요, 제발 지워주세요"라고 말한다면요? 현실 세계에서 편지를 태우면 그 글자들은 사라집니다. 하지만 컴퓨터에서 단순히 "잊으라"고 말하는 것은 까다로운 일입니다. 컴퓨터는 그 비밀을 깊숙한 곳에 숨겨두기만 하거나, 이미 그 비밀을 사용하여 자신의 뇌의 다른 부분을 구축했을 수도 있어서, 다른 모든 것을 망가뜨리지 않고는 단순히 "삭제"하는 것이 불가능할 수도 있습니다. 이것이 바로 "머신 언러닝(machine unlearning)"의 문제입니다. 과학자들은 AI가 단순히 잊는 척하는 것이 아니라, 명령에 따라 특정 정보를 진정으로 잊게 만드는 방법을 알아내기 위해 노력하고 있습니다. 이는 개인정보 보호에 있어 매우 중요한 문제로, 당신의 디지털 삶에 대한 "잊힐 권리"를 보장하며, 로봇에게 기억을 삭제하라고 요청했을 때 로봇이 실제로 수행하여 어떤 유령 같은 흔적도 남기지 않도록 하는 것을 의미합니다.
"Subtract or Replay?(뺄 것인가, 다시 재생할 것인가?)"라는 제목의 이 논문은 다음과 같은 간단한 질문을 던지며 이 문제를 다룹니다: 기억은 어떻게 저장되는가? 저자인 비슈와지스 라메쉬(Vishwajith Ramesh)와 동료들은 그 답이 전적으로 AI의 기억실 안에 있는 "가구"에 달려 있다는 것을 발견했습니다. 그들은 기억을 삭제하는 데 두 가지 매우 다른 방법이 있으며, 적절한 도구를 선택하지 않으면 실패하게 된다는 것을 발견했습니다.
기억을 삭제하는 두 가지 방법
이 논문은 이 아이디어를 두 가지 서로 다른 유형의 AI 모델, 즉 두 종류의 서로 다른 도서관 역할을 하는 모델에 대해 테스트합니다.
1. "주소 지정이 가능한" 도서관 (Gemma 모델)
모든 책에 고유한 번호가 붙은 선반이 있는 도서관을 상상해 보세요. 책을 제거하고 싶다면, 그냥 그 선반으로 가서 책을 꺼내면 됩니다. 도서관 전체를 다시 지을 필요는 없습니다.
저자들은 이를 Gemma라는 모델을 통해 테스트했습니다. 그들은 Gemma의 표준 메모리 부품 중 일부를 이 '주소 지정이 가능한' 도서관처럼 작동하는 특별한 시스템으로 교체했습니다. 이 시스템에서는 모든 정보가 AI의 답변에 얼마나 영향을 미칠지를 제어하는 "계수"(볼륨 조절 노브라고 생각하세요)를 가집니다.
- 마법의 기술: 기억을 삭제하기 위해, 그들은 단순히 볼륨 노브를 0으로 낮추었습니다. 이것을 "대수적 감산(algebraic decrement)"이라고 부릅니다.
- 결과: 완벽하게 작동했습니다. 노브를 낮추었을 때, AI의 출력은 마치 그 기억이 처음부터 없었던 것과 수학적으로 동일해졌습니다. 그 차이는 매우 미미하여 거의 0에 가까웠습니다(KL 발산 값 5.4 × 10⁻¹⁵).
- 함정: 이 방법은 작은 모델(10억 개의 파라미터)에서만 잘 작동합니다. 모델이 커질수록(40억 및 120억 개), 이 방법은 복잡해지고 비용이 많이 들며, AI의 성능을 각각 **11.2%**와 **44.3%**만큼 저하시킵니다. 따라서 "노브를 돌리는" 기술은 작은 도서관에는 완벽하지만, 거대한 도서관을 위한 만능 해결책은 아닙니다.
2. "직조된" 도서관 (Kimi 모델)
이제 책들이 선반 위에 있지 않은 다른 종류의 도서관을 상상해 보세요. 대신, 모든 책의 페이지가 하나의 거대한 단일 태피스트리(tapestry)로 엮여 있습니다. 만약 당신이 실 하나(기억 하나)를 뽑아낸다면, 태피스트리 전체가 움직이고 패턴이 예측할 수 없는 방식으로 변하게 됩니다.
저자들은 "재귀적 상태(recurrent state)"(태피스트리와 같은 기억)를 사용하는 Kimi 모델을 통해 이를 테스트했습니다. 여기서 모든 새로운 정보는 기억의 전체 상태를 변화시킵니다.
- 문제: 그들은 Gemma에서 했던 것처럼 단순히 기억을 "감산"하려고 시도했습니다. 그러나 실패했습니다. 기억이 엮여 있기 때문에, 하나의 실을 제거하는 것은 단순히 구멍을 남기는 것이 아니라 왜곡된 패턴을 남깁니다. 수학적으로 보면, 삭제된 부분의 뒤에 무엇이 오느냐에 따라 기억의 영향력이 **12%에서 49%**까지 변했습니다. 단순히 뺄 수는 없습니다. 삭제에 대한 "영수증"이 더 이상 유효하지 않게 됩니다.
- 해결책: 엮인 태피스트리에서 패턴을 망가뜨리지 않고 실을 뺄 수 없기 때문에, 반드시 재구축해야 합니다. 저자들은 "체크포인트 및 리플레이(checkpoint and replay)" 방법을 사용했습니다. 그들은 원치 않는 실이 엮이기 전의 태피스트리 스냅샷을 저장했습니다. 그런 다음, AI를 그 스냅샷으로 되돌린 후, 방금 전의 나쁜 실을 건너뛰고 그 이후에 일어난 모든 일을 다시 재생했습니다.
- 결과: 이것은 완벽하게 작동했습니다. 리플레이 후의 AI 기억은 나쁜 실을 본 적이 없는 기억과 **비트 단위로 동일(bit-for-bit identical)**했습니다. 그들은 최대 18,842 토큰 길이의 실제 임상 기록을 대상으로 테스트했으며, 매번 성공했습니다. 또한 나쁜 실을 좋은 실로 교체하여 기록을 완벽하게 "수정"하는 것도 가능했습니다.
이것이 당신에게 의미하는 바
이 논문의 주요 결론은 "정확한 삭제"란 단 하나의 마법 버튼이 아니라는 것입니다. 그것은 기억이 어떻게 구축되었는지에 따른 속성입니다.
- 만약 기억이 모든 기록에 대한 명확한 주소를 유지한다면(Gemma의 특별한 설정처럼), 빠르게 그리고 완벽하게 **감산(subtract)**할 수 있습니다.
- 만약 기억이 모든 것을 엮어 놓았다면(Kimi의 태피스트리처럼), 감산할 수 없습니다. 대신 저장된 체크포인트로부터 이야기를 **재구축(rebuild)**해야 합니다.
저자들은 자신들이 찾아낸 것이 아닌 것에 대해서도 매우 명확하게 밝히고 있습니다: 그들은 단순히 기억을 "마스킹"하거나 "억제"(AI에게 무시하라고 말하는 것)하는 것만으로는 충분하지 않다는 것을 증명했습니다. AI는 여전히 숨겨진 방식으로 그것을 "기억"할 수 있으며, 공격자들은 종-종 그것을 다시 끌어낼 수 있습니다. 진정한 삭제는 완벽한 감산이나 완벽한 재구축을 요구합니다.
요약하자면, AI가 진정으로 잊기를 원한다면, 먼저 그 기억의 방을 확인해야 합니다. 선반이 있는 도서관인가요? 그렇다면 노브를 돌리세요. 엮인 태피스트리인가요? 그렇다면 되감아서 다시 재생하세요. 지름길은 없지만, 이제 우리는 어떤 작업에 어떤 도구를 사용해야 하는지 정확히 알고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.