← 최신 논문
🤖 machine learning

Revisiting the Past: Data Unlearning with Model State History

본 논문은 기존 모델 체크포인트를 활용하여 대규모 언어 모델에서 특정 데이터를 효율적이고 효과적으로 잊게 하는 새로운 알고리즘인 모델 상태 연산 (MSA) 을 소개하며, 이는 완전한 재학습의 막대한 비용을 피하면서도 기존 방법들을 능가하는 성능을 보여줍니다.

원저자: Keivan Rezaei, Mehrdad Saberi, Abhilasha Ravichander, Soheil Feizi

게시일 2026-04-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Keivan Rezaei, Mehrdad Saberi, Abhilasha Ravichander, Soheil Feizi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"과거를 재방문하다: 모델 상태 이력을 활용한 데이터 망각"이라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 풀어보겠습니다.

큰 문제: "재학습"의 딜레마

수십억 권의 책을 읽은 거대하고 초지능적인 도서관 (대형 언어 모델) 이 있다고 상상해 보세요. 어느 날, 이 컬렉션 중 한 권의 책에 위험한 화학 물질의 비밀 레시피가 들어 있거나, 혹은 그곳에 있어서는 안 되는 개인 일기가 있다는 사실을 깨닫게 됩니다.

이를 해결하기 위해 기존의 사고방식은 도서관을 해체하여 그 한 권의 책을 제거한 뒤, 도서관 전체를 처음부터 다시 짓는 것이었습니다. 하지만 도서관이 너무 거대하기 때문에, 다시 짓는 데는 수년이 걸리고 천문학적 비용이 듭니다. 이는 산처럼 쌓인 과일에서 나쁜 사과 하나를 제거하기 위해 산 전체를 버리고 새 과일을 사는 것과 같습니다.

**머신 언러닝 (Machine Unlearning)**은 산 전체를 다시 짓지 않고 그 나쁜 사과 하나만을 외과 수술처럼 제거하려는 시도입니다. 그러나 이를 수행하는 것은 매우 어렵습니다. 그 책에 대한 기억을 "지우려" 하면, 종종 도서관이 알고 있던 다른 좋은 것들까지 실수로 지워버리거나, 도서관이 이상하고 혼란스러운 행동을 하기 시작합니다.

새로운 해결책: MSA(모델 상태 연산)

저자들은 **MSA(모델 상태 연산)**이라는 새로운 방법을 제안합니다. 완성된 도서관에서 나쁜 기억을 지우려 애쓰는 대신, 그들은 "시간 여행" 방식을 사용합니다.

비유: 건설 설계도

도서관이 건설 팀에 의해 지어지고 있다고 상상해 보세요.

  1. 최종 건물: 이것이 완성된 모델 (나쁜 책이 포함된 도서관) 입니다.
  2. 설계도: 건설 과정에서 팀은 건물의 다른 단계에서 사진을 찍었습니다. 나쁜 책이 선반에 추가되기 에 찍은 사진이 있다고 가정해 봅시다. 이것이 체크포인트입니다.

MSA 의 작동 원리:

  1. "망각" 벡터: 연구자들은 그 옛날 사진 (체크포인트) 을 가져와서 질문합니다. "이 버전의 건물에 나쁜 책을 추가한다면, 구조가 어떻게 변할까?" 그들은 '깨끗한' 버전과 '더러운' 버전 사이의 정확한 차이를 계산합니다. 이 차이를 **"망각 벡터 (Forget Vector)"**라고 부릅니다.
  2. 연산: 이제 그들은 완성된 건물 (현재 모델) 로 갑니다. 책을 어떻게 제거할지 추측하는 대신, 앞서 계산한 "망각 벡터"를 가져와서 완성된 건물에서 빼기만 합니다.

이는 "그 한 권의 책 추가 효과를 되돌리려면 도서관의 벽을 정확히 이만큼 이동시키면 된다"는 정밀한 수학 공식을 가진 것과 같습니다.

기존 방법보다 나은 이유

기존 방법들은 완성된 도서관만 바라보며 책을 어떻게 제거할지 파악하려 했습니다.

  • 문제점: 도서관이 완성될 때까지는 나쁜 책이 이미 건물 전체의 배치에 영향을 미쳤습니다. 완성된 상태에서 제거를 역추적하려는 것은 구운 케이크를 다시 섞으려는 것과 같습니다. 결과는 엉망이 됩니다.
  • MSA 의 장점: MSA 는 나쁜 책이 도착하기 의 "이전" 사진 (체크포인트) 을 사용하므로, 건물이 어떻게 생겼는지 정확히 알고 있습니다. 그것은 "순수한" 상태를 알고 있습니다. "순수한" 상태와 "나쁜" 상태를 비교함으로써, 도서관의 나머지 부분을 손상시키지 않고 나쁜 영향을 제거할 수 있는 깨끗하고 정밀한 경로를 계산할 수 있습니다.

실험 결과

연구자들은 여러 "도서관"(다른 AI 모델) 과 "나쁜 책"(가짜 저자, 허위 정보, 또는 개인 데이터가 포함된 데이터셋) 에서 이 방법을 테스트했습니다.

  1. 더 나은 기억 제거: 다른 방법들에 비해 MSA 가 AI 가 특정 나쁜 정보를 "잊게" 만드는 데 훨씬 효과적이었습니다.
  2. 더 나은 기억 유지: 중요하게도, MSA 는 실수로 AI 가 좋은 것들을 잊게 만들지 않았습니다. 도서관은 나머지 모든 일에 대해 여전히 똑똑하고 유용하게 남았습니다.
  3. "시간 여행" 요소: 그들은 나쁜 책이 추가되기 수천억 개의 "단어"나 토큰 전에 찍은 매우 오래된 건설 과정의 체크포인트를 사용하여 테스트했습니다. "이전" 사진이 오래전에 찍힌 것이라 하더라도, MSA 는 여전히 놀라울 정도로 잘 작동했습니다. 나쁜 책이 추가되기 직전에 찍은 사진이 필요하지 않았으며, 오래된 사진으로도 수학을 올바르게 수행하기에 충분했습니다.

결론

이 논문은 실수를 수정하기 위해 AI 모델을 폐기할 필요가 없다고 주장합니다. 개발자들이 이미 안전과 테스트를 위해 모델 훈련 중 몇 가지 "스냅샷"을 보관하고 있다면, 그 스냅샷들을 사용하여 정밀한 수학적인 "망각"을 수행할 수 있습니다.

이는 데이터 삭제라는 어려운 작업을 단순한 뺄셈 문제로 바꿉니다: 현재 모델 - (나쁜 데이터로 인한 변화) = 깨끗한 모델.

이는 재학습의 불가능한 비용 없이도 "잊힐 권리"와 같은 개인정보 보호법을 존중하고 AI 에서 유해한 데이터를 제거할 수 있게 해줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →