← 최신 논문
🤖 machine learning

Spectral Saliency for Machine Unlearning

이 논문은 Muon에서 영감을 받아, 확신 있는 언러닝 신호에 기반하여 약한 스펙트럼 방향을 선택적으로 업데이트함으로써 다양한 아키텍처 전반에서 모델의 유용성을 보존하면서도 특정 학습 데이터의 영향을 효과적으로 제거하는 머신 언러닝 방법론인 Spectral Saliency Unlearning(SSU)을 소개한다.

원저자: Cedar Site Bai, Amber Yijia Zheng, Raymond A. Yeh, Brian Bullins

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Cedar Site Bai, Amber Yijia Zheng, Raymond A. Yeh, Brian Bullins

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 디지털 세상에서 인공지능 시스템은 얼굴을 인식하거나, 이미지를 생성하거나, 텍스트를 작성하는 법을 배우기 위해 방대한 양의 데이터 바다를 통해 학습됩니다. 일단 모델이 이 데이터로부터 학습을 마치고 나면, 그 생각을 바꾸는 것은 매우 어려워집니다. 만약 어떤 사람이 일반 데이터 보호 규정(GDPR)과 같은 법률에 따라 자신의 개인 정보를 데이터셋에서 삭제해 달라고 요청할 경우, 표준적인 해결책은 해당 데이터를 삭제하고 전체 시스템을 처음부터 다시 학습시키는 것이었습니다. 이 과정은 믿을 수 없을 정도로 비용이 많이 들고 시간이 오래 걸리며, 종종 원래 학습에 사용되었던 것과 동일한 거대한 컴퓨팅 파워를 필요로 합니다. 이를 해결하기 위해 연구자들은 '머신 언러닝(machine unlearning)'이라 불리는 분야를 발전시켜 왔으며, 이는 전체를 다시 구축하지 않고도 학습된 모델에서 특정 데이터 포인트의 영향력을 외과적으로 제거하는 것을 목표로 합니다. 그 목표는 모델이 원치 않는 정보는 잊게 만들면서도, 다른 모든 것에 대해 수행하는 능력은 그대로 유지하도록 하는 것입니다.

하지만 단순히 학습 과정을 되돌리려고 시도하는 것은 까м롭습니다. 컴퓨터가 특정 이미지나 사실을 '언러닝'하려고 할 때, 모델의 내부 설정을 조정하는 과정에서 의도치 않게 다른 관련 없는 지식까지 손상시킬 수 있습니다. 이는 복잡한 태피스트리에서 단 하나의 얼룩을 제거하려는 것과 같습니다. 만약 잘못된 실을 너무 세게 잡아당기면, 전체 패턴이 풀려버릴 수도 있기 때문입니다. 최근의 방법들은 학습 신호의 특정 부분을 선택적으로 무시함으로써 이를 해결하려 시도했지만, 대개 시행착소(trial and error) 방식에 의존했습니다. 퍼듀 대학교(Purdue University) 연구진의 새로운 연구는 '스펙트럴 살리언시 언러닝(Spectral Saliency Unlearning)'이라는 더 정밀한 접근 방식을 소개합니다. 이 방법은 모델의 어느 부분을 조정해야 할지 추측하는 대신, 학습 과정 자체의 수학적 구조를 분석하여 어떤 방향이 변경하기에 안전하고 어떤 방향이 너무 위험한지를 식별합니다.

연구진은 이 방법을 고급 수학의 개념인 스펙트럴 분석(spectral analysis)에 기반하여 구축했는데, 이는 복잡한 데이터를 마치 화음을 개별 음표로 분리하는 것처럼 근본적인 구성 요소로 분해하는 방식입니다. 인공지능 학습의 맥락에서 시스템은 개선을 지시하는 신호에 의해 유도되며 거대한 가능성의 풍경을 가로질러 이동합니다. 이 연구는 이러한 신호들이 모두 똑같이 신뢰할 수 있는 것은 아니라고 제안합니다. 어떤 신호는 강하고 명확하여 잊어야 할 정보로 직접 안내하는 반면, 다른 신호들은 약하고 모호하며, 종종 잊어야 할 정보와 반드시 기억해야 할 정보가 뒤섞인 채 엉켜 있습니다. 연구진은 모델이 이러한 약하고 혼합된 신호를 사용하여 데이터를 언러닝하려고 할 때, 종종 기억해야 할 데이터에 대한 성능까지 해치게 된다는 것을 발견했습니다.

이를 해결하기 위해 연구팀은 이러한 학습 신호를 위한 필터 역할을 하는 기술을 제안했습니다. 그들은 모델이 변화할 수 있는 각 방향의 강도를 측정하는 방법을 개발했습니다. 만약 어떤 방향이 잊으라는 강력하고 확신에 찬 신호에 의해 뒷받받된다면 모델은 그 방향을 따릅니다. 하지만 신호가 약하거나 모호하다면, 이 방법은 해당 신호를 억제하여 모델이 그 경로를 무시하도록 효과적으로 지시합니다. 이는 모델이 보존해야 할 지식과 지우고자 하는 데이터를 혼동하여 서투른 조정을 하지 않도록 방지합니다. 연구진은 이 아이디어를 이미지 분류 시스템, 새로운 그림을 생성하는 시스템, 그리고 텍스트를 쓰는 대규모 언어 모델(LLM)이라는 세 가지 매우 다른 유형의 인공지능에 걸쳐 테스트했습니다. 모든 경우에서, 이 새로운 방법은 모델이 대상 데이터를 더 효과적으로 잊게 만드는 동시에 나머지 세상에 대한 처리 능력을 보존할 수 있게 해주었습니다.

실험 결과는 놀라웠습니다. CIFAR-10 데이터셋으로 학습된 이미지 분류기에 적용했을 때, 이 새로운 방법은 언러닝된 모델과 완벽하게 재학습된 모델 사이의 격차를 30% 이상 줄였습니다. 특정 사물의 그림을 만들어내는 것이 목표인 이미지 생성 영역에서는, 원치 않는 카테고리를 완벽하게 망각하는 동시에 남은 이미지들의 품질을 거의 24% 향상시켰습니다. 이야기나 질문에 답하기 위해 자주 사용되는 대규모 언어 모델의 경우, 이 접근 방식은 특정 사실을 잊는 것과 일반적인 글쓰기 능력을 유지하는 것 사이의 균형을 일관되게 개선했습니다. 연구진은 이 기술이 모델의 모든 부분을 한꺼번에 조정하려 하기보다, 가장 지배적이고 신뢰할 수 있는 변화의 방향에만 집중함으로써 작동한다고 언급했습니다.

이 연구의 가장 중요한 측면 중 하나는 단순한 경험칙(rules of thumb)에 의존했던 이전 방법들이 왜 성공적이었는지에 대한 이론적 설명을 제공한다는 점입니다. 학습 신호의 수학적 특성을 분석함으로써, 연구진은 약하고 노이즈가 섞인 방향이 바로 망각과 기억 사이의 충돌이 발생하는 지점임을 보여주었습니다. 이러한 방향을 걸러냄으로써 모델은 간섭의 최악의 상황을 피할 수 있습니다. 이러한 통찰은 언러닝을 추측에 기반한 휴리스틱(heuristic) 과정에서 데이터 자체의 구조에 기반한 원칙적인 과정으로 변화시킵니다. 이 연구는 어떤 방향을 업데이트할지 더 선택적으로 결정함으로써, 인공지능 시스템이 일반적인 지능을 잃지 않고도 특정 정보를 잊을 수 있음을 입증하며, 준수적이고 윤리적인 AI 시스템을 향한 실용적이고 효율적인 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →