← 최신 논문
🤖 machine learning

Similarity-Aware Machine Unlearning

본 논문은 새로운 평가 세트와 광범한 실험을 통해 검증된, 의미론적으로 유사한 잔존 데이터에 대한 부수적 피해를 최소화하는 동시에 표준적인 언러닝 효율성을 향상시키는 잔존 인지형 로컬라이제이션 방법을 채택한 유사성 인지형 머신 언러닝 프레임워크를 제안한다.

원저자: Madhavan Citalamangalam Kumaran, Midhun Parakkal Unni, Vicky Kouni, Haripriya Harikumar

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Madhavan Citalamangalam Kumaran, Midhun Parakkal Unni, Vicky Kouni, Haripriya Harikumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 사진 도서관으로부터 모든 것을 배운, 거대하고 똑똑한 디지털 뇌를 만들었다고 상상해 보세요. 이 뇌는 고양이를 개와 구별하거나 배를 자동차와 구별할 수 있을 정도로 매우 정확하며, 그 임무에 아주 능숙합니다. 하지만 여기 문제가 있습니다. 개인정보 보호법이나 개인적 선택으로 인해 사람들이 그 도서관에서 자신의 사진을 삭제하기를 원할 때가 있다는 것입니다. 만약 당신이 단순히 사진을 삭제하기만 한다면, 그 뇌는 마치 시험을 위해 사실을 암기했지만 시험이 끝난 후에도 그것을 잊어버리는 법을 배우지 못한 학생처럼 여전히 그 사실을 기억할 수도 있습니다. 여기서 '머신 언러닝(Machine Unlearning, 기계 망각)'이 등장합니다. 이것은 컴퓨터가 전체 뇌를 버리고 처음부터 다시 만드는 데 드는 엄청난 시간과 비용을 들이지 않고도, 특정 정보를 잊도록 가르치는 기술입니다.

하지만 까다로운 문제가 있습니다. 컴퓨터의 뇌 속에서 정보는 깔끔하고 분리된 서랍에 저장되는 것이 아닙니다. 대신, 그것은 유사한 것들이 서로 뒤엉켜 있는 거대한 연결망과 같습니다. 골든 레트리버 사진과 골든 래브라도 사진은 매우 닮았기 때문에 동일한 연결 세트를 사용할 수 있습니다. 만약 골든 레트리버를 잊게 만들기 위해 그 연결을 끊으려 한다면, 실수로 골든 래브라도를 위한 연결까지 끊어버려 뇌가 계속 간직해야 할 것들까지 잊게 만들 수도 있습니다. 이 논문은 우리가 비슷한 것들을 해치지 않으면서도 원하는 것들을 삭제할 수 있도록 그 그물망을 푸는 방법을 찾는 것에 관한 것입니다.

유명한 CIFAR-10 데이터셋(6만 개의 작은 컬러 이미지 모음)과 ResNet18이라는 모델을 사용하여 연구를 진행한 이 연구진은, 기존의 방식이 다소 투박했다는 것을 발견했습니다. 이전 방식인 '망각 전용 로컬라이제이션(forget-only localization)'은 마치 잡초 자체만을 보고 특정 잡초를 뽑으려는 정원사와 같았습니다. 정원사는 잡초의 뿌리를 잡았지만, 그 잡초가 거의 똑같이 생긴 아름다운 꽃 바로 옆에서 자라고 있었기 때문에 실수로 꽃까지 뽑아버리고 말았습니다. 컴퓨터 용어로 말하자면, 이는 '부수적 피해(collateral damage)'를 초래하여, 모델이 잊어야 할 이미지와 매우 유사한 이미지를 인식하는 능력이 떨어지게 만들었습니다.

이를 해결하기 위해 팀은 새로운 '보존 인지형(retain-aware)' 방식을 제안했습니다. 잊어야 할 대상만을 보는 대신, 그들은 컴퓨터에게 보존해야 할 대상들도 함께 보라고 요청했습니다. 그들은 보존된 이미지가 잊혀진 이미지의 가장 가까운 이웃인지 확인하기 위해 특별한 '유사성 지도(similarity map)'를 만들었습니다. 그리고 영리한 점수 산정 시스템을 사용하여 컴퓨터 뇌의 어느 부분을 수정할지 결정했습니다. 그들은 본질적으로 이렇게 말한 것입니다. "우리가 잊고자 하는 것에 매우 중요한 연결은 끊되, 보존하고자 하는 유사한 것들에게도 정말 중요한 연결이라면 그대로 두어라."

그들은 점수를 계산하는 세 가지 다른 방법을 테스트했습니다: 단순 차감 방식, 가중치 방식(보존에 대한 중요도를 높일 수 있는 방식), 그리고 비율 방식입니다. 11번의 서로 다른 실험을 수행한 결과, 그들의 새로운 접근 방식이 기존의 '망각 전용' 방식보다 훨씬 더 효과적이라는 것을 발견했습니다. 구체적으로, '서브샘플링 차이 방식(subsampled difference method)'(차감의 한 특정한 방식)이 가장 뛰어난 성과를 보였습니다. 이 방식은 목표 이미지를 잊게 만드는 동시에, 유사한 보존 이미지에 대한 정확도를 거의 완벽하게 유지해 냈습니다.

논문은 유사성을 인지함으로써 부수적 피해를 크게 줄일 수 있음을 보여줍니다. 예를 들어, 잊혀진 것들과 시각적으로 매우 가까운 이미지들에 대해 모델이 얼마나 잘 작동하는지 살펴보았을 때, 새로운 방식은 성능 저하가 거의 없었던 반면, 기존 방식은 눈에 띄는 하락을 보였습니다. 또한 그들은 모델이 단순히 추측하거나 이상하게 행동하는 것이 아님을 확인하기 위해 '멤버십 추론 공격(membership inference attack)' 테스트(모델이 삭제된 데이터를 여전히 비밀리에 기억하고 있는지 확인하는 방법)를 사용했으며, 새로운 방식이 데이터를 진정으로 지우는 데 훨씬 더 효과적임을 발견했습니다.

요약하자면, 저자들은 우리가 망각을 단순한 삭제 작업으로 취급해서는 안 된다고 제나합니다. 컴퓨터의 뇌는 패턴과 유사성을 찾아내며 학습하기 때문에, 보존하고자 하는 패턴을 깨뜨리지 않도록 주의해야 합니다. 그들의 새로운 방식은 정교한 외과의사처럼 작동하여, 잊혀진 사진의 특정 기억을 제거하면서도 그와 닮은 친구들의 기억을 손상시키지 않습니다. 비록 특정 이미지 세트와 특정 모델을 대상으로 테스트했지만, 결과는 이 '보존 인지형' 접근 방식이 효과적이면서도 우리가 보존하고자 하는 데이터를 안전하게 지키는 유망한 AI 프라이버시 도구가 될 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →