← 최신 논문
🤖 machine learning

Understanding Machine Unlearning Through the Lens of Mode Connectivity

이 논문은 머신 언러닝(machine unlearning)의 최적화 기하학을 분석하기 위해 언러닝에서의 모드 연결성(mode connectivity in unlearning, MCU)이라는 개념을 도입하여, 언러닝된 모델이 재학습과는 구별되는 메커니즘을 가진 연결된 저손실 분지(low-loss basins)에 주로 존재함을 밝히는 동시에, 프라이버시 지표, 비선형적 언러닝 진행 과정, 그리고 앙상블을 통한 향상된 강건성에 대한 통찰을 제공한다.

원저자: Jiali Cheng, Hadi Amiri

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jiali Cheng, Hadi Amiri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신에게는 인터넷 전체를 읽은 초지능 디지털 뇌, 즉 머신러닝 모델이 있습니다. 이 모델은 케이크를 굽는 법부터 유명한 쿠키의 비밀 레시피까지 모든 것을 알고 있습니다. 그런데 누군가 저작권 문제나 혹은 단순히 구식이라는 이유로 그 쿠키 레시피를 잊어달라고 요청합니다. 단순히 코드 몇 줄을 삭제하는 것으로는 해결할 수 없습니다. 그 지식은 AI의 구조 자체에 이미 엮여 있기 때문입니다. 만약 그것을 억지로 뜯어내려 한다면, 케이크를 굽는 능력이나 간단한 질문에 답하는 능력까지 망가뜨릴 수도 있습니다. 이것이 바로 **기계 망각(Machine Unlearning)**이라는 까다로운 세계입니다. 즉, 일반적인 지능을 망가뜨리지 않으면서 특정 정보만을 잊게 만드는 기술입니다.

이것이 어떻게 작동하는지 이해하기 위해, 과학자들은 "손실 지형(loss landscape)"을 살펴봅니다. 이 지형을 거대한 언덕이 있는 지형이라고 생각해 보세요. 지면의 높이는 AI가 자신의 일을 얼마나 못하는지를 나타냅니다. AI는 실수를 최소화하는 가장 깊은 골짜기(가장 낮은 지점)를 찾고자 합니다. 보통 처음부터 두 개의 서로 다른 AI를 훈련시킨다면, 그들은 서로 다른 골짜기에 도달할 수 있습니다. 하지만 **모드 연결성(Mode Connectivity)**이라는 멋진 발견은 이 별개의 골짜기들이 종종 매끄럽고 낮은 경로로 연결되어 있다는 것을 보여주었습니다. 가파른 언덕을 오르지 않고도 한 AI의 해법에서 다른 해법으로 걸어갈 수 있는 것이죠. 이 논문은 새로운 질문을 던집니다. 만약 우리가 하나의 AI를 가져와서 무언가를 잊게 강제한다면, 그 AI는 자신이 '잊은 버전'인 다른 모델들과 여전히 연결된 골짜기에 도달할까요? 그리고 그들 사이의 경로는 여전히 매끄러울까요, 아니면 삐죽삐죽하고 끊어진 절벽이 될까요?

연구자 제리 쳉(Jiali Cheng)과 하디 아미리(Hadi Amiri)는 이를 탐구하기 위해 **망각에서의 모드 연결성(Mode Connectivity in Unlearning, MCU)**이라는 새로운 개념을 도입했습니다. 그들은 잊는 과정을 지도 위를 여행하는 것에 비유했습니다. 단순히 AI가 올바르게 잊었는지 확인하는 대신, 그들은 서로 다른 '망각된' AI 버전들 사이의 "지형"을 살펴보았습니다. 그들은 많은 방법에서 그 경로가 실제로 매끄럽다는 것을 발견했습니다. 당신은 AI가 비밀스러운 쿠키를 갑자기 기억해 내거나 케이크를 굽는 능력을 잃지 않고도, 하나의 '망각된' 모델에서 다른 모델로 미끄러지듯 이동할 수 있습니다. 망각의 지형은 고립된 구덩이들의 집합이라기보다 넓고 평평한 골짜기에 가깝습니다.

하지만 그 여정이 항상 똑같지는 않습니다. 논문은 AI에게 잊는 법을 가르치는 방법이 매우 중요하다는 점을 밝혀냈습니다. 만약 당신이 학습 순서를 바꾸는 방식(커리큘럼 학습)이나 더 복잡한 수학적 방법(2차 최적화) 같은 서로 다른 훈련 기법들을 사용한다면, 당신은 완전히 다른 골짜기에 도달할 수도 있고 서로 연결되지 않을 수도 있습니다. 이는 마치 같은 목적지로 가는 두 가지 경로를 택하는 것과 같습니다. 하나는 매끄러운 고속도로일 수 있지만, 다른 하나는 완전히 다른 동네로 이어지는 울퉁불퉁한 흙길일 수 있습니다.

가장 놀라운 발견 중 하나는, 두 '망각된' 모델이 서류상으로는 동일해 보일지라도(같은 매끄러운 골짜기에 있을지라도), 실제로는 매우 다르게 행동할 수 있다는 점입니다. 연구진은 모델들이 표준 테스트에서는 비슷하게 수행되었지만, 그들의 "프라이버시" 수준은 격렬하게 요동칠 수 있다는 것을 발견했습니다. 한 모델은 비밀을 기억해 내려는 해커들의 속임수로부터 안전할 수 있지만, 같은 골짜기에 있는 그 쌍둥이 모델은 위험할 정도로 정보를 유출할 수 있습니다. 이는 AI가 무언가를 잊은 것처럼 보인다고 해서, 그것이 정말로 안전하다는 뜻은 아님을 시사합니다.

또한 이 논문은 망각이 일어나는 기묘한 패턴을 밝혀냈습니다. 망각은 한꺼번에 일어나지 않습니다. 처음에는 AI가 비밀 문구를 그대로 반복하는 것을 멈추지만(마치 앵무새가 특정 구절을 멈추는 것처럼), 여전히 그 밑바탕에 깔린 아이디어는 간직하고 있습니다. 더 멀리 나아가서 계속 밀어붙여야만 비로소 깊은 지식을 진정으로 잃게 됩니다. 이는 AI가 처음에 "쿠키 레시피는..."이라고 말하는 것은 멈추지만 여전히 요리법은 알고 있다가, 결국에는 레시피 자체를 완전히 잊어버리는 과정과 같습니다.

마지막으로, 저자들은 이 "매끄러움"이 유용한 도구가 될 수 있다고 제안합니다. 만약 두 망각된 모델 사이의 경로가 울퉁불퉁하고 장벽이 많다면, 그것은 망각 작업이 정말 어려웠음을 의미합니다. 만약 경로가 매끄럽다면, 그 작업은 더 쉬웠던 것입니다. 그들은 심지어 이 매끄러운 경로상의 서로 다른 지점들에 있는 모델들을 혼합함으로써, 비밀을 다시 기억해 내도록 속이기가 더 어려운 초강력한(super-robust) AI를 만들 수 있다는 것을 보여주었습니다.

요약하자면, 이 논문은 단순히 AI가 잊을 수 있는지 여부를 말하는 것이 아니라, AI가 어떻게 잊는지에 대한 지도를 제공합니다. 그것은 망각의 지형이 복잡하며, 때로는 매끄럽고 때로는 삐죽삐죽하며, 우리가 그 경로를 어떻게 항해하느냐에 따라 우리가 잊게 만든 AI의 안전성과 신뢰성이 결정된다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →