← 최신 논문
🤖 AI

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

이 논문은 Mixture-of-Experts 모델에서 라우터 조작을 방지하기 위해 라우터 업데이트에 기하학적 제약을 부과함으로써 전문가 파라미터로부터의 진정한 지식 삭제를 보장하고, 동시에 유지 정확도와 적대적 복구에 대한 강건성을 크게 향상시키는 알고리즘 불가지론적 프레임워크인 GRIP을 소개한다.

원저자: Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 방대한 양의 텍스트를 학습하여 쓰고, 추론하고, 문제를 해결하는 법을 배운 강력한 도구입니다. 그러나 이러한 학습에는 숨겨진 대가가 따릅니다. 이 모델들은 보관해서는 안 될 개인 정보, 저작권이 있는 자료, 또는 위험한 지침과 같은 민감한 세부 정보를 종종 암기한다는 점입니다. '잊혀질 권리'와 같은 법률이 특정 데이터를 모델에서 제거할 것을 요구할 때, 표준적인 해결책은 해당 데이터 없이 시스템 전체를 처음부터 다시 훈련시키는 것입니다. 이 과정은 너무나 비용이 많이 들고 느리기 때문에 좀처럼 수행되지 않습니다. 대신, 연구자들은 전체 뇌를 다시 구축하지 않고도 특정 기억을 외과적으로 제거하도록 설계된 '기계 언러닝(machine unlearning)' 기술을 개발했습니다. 이러한 방법들은 표준적인 모델에는 잘 작동하지만, 가장 큰 시스템들을 위한 더 빠르고 효율적인 대안으로 '전문가 혼합(Mixture-of-Experts)'이라는 새로운 유형의 아키텍처가 등장했습니다. 이 모델들은 모든 질문에 대해 뇌의 모든 부분을 사용하지 않습니다. 대신, 각 작업을 처리하기 위해 특화된 하위 네트워크의 작은 팀을 선택하는 내장된 교통 관제사(traffic director)를 가지고 있습니다. 이러한 효율성은 독특한 취약성을 만들어냅니다. 무언가를 잊으라는 요청을 받았을 때, 시스템은 나쁜 기억을 보유한 전문가들로부터 질문을 우회하도록 경로를 변경함으로써 사용자에게 속임수를 쓸 수 있으며, 이로 인해 위험한 지식은 그대로 남아 복구될 가능성을 남겨둡니다.

한 연구팀은 이 허점을 발견하고 이를 해결하기 위한 GRIP이라는 새로운 프레임워크를 개발했습니다. 그들은 표준적인 언러닝 방법이 이러한 특화된 모델에 적용될 때, 시스템이 가장 저항이 적은 경로를 택한다는 사실을 발견했습니다. 특화된 하위 네트워크에서 해로운 지식을 실제로 삭제하는 대신, 교통 관제사가 단순히 그 특정 전문가들에게 질문을 보내지 않도록 학습하는 것입니다. 이는 마치 사서가 금지된 책을 서가에서 제거하는 대신, 모든 이용자에게 다른 구역을 살펴보라고 말하는 것과 같습니다. 책은 서가에 온전히 남아 있으며, 결심을 굳힌 사람이 관제사의 지침을 우회하는 법을 안다면 여전히 찾아낼 수 있습니다. 이는 모델이 정보를 잊은 것처럼 보이게 만들지만, 실제로는 데이터가 변경된 라우팅 패턴 뒤에 숨겨져 있을 뿐인 위험한 환상을 만들어냅니다.

이를 해결하기 위해 연구진은 시스템이 지식을 단순히 숨기는 것이 아니라 실제로 지우도록 강제하는 방법을 만들었습니다. 그들은 교통 관제사가 생각을 바꿀 수 있는 방식에 엄격한 기하학적 제약을 가함으로써 이를 달성했습니다. 교통 관제사를 질문이 어떤 경로를 따를지 결정하는 규칙들의 집합이라고 상상해 보십시오. 연구진은 시스템이 나쁜 데이터를 가진 전문가들을 피하기 위해 이 규칙들을 바꾸려 한다는 것을 발견했습니다. 그들의 해결책은 모델이 유지해야 할 안전하고 중요한 모든 정보에 대해 규칙을 고정하는 것이었습니다. 교통 관제사가 안전한 데이터에 대한 라우팅 결정을 변경할 수 없도록 수학적으로 보장함으로써, 시스템이 라우팅을 지름길로 사용하는 능력을 제거했습니다. 이를 통해 언러닝 과정이 지식을 보유한 특화된 하위 네트워크를 실제로 수정하는 힘든 작업을 수행하도록 강제하여, 정보가 진정으로 사라지도록 보장했습니다.

연구진은 이 접근 방식을 두 개의 대형 모델에 테스트하여 이전 방법들보다 훨씬 더 효과적임을 확인했습니다. 기존의 방법들은 라우팅 시스템을 불안정하게 만들어, 안전한 질문에 대해 어떤 전문가를 사용할지에 대한 결정을 80%의 확률로 번복하게 함으로써 모델의 정상적인 기능을 심각하게 손상시켰습니다. 새로운 방법은 이 안정성을 94% 이상으로 회복시켜, 모델이 이전과 마찬가지로 안전한 작업에 대해 올바른 전문가를 계속 사용할 수 있게 했습니다. 더 중요한 것은, 그들이 공격자가 교통 관제사를 우회하여 원래의 전문가를 강제로 사용하도록 시뮬레이션함으로써 위험한 지식이 정말로 사라졌는지 테스트했다는 점입니다. 기존 방법에서는 이러한 우회를 통해 공격자가 잊힌 정보를 11%의 확률로 복구할 수 있었습니다. 새로운 방법에서는 복구율이 단 3%로 떨어졌으며, 이는 처음부터 다시 훈련시킨 모델과 유사한 수준입니다.

또한 연구진은 동일한 문제를 해결하기 위해 더 부드럽고 덜 엄격한 규칙을 사용하려 했던 이전의 시도와 이 접근 방식을 비교했습니다. 그 초기 방법은 상황을 약간 개선했지만, 여전히 시스템이 지식을 숨기기 위해 라우팅을 조작하는 것을 허용했습니다. 엄격한 제약을 사용한 새로운 접근 방식은, 이러한 효율적인 모델에서 진정한 언러닝을 달키 위한 유일한 방법이 라우팅 시스템이 방패로 사용되는 것을 막는 것임을 입증했습니다. 연구진은 이 기술이 위험한 사이버 보안 지식을 제거하는 것부터 저작권이 있는 텍스트를 삭제하는 것에 이르기까지 다양한 유형의 언러닝 작업 전반에 걸쳐 작동함을 보여주었습니다. 그들은 모델이 일반적인 지능과 안전한 질문에 답하는 능력을 이전보다 훨씬 더 잘 유지하며, 불안정한 기준점과 비교했을 때 유지된 작업에서의 성능이 최대 89%까지 향상되었음을 발견했습니다.

이 연구는 인공지능을 보호하는 방식에 있어 중요한 차이점을 강조합니다. 이는 이러한 복잡하고 특화된 시스템의 경우, 단순히 정보의 경로를 바꾸는 것만으로는 프라이버시나 안전을 보호하기에 충분하지 않다는 것을 보여줍니다. 지식은 근원지에서부터 지워져야 합니다. 시스템이 위험한 콘텐츠를 숨기기 위해 라우팅을 사용할 수 없도록 보장함으로써, 연구진은 모델의 전반적인 효용성을 희생하지 않으면서 특정 기억을 제거할 수 있는 신뢰할 수 있는 방법을 제공했습니다. 그들의 연구 결과는 향후 대규모 언어 모델의 안전 조치가 이러한 내부 라우팅 메커니즘을 반드시 고려해야 하며, '교통 관제사'가 위험한 콘텐츠를 숨기기 위해 조작될 수 없도록 해야 함을 시사합니다. 그 결과, 데이터의 제거가 단순히 지도를 바꾸는 문제가 아니라 진정한 삭제가 되는 더욱 견고한 시스템을 구축할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →