← 최신 논문
📊 statistics

Extending Kernel Trick to Influence Functions

본 논문은 모델 크기가 아닌 데이터셋 크기에 따라 확장되는 영향 함수의 이중 표현을 제시하여 대규모 선형화 가능 모델에서 데이터 제거의 영향을 추정하는 효율적인 대안을 제공하지만, 모델 출력 차원과 데이터셋 크기의 곱에 비례하여 크기가 증가하는 행렬이 필요하다는 트레이드오프가 수반된다.

원저자: Zhenhuan Sun, Shahrokh Valaee

게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhenhuan Sun, Shahrokh Valaee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Extending Kernel Trick to Influence Functions" 논문을 쉬운 언어와 일상적인 비유로 설명합니다.

큰 문제: "블랙박스"와 "되돌리기" 버튼

매우 똑똑한 AI(기계 학습 모델) 를 고양이와 개를 구분하도록 훈련시켰다고 상상해 보세요. 학습을 위해 방대한 사진 도서관을 제공했습니다. 이제 한 사용자가 "내 개 사진 하나를 당신의 기억에서 삭제하고 싶습니다. 그 사진을 본 적도 없는 것처럼 완전히 잊어주세요"라고 요청한다고 가정해 봅시다.

AI 세계에서는 이를 **기계 망각 (Machine Unlearning)**이라고 부릅니다. 목표는 특정 데이터 포인트의 영향을 제거하여, 해당 데이터 없이 처음부터 다시 훈련한 것과 정확히 동일한 방식으로 모델이 행동하도록 하는 것입니다.

이를 수행하는 표준 방법은 **영향 함수 (Influence Functions)**라는 수학적 도구를 사용합니다. 이 도구는 마치 "확대경"처럼, 그 한 장의 사진이 모델의 뇌를 얼마나 변화시켰는지 정확히 계산하려는 역할을 합니다.

하지만 문제점이 있습니다:
작은 모델에서는 이 확대경이 잘 작동합니다. 하지만 코드를 작성하거나 예술을 생성하는 현대의 거대 AI 모델처럼 "뇌"가 너무 거대 (수십억 개의 매개변수) 한 경우, 한 알의 모래가 조수에 미치는 영향을 보기 위해 해변의 모든 모래알을 세어보려는 것과 같습니다. 시간이 너무 오래 걸리고 컴퓨터 성능이 너무 많이 필요합니다. 현재 방법은 모델의 크기에 비례하여 커지는 수학 문제를 풀려고 하기에 막히게 됩니다.

해결책: 새로운 관점 ("이중" 관점)

이 논문의 저자 Zhenhuan Sun 과 Shahrokh Valaee 는 교묘한 단축책을 제안합니다. 그들은 말합니다. "거대한 모델의 뇌 관점에서 문제를 바라보는 대신, 보통 더 작은 데이터셋의 관점에서 바라봅시다."

이를 **이중 표현 (Dual Representation)**이라고 부릅니다.

비유: 요리사와 레시피 책

AI 모델을 **요리사 (모델)**로, 훈련 데이터를 **레시피 책 (데이터셋)**으로 상상해 보세요.

  • 옛 방법 (매개변수 공간): 레시피 하나를 제거하는 것이 요리사의 요리 스타일에 어떤 변화를 주는지 보기 위해, 옛 방법은 요리사의 전체 뇌, 근육, 기억을 분석하려 했습니다. 요리사가 거대한 뇌를 가진 세계적으로 유명한 스타라면, 이는 엄청나게 느리고 비용이 많이 듭니다.
  • 새 방법 (이중/알파 공간): 저자들은 말합니다. "잠깐만요. 요리사는 읽은 레시피에 따라 요리만 바꿉니다. 레시피가 1,000 권이고 요리사가 거대하다면, 요리사의 뇌를 분석하는 것보다 1,000 권의 레시피를 분석하는 것이 실제로 더 빠릅니다."

모델의 내부 가중치 (요리사의 뇌) 가 아닌 **데이터 포인트 간의 관계 (레시피)**에 초점을 맞춰 수학을 전환함으로써, "되돌리기" 효과를 훨씬 빠르게 계산할 수 있습니다.

작동 원리: "선형" 단축책

이 새로운 방법은 특정 조건에 의존합니다. 모델이 **"선형화 가능 (Linearizable)"**해야 합니다.

그게 무슨 뜻일까요?
구불구불한 산길을 상상해 보세요. 그 길의 아주 작은 부분을 매우 가까이 확대하면 완벽하게 직선처럼 보입니다.

  • 선형화 가능한 모델: 훈련 중에 "길"이 극도로 비틀거리지 않는 모델들입니다. 모델이 시작점 근처에 머무르기 때문에, 계산을 위해 길을 직선 (선형) 으로 간주할 수 있습니다.
  • 기교: 저자들은 **Neural Tangent Kernel (NTK)**이라는 수학적 도구를 사용합니다. NTK 는 모든 데이터 포인트가 다른 모든 데이터 포인트와 어떻게 상호작용하는지 설명하는 지도라고 생각할 수 있습니다. 모델의 복잡한 내부 변화를 추적하는 대신, 이 지도 위에서 데이터 포인트들이 서로에게 어떻게 영향을 미치는지 추적합니다.

결과: 속도 대 정확도

이 논문은 두 가지 시나리오에서 이 새로운 방법을 기존 방법과 비교하여 테스트했습니다.

  1. 속도: 모델이 거대하지만 (거대 신경망과 같이) 데이터셋이 상대적으로 작을 때, 새로운 방법은 훨씬 더 빠릅니다. 도시 블록 전체를 걷는 대신 공원을 가로지르는 단축길을 가는 것과 같습니다.

    • 비유: 10,000 권의 책 (데이터) 이 있는 도서관과 행성 크기의 뇌를 가진 사서 (모델) 가 있다고 가정해 보세요. 사서에게 한 권의 책에 대해 기억을 다시 계산하라고 요청하면 영원히 걸립니다. 하지만 책 목록만 보고 책들이 서로 어떻게 관련되는지 파악하면 빠르게 해결할 수 있습니다.
  2. 정확도: 새로운 방법은 기존 방법 (및 모델을 처음부터 다시 훈련한 경우) 과 거의 동일한 결과를 생성합니다. "요리사"는 새로운 단축책을 사용하여 레시피를 똑같이 효과적으로 잊어버립니다.

  3. "무한" 사례: 이 논문은 이 방법이 이론적으로 무한히 넓은 모델 (무한한 매개변수를 가진 모델) 에 대해서도 작동함을 보여줍니다. 이 경우 기존 방법은 사용할 수 없지만, 새로운 방법은 모델 크기가 아닌 데이터만 고려하므로 완벽하게 작동합니다.

한계점 (세부 사항)

저자들은 이 기법이 작동하지 않는 부분을 솔직하게 밝힙니다.

  • 오직 "선형화 가능한" 모델에서만 작동합니다: 모델이 너무 혼란스럽거나 훈련 중에 "뇌"가 너무 극적으로 변하는 경우 (시작점에서 멀리 벗어나는 모델 등), 직선 도로 근사법은 무너집니다.
  • 거대한 지도가 필요합니다: 이 단축책을 사용하려면 모든 데이터 포인트를 다른 모든 데이터 포인트에 연결하는 거대한 지도 (NTK 행렬) 를 만들어야 합니다. 데이터셋이 방대하다면 (수백만 장의 사진), 이 지도를 만들고 저장하는 것은 원래 문제와 마찬가지로 비용이 많이 듭니다.

요약

간단히 말해, 이 논문은 AI 모델에서 데이터를 "망각"시키는 새로운 방법을 제시합니다. 느린 AI 의 거대하고 복잡한 뇌를 풀려고 시도하는 대신, 데이터 포인트 간의 관계 (더 빠름) 를 살펴봅니다. 모델이 어느 정도 예측 가능하고 선형적인 방식으로 행동한다면, 기계 망각을 대규모 모델에 실현 가능하게 만드는 수학적 "관점의 전환"입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →