← 최신 논문
🤖 machine learning

Locking Pretrained Weights via Deep Low-Rank Residual Distillation

본 논문은 표준 MLP 를 추론-학습 비대칭성을 활용하여 적응형 공격자에게 금지적인 메모리 및 최적화 장벽을 생성하면서도 모델 성능을 유지하는 심층 저랭크 잔여 네트워크로 대체함으로써 오픈 가중치 언어 모델을 무단 파인튜닝으로부터 보호하는 DLR-Lock 라는 방어 메커니즘을 소개합니다.

원저자: Keitaro Sakamoto, Pierre Ablin, Federico Danieli, Marco Cuturi

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Keitaro Sakamoto, Pierre Ablin, Federico Danieli, Marco Cuturi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 여러분이 거대하고 매우 지능적인 로봇 (대규모 언어 모델) 을 구축했고, 그 "뇌" (가중치) 를 세상과 공유하여 사람들이 사용할 수 있게 하고 싶다고 가정해 봅시다. 하지만 일부 사용자가 그 뇌를 가져가서 수정한 뒤, 여러분이 의도하지 않은 목적—예를 들어 해로운 콘텐츠를 생성하거나 안전 규칙을 우회하는 것—으로 사용할까 봐 걱정됩니다.

여러분은 이렇게 말하고 싶을 것입니다. "내 로봇을 사용할 수는 있지만, 그 뇌를 쉽게 변경하여 다른 일을 하도록 만들 수는 없습니다."

이 논문은 "Locking Pretrained Weights via Deep Low-Rank Residual Distillation(사전 학습된 가중치를 심층 저랭크 잔류 증류로 잠그기)이라는 제목으로, 로봇의 뇌를 파괴하지 않고 "잠금"을 걸 수 있는 교묘한 방법을 제안합니다. 여기서는 간단한 비유를 통해 그 작동 원리를 설명합니다.

문제: "열린 상자" 딜레마

현재 기업들이 오픈 모델을 출시할 때는, 후드를 완전히 열고 엔진을 노출시킨 채 자동차를 누군가에게 주는 것과 같습니다. 누구나 후드를 열고 점화 플러그를 교체하거나 엔진을 튜닝하여 더 빠르게 달리게 하거나 다른 연료로 작동하게 만들 수 있습니다. AI 세계에서는 이는 누구나 모델을 가져와 새로운 작업에 대해 매우 저렴하게 "파인튜닝"(재학습) 할 수 있음을 의미합니다.

전통적인 보안은 엔진을 숨기거나 후드에 가짜 자물쇠를 걸려고 시도합니다. 하지만 이 논문은 해커가 충분히 영리하다면 그 자물쇠를 따거나 가짜 부품을 역공학으로 알아낼 수 있다고 주장합니다.

해결책: "심층 미로" 트릭

애플의 저자들은 DLR-Lock이라는 새로운 종류의 잠금 장치를 제안합니다. 엔진을 숨기는 대신, 외부에서는 똑같이 보이지만 내부에서는 헤매기 악몽 같은 심층적이고 복잡한 미로로 엔진을 교체하는 것입니다.

핵심 아이디어는 세 부분으로 나누어 설명할 수 있습니다.

1. "일방통행" (추론 vs 학습)

모델을 공장으로 생각하세요.

  • 추론 (모델 사용): 이는 고객이 공장을 걸어 들어가 제품을 사가는 것과 같습니다. 들어와서 물건을 들고 나가기만 하면 됩니다. 그들이 취한 모든 단계를 기억할 필요는 없으며, 최종 제품만 있으면 됩니다.
  • 학습 (모델 변경): 이는 기술자가 공장을 수리하려는 것과 같습니다. 기계를 수리하려면 기술자는 문제가 발생한 위치를 파악하기 위해 과정의 각각의 모든 단계를 기억해야 합니다. 그들은 작업을 거꾸로 수행하기 위해 방대한 양의 "메모리"(활성화) 를 저장해야 합니다.

이 논문은 모델을 사용하는 것은 저렴하고 쉽지만, 모델을 수정하거나 학습하는 것은 비용이 많이 들고 메모리를 많이 소모한다는 사실을 이용합니다.

2. "심층 미로" (DLR-Net)

일반적인 AI 모델에서 정보를 처리하는 부분 (MLP 라고 함) 은 짧고 간단한 복도와 같습니다. 들어가고 나면 됩니다. 매우 빠릅니다.

저자들은 이 짧은 복도를 **심층 저랭크 잔류 네트워크 (DLR-Net)**로 교체합니다.

  • 비유: 짧은 복도를 정확히 같은 출구로 이어지는 100 층짜리 나선형 계단으로 교체한다고 상상해 보세요.
  • 사용자 (추론) 에게: 100 계단을 오르는 데는 아주 조금 더 시간이 걸리지만 여전히 빠릅니다. 사용자는 제품을 받고, 모델은 이전과 똑같이 작동합니다.
  • 해커 (학습) 에게: 해커가 계단 (가중치) 을 "수정"하려면 100 층 계단 오르기 과정의 각 단계를 모두 기억하여 어디를 변경해야 할지 파악해야 합니다. 이는 막대한 양의 메모리 (RAM) 를 필요로 합니다.

3. "메모리 함정"

이 논문은 모델을 이렇게 깊게 만들어 메모리 함정을 생성한다고 주장합니다.

  • 모델을 학습하려면 해커의 컴퓨터는 모든 중간 단계를 저장해야 합니다.
  • 해커가 "그래디언트 체크포인팅"(단계를 잊었다가 나중에 재계산하여 메모리를 절약하는 기법) 이라는 트릭을 사용하려 한다면, 100 층 계단 오르기를 반복해서 다시 수행해야 합니다.
  • 결과: 잠긴 모델을 학습하는 것은 원래 모델을 학습하는 것보다 지수적으로 느리고 비싸게 됩니다. 전구 하나를 교체하기 위해 짧은 길을 걷는 것과 산을 오르는 것의 차이와 같습니다.

로봇을 파괴하지 않고 어떻게 이를 수행했는가

여러분은 이렇게 물을지도 모릅니다. "엔진을 100 층 계단으로 바꾸면 로봇이 작동하지 않게 되지 않나요?"

아닙니다. 저자들은 **증류 (Distillation)**라는 기법을 사용했습니다.

  • 비유: 완벽한 수프를 만드는 법을 정확히 아는 마스터 셰프 (원래 모델) 를 상상해 보세요. 저자들은 새로운 복잡한 주방 (DLR-Net) 을 구축하고, 마스터 셰프가 수프를 맛보고 "아니, 조금 더 짜게 해줘"라고 말할 때까지 훈련시켜, 새로운 주방이 원래 수프와 정확히 같은 맛의 수프를 만들도록 했습니다.
  • 그들은 두 단계로 이를 수행했습니다. 먼저 개별 재료 (모듈) 의 맛을 맞춘 다음, 전체 식사 (최종 출력) 의 맛을 맞췄습니다.
  • 주장: 잠긴 모델은 일반 사용자에게 원래 모델과 똑같이 작동하지만, 누구도 이를 재학습하는 것은 극도로 어렵습니다.

결론

이 논문은 모델 (특히 Qwen3-0.6B 모델에서 테스트됨) 을 가져와 내부 구성 요소를 이러한 "심층 미로"로 교체하고 다음을 달성할 수 있음을 보여줍니다.

  1. 품질 유지: 모델은 여전히 이전과 똑같이 질문에 답변하고 텍스트를 작성합니다.
  2. 문 잠금: 모델을 파인튜닝하거나 적응시키려는 모든 시도는 시간과 컴퓨터 성능 측면에서 훨씬 더 비싸게 됩니다 (구체적으로, 학습의 "역전파"가 모델 사용의 "순전파"보다 훨씬 느려집니다).

이는 구조적 잠금 장치입니다. 자물쇠를 딸 수 없는 이유는 자물쇠가 비밀이어서가 아니라, 잠금 장치의 메커니즘이 도둑의 일을 극도로 어렵게 설계되었기 때문이며, 정당한 사용자는 그 차이를 전혀 느끼지 못하기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →