← 최신 논문
🤖 machine learning

Towards Building Non-Fine-Tunable Foundation Models

본 논문은 핵심적인 희소 서브네트워크 마스크를 비공개로 유지한 채 밀집 가중치만을 공개함으로써, 기본 모델의 성능은 보존하면서도 적응(adaptation)을 불안정하게 만드는 내재적 기하학적 불일치를 생성하여 파운데이션 모델을 무단 미세 조정으로부터 보호하는 프레임워크인 프라이빗 마스크 사전 학습(Private Mask Pre-Training, PMP)을 제안한다.

원저자: Ziyao Wang, Nizhang Li, Pingzhi Li, Guoheng Sun, Tianlong Chen, Ang Li

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziyao Wang, Nizhang Li, Pingzhi Li, Guoheng Sun, Tianlong Chen, Ang Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수년간 수백만 달러를 들여 거대하고 완벽한 빵 한 덩어리(파운데이션 모델)를 구웠다고 상상해 보세요. 당신은 이 레시피를 세상과 공유하여 모두가 배우고 자신만의 맛있는 샌드위치를 만들 수 있기를 바랍니다. 하지만 한 가지 걱정이 있습니다. 누군가 당신의 빵을 가져가서, 허가 없이 자신만의 이상한 재료로 다시 "굽는(재학습하는)" 과정에서 독성이 있거나 해로운 것을 만들어내면 어떡하죠? 혹은 더 나아가, 당신이 그토록 공들여 개발한 맛에 대해 그들이 모든 공로를 가로채 버리면 어떡하죠?

이 논문은 사람들이 빵을 있는 그대로 즐길 수는 있게 하되, 허가 없이 성공적으로 "다시 굽는" 것은 매우 어렵게 만드는 영리한 방법을 제안합니다.

이것이 저자들이 **프라이빗 마스크 프리트레이닝(Private Mask Pre-Training, PMP)**이라고 부르는 해결책이 작동하는 방식입니다. 이해를 돕기 위해 간단한 비유를 사용하겠습니다.

1. 문제점: "열린 레시피"의 딜레마

현재 AI 기업들이 모델을 공개할 때, 그들은 "가중치(weights, 뇌의 최종 설정값)"를 제공합니다. 누구나 이 가중치를 가져가서 특정 작업에 맞게 미세하게 조정(fine-tuning)할 수 있습니다.

  • 장점: 과학 발전과 혁신에 도움이 됩니다.
  • 단점: 원작자가 통제력을 잃습니다. 누군가 모델을 위험하게 수정할 수도 있고, 제작자가 서비스로 판매하려 했던 작업을 위해 모델을 저렴하게 변형함으로써 제작자의 경제적 가치를 훔칠 수도 있습니다 있습니다.

2. 해결책: "비밀 골격"

저자들은 모델을 훈련하는 새로운 방식을 제안합니다. 뇌 전체를 똑같이 훈련시키는 대신, 뇌의 특정 부분인 희소한 "골격(skeleton)"만을 훈련시키고 나머지 부분은 고정된 상태로 유지하는 것입니다.

모델을 하나의 거대하고 복잡한 체육관이라고 생각해 보세요.

  • 표준 훈련: 모든 사람이 체육관의 모든 근육을 사용해 운동합니다.
  • PMP 훈련: 훈련사(AI 기업)는 실제로 모든 힘을 쓰는 데 기여하는 특정 기구 10%(이것을 "복권(Lottery Ticket)"이라 부릅니다)를 비밀리에 식별합니다. 그리고 나머지 90%의 기구는 아무도 건드릴 수 없도록 잠가버립니다. 오직 중요한 10%만을 훈련시킵니다.

3. 공개: 체육관을 주되, 지도는 숨긴다

모델 훈련이 끝나면, 회사는 체육관을 대중에게 공개합니다.

  • 공개하는 것: 체육관의 최종 상태(가중치). 이는 정상적이고 완전히 기능하는 체육관처럼 보입니다.
  • 숨기는 것: 어떤 기구가 실제로 훈련되었고 어떤 것이 그냥 고정된 소품인지 알려주는 **비밀 지도(이진 마스크, binary mask)**입니다.

4. 결과: 두 가지 다른 시나리오

시나리오 A: 권한이 있는 사용자 (지도를 가진 경우)
당신이 신뢰할 수 있는 파트너라면, 회사는 당신에게 비밀 지도를 줍니다. 당신은 어떤 기구를 사용해야 하는지 정확히 알 수 있습니다. 당신은 그 특정 10%의 기구들을 조정할 수 있고, 체육관은 당신의 새로운 작업에 맞춰 완벽하게 작동합니다. 당신은 훌륭한 결과를 얻습니다.

시나리오 B: 권한이 없는 사용자 (지도가 없는 경우)
만약 낯선 사람이 지도 없이 모델을 미세하게 조정하려고 시도한다면, 그는 어떤 기구가 실제 훈련된 것인지, 어떤 것이 그냥 고정된 소품인지 알지 못합니다.

  • 그는 모든 것을 조정하려고 시도합니다.
  • 하지만 훈련되지 않고 고정된 90%의 기구들을 건드리게 되는데, 이는 마치 움직이도록 설계되지 않은 벽을 밀어내는 것과 같습니다.
  • 비유: 자동차 핸들을 돌려 조향하려고 하는데, 누군가 몰래 스티어링 칼럼을 대시보드에 용접해 놓은 상황과 같습니다. 억지로 조종하려고 하면, 단순히 조종에 실패하는 것을 넘어 메커니즘 자체가 망가져 버립니다.
  • 논문의 주장: 이러한 "불일치"는 모델을 불안정하게 만듭니다. 무단 사용자가 미세 조정을 시도하면 할수록, 성능은 더욱 악화됩니다. 즉, 비밀 열쇠 없이 모델을 적응시키려 하면 모델이 사실상 "고장" 나게 됩니다.

5. "얼리 버드(Early Bird)" 기술

그들은 어떻게 그 특정 10%의 기구를 찾아냈을까요?
그들은 **"얼리 버드 로터리 티켓(Early-Bird Lottery Ticket)"**이라는 방법을 사용했습니다.

  • 모델 훈련을 시작한 지 불과 몇 분 만에 과정을 살펴봅니다.
  • 그 초기 몇 분 동안 뇌의 어느 부분이 가장 빠르게 "깨어나고" 학습하는지를 관찰합니다.
  • 그 특정 부분들을 "비밀 골격"으로 확정하고, 나머지 부분은 남은 훈련 시간 동안 무시합니다.
  • 논문은 이 초기 선택이 매우 중요하다고 주장합니다. 만약 무작위로 부분을 골라 훈련했다면, 모델의 성능은 떨어지고 누군가 악용하기도 어려워지지 않았을 것입니다.

요약된 주장

이 논문은 다음을 입증합니다:

  1. 여전히 모델을 사용할 수 있습니다: 기본 모델(빵)은 일반적인 모델만큼 맛이 좋습니다. 여전히 글을 쓰고, 추론하고, 대화할 수 있습니다.
  2. 무단 수정은 실패합니다: 비밀 지도 없이 미세 조정을 시도하면, 다양한 작업에서 모델의 성능이 크게 떨어집니다.
  3. 권한이 있는 수정은 작동합니다: 지도를 가지고 있다면 여전히 성공적으로 미세 조정을 할 수 있습니다.
  4. 이는 "프리트레이닝" 기능입니다: 이것은 나중에 덧붙이는 패치가 아닙니다. 모델이 처음부터 어떻게 훈련되는지에 이미 녹아들어 있는 방식입니다.

요약하자면, 이 논문은 AI 모델을 공유하는 방법 중 하나로, **설계 단계부터 견고함(robust by design)**을 갖춘 방식을 제안합니다. 즉, 모델은 모두에게 잘 작동하지만, 생성 과정에서 숨겨진 비밀 키(마스크)가 없다면 허가되지 않은 변경으로부터 "잠겨" 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →