Can Watermarking Techniques Help Prevent LLM Model Stealing?
이 논문은 은닉층 차원 추출을 포함한 블랙박스 모델 탈취 공격을 방지하기 위해 모델 로짓(logit)을 섭동시키는 워터마킹 기반의 방어 기법을 제안하며, 이 접근 방식이 모델의 효용성을 크게 저하시키지 않으면서도 그러한 공격을 효과적으로 저지한다는 것을 실증적 실험을 통해 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 수백만 달러의 비용이 드는 장엄하고 비밀스러운 케이크 레시피를 만들었다고 상상해 보십시오. 당신은 케이크를 판매하지 않고, 그저 창구를 통해 조각을 주문할 수 있게 해줍니다. 사람들은 맛은 볼 수 있지만, 재료 목록이나 섞는 그릇(mixing bowl)의 크기는 볼 수 없습니다.
최근에 한 무리의 교활한 요리사들이 당신의 주방 내부를 훔쳐보는 트릭을 발견했습니다. 그들은 특정 조각들을 수천 번 주문하고 남겨진 아주 작은 부스러기들(이를 "로짓(logits)"이라 부릅니다)을 분석함으로써, PCA라는 수학적 돋보기를 사용하여 당신의 그릇 크기(즉, "숨겨진 차원(hidden dimension)")를 알아내는 방법을 찾아냈습니다. 일단 그들이 그 크기를 알게 되면, 그들은 당신의 전체 비밀 레시피를 역설계하여 경쟁하는 케이크 가게를 차릴 수도 있습니다.
이 논문은 당신의 주방을 보호하기 위한 새로운 방법인 디지털 워터마크를 제안합니다. 단순히 그릇을 숨기는 대신, 저자들은 모든 케이크 조각이 창구를 떠나기 전에 특별하고 눈에 보이지 않는 "노이즈"를 뿌릴 것을 제안합니다. 이 노이즈는 교활한 요리사들의 수학적 계산을 혼란스럽게 설계되었으며, 케이크의 맛은 그대로 유지하면서도 그들이 그릇의 크기를 파악하는 것을 불가능하게 만듭니다.
"노이즈" 문제: 단순한 트릭이 실패하는 이유
저자들은 이 노이즈를 추가하는 여러 가지 방법을 테스트했으며, 몇몇 뻔한 아이디어들이 완전히 실패했다는 것을 발견했습니다.
- "정적(Static)"의 실수: 만약 모든 조각에 똑같은 양의 노이즈를 더한다면, 요리사들은 그것을 그냥 빼버릴 수 있습니다. 이는 마치 모든 쿠키에 똑같은 양의 소금을 뿌리는 것과 같습니다. 영리한 요리사는 소금 맛을 보고 그것을 무시할 수 있기 때문입니다.
- "정렬(Sorted)"의 실수: 그들은 노이즈를 재료의 순서에 맞춰 정렬하는 실험을 했습니다. 놀랍게도 이 역시 작동하지 않았습니다. 노이즈 자체에 숨겨진 패턴이 있어, 요리사들이 여전히 그것을 볼 수 있었기 때문입니다. 이는 마치 유리창에 남겨진 지문처럼 흔적을 남겼습니다.
- "곱셈(Multiplication)"의 실수: 그들은 재료에 무작위 숫자를 곱하는 실험을 했습니다. 이는 케이크의 맛(모델 품질)을 망가뜨렸지만, 요서들이 그릇의 크기를 세는 것을 막지는 못했습니다.
이 논문은 단순한 독립적 노이즈(매번 변하는 무작위 뿌리기)를 사용하는 것에 대해 명시적으로 반대합니다. 왜냐하면 요리사들이 같은 조각을 40번 주문하여 그 결과를 평균 내면 노이즈를 씻어낼 수 있기 때문입니다.
승리 전략: "비밀 시드(Secret Seed)"와 "소프트플러스(Softplus)" 방패
저자들은 디지털 이미지 워터마킹에서 영감을 얻은, 실제로 작동하는 해결책을 찾아냈습니다. 그들의 방법에는 두 가지 핵심 요소가 있습니다.
- 비밀 시드: 무작위 노이즈를 사용하는 대신, 주방은 오븐 안의 케이크 반죽 상태에 기반한 비밀 코드(암호화 함수)를 사용합니다. 이는 모든 조각이 내용물에 따라 고유한 노이즈 패턴을 갖게 함을 의미합니다. 요리사가 동일한 프롬프트를 두 번 주문하더라도 노이즈는 동일하게 유지되어 평균을 낼 수 없지만, 프롬프트가 조금이라도 바뀌면 노이즈는 완전히 달라집니다.
- 소프트플러스 방패: 노이즈가 케이크의 맛을 망치지 않도록 하기 위해, 저자들은 "소프트플러스(softplus)"라고 불리는 특별한 수학적 트릭을 사용합니다. 이것은 재료를 아주 살짝 구부려 그릇의 크기는 숨기되, 가장 맛있는 재료들의 순서는 그대로 유지하는 부드러운 필터라고 생각하면 됩니다.
이 "비밀 시드"를 "소프트플러스"와 결합하고 여기에 가우시안 노이즈(미세한 설탕 가루 같은 것)를 더했을 때, 결과는 인상적이었습니다. Mistral-7B(숨겨진 차원이 4,096인 모델)에 대한 테스트에서, 교활한 요리사들은 완전히 실패했습니다. 수학적으로 데이터에서 그릇의 크기를 드러내는 명확한 "도약(jump)"이 나타나지 않았습니다. 요리사들이 "강건한 PCA(Robust PCA)"와 같은 고급 기술을 사용하거나 소프트플러스 필터를 역으로 추적하려고 시도했음에도 불구하고, 공격은 실패했습니다.
케이크의 맛은 여전히 좋은가?
가장 큰 걱정은 "재료를 건드리면 케이크 맛이 나빠지지 않을까?"였습니다.
저자들은 이를 면밀히 측정했습니다. 그들은 MMLU(지식 및 추론 테스트)라는 벤치마크를 사용하였으며 다음과 같은 결과를 얻었습니다:
- 단순하고 무질서한 노이즈는 모델 점수를 크게 떨어뜨렸습니다 (일부 경우 약 44.75% 또는 **49.52%**까지 하락).
- 그러나 소프트플러스 기반 방식은 점수를 매우 높게 유지하여 **56.55%**에서 57.78% 사이를 기록했습니다! 이는 수정되지 않은 원래의 모델과 거의 비슷합니다.
또한 그들은 **퍼플렉시티(Perplexity)**라는 지표를 통해 "풍미 프로필"이 얼마나 변했는지 확인했습니다. 가장 좋은 설정들은 퍼플렉시티가 단 3.37이었으며, 이는 원래 모델의 3.40과 매우 근접한 수치입니다.
결론
이 논문은 세상의 모든 가능한 도난을 해결했다고 주장하는 것이 아니라, 이 특정한 방법이 강력한 방어책임을 강력하게 시사합니다. 프롬프트에 의존하는 비밀 시드와 부드러운 "소프트플러스" 필터를 사용함으로써, 저자들은 모델이 똑똑하고 유용하게 유지되는 동시에, 도둑들이 모델의 크기를 훔치는 데 필요한 수학적 단서들을 효과적으로 교란할 수 있었습니다.
요약하자면, 이제 당신은 도둑들이 당신의 주방 크기를 측정하는 것을 막기 위해, 케이크의 맛을 망치지 않으면서도 AI의 답변 위에 약간의 "혼란 가루(confusion dust)"를 뿌릴 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.