← 최신 논문
🤖 AI

Hey, That's My Model! Introducing Chain & Hash, An LLM Fingerprinting Technique

이 논문은 출력 변형 공격과 미세 조정에 대해서도 검증 가능하고 견고하며 위조 불가능한 소유권 증명을 제공하기 위해 프롬프트를 응답에 암호학적으로 결합하는 새로운 LLM 핑거프린팅 프레임워크인 "Chain & Hash"를 소개한다.

원저자: Mark Russinovich, Yanan Cai, Ahmed Salem

게시일 2026-07-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mark Russinovich, Yanan Cai, Ahmed Salem

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 비싸고 정교하게 제작된 맞춤형 로봇 요리사를 소유하고 있다고 상상해 보십시오. 당신은 완벽한 식사를 요리하도록 이 로봇을 수년간 훈련시켰습니다. 그런데 누군가 당신의 로봇을 훔쳐서 이름을 바꾸고, 그 로봇이 만든 음식을 마치 자신의 것인 양 팔기 시작했습니다. 내부 배선을 보기 위해 로봇의 금속 외피를 열지 않고도, 이 로봇이 당신의 것이라는 사실을 어떻게 증명할 수 있을까요?

이것이 바로 마이크로소프트 연구진(Mark Russinovich 및 동료들)이 새로운 논문 **"Hey, That's My Model!"**을 통해 해결하고자 하는 문제입니다. 그들은 오늘날 우리가 사용하는 초지능형 AI 챗봇인 대규모 언어 모델(LLM)을 위한 보이지 않는, 깨뜨릴 수 없는 워터마크인 Chain & Hash 기술을 소개합니다.

이 기술이 어떻게 작동하는지 쉬운 개념으로 나누어 설명해 드리겠습니다.

1. 문제점: "블랙박스" 도둑

현재는 누군가 AI 모델을 훔친 뒤, 이를 약간 수정하거나 말투를 변경(예: 해적처럼 말하거나 격식 있는 변호사처럼 말하기)하여 도난 사실을 숨길 수 있습니다. 기존의 소유권 증명 방식은 모델의 내부 코드를 확인해야 하거나(도둑은 이를 보여주지 않을 것입니다), 모델의 유용성을 해칠 수 있다는 단점이 있습니다.

2. 해결책: 암호학적 "비밀 악수"

저자들은 이 방법이 당신과 당신의 AI 사이의 비밀 악수처럼 작동하는 방식을 제안합니다. 당신은 로봇의 내부를 들여다볼 필요가 없습니다. 그저 특정 질문을 던지기만 하면 되며, 로봇은 그것이 당신의 것임을 증명하기 위해 반드시 특정한 답변을 내놓아야 합니다.

하지만 여기에는 함정이 있습니다. 만약 도둑이 로봇의 성격을 바꾼다면, 로봇은 비밀 악수를 잊어버릴 수도 있습니다. 그래서 연구진은 이러한 변화에도 살아남을 수 있는 시스템을 구축했습니다.

단계 A: 체인 (The "Linked Chain")

당신에게 10개의 특별한 질문 세트가 있다고 상상해 보십시오. 일반적인 시스템에서는 단순히 답변을 암기할 수도 있습니다. 하지만 Chain & Hash에서는 질문들이 체인처럼 서로 연결되어 있습니다.

  • 질문 #1에 대한 답변은 질문 #2에 의존합니다.
  • 질문 #2에 대한 답변은 질문 #3에 의존합니다.
  • 이런 식으로 계속됩니다.

이들은 이 질문과 답변들을 결합하기 위해 수학적 "잠금 장치"(암호학적 해시)를 사용합니다. 이는 다음을 의미합니다:

  • 조작 불가능: 도둑은 답변을 단순히 추측할 수 없습니다. 올바른 답변을 얻으려면 로봇 전체를 처음부터 다시 학습시켜야 하는데, 이는 엄청나게 비용이 많이 들고 눈에 띄는 작업입니다.
  • 고유함: 이 수학적 구조는 답변이 무작위해 보이면서도 소유자에게는 완벽하게 일관되도록 보장합니다.

단계 B: "카멜레온" 훈련 (The "Meta-Prompt" 방어)

가장 큰 위협은 "좋아, 로봇, 이제부터 너는 해적이야!"라거나 "모든 문장을 '답변:'으로 시작해!"라고 명령하는 도둑입니다. 이는 보통 지문(fingerprint)을 깨뜨려 버립니다.

이를 해결하기 위해 연구진은 "카멜레온" 전략을 사용하여 AI 모델을 훈련했습니다:

  • 모델이 어떤 "의상"(또는 메타 프롬프트)을 입더라도 비밀 질문에 정확히 똑같은 방식으로 답하도록 가르쳤습니다.
  • 그들은 수천 가지의 다양한 "의상"(예: "해적처럼 말하기", "매우 예의 바르게 행동하기", "이모지 사용하기")을 가지고 연습했습니다.
  • 또한 질문에 "노이즈"(무작잡한 단어들)를 추가하여, 모델이 방해 요소에 집중하지 않고 비밀 신호에만 집중하는 법을 배우도록 했습니다.

3. 결과: 강력하고, 빠르며, 보이지 않음

연구진은 이 기술을 Llama나 Phi와 같은 여러 인기 AI 모델에 테스트했습니다. 결과는 다음과 같습니다.

  • 투명성 (Invisible): AI는 일반적인 작업에서도 완벽하게 작동합니다. 시를 쓰거나 수학 문제를 풀라고 요청해도 이전과 다름없이 성능을 발휘합니다. 지문이 모델을 느리게 만들거나 멍청하게 만들지 않습니다.
  • 효율성 (Fast): 소유권을 증명하기 위해 1,000개의 질문을 던질 필요가 없습니다. 단 10개의 질문만 던지면 되며, 모델이 그중 단 2개만 맞혀도 소유권을 증명할 수 있습니다. 이는 빠른 신원 확인과 같습니다.
  • 강건성 (Robust): 도둑이 모델의 스타일을 바꾸거나 새로운 데이터로 학습(미세 조정)시키더라도 비밀 악수는 유지됩니다. 모델은 해적 흉내를 내고 있더라도 비밀 질문에 여전히 올발른 답변을 내놓습니다.
  • 위조 불가능성 (Unfakeable): "Chain & Hash" 수학 구조 덕분에 도둑은 답변을 추측할 수 없습니다. 지문을 위조하려면 모델 전체를 다시 학습시켜야 하며, 이는 도난의 목적 자체를 무색하게 만듭니다.

4. 보너스: "애드온"에도 작동합니다

이 논문은 이 기술이 LoRA 어댑터에도 작동함을 보여줍니다. LoRA 어댑터는 의료 조언과 같은 새로운 기술을 가르치기 위해 거대 AI 모델에 부착하는 작고 저렴한 "패치"와 같습니다. 연구진은 이 지문을 이러한 작은 패치에 직접 심을 수 있음을 증명하여, 가벼운 버전의 AI까지도 보호할 수 있게 했습니다.

요약

요컨대, Chain & Hash는 AI 소유자가 모델에 암호학적 비밀 악수를 심을 수 있는 방법입니다. 이는 도둑이 모델의 성격이나 정체를 바꾸려고 아무리 노력하더라도, 모델이 특정 질문에 정확하게 답하도록 가르치는 방식입니다. 이는 자동차에 고유한 일련번호를 새기는 것과 같습니다. 이 번호는 오직 올바른 질문을 던졌을 때만 빛을 발하며, 도둑이 자동차의 색을 칠하더라도 그 차가 당신의 소유임을 증명해 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →