MirrorMark: A Distortion-Free Multi-Bit Watermark for Large Language Models
MirrorMark 은 토큰 확률 분포를 왜곡하지 않고 강건하고 탐지 가능한 메시지를 임베딩함으로써 텍스트 품질을 유지하면서 정확도와 탐지율에서 기존 방법들을 크게 능가하는 대규모 언어 모델을 위한 새로운 다중 비트 워터마킹 기술입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 빵을 굽는 제빵사라고 상상해 보세요. 당신은 빵을 위한 새롭고 완벽한 레시피를 고안해 냈습니다. 누군가 당신의 빵을 자신의 이름으로 팔더라도 그것이 yours 임을 증명할 수 있도록 하고 싶습니다. 하지만 여기에는 함정이 있습니다. 빵 덩어리에 거대한 "내 것"이라고 찍어서는 안 됩니다. 그렇게 하면 외관과 맛이 망가집니다. 또한 반죽에 비밀 코드를 속삭여서는 안 됩니다. 누군가 한 조각을 잘라내거나 부스러기를 추가하면 그 속삭임은 사라지기 때문입니다.
이것이 MirrorMark가 우리를 위해 글을 쓰는 AI 시스템인 대규모 언어 모델 (LLM) 에게 해결하는 문제입니다.
다음은 MirrorMark 가 작동하는 방식을 간단한 개념으로 분해한 것입니다:
1. 기존 "워터마크"의 문제점
현재의 워터마킹 방법들은 결함이 있는 두 가지 유형의 도장이라고 생각할 수 있습니다:
- "왜곡하는" 도장: 일부 방법은 비밀을 숨기기 위해 레시피를 약간 변경하려고 시도합니다. 예를 들어, AI 가 평소와 다르게 약간 다른 단어를 선택하도록 강제할 수 있습니다. 이는 빵을 표시하기 위해 이상한 향신료를 추가하는 것과 같습니다. 작동은 하지만 빵의 맛이 달라집니다 (텍스트 품질이 저하됨).
- "취약한" 도장: 다른 방법들은 맛을 바꾸지 않고 비밀을 숨기려고 시도합니다. 하지만 이는 붐비는 방에서의 속삭임과 같습니다. 누군가 텍스트를 편집하면 (문장을 추가하거나, 단어를 삭제하거나, 문장을 재구성하는 경우), 그 속삭임은 사라지고 더 이상 빵이 yours 임을 증명할 수 없게 됩니다.
2. MirrorMark 의 해결책: "완벽한 반사"
MirrorMark 는 비밀 메시지를 숨기는 새로운 방식으로, 왜곡이 없는 (빵의 맛을 바꾸지 않음) 동시에 강건한 (편집을 견딤) 특징을 가집니다.
이는 Mod-1 Mirroring이라는 교묘한 트릭을 사용합니다.
- 유사점: AI 가 0 과 1 사이 어딘가에 떨어지는 주사위 굴림을 기반으로 단어를 선택한다고 상상해 보세요.
- 트릭: MirrorMark 는 주사위 굴림을 변경하는 대신, 보내려는 비밀 메시지에 따라 그 숫자를 특정 선 (거울) 을 기준으로 "접습니다".
- 마법: 종이를 완벽하게 접으면 종이의 모양은 변하지 않지만 다른 쪽에서 보면 다르게 보입니다. 마찬가지로 MirrorMark 는 AI 가 사용하는 무작위 숫자들을 재배열하지만, 그 숫자들의 전체적인 패턴은 정확히 동일하게 유지됩니다.
- 결과: AI 는 워터마크 없이 작성했을 때와 마찬가지로 100% 자연스럽고 고품질인 텍스트를 작성합니다. 하지만 단어 선택의 구체적인 내부에는 나중에 복원할 수 있는 멀티 비트 코드 (디지털 지문과 같은) 가 숨겨져 있습니다.
3. "컨텍스트 기반 균형 스케줄러" (CABS)
완벽한 거울이 있더라도 위험이 있습니다: 만약 누군가 텍스트의 한 부분을 잘라낸다면 어떻게 될까요? 비밀 메시지가 고르게 퍼져 있었다면, 한 부분을 잘라내는 것이 전체 메시지를 삭제할 수 있습니다.
MirrorMark 는 CABS(Context-Anchored Balanced Scheduler) 라는 스마트한 관리자를 도입합니다.
- 유사점: 긴 책 안에 100 개의 작은 쪽지를 숨기고 있다고 상상해 보세요. 모든 쪽지를 첫 장에 숨기고 누군가 그 장을 찢어 버리면 모든 것을 잃게 됩니다. 무작위로 숨기면 쪽지들이 뭉쳐서 다른 페이지는 비어 있게 될 수 있습니다.
- CABS 의 작동 방식: CABS 는 꼼꼼한 사서처럼 행동합니다. 작성 중인 텍스트를 살펴보고 비밀 쪽지가 책 전체에 고르게 퍼지도록 보장합니다.
- 안전망: 또한 "프레임"이나 장을 생성합니다. 누군가 한 페이지를 찢어 버리더라도 CABS 는 피해가 그 프레임 한 곳에만 국한되도록 보장합니다. 책의 나머지는 동기화되어 있으므로, 숨겨진 메시지를 나머지 쪽지에서 다시 조립할 수 있습니다. 이로 인해 복사 - 붙여넣기나 삭제 공격으로 워터마크를 파괴하기 매우 어려워집니다.
4. 실험 결과
연구진들은 LLaMA-2 와 같은 AI 모델을 사용하여 MirrorMark 를 다른 최상위 방법들과 비교 테스트했습니다.
- 품질: MirrorMark 가 생성한 텍스트는 일반적인 AI 텍스트와 구별할 수 없었습니다. 로봇 같거나 이상하게 들리지 않았습니다.
- 탐지: 다른 방법들보다 MirrorMark 를 탐지하는 것이 훨씬 쉬웠습니다. 소량의 텍스트 (300 단어) 만으로도 높은 정확도로 워터마크가 포함된 콘텐츠를 식별할 수 있었습니다.
- 강건성: 공격자들이 단어를 삭제하거나 새로운 단어를 추가하거나 텍스트의 일부를 복사 - 붙여넣기하여 워터마크를 "파괴"하려고 시도했을 때, MirrorMark 는 경쟁자들보다 훨씬 잘 견뎌냈습니다.
- 용량: 단순한 "예/아니오" 신호뿐만 아니라 많은 정보 (멀티 비트) 를 숨길 수 있습니다. 이는 "누가 이것을 만들었는가?" 또는 "언제 만들어졌는가?"와 같은 세부 정보를 전달할 수 있음을 의미합니다.
요약
MirrorMark 는 유령 서명과 같습니다. 텍스트에 눈에 보이는 흔적을 남기지 않고, 단어의 맛을 바꾸지 않으며, 책에서 페이지를 찢어 버려도 깨지지 않습니다. 이는 AI 가 사고하는 방식의 자연스러운 무작위성 안에 복잡한 코드를 숨기기 위해 수학적 "거울"을 사용하며, AI 의 출력이 고품질을 유지하면서도 여전히 그 출처로 추적 가능하도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.