← 최신 논문
💬 NLP

Majority Bit-Aware Watermarking For Large Language Models

본 논문은 대규모 녹색 목록에서도 강력한 워터마크 신호를 유지함으로써 LLM 워터마킹에서 텍스트 품질과 복호화 정확도 간의 상충 관계를 해결하는 두 가지 구현체 (MajorMark 및 MajorMark+^{+}) 를 갖춘 새로운 인코딩 패러다임인 "다수 비트 인식 워터마킹"을 소개합니다.

원저자: Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiahao Xu, Rui Hu, Olivera Kotevska, Zikai Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대형 언어 모델 (LLM) 을 당신이 요청하는 거의 모든 요리 (텍스트) 를 해낼 수 있는 천재적인 셰프로 상상해 보세요. 문제는 때로 악의적인 행위자들이 이러한 셰프들을 이용해 '독이 든' 요리—가짜 뉴스, 사기, 또는 유해한 콘텐츠—를 만들어낸다는 점입니다. 이를 잡아내기 위해서는 정확히 어느 셰프가 만들었는지 알 수 있도록 음식에 태그를 붙이는 방법이 필요합니다. 이 태그를 워터마크라고 부릅니다.

하지만 함정이 하나 있습니다. 과거에 텍스트에 워터마크를 넣는 것은 섬세한 종이 위에 무겁고 투박한 도장을 찍는 것과 같았습니다. 도장이 더 눈에 띄게 만들수록 (나중에 찾기 쉽게 하기 위해) 종이의 질감 (글쓰기의 품질) 을 더 망가뜨렸습니다. 종이를 망가뜨리지 않을 정도로 도장이 너무 작다면, 그것은 너무 희미해서 나중에 찾을 수 없었습니다.

이 논문은 MajorMark와 **MajorMark+**라고 불리는 새로운 텍스트 워터마킹 방식을 소개합니다. 이는 다수결 규칙과 **조각 (shards)**을 활용한 교묘한 트릭을 통해 '품질 대 탐지 가능성' 문제를 해결합니다.

다음은 이를 간단한 개념으로 나누어 설명한 것입니다:

1. 구식 방식: '작은 녹색 목록' 문제

AI 의 어휘 (사용할 수 있는 모든 단어) 를 거대한 구슬 주머니라고 상상해 보세요.

  • 구식 방법: 비밀 메시지를 숨기기 위해 AI 는 다음 단어를 오직 아주 작은 '초록색' 구슬들 (주머니의 약 25%) 에서만 선택하도록 강요받았습니다. 나머지는 무시했습니다.
  • 절충: 초록색 목록이 너무 작다면 AI 는 규칙에 맞추기 위해 기이하고 부자연스러운 단어를 선택할 수밖에 없어 이야기가 로봇처럼 들렸습니다. 반면 초록색 목록이 크다면 (이야기를 자연스럽게 유지하기 위해) 비밀 메시지는 너무 희미해져 나중에 찾을 수 없게 되었습니다.

2. 새로운 아이디어: '다수 비트 (Majority Bit)' 전략

저자들은 AI 를 작은 목록으로 제한할 필요가 없다는 것을 깨달았습니다. 대신 투표 시스템을 사용했습니다.

비밀 메시지가 110111과 같은 0 과 1 의 긴 문자열이라고 상상해 보세요.

  • 트릭: 시스템은 메시지를 보고 "어떤 숫자가 더 많이 나타나는가?"라고 묻습니다. 110111에서 숫자 1이 '다수 비트'입니다.
  • 녹색 목록: 작은 목록을 선택하는 대신, AI 는 메시지의 '1'에 해당하는 어떤 단어라도 선택할 수 있습니다. '1'이 다수이므로 이 녹색 목록은 거대합니다 (전체 단어의 최소 50% 이상!).
  • 결과: AI 는 자연스러운 소리의 단어를 매우 많이 선택할 수 있으므로 텍스트는 완벽하게 들립니다. 하지만 AI 가 여전히 '1' 단어 쪽으로 약간씩 유도되기 때문에 비밀 메시지는 여전히 존재하며, 단지 어떤 단어가 선택되었는지에 대한 통계적 패턴 속에 숨겨져 있을 뿐입니다.

3. MajorMark: '클러스터 탐정'

MajorMark는 이 다수 전략을 사용합니다.

  • 인코딩: AI 는 비밀 메시지의 다수 비트와 일치하는 단어 쪽으로 텍스트를 약간 유도하며 글을 씁니다.
  • 디코딩: 메시지를 다시 읽기 위해 탐정 (디코더) 은 텍스트를 살펴보고 서로 다른 '그룹 (조각)'에 속한 단어들이 얼마나 자주 나타났는지 세어봅니다.
  • 비유: 단어들이 두 개의 통에 분류되어 있다고 상상해 보세요. 비밀 메시지가 '1'이었다면, '1'을 위한 통이 '0'을 위한 통보다 약간 더 많은 구슬을 담게 됩니다. 디코더는 간단한 클러스터링 도구 (구슬을 색깔별로 분류하는 것과 유사) 를 사용하여 어느 통이 더 무거운지 확인합니다. 한 통이 명확하게 더 무겁다면, 비밀 메시지가 '1'이었음을 알게 됩니다.

4. MajorMark+: '블록 단위' 업그레이드

만약 비밀 메시지가 매우 길다면 어떻게 될까요? '다수 비트'가 덜 명확해져 신호가 약해질 수 있습니다.

  • 해결책: **MajorMark+**는 긴 메시지를 더 작은 블록으로 자릅니다 (긴 줄을 짧은 구간으로 자르는 것과 유사).
  • 작동 방식: '다수 비트' 규칙을 각 작은 블록에 독립적으로 적용합니다.
  • 이점: 이는 모든 단일 블록에 대해 '녹색 목록'을 크게 유지하여 매우 긴 메시지라도 텍스트의 품질이 유지되도록 보장합니다. 또한 메시지를 찾기 위해 더 정밀한 '계산' 방법을 사용하여 놓치는 것을 어렵게 만듭니다.

왜 이것이 중요한가 (논문에 따르면)

저자들은 최상위 AI 모델들을 대상으로 이를 테스트한 결과 다음을 발견했습니다:

  1. 더 나은 품질: AI 가 작고 제한적인 목록에서 선택하도록 강요받지 않기 때문에 워터마크가 적용된 텍스트는 이전 방법들보다 훨씬 더 자연스럽습니다 (낮은 '퍼플렉시티').
  2. 더 나은 탐지: 텍스트가 자연스러워 보임에도 불구하고, 비밀 메시지는 이전 방법들보다 실제로 찾고 정확하게 디코딩하기가 더 쉽습니다.
  3. 강건성: 누군가 텍스트를 편집하려고 하더라도 (일부 잘라 붙이거나 문장을 재구성하는 등), 다수 비트의 통계적 '무게'가 여전히 탐지 가능하기 때문에 워터마크는 보통 살아남습니다.

요약하자면: 이 논문은 AI 가 인간처럼 들리는 것과 추적 가능한 것 사이에서 선택을 강요받지 않도록 하는 새로운 AI 텍스트 태깅 방식을 제안합니다. 어떤 단어에 미세한 부스트를 줄지 선택하기 위해 '다수 투표' 시스템을 사용함으로써, AI 가 자연스럽게 글을 쓰면서도 강력하고 복구 가능한 비밀 메시지를 내장할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →