← 최신 논문
💬 NLP

QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs

이 논문은 LLM 의 텍스트 품질과 검증 결과에 메시지 의존성을 유발하지 않도록 보장하기 위해, 연속 확률 구간을 등분할된 빈으로 나누어 메시지를 임베딩하는 새로운 화이트박스 멀티비트 워터마킹 기법인 QuantileMark 를 제안하고 그 유효성을 입증합니다.

원저자: Junlin Zhu, Baizhou Huang, Xiaojun Wan

게시일 2026-04-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Junlin Zhu, Baizhou Huang, Xiaojun Wan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

양자트 마크 (QuantileMark): AI 가 쓴 글을 위한 '공정한' 디지털 지문

이 논문은 인공지능 (AI) 이 쓴 글이 진짜 사람인지, 아니면 AI 가 생성한 것인지, 그리고 누가 그 글을 썼는지 알 수 있게 해주는 새로운 기술을 소개합니다. 이를 위해 '워터마크 (디지털 지문)' 기술을 개선했는데, 기존 방식의 문제점을 해결하고 훨씬 더 공정하고 강력한 방법을 제안했습니다.

이 복잡한 기술을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 왜 이런 기술이 필요할까요? (배경)

지금 AI 가 글을 쓰거나 그림을 그리는 게 너무 흔해졌습니다. 가짜 뉴스나 저작권 문제, 혹은 누가 이 글을 썼는지 추적해야 할 때, 우리는 **"이 글이 AI 가 쓴 거야?"**라고 확인할 수 있어야 합니다.

기존 기술들은 단순히 "AI 가 쓴 글이다/아니다" (0 또는 1) 만 알려주거나, 사용자 ID 같은 정보를 숨겨서 넣었습니다. 하지만 문제는 기존 방식이 '불공정'하다는 점입니다.

2. 기존 방식의 문제: "누가 가산점을 받나?" (비유: 주사위 게임)

기존의 워터마크 기술은 마치 주사위를 굴려서 특정 숫자를 맞추는 게임과 비슷했습니다.

  • 문제 상황: AI 가 글을 쓸 때, 어떤 단어는 나올 확률이 80% (매우 흔함) 이고, 어떤 단어는 0.01% (매우 드묾) 입니다.
  • 기존 방식의 치명점: 만약 '사용자 A'의 비밀 코드가 '80% 확률 단어'와 연결되어 있다면, AI 는 아무 노력 없이 그 단어를 선택해도 코드가 삽입됩니다. 하지만 '사용자 B'의 코드가 '0.01% 확률 단어'와 연결되어 있다면, AI 는 억지로 그 드문 단어를 선택해야 합니다.
    • 결과: 사용자 A 는 글을 자연스럽게 쓰지만, 사용자 B 는 글이 어색해지거나 품질이 떨어집니다. 또한, 감시하는 사람 (검증자) 입장에서 사용자 A 의 글은 쉽게 발견되지만, 사용자 B 의 글은 찾기 어렵습니다.
    • 핵심: 메시지 (사용자 ID) 에 따라 글의 품질과 탐지 확률이 달라지는 '불공정'한 상황이 발생합니다.

3. 새로운 해결책: 양자트 마크 (QuantileMark)

이 논문이 제안한 QuantileMark는 이 불공정함을 해결하기 위해 '확률의 영역을 똑같이 나누는' 방식을 사용합니다.

🍕 비유: 피자를 똑같이 잘라 나누기

기존 방식은 피자를 자를 때, 한 조각은 크고 다른 조각은 작게 잘랐다면 (불공정), QuantileMark 는 피자를 정확히 같은 크기로 M 개 조각으로 나눕니다.

  1. 균등한 기회 (Equal-Mass Partition):

    • AI 가 다음 단어를 고를 때, 모든 가능한 확률 (0%~100%) 을 M 개의 똑같은 크기의 구간으로 나눕니다.
    • 예를 들어, 4 개의 사용자 ID 가 있다면, 각 ID 는 정확히 25% 의 확률 영역을 하나씩 차지합니다.
    • 어떤 단어가 나오든 상관없이, 각 사용자 ID 는 항상 똑같은 25% 의 확률 예산을 갖게 됩니다.
    • 효과: 사용자 A 이든 B 이든, 글을 쓸 때의 자연스러움 (품질) 이 똑같습니다. 누구에게나 불이익이 없습니다.
  2. 강력한 증거 (Strong Evidence):

    • 기존 방식은 '드문 단어'를 강제로 쓰게 해서 글이 어색해지면, 그 흔적도 희미해집니다.
    • 하지만 QuantileMark 는 확률 구간을 정확히 맞추는 것에 집중합니다. AI 가 특정 구간에 맞춰 단어를 선택하면, 검증자는 "아, 이 단어가 그 25% 구간에 딱 들어갔네!"라고 확신할 수 있습니다.
    • 결과: 글의 품질을 해치지 않으면서도, 누가 썼는지 찾아내는 능력 (탐지력) 이 훨씬 강력해집니다.

4. 어떻게 작동할까요? (작동 원리)

이 기술은 두 단계로 나뉩니다.

  • 쓰기 단계 (Embedding):

    • AI 가 글을 쓸 때, 비밀 키 (Key) 를 이용해 "오늘은 3 번 사용자 (ID) 가 글을 쓴다"고 정합니다.
    • 그리고 AI 가 다음 단어를 고를 때, 3 번 사용자가 할당받은 25% 확률 구간 안에 있는 단어만 골라냅니다.
    • 이때, 그 구간 안에 있는 단어들 중에서도 확률에 따라 자연스럽게 골라내므로 글이 어색하지 않습니다.
  • 읽기/검증 단계 (Detection):

    • 검증자 (서비스 제공자) 는 같은 비밀 키를 가지고 있습니다.
    • 검증자는 AI 가 쓴 글을 보고, "이 단어가 원래 3 번 사용자의 25% 구간에 속할 확률이 얼마나 될까?"를 계산합니다.
    • 이 확률들을 모아서 "아, 이 글은 3 번 사용자가 썼구나!"라고 추론합니다.

5. 왜 이것이 중요한가요? (결론)

  • 공정성: 어떤 사용자든 글의 품질이 떨어지지 않습니다. (메시지 대칭성)
  • 강력함: 글이 길어질수록, 혹은 글이 조금 변형되더라도 누가 썼는지 찾아낼 확률이 매우 높습니다.
  • 실용성: AI 서비스 제공자 (예: OpenAI, 구글 등) 가 내부적으로 사용자를 추적하고, 악성 콘텐츠의 원천을 찾을 때 매우 유용합니다.

요약

QuantileMark는 AI 가 글을 쓸 때, 누가 썼는지에 상관없이 모두에게 똑같은 공정한 기회를 주면서, 동시에 누가 썼는지 찾아내는 능력을 극대화하는 새로운 기술입니다. 마치 모든 참가자에게 똑같은 크기의 피자를 주되, 누가 먹었는지 알 수 있는 독특한 흔적을 남기는 것과 같습니다.

이 기술은 AI 시대의 '신원 확인'과 '책임 소재'를 명확히 하는 데 큰 역할을 할 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →