← 최신 논문
💬 NLP

TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection

TextSeal 은 이중 키 생성과 다중 영역 로컬라이제이션을 통해 강력한 출처 탐지 및 증류 보호를 보장하면서도 출력 품질을 유지하고 추론 오버헤드 없이 서빙 최적화를 지원하는 최첨단 왜곡 없는 LLM 워터마킹 체계입니다.

원저자: Tom Sander, Hongyan Chang, Tomáš Souček, Tuan Tran, Valeriu Lacatusu, Sylvestre-Alvise Rebuffi, Alexandre Mourachko, Surya Parimi, Christophe Ropers, Rashel Moritz, Vanessa Stark, Hady Elsahar, Pierre
게시일 2026-05-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tom Sander, Hongyan Chang, Tomáš Souček, Tuan Tran, Valeriu Lacatusu, Sylvestre-Alvise Rebuffi, Alexandre Mourachko, Surya Parimi, Christophe Ropers, Rashel Moritz, Vanessa Stark, Hady Elsahar, Pierre Fernandez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매일 수천 개의 맛있는 빵을 굽는 제빵사라고 상상해 보세요. 당신은 식료품점에 진열된 빵이 당신 것이 맞는지, 아니면 누군가가 당신의 레시피를 베껴서 직접 구운 것인지 알고 싶습니다. 하지만 여기서 함정이 하나 있습니다. 빵에 "제빵사 톰 제작"이라고 찍어 넣을 수는 없습니다. 그렇게 하면 맛과 식감이 망가져 버리기 때문입니다. 대신 인간의 혀에는 보이지 않지만, 당신의 특수 스캐너가 감지할 수 있는 고유한 지문처럼 남는 비밀 재료가 필요합니다.

이것이 바로 TextSeal이 대규모 언어 모델 (AI) 에게 해결하는 문제입니다. TextSeal 은 텍스트의 소리나 모양을 바꾸지 않고 누가 그 글을 썼는지 증명하는 새로운 고기술 '보이지 않는 워터마크'입니다.

TextSeal 의 작동 원리를 간단한 개념으로 나누어 설명해 보겠습니다.

1. 비밀 재료 (이중 키 생성)

이전 워터마크는 항상 같은 자리에 같은 표시를 찍는 도장 같았습니다. AI 에게 같은 질문을 두 번 했다면, 두 번 모두 정확히 같은 답변을 내놓았을 것입니다. 이는 사용자에게 지루할 뿐만 아니라 AI 가 반복적인 루프 (예: 반복 재생되는 노래) 에 갇히게 만들 수도 있습니다.

TextSeal 의 해결책: 하나의 키 대신 두 개의 비밀 키를 사용합니다. AI 가 단어를 선택할 때마다 동전을 던져 어느 키를 사용할지 결정합니다.

  • 비유: 두 가지 다른 비밀 향신료가 있다고 상상해 보세요. 때로는 향신료 A 를 뿌리고, 때로는 향신료 B 를 뿌립니다. 먹는 사람에게는 빵의 맛이 전혀 변하지 않지만 (왜곡 없음), 당신의 스캐너에게는 향신료의 패턴이 당신 것임을 증명하는 고유하고 다양한 지문을 만들어냅니다. 이는 AI 의 답변을 신선하고 다양하게 유지하면서도 추적 가능하게 만듭니다.

2. 똑똑한 스캐너 (엔트로피 가중치 탐지)

워터마크를 탐지하는 것은 어렵습니다. AI 가 때로는 매우 예측 가능한 내용 (낮은 '엔트로피') 을 쓰고, 때로는 매우 창의적이고 예측 불가능한 내용 (높은 '엔트로피') 을 쓰기 때문입니다.

  • 문제: AI 가 다음 단어가 "the"일 것이라고 99% 확신하는 경우, 그 자리에 워터마크를 추가하는 것은 폭풍우 속 속삭임을 숨기려는 것과 같습니다. 듣기 매우 어렵습니다. 하지만 AI 가 여러 단어 사이에서 추측할 때 워터마크 신호는 훨씬 더 강해집니다.
  • TextSeal 의 해결책: AI 가 불확실한 부분 (높은 엔트로피) 에 더 집중하도록 아는 '똑똑한 스캐너'를 사용합니다. 지루하고 예측 가능한 부분은 무시하고, 워터마크 신호가 가장 강한 창의적인 부분에 초점을 맞춥니다. 이로써 긴 문서에서도 탐지 정확도가 훨씬 높아집니다.

3. 건초더미 속의 바늘 찾기 (지역화 탐지)

누군가 당신이 쓴 단락을 가져와 인간이 쓴 50 페이지 분량의 에세이에 섞어 놓고, 전체가 자신의 것이라고 주장한다고 가정해 보세요. 기존 워터마크는 전체 에세이를 살펴보다가 인간이 쓴 글에 혼란을 느껴 "워터마크를 찾을 수 없다"고 말할 것입니다.

TextSeal 의 해결책: 전체 문서를 보는 것이 아니라 특정 영역을 스캔합니다.

  • 비유: 해변에서 모래 한 알을 찾으려 하는 대신, TextSeal 은 고유한 색을 띠는 작고 구체적인 모래 무늬를 찾습니다. AI 가 쓴 텍스트가 거대한 문서의 5% 에 불과하더라도, TextSeal 은 그 5% 를 분리해 내고 나머지는 무시하며 "아하! 이 특정 단락은 분명히 AI 가 생성한 것이다"라고 말할 수 있습니다. 이는 AI 텍스트가 문서 전체에 잘게 쪼개져 흩어져 있더라도 작동합니다.

4. '방사능' 효과 (증류 보호)

아마도 가장 강력한 기능일 것입니다. 경쟁사가 워터마크가 적용된 출력물을 기반으로 자체 모델을 훈련시켜 AI 의 '두뇌'를 훔치려 한다면, 워터마크는 텍스트 안에 머무는 것을 넘어 학습됩니다.

  • 비유: 당신의 비밀 향신료가 너무 강력해서, 경쟁사가 당신의 옛 빵들을 참고 자료로 사용해 빵을 구우려 해도, 그들이 당신의 비밀 레시피를 본 적이 없더라도 그들의 새로운 빵에도 당신의 향신료 흔적이 희미하게 남아 있다고 상상해 보세요.
  • 주장: 논문은 TextSeal 워터마크가 적용된 데이터로 학생 모델 (student model) 을 훈련시키면, 그 학생 모델이 '방사능'이 된다고 보여줍니다. 학생 모델을 테스트하면 여전히 워터마크 신호가 나타나 훈련 데이터가 yours 임을 증명합니다. 이는 경쟁사가 당신의 모델 지식을 몰래 복사하는 것을 막아줍니다.

왜 이것이 중요한가요?

  • 보이지 않습니다: 논문은 수천 개의 예시를 인간에게 읽게 하여 테스트했습니다. 그들은 워터마크가 적용된 텍스트와 적용되지 않은 텍스트의 차이를 구별하지 못했습니다. AI 가 로봇처럼 들리거나 실수를 하도록 만들지 않았습니다.
  • 빠릅니다: AI 의 사고 과정에 거의 시간을 추가하지 않으므로 실시간 애플리케이션에서 사용할 수 있습니다.
  • 강합니다: 텍스트가 심하게 희석되거나 인간이 쓴 글과 섞여 있더라도 워터마크를 탐지하는 데 있어 기존 방법들 (예: Google 의 SynthID) 보다 뛰어납니다.

요약하자면, TextSeal은 복사, 혼합, 그리고 다른 모델에 의해 '학습'되는 것까지 견디면서도 텍스트의 품질을 해치지 않는 보이지 않고 깨지지 않는 잉크로 AI 의 작업에 서명하는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →