← 최신 논문
💬 NLP

SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking

이 논문은 코드 생성이나 수학적 추론과 같이 엔트로피가 낮은 환경에서 기존 KGW 워터마킹 방식의 성능이 저하되는 문제를 해결하기 위해, 다음 토큰의 로짓(logit) 분포를 고려하여 어휘집을 두 그룹으로 균형 있게 나누는 SSG(Sort-then-Split by Groups) 방식을 제안하여 워터마크 탐지 성능을 향상시켰습니다.

원저자: Chenxi Gu, Xiaoning Du, John Grundy

게시일 2026-04-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chenxi Gu, Xiaoning Du, John Grundy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 배경: "AI가 쓴 글을 어떻게 알아챌까?" (워터마크의 원리)

우리가 어떤 글을 읽을 때, 그 글이 사람이 쓴 건지 AI가 쓴 건지 궁금할 때가 있죠? 연구자들은 AI가 글을 쓸 때 **'특정한 규칙'**을 따르도록 만듭니다.

예를 들어, AI에게 글을 쓰라고 시키면서 **"단어를 선택할 때, 홀수 번째 단어는 가급적 '초록색 단어'를 골라라"**라는 비밀 규칙을 주는 거예요. 나중에 검사관이 글을 봤을 때 "어? 초록색 단어가 유독 많네? 이건 AI가 쓴 거구나!"라고 알아채는 방식이죠. 이것이 바로 기존의 KGW 방식입니다.

2. 문제점: "정답이 너무 뻔한 상황에서는 낙인을 찍을 수 없다!"

그런데 문제가 하나 있습니다. 바로 **'수학 문제'**나 '코딩' 같은 분야예요.

비유를 들어볼까요?
여러분이 친구에게 **"1 + 1은 뭐야?"**라고 물었다고 해봅시다. 친구가 대답할 수 있는 단어는 사실상 "2" 하나뿐이죠. 이때 "초록색 단어를 써서 대답해!"라고 규칙을 주면 어떻게 될까요?

  • 만약 '2'가 빨간색 단어라면? 친구는 '2'라고 말해야만 정답을 맞히는데, 규칙 때문에 억지로 초록색 단어를 찾으려다 보니 정답을 틀리게 됩니다.
  • 결국, **정답이 너무 명확한 상황(저엔트로피 상황)**에서는 AI가 규칙을 지키려다 글의 품질(정답률)을 망치거나, 규칙을 지키려 해도 선택지가 너무 적어 낙인을 제대로 남기지 못하게 됩니다.

3. 해결책: SSG (Sort-then-Split by Groups) — "공평한 팀 나누기"

이 논문의 저자들은 이 문제를 해결하기 위해 SSG라는 새로운 방법을 제안했습니다. 핵심은 **"가장 중요한 단어들을 초록색과 빨간색 팀으로 공평하게 나눠주는 것"**입니다.

기존 방식이 주머니에서 단어를 무작위로 꺼내 팀을 나눴다면, SSG는 단어들을 '중요도(확률)' 순서대로 줄을 세운 뒤, 두 명씩 짝을 지어 한 명은 초록색 팀, 한 명은 빨간색 팀으로 보냅니다.

[비유: 맛집 메뉴 결정하기]

  • 기존 방식: 메뉴판에 있는 음식들을 눈 감고 무작위로 '추천 메뉴(초록색)'와 '일반 메뉴(빨간색)'로 나눕니다. 운이 나쁘면 맛있는 메뉴가 전부 '일반 메뉴'에 몰려버려서, 추천을 하려고 해도 맛없는 것만 추천해야 하는 상황이 생깁니다.
  • SSG 방식: 맛있는 메뉴 순서대로 줄을 세웁니다. 1등 메뉴와 2등 메뉴를 묶어서 한 명은 초록색, 한 명은 빨간색 팀으로 보냅니다. 이렇게 하면 '가장 맛있는 메뉴'가 초록색 팀과 빨간색 팀에 골고루 섞이게 됩니다.

이제 AI는 가장 정답에 가까운(맛있는) 단어를 고르면서도, 그중 하나는 반드시 초록색 팀이 되도록 설계할 수 있습니다. 덕분에 글의 품질(정답률)은 유지하면서도, 초록색 단어가 얼마나 쓰였는지 아주 명확하게 확인할 수 있게 된 것이죠.

4. 결론: 무엇이 좋아졌나요?

  1. 정확한 탐지: 코딩이나 수학 문제처럼 정답이 딱 정해진 어려운 문제에서도 AI가 쓴 글인지 아주 잘 찾아냅니다.
  2. 품질 유지: 낙인을 찍기 위해 억지로 이상한 단어를 쓰지 않아도 되므로, AI가 내놓는 답변의 정확도가 떨어지지 않습니다.
  3. 효율성: 모든 단어를 다 계산할 필요 없이, 확률이 높은 상위 단어들만 골라서 처리하기 때문에 속도도 빠릅니다.

한 줄 요약:
"정답이 정해진 까다로운 문제에서도 AI의 흔적을 놓치지 않도록, 중요한 단어들을 초록색/빨간색 팀으로 공평하게 배분하는 똑똑한 낙인 찍기 기술을 개발했다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →