← 최신 논문
💻 computer science

Can we Watermark Low-Entropy LLM Outputs?

이 논문은 기존 연구가 요구했던 높은 엔트로피 가정 없이도 LLM 의 저엔트로피 출력을 대상으로, 무작위 치환 및 삭제 공격에 견고한 탐지 불가능한 워터마킹 기법을 제안합니다.

원저자: Noam Mazor, Andrew Morgan, Rafael Pass

게시일 2026-04-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Noam Mazor, Andrew Morgan, Rafael Pass

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 문제: AI 가 쓴 글을 어떻게 구별할까? (수박 속의 씨앗)

요즘 AI 가 쓴 글은 사람과 구별하기 힘들 정도로 자연스럽습니다. 그래서 "이 글이 AI 가 쓴 거야, 사람이 쓴 거야?"를 구별하는 **수박 속의 씨앗 (워터마크)**을 넣는 기술이 필요해졌습니다.

  • 기존의 방법 (높은 엔트로피): 예전 연구자들은 AI 가 글을 쓸 때 매우 다양한 단어를 골라야만 씨앗을 넣을 수 있다고 했습니다. 마치 수박이 아주 크고 단단해야 씨앗을 박을 수 있는 것처럼요. 하지만 AI 가 "안녕하세요, 안녕하세요..."처럼 단순하고 반복적인 글을 쓸 때는 (단어가 다양하지 않을 때) 기존 기술로는 씨앗을 박을 수 없었습니다.
  • 이 논문의 목표: AI 가 아주 단순한 글 (낮은 엔트로피) 을 써도, 그 안에 보이지 않는 씨앗을 박아낼 수 있는 기술을 개발하는 것입니다.

2. 해결책: "비밀스러운 해시 함수"라는 자물쇠

연구자들은 AI 의 단어를 0 과 1 로 바꾸는 대신, **비밀스러운 해시 함수 (Hash Function)**라는 도구를 사용했습니다.

  • 비유: AI 가 "사과"라는 단어를 선택했다고 칩시다.
    • 기존 방식: "사과"라는 글자 자체를 0 과 1 로 바꾸려고 애썼는데, 글자가 너무 단순하면 (예: "사과"만 계속 나옴) 0 과 1 로 바꾸는 과정에서 정보가 꼬여서 씨앗을 넣을 수 없었습니다.
    • 새로운 방식: "사과"라는 단어를 **비밀스러운 자물쇠 (해시 함수)**로 잠그고, 그 자물쇠가 열리면 (0) 아니면 **닫히면 (1)**이라고 판단합니다.
    • 핵심: AI 가 "사과"를 고르든 "배"를 고르든, 그 단어를 자물쇠에 넣었을 때 0 이 나오는지 1 이 나오는지만 맞추면 됩니다. 이렇게 하면 AI 가 아무리 단순한 글만 써도, 자물쇠를 통해 씨앗 (워터마크) 을 숨길 수 있습니다.

3. 도전 과제: 도둑이 씨앗을 지우려고 할 때 (변형과 삭제)

이제 가장 중요한 부분입니다. 만약 누군가 AI 가 쓴 글을 고쳐서 씨앗을 지우려고 한다면 어떨까요?

  • 변형 (Substitution): "사과"를 "배"로 바꾸는 것.
  • 삭제 (Deletion): 글자나 문장을 지우는 것.

기존 기술들은 이런 공격을 막기 위해 매우 강력한 조건이 필요했습니다. 하지만 이 논문의 기술은 약한 조건에서도 작동합니다.

  • 비유 (랜덤한 변형): 도둑이 글을 고칠 때, "사과"를 임의로 다른 과일로 바꾼다고 가정해 봅시다.
    • 이 논문의 기술은 **"아무리 단어가 바뀌어도, 자물쇠 (해시) 를 열었을 때 0 이 나올지 1 이 나올지는 여전히 50:50 확률"**이라는 원리를 이용합니다.
    • 즉, 도둑이 단어를 바꿔도 씨앗의 패턴이 무작위로 섞일 뿐, 완전히 사라지지는 않습니다. 마치 수박 씨앗이 흩어지더라도 수박 전체를 먹어치우지 않는 한 씨앗의 흔적은 남는 것과 같습니다.

4. 두 가지 새로운 전략

이 논문은 두 가지 시나리오를 제안합니다.

  1. 랜덤한 변형에 강한 기술:

    • 도둑이 글을 무작위로 고칠 때 (예: "안녕하세요"를 "반갑습니다"로 바꿈), 씨앗이 여전히 살아남습니다.
    • 조건: AI 가 쓴 글의 일부만이라도 약간의 '다양성' (엔트로피) 이 있으면 됩니다. (예: 100 개의 단어 중 10 개만이라도 다양하면 됨).
  2. 삭제와 변형 모두에 강한 기술:

    • 도둑이 글을 고칠 뿐만 아니라, 일부 문장을 지워버릴 수도 있습니다.
    • 조건: 이 경우, 글을 쓴 사람 (프롬프트) 이 "자연스러운 질문"을 했을 때만 작동합니다. (예: "오늘 날씨 어때?"라고 물었을 때). 하지만 "이모지만 계속 찍어달라" 같은 비정상적인 질문에는 약할 수 있습니다.
    • 대안: 만약 더 강력한 암호학 기술 (PRC) 을 쓴다면, 자연스러운 질문이 아니더라도 삭제 공격을 막을 수 있습니다.

5. 요약: 왜 이것이 중요한가?

  • 기존의 한계: "AI 가 아주 창의적이고 다양한 글을 써야만 도장을 찍을 수 있다."
  • 이 논문의 혁신: "AI 가 아주 단순하고 반복적인 글을 써도, 비밀스러운 자물쇠를 이용해 도장을 찍을 수 있다."
  • 실제 효과: AI 가 "안녕하세요"를 100 번 반복하는 글이라도, 그 안에 숨겨진 씨앗을 통해 "이건 AI 가 쓴 글이다"라고 증명할 수 있게 됩니다.

한 줄 요약:

"아무리 단순하고 지루한 AI 글이라도, 비밀스러운 자물쇠를 이용해 지워지지 않는 'AI 도장'을 찍을 수 있는 새로운 방법을 찾았습니다!"

이 기술은 앞으로 AI 가 생성한 콘텐츠가 얼마나 단순하든 상관없이, 그 출처를 명확히 하고 저작권을 보호하는 데 큰 역할을 할 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →