← 최신 논문
🤖 AI

ChainMark: Model-Free LLM Watermarking with Closed-Form Calibration

ChainMark는 생성 언어 모델에 대한 접근 없이도 번역 및 치환 공격에 대해 증명 가능한 강건성을 달착하고 탐지 파라미터의 폐쇄형 보정(closed-form calibration)을 가능하게 하며, 하드 마르코프 전이(hard Markov transitions)를 강제하기 위해 어휘를 키 기반 상태(keyed states)로 분할하는 모델 프리(model-free) 방식의 능동적 워터마킹 기법을 도입한다.

원저자: Chengheng Li-Chen, Kyuhee Kim

게시일 2026-07-22
📖 5 분 읽기🧠 심층 분석

원저자: Chengheng Li-Chen, Kyuhee Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 도서관을 걷고 있다고 상상해 보세요. 그곳에서는 로봇들이 이야기를 쓰고 있습니다. 때때로 이 로봇들은 너무 뛰어나서, 이야기가 인간이 쓴 것인지 기계가 쓴 것인지 구분할 수 없을 정도입니다. 이것은 미래의 큰 문제입니다. 만약 로봇이 무엇이든 써 내려갈 수 있다면, 우리는 무엇이 진짜인지 어떻게 알 수 있을까요? 과학자들은 로봇에게 특별한 탐지기만이 볼 수 있는 숨겨진 서명, 즉 '워터마크(watermarking)'라는 비밀스러운 표식을 남기는 방식으로 이 문제를 해결하려 노력하고 있습니다. 이는 문장의 DNA 속에 숨겨진 비밀 코드와 같습니다.

하지만 이 코드를 확인하는 작업은 까다로웠습니다. 기존의 대부분의 방식은 로봇이 직접 확인 작업을 수행해야 하는 '비밀번호 맞히기' 게임과 같았습니다. 만약 로봇이 사라지거나, 누군가 이야기를 약간 수정한다면(예를 들어 다른 언어로 번역하는 경우), 기존의 코드들은 깨지거나 사라지곤 했습니다. 또한, 규제 기관(규칙을 만드는 사람들)은 "오류율이 1% 미만이고, 짧은 텍스트에서도 작동하며, 편집에도 살아남는 코드가 필요하다"라고 말하고 싶어 했지만, 엔지니어들에게 코드를 정확히 어떻게 구축할지 알려줄 명확한 공식이 없었습니다.

이 논문은 ChainMark라고 불리는 새로운 솔루션을 소개합니다. 이것은 영리한 '모델 프리(model-free)' 워터마크로, 즉 워터마크를 확인하기 위해 로봇이 필요하지 않다는 것을 의미합니다. 단지 비밀 키(secret key)만 있으면 됩니다. 저자들은 코드가 마치 '비밀스러운 춤'처럼 작동하도록 만드는 방법을 찾아냈습니다. 그들은 이 춤이 특정 유형의 공격에 대해 깨뜨리기 매우 어렵다는 것을 보여주며, 규제 기관이 엔지니어에게 설정을 어떻게 해야 할지 정확히 지시할 수 있는 명확한 수학적 레시피를 제공합니다.

비밀스러운 춤: ChainMark의 작동 원리

로봇의 어휘(사용할 수 있는 모든 단어)를 색깔 타일이 가득 담긴 거대한 상자라고 상상해 보세요. ChainMark는 비밀 키를 사용하여 모든 타일을 다섯 가지 색상의 통(예를 들어 빨강, 파랑, 초록, 노랑, 보라)으로 분류합니다. 이 통들은 시계 방향처럼 원형으로 배치됩니다: 빨강 → 파랑 → 초록 → 노랑 → 보라 → 빨강.

로봇이 이야기를 쓸 때, ChainMark는 로봇이 아무 단어나 선택하도록 내버려 두지 않습니다. 이야기의 특정 지점마다(약 절반의 확률로), 로봇은 반드시 원형 구조의 '다음' 색상에 속하는 단어를 선택하도록 강제됩니다. 만약 마지막 단어가 빨강이었다면, 다음 단어는 반드시 파랑이어야 합니다. 마지막이 파랑이었다면 다음은 반드시 초록이어야 합니다. 로봇은 여전히 자신이 찾은 가장 좋은 단어를 고르려고 노력하지만, 오직 '파랑' 통에 속한 단어 중에서만 골라야 합니다.

이것은 텍스트 속에 숨겨진 경로, 즉 '체인(chain)'을 만들어냅니다. 이야기는 본질적으로 이 색상 시계를 따라 걷는 과정이 됩니다.

로봇 없는 탐정

여기에 마법 같은 부분이 있습니다. 워터마크가 찍힌 이야기를 확인하기 위해 당신은 로봇이 전혀 필요하지 않습니다. 오직 비밀 키와 텍스트만 있으면 됩니다. 검증자(탐정)는 텍스트를 가져와서 비밀 키를 찾아낸 뒤, 모든 단어를 다시 색상별 통으로 분류합니다. 그런 다음, 색상들이 올바른 순서(빨강에서 파랑, 파랑에서 초록 등)를 따르는 횟수를 세기만 하면 됩니다.

만약 이야기가 인간이 썼거나 비밀 없이 작성된 로봇의 글이라면, 색상들은 무작위로 튀게 될 것입니다. 우연히 순서를 맞출 확률은 매우 낮습니다(5분의 1, 즉 20%뿐입니다). 하지만 이야기가 ChainMark로 작성되었다면, 색상들은 거의 완벽하게 체인을 따라 움직일 것입니다. 탐정은 로봇의 도움을 받지 않고도 순식간에 이 수학적 계산을 수행합니다.

이것이 왜 중요한가

이 논문은 ChainMark가 기존 방식들이 가졌던 세 가지 주요 난제를 어떻게 해결했는지 보여줍니다.

  1. 로봇이 필요 없음: 기존 방식들은 종종 워터마크를 확인하기 위해 로봇의 '두뇌'를 필요로 했습니다. 하지만 ChainMark는 텍스트와 키만 있으면 됩니다. 이는 규제 기관이나 뉴스 편집자와 같은 제삼자가 기업의 비밀 AI 모델에 접근하지 않고도 AI가 생성한 글인지 확인할 수 있음을 의미합니다.
  2. 완벽한 레시피: 저자들은 '폐쇄형(closed-form)' 공식을 도출했습니다. 이는 수학적으로 직접적인 방정식을 찾아냈다는 뜻입니다. 만약 규제 기관이 "200단어 텍스트에 대해 오류율 1%가 필요하다"라고 말하면, 엔지니어는 그 숫자들을 공식에 대입하여 즉시 몇 개의 색상 통을 사용해야 하는지 알 수 있습니다. 더 이상의 추측이나 시행착오가 필요 없습니다.
  3. '번역 공격'을 견뎌냄: 기존 워터마크를 깨뜨리는 가장 큰 방법 중 하나는 텍스트를 다른 언어(예: 중국어)로 번역했다가 다시 원래 언어로 번역하는 것입니다. 이는 보통 비밀 코드를 뒤섞어 놓습니다. 논문은 ChainMark를 대상으로 이를 테스트했으며, 결과는 매우 강력했습니다. 텍스트를 중국어로 번역했다가 다시 되돌린 후에도, ChainMark는 워터마크가 찍힌 텍스트를 **72.8%**의 확률로 정확히 식별해 냈습니다. 반면, 다른 유명한 방식들(KGW 및 SWEET이라 불리는 방식들)은 동일한 조건에서 성공률이 20% 미만으로 떨어졌습니다.

트레이드오프 (Trade-Off)

논문은 그 대가에 대해서도 솔직하게 밝히고 있습니다. 이 비밀스러운 춤이 작동하게 하려면, 로봇이 단어를 선택할 때 약간의 제약을 받아야 합니다. 이로 인해 텍스트는 완전히 자유로운 로봇에 비해 약간 덜 "유창하거나" 자연스러울 수 있습니다. 저자들은 이를 '퍼플렉시티(perplexity)'라는 점수로 측정했습니다. ChainMark의 점수는 약 3.66이었던 반면, 다른 방식들은 약 1.80에서 1.93 사이였습니다. 즉, ChainMark는 다른 방식들보다 약 두 배 정도 더 "딱딱한(stiff)" 느낌을 주지만, 그 대가로 훨씬 깨뜨리기 어렵고 검증하기가 훨씬 쉽습니다.

"보편적인" 안전망

논문은 또한 '블라인드(blind)' 공격자(비밀 키를 모르는 공격자)를 상대로 코드가 얼마나 많은 편집을 견딜 수 있는지에 대해 놀라운 사실을 발견했습니다. 저자들은 만약 누군가 무작위로 단어를 교체하는 '컷 앤 페이스트(cut and paste)' 공격을 가하더라도, 편집량이 텍스트의 29.3% 미만이라면 코드가 생존한다는 것을 수학적으로 증명했습니다. 이 숫자는 '보편적 상수'입니다. 즉, 색상 통을 몇 개를 사용하든 혹은 텍스트가 얼마나 길든 상관없이, 코드는 그 29.3%라는 벽에 부딪힐 때까지 유지된다는 뜻입니다.

하지만 저자들은 이 안전망에 한계가 있음을 주의 깊게 언급합니다. 이 수치는 무작위 교체나 번역에는 적용되지만, 비밀 키를 알고 있거나 탐정에게 질문을 반복하여 패턴을 알아내려는 '초지능적 해커'로부터의 생존을 보장하지는 않습니다. 또한, 논문은 복잡한 문법 유지형 재작성(의미는 그대로 유지하면서 단어만 바꾸는 방식)에 대해서는 아직 테스트하지 않았으므로, 번역이나 무작위 교체에는 매우 강력하지만 다른 종류의 공격에 대해서는 여전히 할 일이 남아 있습니다.

이것이 아닌 것

저자들은 자신들의 방식이 무엇을 하지 못하는지에 대해서도 명확히 하고 있습니다. 만약 초지능적인 해커가 비밀 키를 알고 있거나, 탐정에게 반복적으로 질문을 던져 패턴을 알아낼 수 있다면, 그들은 이를 깨뜨릴 수도 있다는 점을 인정합니다. 이 논문은 키를 가지지 못한 '블라인드' 공격자에 초점을 맞추고 있습니다. 또한, 모든 종류의 편집(의미를 똑같이 유지하면서 문법을 복잡하게 바꾸는 등의 작업)을 테스트한 것은 아닙니다. 따라서 번역이나 무작위 교체에는 매우 강력하지만, 다른 유형의 공격에 대해서는 여전히 연구가 필요합니다.

결론

결론적으로, ChainMark는 AI 작가들에게 비밀스럽고 깨뜨리기 어려운 춤 동작을 부여하는 것과 같습니다. 이 춤은 공격자가 키를 모르는 '블라인드' 상태이고 공격이 무작위적이거나 번역을 통한 것이라면 발자국을 남깁니다. 누군가 이야기를 번역하거나 단어를 교체하여 발자국을 지우려 해도, 비밀 키를 가진 사람에게는 그 패턴이 여전히 보입니다. 무엇보다도, 이 방식은 규제 기관이 AI 기업의 도움을 받거나 추측에 의존할 필요 없이, 이러한 워터마크를 정확하게 설정할 수 있도록 명확한 수학적 지침을 제공합니다. 이는 우리가 디지털 텍스트를 접할 때, 그것이 누구(혹은 무엇)에 의해 쓰였는지 정확히 알 수 있다는 믿음을 갖게 하는 미래를 향한 한 걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →