← 최신 논문
🤖 machine learning

Dataset Watermarking for Closed LLMs with Provable Detection

본 논문은 무작위로 선택된 단어 쌍의 공발생 빈도를 증가시켜 탐지 가능한 신호를 임베딩하고, 워터마크가 적용된 데이터가 파인튜닝 토큰의 1% 만을 구성할 때에도 모델 출력에서 이를 성공적으로 식별하면서도 데이터셋의 유용성을 유지하는 폐쇄형 대규모 언어 모델을 위한 최초의 증명 가능한 데이터셋 워터마킹 방법을 소개한다.

원저자: Pengrun Huang, Kamalika Chaudhuri, Yu-Xiang Wang

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pengrun Huang, Kamalika Chaudhuri, Yu-Xiang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 특별한 케이크를 위한 비밀 가족 레시피를 수년간 완벽하게 다듬어 온 베이커라고 상상해 보세요. 당신은 이 레시피를 세상에 공유하여 다른 사람들이 배우길 원합니다. 하지만 거대하고 화려한 베이커리 체인이 당신의 비밀 레시피를 가져가 자신들의 거대한 반죽에 섞은 뒤, 새로운 케이크가 완전히 자신들의 발명품이라고 주장할까 봐 걱정됩니다. 더 나쁘게는, 그들은 당신의 레시피를 사용하여 케이크 맛을 특정 방식으로 "더 좋게" 만들어 심사위원들을 속이고 자신들의 체인이 세계 최고라고 믿게 할 수도 있습니다.

이 논문은 베이커리 체인이 자신의 믹싱 볼이나 레시피 책을 보여주기를 거부하더라도 레시피가 사용되었음을 증명할 수 있는 교묘하고 보이지 않는 "재료 태그"를 소개합니다.

다음은 이 논문의 방법이 간단한 개념으로 분해된 작동 원리입니다:

문제: "블랙박스" 베이커리

인공지능 (AI) 세계에서 기업들은 방대한 양의 텍스트를 공급하여 거대한 "언어 모델"(지능형 챗봇과 같은) 을 구축합니다. 때로는 실수로 또는 고의로 시험 문제나 독점 기사와 같은 특정 데이터셋을 이러한 모델을 훈련시키는 데 사용합니다. 이를 "오염 (contamination)"이라고 합니다.

문제는 이러한 모델 대부분이 **폐쇄형 (Closed-Box)**이라는 점입니다. 당신은 그들과 대화 (질문하기) 할 수는 있지만, 정보가 어떻게 처리되는지 보기 위해 그들의 두뇌 속을 들여다볼 수는 없습니다. 이전의 부정행위자 적발 방법들은 모델의 "로그잇 (logits, 내부 수학)"을 엿보는 것을 필요로 했는데, 이는 폐쇄형 모델에서는 불가능합니다.

해결책: "비밀 단어 쌍" 태그

저자들은 데이터셋이 공개되기 전에 워터마킹하는 새로운 방법을 제안합니다. 다음과 같이 생각하세요:

  1. 비밀 코드: 데이터셋을 공개하기 전에 소유자는 일반적인 대화에서 자주 함께 쓰이지 않는 단어 쌍의 무작위 목록을 선택합니다 (예: "마그네슘"과 "우산").
  2. 재작성: 그들은 AI 를 사용하여 데이터셋을 다시 씁니다. 목표는 문장의 의미를 바꾸는 것이 아니라, 특정 단어 쌍이 자연적으로 발생할 때보다 약간 더 자주 함께 나타나도록 하는 것입니다. 마치 레시피의 재료를 살짝 배열하여 "마그네슘"과 "우산"이 몇 번 더 같은 단락에 나타나도록 하는 것과 같습니다.
  3. 보이지 않는 신호: 인간 독자에게는 텍스트가 정상적으로 보입니다. 하지만 통계적으로 그 특정 단어 쌍들은 이제 해당 데이터셋에서 "점착성 (sticky)"을 띠게 됩니다.

탐지: "맛보기 테스트"

나중에 회사가 자신의 모델이 오직 자신들의 데이터만으로 훈련되었다고 주장한다면, 당신은 다음과 같이 테스트할 수 있습니다:

  1. 질문: 모델에게 텍스트를 대량으로 생성하도록 요청합니다 (예: 이야기 쓰기나 질문 답변).
  2. 계산: 생성된 텍스트를 확인하여 그 "점착성" 단어 쌍 (마그네슘 + 우산) 이 순수한 우연보다 더 자주 함께 나타나는지 확인합니다.
  3. 판결: 모델이 워터마크된 데이터를 사용했다면, 그 단어 쌍들은 빈번하게 함께 나타날 것입니다. 모델이 당신의 데이터를 사용하지 않았다면, 단어 쌍들은 무작위로 흩어질 것입니다.

이 논문은 수학적으로 이러한 패턴을 보인다면, 그것은 우연이 아니라 모델이 당신의 특정 데이터셋으로 훈련되었기 때문임이 거의 확실하다고 증명합니다.

이것이 큰 문제인 이유

이 논문은 세 가지 주요 장점을 강조합니다:

  • 폐쇄형 모델에서도 작동합니다: 모델의 내부 코드를 볼 필요가 없습니다. 일반 사용자처럼 그들과 대화하기만 하면 됩니다. 마치 부엌을 볼 필요 없이 케이크를 맛보기만 하여 비밀 재료를 감지하는 것과 같습니다.
  • 강인합니다 ("희석" 테스트): 베이커리가 당신의 레시피를 다른 99 개의 레시피와 섞었다고 상상해 보세요. 논문은 워터마크된 데이터셋이 전체 훈련 데이터의 **1%**만 차지하더라도 여전히 그 "점착성" 단어 쌍을 감지할 수 있음을 보여줍니다. 신호는 다른 데이터의 거대한 바다에 잠기더라도 살아남을 만큼 강력합니다.
  • 편집을 견딥니다: 베이커리가 무작위 단어를 삭제하거나, 동의어를 바꾸거나, 이모지를 추가하여 레시피를 "정리"하려 하더라도 신호는 보통 살아남습니다. 개별 단어에 대한 미세하고 구체적인 변경에 의존하는 다른 방법들은 텍스트가 편집되면 쉽게 무너지지만, 이 "단어 쌍" 방법은 더 튼튼합니다.

케이크를 망치나요?

워터마킹에 대한 주요 우려는 "이것이 데이터를 너무 많이 변경하여 AI 테스트에 더 이상 유용하지 않게 만들지는 않는가?"입니다.

저자들은 이를 광범위하게 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  • 의미는 유지됩니다: 다시 씌어진 텍스트는 여전히 원래 텍스트와 같은 의미를 가집니다.
  • 테스트는 여전히 작동합니다: 이 워터마크된 데이터셋을 사용하여 AI 의 지능을 테스트하면, AI 는 원래 텍스트를 사용했을 때와 동일한 점수를 받습니다. 어떤 AI 가 가장 똑똑한지에 대한 "순위"는 변하지 않습니다.
  • 다른 방법들보다 낫습니다: 전체 문장을 다시 쓰는 다른 워터마킹 방법들 (텍스트가 로봇처럼 들리게 만들 수 있음) 과 비교하여, 이 방법은 더 작고 국소적인 편집을 하여 텍스트가 자연스럽고 자연스러운 느낌을 유지하게 합니다.

한계점

이 논문은 이것이 할 수 없는 것에 대해 솔직합니다:

  • 시간 여행 불가: 이 워터마크는 데이터를 공개하기 에 적용해야 합니다. 이미 수 년 전에 공개된 데이터셋으로 돌아가서 워터마크를 적용할 수는 없습니다.
  • 방패가 아님: 이것은 사후에 도난이나 오염을 탐지하기 위한 도구일 뿐, 처음부터 발생하는 것을 막는 방패는 아닙니다.
  • 훈련 규모: 테스트는 "파인튜닝 (fine-tuning, 모델에 특정 기술 가르치기)"에서 수행되었으며, 이는 모델이 모든 것을 배우는 거대한 "사전 훈련 (pre-training)" 단계보다 규모가 작습니다. 그 거대한 사전 훈련 단계에서 오염을 탐지하는 것은 여전히 해결되지 않은 과제입니다.

요약하자면, 이 논문은 증거를 숨기려 하더라도 폐쇄형 AI 모델이 훈련에 사용되었음을 데이터 소유자가 증명할 수 있도록 하는 통계적 "지문"을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →