← 최신 논문
💻 computer science

Echoes within the Reasoning: Stealthy and Effective Watermarking via Chain of Thought

본 논문은 추론의 충실도를 훼손하지 않으면서 견고하고 은밀한 탐지를 가능하게 하기 위해 체인 오브 씽킹 추론 흔적의 내부 기하학적 구조에 소유권 신호를 임베딩하는 새로운 워터마킹 프레임워크인 BiCoT를 제안하며, 이는 모델 도용 및 분포 변화를 처리하기 위한 강인한 부분공간 등록 검증기로 보완됩니다.

원저자: Jiacheng Lu, Yiming Li, Tao Song, Weijian Wang, Wenjie Qu, Haibing Guan, Jiaheng Zhang

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiacheng Lu, Yiming Li, Tao Song, Weijian Wang, Wenjie Qu, Haibing Guan, Jiaheng Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 복잡한 퍼즐을 해결하는 데 탁월한 매우 지능적인 로봇을 소유하고 있다고 가정해 봅시다. 당신은 이 로봇을 훈련시키는 데 수백만 달러와 수년의 시간을 투자했습니다. 이제 누군가가 당신의 로봇을 훔쳐서 재브랜드한 뒤, 자신의 것처럼 판매할까 봐 걱정됩니다. 로봇의 퍼즐 해결 방식을 바꾸거나 태그가 붙은 것이 명확해지지 않으면서도 "이 로봇은 내 것이다"라고 증명할 방법이 필요합니다.

이 논문은 이 문제를 해결하기 위해 BiCoT라는 새로운 방법을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명하겠습니다.

문제: "최종 답안"의 함정

이전 방법들은 AI 모델에 약간의 비밀 코드를 추가하거나 특정 "트리거" 구문에 반응하게 함으로써, AI 모델이 최종 답안을 약간 변경하도록 강제하여 워터마킹을 시도했습니다.

  • 결함: 이는 문장의 마지막 단어를 변경하여 비밀 메시지를 숨기려는 것과 같습니다. 마지막 단어를 변경하면 문장의 의미가 훼손될 수 있습니다. AI 가 수학 튜터라면, 비밀을 숨기기 위해 최종 숫자를 변경하면 수학이 틀리게 됩니다. 이는 트레이드오프입니다. 완벽한 답안을 가질지, 아니면 숨겨진 워터마크를 가질지 선택해야 하지만, 둘 다 가지는 경우는 드뭅니다.

해결책: "생각" 과정에 숨기기

저자들은 AI 가 답을 주기 전에 **생각의 사슬 (Chain of Thought, CoT)**을 거친다는 사실을 깨달았습니다. 이는 AI 가 내부적으로 수행하는 단계별 추론 (예: "먼저 이 숫자들을 더하고, 그 다음에 나누고...") 입니다.

AI 의 추론 과정을 건설 현장으로 생각해 보세요:

  1. 최종 답안은 완공된 건물입니다.
  2. 생각의 사슬은 건물을 짓는 동안의 비계, 설계도, 그리고 작업자들의 이동입니다.

이 논문은 "완공된 건물"은 취약하다고 주장합니다. 건물을 건드리면 무너질 수 있습니다. 하지만 "비계"는 거대하고 복잡하며 건물을 부수지 않고 무언가를 숨길 공간이 많습니다.

BiCoT 의 작동 원리: "구조적 앵커"

연구자들은 생각 과정의 모든 부분이 동등하지 않다는 것을 발견했습니다.

  • "앵커": 수학 문제에서 숫자(자릿수) 가 가장 중요한 부분입니다. 이들은 논리를 지탱하는 "구조적 앵커"입니다. 숫자를 건드리면 수학이 무너집니다.
  • "연결자": "따라서", "왜냐하면", "그리고"와 같은 단어는 유연합니다. 이들은 문장을 지탱하는 "연결자"입니다.

BiCoT 전략:
최종 답안을 변경하는 대신, BiCoT 는 소유권 비밀을 생각 과정의 기하학적 구조 내부에 숨깁니다. 구체적으로는 그 "구조적 앵커"(숫자) 를 대상으로 합니다.

  1. 비밀 서명: 소유자가 비밀 "키"(고차원 공간의 특정 방향) 를 가지고 있다고 상상해 보세요.
  2. 정렬: BiCoT 는 AI 가 숫자에 대한 내부 표현을 이 비밀 키와 정렬되도록 강제합니다. 이는 비계의 철골에 소유자만 알아볼 수 있는 비밀 색으로 페인트를 칠하는 것과 같습니다.
  3. 안전망: AI 가 혼란을 겪지 않도록 하기 위해, 이 방법은 "연결자" 단어 (예: "그리고" 또는 "왜냐하면") 가 비밀 키와 직교(90 도 각도) 하도록 강제합니다. 이렇게 하면 비밀이 정상적인 언어로 스며드는 것을 방지하여 AI 의 말하기와 추론 능력을 완벽하게 유지합니다.

"드리프트" 문제와 "센티널" 수정

도둑이 모델을 훔쳐 워터마크를 제거하기 위해 모델을 "조절"(재훈련 또는 압축) 한다면 어떻게 될까요? 이를 드리프트라고 합니다. 이는 누군가 비계를 다시 페인트하여 비밀 색을 씻어내는 것과 같습니다.

이를 해결하기 위해 BiCoT 는 **강건한 부분공간 등록 (Robust Subspace Registration, RSR)**이라는 교묘한 검증 트릭을 사용합니다.

  • 센티널: 시스템은 보정 센서처럼 작용하는 일련의 "센티널" 토큰(특정 중립 단어) 을 사용합니다.
  • 보정: 소유자가 모델을 확인할 때, 이러한 센티널이 어떻게 이동했는지 살펴봅니다. 전체 모델이 "다시 페인트"되어 (드리프트되어) 있다면, 센티널은 일관된 이동을 보여줍니다.
  • 수정: 시스템은 수학적으로 이 이동을 빼서, 비밀 서명이 페인트 아래에 여전히 존재하는지 확인하기 위해 모델을 효과적으로 "재중앙화"합니다. 이는 누군가 무거운 그림을 걸었더라도 벽이 여전히 곧은지 확인하기 위해 수평계를 사용하는 것과 같습니다.

결과

이 논문은 이 방법이 다음과 같다고 주장합니다.

  • 은밀함: AI 의 답안을 살펴보기만 해서는 AI 가 워터마킹되었는지 알 수 없습니다. 수학은 여전히 정확하며 문장은 여전히 의미가 통합니다.
  • 강건함: 도둑이 모델을 재훈련하거나, 압축하거나, 노이즈를 추가하려 하더라도 "센티널" 시스템은 추론 단계에 숨겨진 비밀 서명을 여전히 찾을 수 있습니다.
  • 효과성: 테스트에서 이 방법은 거의 완벽한 정확도로 도난당한 모델을 식별했으며, 모델의 작업 수행 능력을 원본과 거의 동일하게 유지했습니다.

한 마디로 요약

BiCoT 는 AI 의 생각 과정 DNA 에 숨겨진 워터마크와 같습니다. 최종 제품을 찍어내는 것 (이는 제품을 망가뜨림) 대신, AI 가 숫자에 대해 생각하는 방식의 내부 설계도를 미묘하게 변경합니다. 누군가 설계도를 다시 칠하려 하더라도, 비밀 DNA 는 여전히 탐지 가능하여 진정한 소유자가 누구인지 증명하며, AI 는 감시받고 있거나 문제 해결 능력을 잃었다는 것을 전혀 인지하지 못합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →