← 최신 논문
🤖 machine learning

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

이 논문은 콘텐츠 키 기반의 선택 채널과 위치 키 기반의 집계 채널을 중첩함으로써 리셀러의 적대적 삭제 및 재작성 시도를 견뎌내고, 왜곡 없는 행동 선택과 깨지지 않는 출처 추적을 보장하는 LLM 에이전트 궤적을 위한 새로운 2채널 강건 속성 워터마크인 TRACE를 소개한다.

원저자: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

게시일 2026-07-10
📖 5 분 읽기🧠 심층 분석

원저자: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 비행기를 예약하고, 피자를 주문하고, 와이파이를 고칠 수 있는 초지능 로봇 비서를 만들었다고 상상해 보십시오. 당신은 이 로봇을 중간 판매자(리셀러)에게 판매하고, 그들은 이를 고객에게 대여합니다. 문제는? 중간 판매자가 더 저렴한 로봇을 몰래 끼워 넣거나, 자신이 직접 만든 것이라고 주장하거나, 혹은 흔적을 숨기기 위해 로그를 조작할 수도 있다는 점입니다.

보통 로봇이 내린 결정을 증명하기 위해 우리는 로봇이 사용한 모든 도구와 수행한 모든 행동의 기록인 '일기(log)'를 살펴봅니다. 하지만 중간 판매자가 일기를 소유하고 있다면, 그들은 페이지를 지우거나 이야기를 다시 써서 마치 자신들이 그 일을 해낸 것처럼 꾸밀 수 있습니다. 기존의 워터마크는 일기 페이지 위에 적힌 투명 잉크와 같습니다. 만약 중간 판매자가 텍스트를 다시 쓰면, 그 잉크는 사라져 버립니다.

여기, 일기 소유자가 기록을 깨끗이 지우려 해도 살아남도록 설계된 새로운 종류의 디지털 지문, TRACE가 등장했습니다. TRACE는 단순히 페이지 위에 글을 쓰는 것이 아니라, 일기 자체를 파괴하지 않고서는 되돌릴 수 없는 두 가지 영리한 방식으로 '이야기' 자체를 바꿉니다.

두 채널의 마술 (The Two-Channel Magic Trick)

TRACE는 서로를 보호하는 두 가지 다른 코드를 사용하는 스파이처럼, 두 개의 "채널"을 사용하여 증거를 숨깁니다.

1. "선택(Choice)" 채널 (보이지 않는 손)
로봇이 문을 선택해야 하는 상황을 상상해 보십시오. 다섯 개의 문이 있지만, 오직 하나만이 보물로 이어집니다. 일반적인 로봇은 자신의 논리에 따라 문을 고릅니다. TRACE의 "선택" 채널은 성공 확률을 바꾸지 않으면서도 로봇이 특정 문을 고르도록 부드럽게 유도하는 마법 같은 '보이지 않는 손' 역할을 합니다.

  • 작동 방식: 이 채널은 지금까지의 이야기(콘텐츠)에 기반한 비밀 키를 사용하여 어떤 문을 고를지 결정합니다.
  • 초능력: 만약 중간 판매자가 일기에서 페이지를 삭제하면(삭제 공격), 이야기가 건너뛰게 되지만, 보이지 않는 손은 다음 페이지를 위해 즉시 경로를 재설정합니다. 이는 마치 길을 잘못 들었을 때 즉시 경로를 다시 안내하는 GPS와 같습니다. 증거가 페이지 번호가 아닌 '선택의 내용'에 묶여 있기 때문에 증거는 살아남습니다.
  • 단점: 만약 중간 판매자가 이야기를 다시 써서 ("문 A"를 "파란 문"으로 변경) 내용을 바꾼다면, 이 채널은 깨집니다. 보이지 않는 손은 "문 A"를 찾고 있었는데, 이제는 혼란에 빠지기 때문입니다.

2. "카운트(Count)" 채널 (스켈레톤 키)
이제 로봇의 일기가 그룹 단위로 구성되어 있다고 상상해 보십시오. 하나의 결정 뒤에 몇 개의 관찰 기록이 따르는 식입니다. TRACE의 "카운트" 채널은 단어에는 관심이 없습니다. 대신 '구조'에 집중합니다. 이 채널은 일부 그룹에 "유령 기록(redundant note)"을 몰래 추가하여, 어떤 그룹은 원래 하나였던 기록을 두 개로 만듭니다.

  • 작동 방식: 이 채널은 일기 구조의 '위치'에 기반한 비밀 키를 사용합니다. 그리고 결정합니다: "그룹 1에는 유령 기록을 넣고, 그룹 2에는 넣지 않는다."
  • 초능력: 만약 중간 판매자가 텍스트를 다시 써서 ("문 A"를 "파란 문"으로 변경) 내용을 바꾼다 해도, 그룹 내의 기록 개수는 그대로 유지됩니다. 구조는 변하지 않습니다. 이 채널은 기록의 개수를 바꾸지 않는 한 재작성 공격에 대해 무적입니다. 왜냐하면 기록의 개수를 바꾸는 것은 일기 형식을 깨뜨리는 일이기 때문입니다.
  • 단점: 만약 중간 판매자가 페이지를 삭제하면, 카운트가 변하게 되어 이 채널은 혼란에 빠집니다.

"더블 블라인드" 방어 (The "Double-Blind" Defense)

여기서 천재적인 부분이 나옵니다. 중간 판매자는 이길 수 없습니다.

  • 만약 그들이 "선택" 채널을 숨기기 위해 페이지를 삭제한다면, 구조에 의존하는 "카운트" 채널은 완벽하게 유지됩니다.
  • 만약 그들이 "카운트" 채널을 숨기기 위해 텍스트를 재작성한다면, 콘텐츠에 의존하는 "선택" 채방은 완벽하게 유지됩니다.
  • 이 두 가지를 모두 지우려면, 중간 판매자는 일기의 70%를 삭제하고 거의 모든 내용을 다시 써야 합니다. 하지만 그렇게 되면 일기는 너무 망가져서 쓸모가 없게 됩니다. 그들은 자신이 팔려고 했던 바로 그 제품을 파괴하는 셈입니다!

숫자가 말해주는 것들

연구진은 이 기술을 두 가지 실제 로봇 챌린지에 테스트했습니다: ToolBench(짧은 작업, 작업당 약 1.4 단계의 결정)와 ALFWorld(긴 작업, 약 23~25 단계의 결정).

  • 로봇에 대한 피해 없음: TRACE는 "왜곡이 없습니다(distortion-free)." TRACE를 사용하는 로봇은 워터마크가 없는 로봇과 동일한 성공률을 보입니다. 실제로 ALFWorld에서 워터마크가 없는 로봇은 82.4%의 성공률을 보였고, TRACE는 83.6%를 기록했습니다. 강제로 선택을 유도하려 했던 다른 워터마크들은 성공률이 8.1포인트나 떨어졌습니다!
  • 탐지 점수: 긴 작업(ALFWorld)에서 "선택" 채널은 z = 100이라는 탐지 점수에 도달했습니다. 이는 믿을 수 없을 정도로 강력한 신호입니다. 중간 판매자가 단계의 70%를 삭제하더라도 점수는 탐지선 위에 머물렀습니다.
  • 재작성 테스트: 초지능 AI("LLM rewriter")가 워터마크를 숨기기 위해 일기를 재작성하려고 시도했을 때, "카운트" 채널은 정확히 동일하게 유지되었습니다. 점수는 전혀 변하지 않았습니다. 반면, 기존의 워터마크(예: "Red-Green" 방식)는 거의 0에 가깝게 떨어졌습니다.
  • 속임수의 비용: 두 채널을 동시에 무력화하려면 공격자는 행동의 일정한 비율을 훼짝히 망가뜨려야 합니다. 논문은 수학적으로 당신이 단순히 '편집'을 통해 빠져나갈 수 없으며, 반드시 서비스를 파괴해야만 한다는 것을 증명합니다.

TRACE가 해결하지 못하는 것들

이 논문은 TRACE가 무엇을 하지 않는지도 명확히 밝히고 있습니다:

  • 이것은 중간 판매자가 단순히 로봇을 완전히 다른 모델로 교체하는 것에 대한 마법 같은 방패가 아닙니다. 만약 그들이 당신의 로봇을 아예 사용하지 않는다면, 찾아낼 워터마크도 존재하지 않습니다.
  • 단 하나의 예시만 있는 짧은 작업의 경우, 이것은 완벽한 해결책이 아닙니다. (ToolBench와 같은 짧은 작업에서는) 강력한 신호를 얻기 위해 약 **10개의 궤적(trajectory)**을 함께 모아야 합니다. 단일 작업에는 충분한 "결정 엔트로피(무작위성)"가 없기 때문입니다.
  • 이것은 중간 판매자가 정직할 것이라고 가정하지 않습니다. 이 시스템은 증거를 쥐고 있는 사람이 바로 적(enemy)인 시나리오를 위해 설계되었습니다.

핵심 요약

TRACE는 중간 판매자가 로그에 대한 모든 권한을 가지고 있고, 로그를 삭제하거나 재작성하려 하더라도, 로봇의 행동이 창작자의 것임을 증명할 수 있는 최초의 시스템입니다. 이는 증거를 두 부분으로 나누어 작동합니다: 하나는 삭제에 견디고, 다른 하나는 재작성에 견딥니다. 수학적 계산에 따르면, 이를 무력화하려는 공격자는 자신이 팔고자 하는 바로 그 서비스를 파괴해야만 합니다. TRACE는 누가 펜을 쥐고 있든 상관없이, 일기 속에 진실을 담아두는 견고하고 왜곡 없는 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →