← 최신 논문
🤖 AI

AgentMark: Utility-Preserving Behavioral Watermarking for Agents

이 논문은 LLM 기반 에이전트의 고수준 계획 행동(도구 및 하위 목표 선택 등)에 유틸리티 저하 없이 다중 비트 식별자를 삽입하여 지식재산권 보호와 출처 추적을 가능하게 하는 블랙박스 대응형 행동 워터마킹 프레임워크인 'AgentMark'를 제안합니다.

원저자: Kaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou

게시일 2026-04-27
📖 2 분 읽기☕ 가벼운 읽기

원저자: Kaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 배경: "누가 이 일을 시켰나?" (AI 에이전트의 책임 문제)

요즘 AI는 단순히 채팅만 하는 게 아니라, 스스로 계획을 세워 비행기 표를 예약하거나, 복잡한 코딩을 하고, 심지어 가상 세계에서 사람처럼 생활하기도 합니다. 이를 **'AI 에이전트'**라고 부르죠.

그런데 문제가 생길 수 있습니다. 만약 어떤 AI 에이전트가 사기를 치거나, 잘못된 정보를 퍼뜨리거나, 회사의 기밀 기술을 몰래 복제해서 사용한다면 어떻게 할까요? "이건 우리 회사가 만든 AI가 한 게 아니에요!"라고 발뺌하면 잡기가 매우 어렵습니다.

기존에는 AI가 쓴 **'글자(텍스트)'**에 워터마크를 심어왔지만, 에이전트는 글자만 쓰는 게 아니라 **'행동(계획)'**을 합니다. 예를 들어, "A 도구를 쓰고, 그다음에 B라는 목표를 세워야지"라는 '결정 과정' 자체가 중요하죠. 이 '결정 과정'에는 기존 방식의 워터마크를 심기가 매우 까다로웠습니다.


2. 핵심 아이디어: "춤추는 방식에 숨겨진 암호" (AgentMark)

여기서 AgentMark라는 멋진 아이디어가 등장합니다.

비유를 들어볼까요? 어떤 무용수(AI 에이전트)가 무대 위에서 춤을 춘다고 해봅시다. 이 무용수가 누구인지 증명해야 하는데, 무용수의 옷에 로고를 크게 박으면 무용의 아름다움(AI의 성능)을 해칠 수 있습니다.

AgentMark는 옷에 로고를 새기는 대신, '춤추는 동작의 미세한 패턴'에 암호를 숨깁니다.

  • 기존 방식 (Bias-based): "무조건 오른쪽으로 세 번 점프해!"라고 강요하는 방식입니다. 이러면 무용수가 춤을 망치거나(AI 성능 저하), 원래 추려던 춤의 느낌이 완전히 달라집니다.
  • AgentMark 방식 (Distribution-preserving): 무용수가 원래 추려던 춤의 흐름(확률 분포)은 전혀 건드리지 않습니다. 대신, 무용수가 "왼쪽으로 갈까, 오른쪽으로 갈까?" 고민하는 그 찰나의 순간에, 원래의 리듬을 깨뜨리지 않는 선에서 아주 미세하게 암호화된 선택을 하도록 유도합니다.

결과적으로 겉으로 보기에는 평소와 똑같이 완벽한 춤을 추는 것 같지만, 나중에 전문가가 그 춤의 스텝을 분석해보면 "아, 이 스텝의 패턴을 보니 이건 'A사'의 무용수구나!"라고 알아낼 수 있는 것이죠.


3. 이 기술의 세 가지 필살기

  1. "성능은 그대로!" (Utility-Preserving): AI가 워터마크 때문에 바보가 되지 않습니다. 원래 하려던 일을 똑같이 똑똑하게 수행하면서도 정체성만 남깁니다.
  2. "일부만 봐도 알아채!" (Robustness): 만약 AI가 일을 하다가 중간에 기록이 끊기거나, 일부 로그(기록)가 삭제되어도 괜찮습니다. 마치 퍼즐 조각 몇 개가 없어도 전체 그림을 유추할 수 있는 특수 코딩 기술(RLNC)을 써서, 남은 기록만으로도 "이건 누구의 AI다"라는 것을 찾아낼 수 있습니다.
  3. "이중 보안 가능!" (Compatibility): AI가 내뱉는 '말(텍스트)'에 찍는 워터마크와, AI가 하는 '행동(계획)'에 찍는 AgentMark를 동시에 사용할 수 있습니다. 말과 행동 모두에서 출처를 확인할 수 있는 강력한 이중 보안이 되는 셈이죠.

4. 요약하자면

AgentMark는 AI 에이전트가 자신의 본래 능력(지능)을 전혀 깎아먹지 않으면서도, 그가 내리는 결정의 패턴 속에 '디지털 지문'을 남기는 기술입니다.

이 기술이 완성되면, AI가 사고를 쳤을 때 "누가, 어떤 시스템을 통해 이 행동을 했는지"를 명확히 밝혀낼 수 있어, 더욱 안전하고 책임감 있는 AI 시대를 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →