← 최신 논문
🤖 AI

Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents

이 논문은 네트워크 및 브라우저 상호작용 특징을 결합한 다층 핑거프린팅 프레임워크를 도입함으로써, 자율 에이전트와 인간 및 전통적인 크롤러를 97%의 정확도로 구별하여 무차별적인 AI 웹 에이전트 스크래핑에 대응하는 강력하고 회피 저항적인 방어 체계를 제안한다.

원저자: Dayeon Kang, Hyejun Jeong, Jade Sheffey, Pubali Datta, Amir Houmansadr

게시일 2026-06-23
📖 5 분 읽기🧠 심층 분석

원저자: Dayeon Kang, Hyejun Jeong, Jade Sheffey, Pubali Datta, Amir Houmansadr

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대하고 북적이는 도서관이라고 상상해 보세요. 수년 동안 사서들(웹사이트 소유자)은 특정 책에 접근하지 말라는 단순한 "출입 금지" 표지판(robots.txt)에 의존해 왔습니다. 또한 봇들을 식별하기 위해 그들의 신분증을 확인하는 보안 요원들도 있었습니다.

하지만 최근, 새로운 종류의 방문객이 도착했습니다: 바로 **AI 웹 에이전트(AI Web Agents)**입니다. 이들은 단순히 텍스트를 스캔하는 단순한 로봇이 아닙니다. 이들은 버튼을 클릭하고, 양식을 채우고, 페이지를 스크롤하며, 인간처럼 결정을 내릴 수 있는 지능적이고 자율적인 쇼핑객과 같습니다. 문제는 이들이 인간인 척하는 데 매우 능숙하며, "출입 금지" 표지판을 무시하고 봐서는 안 될 콘텐츠를 긁어간다는 점입니다.

당신이 제공한 논문 **"Whose Agent Are You?"**는 이 영리한 쇼핑객들을 잡아낼 수 있는 새로운 방법을 소개합니다. 저자들은 MARK(Multi-layer Agent fingerprinting framewoRK)라고 불리는 시스템을 구축했는데, 이는 마치 초정밀 탐정처럼 작동합니다. MARK는 단순히 신분증을 확인하는 대신, 방문객이 어떻게 움직이는지, 웹사이트와 어떻게 대화하는지, 그리고 선반과 어떻게 상호작용하는지를 관찰합니다.

이 시스템이 어떻게 작동하는지 비유를 통해 쉽게 설명해 드리겠습니다.

1. 설정: "함정" 도서관

연구진은 이 AI 에이전트들을 함정에 빠뜨리거나 정체를 드러내도록 설계된 다섯 가지 특정 퍼즐이 있는 특별하고 통제된 웹사이트(테스트베드)를 구축했습니다.

  • 가짜 버튼: 실제처럼 보이지만 아무런 동작도 하지 않는 버튼입니다.
  • 숨겨진 버튼: 마우스를 특정 위치에 올렸을 때만 나타나는 버튼입니다.
  • 지연 반응: 응답하는 데 몇 초의 시간이 걸리는 버튼입니다.
  • 혼란스러운 라벨: 텍스트에는 "예(Yes)"라고 적혀 있지만, 그 아래의 컴퓨터 코드에는 "아니오(No)"라고 되어 있는 버튼입니다.

연구진은 여섯 가지 유형의 AI 에이전트(AutoGen, Skyvern, Claude, Gemini, OpenAI의 Operator 등)를 이 도서관에 초대했습니다. 또한 이들이 어떻게 행동하는지 확인하기 위해 실제 인간과 기존의 멍청한 로봇(전통적인 크롤러)들도 초대했습니다.

2. 탐정 업무: 네 가지 층위의 단서

MARK 시스템은 단 하나의 요소만 보는 것이 아니라, 마치 네 대의 카메라를 가진 탐정처럼 네 가지 각도에서 방문객을 관찰합니다.

  • 레이어 1: 타이밍 ( "페이스" 카메라)

    • 관찰 대상: 방문객이 한 페이지를 클릭하고 다음 페이지를 클릭할 때까지 얼마나 기다리는가?
    • 단서: 인간과 일부 AI 에이전트는 "생각하는 시간"을 갖습니다. 반면 다른 것들은 로봇처럼 즉각적으로 클릭합니다. 어떤 에이전트들은 메트로놈처럼 매우 일정하며, 다른 것들은 불규칙합니다.
    • 비유: 경주를 상상해 보세요. 어떤 주자들은 완벽한 간격으로 질주하고, 어떤 주자들은 조깅을 하다가 멈춰서 신발 끈을 묶고 다시 질주합니다. 발걸음의 타이밍이 그들의 정체를 드러냅니다.
  • 레이어 2: 악수 ( "TLS" 카메라)

    • 관찰 대상: 방문객이 웹사이트에 연결될 때, 보안 규칙에 합의하기 위해 악수를 합니다(TLS 핸드셰이크라고 불리는 기술적 과정).
    • 단서: 모든 브라우저와 로봇은 각기 조금씩 다른 방식으로 악수를 합니다. 이는 마치 고유한 악수 스타일과 같습니다.
    • 비유: 파티에서 누군가를 만났을 때, 당신은 평범하게 악수를 할 수 있습니다. 하지만 로봇은 특정한 움켜쥐는 방식으로 악수를 하거나, 다른 브라우저는 다른 방식의 "하이파이브"를 사용할 수도 있습니다. 연구진은 한 에이전트(Skyvern)가 17개의 특정 규칙을 가진 독특한 "악수"를 사용하는 반면, 다른 에이전트들은 16개를 사용한다는 것을 발견했습니다. 또한 다른 에이전트(Operator)는 "Firefox" 핸드셰이크 스타일을 사용하는 유일한 존재였으며, 나머지 모두는 "Chrome"을 사용했습니다.
  • 레이어 3: 대화 ( "HTTP" 카메라)

    • 관찰 대상: 방문객이 요청과 함께 보내는 라벨과 메모들(예: "나는 이미지를 찾고 있다" 또는 "나는 이 페이지에 있다" 등)입니다.
    • 단서: 실제 인간은 웹사이트와 대화할 때 엄격한 문법 규칙을 따릅로. AI 에이전트는 자동으로 조립되기 때문에 문법적 실수를 하거나 이상하고 일관성 없는 문법을 사용하는 경우가 많습니다.
    • 비유: 커피를 주문하는 상황을 상상해 보세요. 인간은 "라떼 한 잔 주세요"라고 말합니다. 하지만 AI 에이전트는 "라떼 한 잔 주세요... 하지만 또한, 나는 로봇이며, 나의 주문은 스크립트를 위한 것입니다"라고 말할 수 있습니다. 한 에이전트(Browser Use)는 논리적으로 불가능한 요청을 보냈기 때문에(예: "나는 웹사이트에 있지 않다"라고 말하면서 동시에 "나는 이미지를 보고 있다"라고 말함) 100% 확률로 적발되었습니다.
  • 레이어 4: 행동 ( "마우스 및 키보드" 카메라)

    • 관찰 대상: 방문객이 마우스를 움직이고, 타이핑하고, 스크롤하는 방식입니다.
    • 단서: 인간은 마우스를 부드러운 곡선으로 움직입니다. 일부 AI 에이전트는 단순히 A 지점에서 B 지점으로 점프합니다. 또 다른 것들은 인간을 흉내 내려 노력하지만, 결과적으로 너무 길고 이상한 루프를 그리며 움직입니다.
    • 비유: 누군가 원을 그리는 것을 관찰한다고 가정해 봅시다. 인간은 매끄러운 곡선을 그립니다. 로бо트는 삐죽삐죽한 사각형을 그린 다음 이를 부드럽게 만들려고 시도할 수 있습니다. 한 에이전트(Skyvern)는 마우스를 믿기 힘들 정도로 길고 구불구불한 경로로 움직여 인간처럼 보이려고 지나치게 노력했기 때문에 적발되었고, 다른 에이전트(AutoGen)는 마우스를 거의 움직이지 않고 즉각적으로 클릭만 했습니다.

3. 판결: 단서 종합하기

연구진은 이 모든 단서를 모아 "결정 트리(Decision Tree)"(일련의 예/아니오 질문을 던지는 간단한 컴퓨터 프로그램)에 입력했습니다.

  • 결과: 이 네 가지 층위의 단서를 결합함으로써, 시스템은 방문 중인 방문객이 정확히 어떤 AI 에이전트인지, 혹은 인간인지 아니면 기존의 구식 로봇인지를 97%의 정확도로 식별할 수 있었습니다.
  • 주의점: 만약 단 하나의 층위(예: 타이밍)만 보았다면 혼동이 생길 수 있었습니다. 예를 들어, 두 가지 서로 다른 AI 에이전트(Claude와 Gemini)는 악수 방식(레이어 2)과 대화 방식(레이어 3)에서 거의 동일하게 보였습니다. 하지만 시스템이 그들의 마우스 움직임(레이어 4)을 관찰했을 때, 비로소 그들을 구분해 낼 수 있었습니다!

이것이 왜 중요한가

이 논문은 우리가 더 이상 "출입 금지" 표지판이나 단순한 신분증 확인에만 의존할 수 없다고 결론짓습니다. AI 에이전트는 너무 똑똑하고 인간을 흉내 내는 데 너무 능숙하기 때문입니다. 그러나 이들은 서로 다른 소프트웨어 "두뇌"와 "몸체"를 기반으로 구축되었기 때문에, 고유한 디지털 발자국을 남깁니다.

그들이 어떻게 움직이고, 어떻게 연결하며, 무엇을 말하고, 언제 행동하는지를 관찰함으로써, 웹사이트 소유자들은 드디어 인간 방문객, 도움이 되는 로봇, 그리고 콘텐츠를 훔칠지도 모르는 AI 에이전트를 구별할 수 있습니다. 이는 도둑을 단순히 얼굴로만 아는 것이 아니라, 그가 걷는 특정한 방식, 발소리의 독특한 울림, 그리고 열쇠를 쥐는 이상한 손 모양을 통해 알아내는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →