← 최신 논문
🤖 AI

What Does It Take to Detect an AI Agent? Minimal Feature Sets for Behavioral Detection under Browser Automation

이 논문은 추론 패턴이 아닌 브라우저 자동화의 고유한 아티팩트를 활용하는 최소한의 견고한 행동 특징 세트(구체적으로 mouse_event_rate 및 teleport_click_ratio)를 통해 AI 에이전트를 식별함으로써, 이진 인간 대 봇 분류기의 한계를 극복하고 정교한 회피 시도 속에서도 완벽에 가까운 탐지 정확도를 달성하는 3클래스 탐지 프레임워크를 제안한다.

원저자: Vishisht Choudhary, Lukas Schmidt, Anne Zoë Kenntner, Feras Skhab, Michel Osswald, Jens Ernstberger

게시일 2026-07-30
📖 5 분 읽기🧠 심층 분석

원저자: Vishisht Choudhary, Lukas Schmidt, Anne Zoë Kenntner, Feras Skhab, Michel Osswald, Jens Ernstberger

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대하고 북적이는 도시라고 상상해 보세요. 수십 년 동안 성문의 보안 요원들은 매우 단순한 업무를 수행했습니다. 그들은 단 두 종류의 사람만 찾아내면 되었습니다. 자연스럽고 약간 비틀거리며 걷고, 중간에 멈춰 생각하기도 하며, 때로는 자기 발에 걸려 넘어지기도 하는 인간이 있었습니다. 그리고 **봇(Bot)**은 엄격한 일정에 따라 움직이는 로봇과 같아서, 결코 주저하지 않고 완벽한 직선으로 행진하며 기계적인 정밀함으로 움직였습니다. 경비원들은 이 "인간 대 로봇"이라는 이분법을 중심으로 전체 시스템을 구축했습니다. 인간처럼 걸으면 통과되었고, 로봇처럼 행진하면 제지당했습니다.

하지만 최근 들어 세 번째 유형의 방문객이 나타나기 시작했습니다. 바로 **AI 에이전트(AI Agent)**입니다. 이들을 아주 똑똑하고 초지능적인 관광객이라고 생각해 보세요. 이들은 지도를 읽고, 복잡한 경로를 계획하며, 누구보다 뛰어난 문제 해결 능력을 갖추고 있습니다. 하지만 이들도 여로 이동하기 위해서는 도시의 자동화된 지하철 시스템(브라우저 자동화)을 이용해야 합니다. 문제는 이 AI 에이전트들이 매우 교활하다는 점입니다. 이들은 필요할 때 인간처럼 행동할 수 있을 만큼 영리하지만, 여전히 브라우저 자동화 도구를 사용하여 움직여야 합니다. 기존의 보안 요원들은 "인간" 혹은 "로봇"만을 식별하도록 훈련되었기에 혼란에 빠졌습니다. AI 에이전트들이 기존의 구식 로봇처럼 보이지 않도록 너무나 영리하게 행동했기 때문에, 요원들은 이들을 일반적인 사람으로 착각하여 성문 안으로 들여보내 버렸습니다.

이것이 뮌헨 공과대학교와 Kontext Security의 연구팀이 해결하고자 했던 퍼즐입니다. 그들은 다음과 같은 단순하지만 결정적인 질문을 던졌습니다. "마우스 움직임과 버튼 클릭 방식만을 관찰하여 인간, 로봇, 그리고 스마트한 AI 에이전트를 구분할 수 있는가?" 만약 가능하다면, 이를 위해 필요한 절대적인 최소 정보량은 얼마인가?

정체성의 위기

연구진은 기존의 보안 시스템이 처참하게 실패하고 있다는 것을 발견했습니다. 그들이 표준적인 "인간 대 봇" 탐지기를 이 새로운 AI 에이전트들에게 테스트했을 때, 결과는 엉망이었습니다. 흔히 쓰이는 탐지기 유형(MLP라고 불리는)은 **39.1%**의 AI 에이전트가 인간으로 오인되어 통과되도록 내버려 두었습니다. 더욱 정교한 탐지기(SAINT라고 불리는)는 **34.5%**를 놓쳤습니다. 랜덤 포레스트(Random Forest) 모델조차 이들의 **30.0%**를 잡아내지 못했습니다.

연구팀은 이것이 단순히 탐지기가 "멍청해서" 발생하는 문제가 아니라는 점을 깨달았습니다. 이것은 구조적인 문제였습니다. 탐지기들은 사람을 분류하기 위해 "인간" 또는 "봇"이라는 두 개의 상자만을 가지고 만들어졌습니다. 스마트한 AI 에이전트가 나타났을 때, 그들은 어느 쪽 상자에도 깔끔하게 들어맞지 않았고, 결국 탐지기는 그냥 추측을 해버린 것입니다. 연구진은 만약 "에이전트"라고 라벨링 된 세 번째 상자를 단순히 추가하기만 한다면, 탐지기들이 매번 **100%**의 확률로 에이전트를 완벽하게 잡아낼 수 있다는 것을 증명했습니다.

비밀은 "유령"의 움직임에 있다

그렇다면 어떻게 그들을 잡아냈을까요? 연구팀은 AI 에이전트들이 잡히는 이유가 그들의 "사고"나 영리한 "계획" 때문이 아니라는 것을 발견했습니다. 대신, 그들은 기계 속의 유령들 때문에 잡혔습니다.

사람이 키보드를 치거나 마우스를 움직이는 모습을 상상해 보세요. 그들의 손은 물리적인 객체입니다. 무게가 있고, 관성이 있으며, 카메라나 센서가 포착할 수 있는 미세하고 지저리며 떨리는 움직임을 만듭니다. 하지만 AI 에이전트가 브라우저 자동화 도구(Playwright와 같은)를 사용할 때, 그것은 물리적인 손을 움직이는 것이 아닙니다. 그것은 디지털 명령을 보내는 것입니다. 마치 유령이 버튼을 누르는 것과 같습니다.

연구팀은 이 디지털 유령들이 매우 구체적이고 눈에 보이지 않는 서명을 남긴다는 것을 발견했습니다.

  1. 지터(Jitter)의 부재: 인간이 마우스를 움직일 때에는 약간의 흔들림이 발생합니다. 하지만 AI가 클릭할 때는 목표 지점에 그냥 '나타납니다'. 클릭 직전까지의 작고 지저분한 움직임이 없습니다.
  2. "휠(Wheel)" 회전의 부재: 마우스 휠로 웹페이지를 스크롤하면 특정 데이터 스트림이 생성됩니다. 하지만 AI는 휠을 아예 건너뛰고 페이지에 스크롤 명령을 직접 내립니다.
  3. 즉각적인 클릭: 인간은 마우스 버튼을 누르고 떼는 데 아주 짧은 찰나의 시간이 걸립니다. 하지만 AI는 변동성 없이 즉각적으로 수행합니다.

연구팀은 AI가 숨을 수 있는지 테스트하기 위해 "5단계 회피 사다리"를 구축했습니다. 그들은 모든 방법을 시도했습니다.

  • 1단계: AI가 평범하게 클릭함.
  • 2단계: AI가 수학 공식을 사용하여 인간처럼 곡선을 그림.
  • 3단계: AI가 인간의 움직임을 모방하는 학습형 AI(GAN)를 사용하여 가짜 마우스 경로를 생성함.
  • 4단계: AI가 인간처럼 보이기 위해 무작위 "지터"를 추가함.
  • 5단계: AI가 실제 인간이 마우스를 움직인 기록을 재생함.

심지어 AI가 실제 인간의 마우스 움직임 녹화본을 재생했을 때(5단계)조차도 여전히 발각되었습니다! 왜일까요? 마우스의 경로는 인간처럼 보였을지라도, 클릭이 일어나는 방식은 여전히 디지털 명령이었기 때문입니다. AI는 물리적인 마우스 휠을 사용하지 않았다는 사실이나, 인간의 손이 가진 미세하고 자연스러운 떨림이 없다는 사실을 속일 수 없었습니다. "유령"의 서명이 여전히 남아 있었던 것입니다.

마법의 두 가지 특징 세트

이 발견에서 가장 흥ante한 부분은 실제로 얼마나 적은 정보가 필요했는가 하는 점이었습니다. 연구진은 모든 AI 에이전트를 잡아낼 수 있는 가장 작은 특징 세트를 찾기 위해 수천 가지의 서로 다른 조합을 테스트했습니다.

그들은 AI를 식별하기 위해 매우 복잡한 시스템이 필요하지 않다는 것을 발견했습니다. 단 두 가지의 간단한 요소만 있으면 됩니다:

  1. 마우스 이벤트 발생률(Mouse Event Rate): 마우스가 얼마나 자주 움직이는가. (AI의 움직임은 클릭 전까지 매우 드물거나 존재하지 않는 경우가 많습니다).
  2. 클릭 지속 시간 표준 편차(Click Duration Standard Deviation): 클릭하는 데 걸리는 시간의 변동성이 얼마나 큰가. (AI의 클릭은 완벽하게 일관적이지만, 인간의 클릭은 다양합니다).

이 두 가지 단서만으로도 시스템은 가장 고도화된 속임수를 사용하는 상황에서도 **100%**의 AI 에이전트를 식별할 수 있었습니다. 만약 여기에 세 가지 특징(타이핑 속도나 스크롤 속도의 변동성 등)을 더 추가한다면, 시스템은 인간, 봇, 에이전트를 동시에 완벽하게 구분하여 0.991이라는 거의 완벽한 점수를 기록할 수 있었습니다.

이것이 의미하는 바

이 논문은 AI 에이전트를 잡아내는 것은 그들이 인간처럼 "생각하는가"를 알아내는 것이 아니라, 그들이 웹을 돌아다니기 위해 다른 종류의 "근육"을 사용하고 있음을 알아채는 것이라고 결론짓습니다. 그들은 물리적인 손 대신 디지털 명령을 사용하고 있습니다.

연구진은 만약 단 하나의 특징만을 사용하여 탐지기를 만들려고 한다면 속을 수 있다고 경고합니다. 예를 들어, 단독으로는 완벽해 보였던 한 가지 특징은 탐지기가 실제 인간을 포함한 모든 사람을 "에이전트"라고 추측하게 만들어, 아무런 쓸모가 없게 만들었습니다. 하지만 올바른 두 가지 특징을 함께 사용한다면, 탐지기는 매우 강력해집니다.

이 발견은 인터넷의 미래에 있어 매우 중요한 사건입니다. AI 에이전트가 흔해짐에 따라, 웹사이트들은 누가 브라우징을 하고 있는지 알아야 할 것입니다. 이 연구는 그들을 찾아내기 위해 거대하고 복잡한 시스템을 구축할 필요가 없다는 것을 보여줍니다. 우리는 그저 디지털 유령들이 인간처럼 걷고자 할 때 남기는 작고 보이지 않는 발자국을 찾기만 하면 됩니다. 그리고 그들이 표준적인 브라우저 도구를 사용하는 한, 그 발자국은 언제나 그곳에 남아 있을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →