Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents
이 논문은 상용 솔버와 신흥 LLM 기반 브라우저 에이전트를 대상으로 웹 봇 방어 체계의 회복력을 체계적으로 평가하며, 챌린지 기반 방어는 쉽게 우회되는 반면 비대화형 방어는 행동 분석보다 실행 환경의 신뢰성에 더 의존함으로써 신뢰할 수 있는 환경에서 작동하는 정교한 에이전트에 취약하다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 거대하고 북적이는 도시라고 상상해 보세요. 이 도시에는 두 가지 주요 유형의 여행자가 있습니다. 바로 실제 사람과 '봇(bot)'입니다. 봇은 어떤 일을 빠르게 수행하도록 프로그래밍된 자동화된 로봇과 같습니다. 때로는 편지를 분류하는 우체부처럼 도움이 되기도 하지만, 종종 비밀번호를 훔치기 위해 수천 개의 문 잠금장치를 동시에 따려는 도둑처럼 악의적인 모습을 보이기도 합니다. 도시를 안전하게 지키기 위해 웹사이트 소유자들은 문 앞에 '게이트(gate)'를 설치합니다. 오랫동안 이 게이트는 "당신은 인간입니까?"라는 간단한 질문을 던지는 경비원과 같았습니다. 예를 들어, 교통 신호등 사진을 보여주고 그것을 클릭하라고 요청하는 식이었죠. 만약 당신이 올바른 것을 클릭했다면, 안으로 들어갈 수 있었습니다. 하지만 사진을 볼 수 없는 로봇이라면 밖에서 갇혀 있어야 했습니다.
하지만 최근, 새로운 종류의 여행자가 도착했습니다. 바로 'AI 에이전트'입니다. 이들을 서투른 로봇이 아니라, 아주 똑똑한 디지털 인턴이라고 생각해보세요. 이들은 웹사이트를 읽고, 내용을 이해하며, 버튼을 클릭하고, 심지어 평이한 영어로 된 지시사항을 따라 퍼즐을 풀 수도 있습니다. 보안 요원들의 큰 고민은 이것입니다. "이 똑똑한 인턴들이 경비원들을 속일 수 있을까?" 만약 답이 '예'라면, 기존의 게이트들은 더 이상 도둑들을 막아내기에 충분하지 않을 것입니다. 이것이 바로 플로리다 국제 대학교(Florida International University)의 연구팀이 알아내고자 했던 핵심입니다. 그들은 이 새로운 AI 에이전트들이 오늘날 웹사이트에서 사용하는 현대적인 보안 게이트를 몰래 통과할 수 있는지, 만약 그렇다면 어떻게 통과하는지를 확인하고 싶었습니다.
위대한 게이트 탈취 사건: 연구진이 발견한 것들
연구진은 방어 체계를 테스트하기 위해 '악당' 역할을 맡기로 했습니다. 그들은 단순히 추측만 한 것이 아니라, 고전적인 "교통 신호등 클릭" 퍼즐부터 백그라운드에서 실행되는 보이지 않는 보안 검사까지, 7가지 서로 다른 유형의 보안 게이트가 있는 실제 세계의 테스트 도시를 구축했습니다. 그런 다음, 누가 통과할 수 있는지 확인하기 위해 두 팀의 공격자를 투입했습니다.
팀 1: "사람 고용하기" 서비스
첫 번째 팀은 중간 관리자 역할을 하는 상업적 서비스를 이용했습니다. 로봇이 퍼즐에 부딪히면, 스스로 해결하는 대신 실제 사람 작업자에게 사진을 보내 몇 초 만에 정답을 받아오는 방식입니다. 연구진은 이 방법이 무서울 정도로 효과적이라는 것을 발견했습니다. 고전적인 퍼즐(hCaptcha나 reCaptcha v2 같은 경우)에 대해, 이 서비스들은 **100%**의 성공률을 기록했습니다. 이는 마치 당신을 위해 자물쇠를 따 줄 사람을 고용하는 것과 같았습니다. 거의 매번 성공했으며, 비용도 1,000번 시도당 때로는 단돈 0.10달러 정도로 매우 저렴했습니다. 퍼즐을 보여주지 않는 "보이지 않는" 게이트조차도 대부분 이 방식으로 뚫렸습니다. 하지만 아무런 질문도 던지지 않고 사용자의 행동을 관찰하는 가장 진보된 형태의 보이지 않는 게이트(reCaptcha v3)의 경우, 이 서비스들의 성공률은 약 **23%**에 그쳤습니다. 퍼즐을 풀기 위해 사람을 고용할 수는 있지만, 사람을 고용해 가짜 디지털 이력을 만들어내는 것은 쉽지 않다는 결론이 나왔습니다.
팀 2: "똑똑한 AI 인턴들"
두 번째 팀은 스스로 읽고 클릭할 수 있는 새로운 LLM 기반 브라우저 에이전트, 즉 "똑똑한 인턴들"을 사용했습니다. 연구진은 클라우드에서 실행되거나 개인 컴퓨터에서 실행되거나 브라우저 확장 프로그램 형태인 6가지 서로 다른 버전의 에이전트를 테스트했습니다.
결과는 실패와 놀라움이 섞여 있었습니다. 고전적인 퍼즐을 마주했을 때, 대부분의 AI 인턴들은 처참하게 실패했습니다. 그들은 퍼즐을 볼 수도 있고 지시사항을 이해할 수도 있었지만, 이미지 인식 과제를 실제로 '해결'하지는 못했습니다. 이는 마치 지도는 읽을 줄 알지만 신발 끈은 묶지 못하는 천재를 보는 것과 같았습니다. 그들에게는 도움을 줄 특별한 '솔버(solver)' 모듈이 필요했고, 그것 없이는 움직일 수 없었습니다.
하지만 이야기는 여기서부터 정말 흥ей로워집니다. 연구진이 이 에이전트들을 보이지 않는 게이트(reCaptcha v3 등)에 대해 테스트했을 때, 에이전트들이 실패한 이유는 그들이 "멍청해서"가 아니었습니다. 그들은 "가짜처럼 보였기 때문"이었습니다.
연구진은 보안 시스템이 에이전트가 얼마나 똑똑한지를 체크하는 것이 아니라, 에이전트의 환경이 얼마나 실제처럼 보이는지를 체크한다는 것을 발견했습니다. 연구진은 거의 동일하게 행동하는 두 에이전트, Browser-Use와 NanoBrowser를 비교했습니다. 두 에이전트 모두 버튼을 클릭하고, 마우스를 움직이고, 양식을 작성하는 방식이 거의 똑같았습니다. 그럼에도 불구하고, NanoBrowser는 게이트를 통과했지만, Browser-Use는 차단되었습니다.
왜 그랬을까요? 차이점은 행동 방식에 있지 않았습니다. 차이점은 그들의 "배낭"에 있었습니다. NanoBrowser는 쿠키, 저장된 로그인 정보, 안정적인 디지털 지문(fingerprint) 등 오랜 시간의 기록을 가진 실제 웹 브라우저 안에서 실행되고 있었습니다. 마치 도시에서 수년간 거주해 온 사람처럼 말이죠. 반면, Browser-Use는 깨끗하고 갓 생성된 브라우저 환경에서 실행되고 있었는데, 이는 마치 현지 유심 카드를 아직 사지 않은 채 막 도착한 관광객처럼 수상하게 보였습니다. 보안 시스템은 이 "깨끗한" 환경의 냄새를 맡고, 에이전트가 완벽하게 행동하고 있음에도 불구하고 "안 돼, 너는 봇이야"라고 선언한 것입니다.
핵심적인 시사점
이 논문은 "퍼즐을 더 어렵게 만드는 것"이라는 기존의 개념이 힘을 잃어가고 있다고 시사합니다. 단순히 퍼즐을 더 복잡하게 만든다고 해도, 공격자들은 단돈 몇 푼에 사람을 고용해 이를 해결할 수 있기 때문입니다. 가장 똑똑한 AI 에이전트들조차 특별한 도구 없이는 퍼즐을 풀 수 없습니다.
진정한 보안 경계는 이동했습니다. 이제는 "수수께끼를 풀 수 있느냐"의 문제가 아니라, "당신이 이 동네에 속해 있다는 것을 증명할 수 있느냐"의 문제입니다. 연구진은 reCaptcha v3와 같은 방어 체계가 강력한 이유가, "깨끗한" 로봇 환경과 "삶의 흔적이 있는" 인간 환경을 구분할 수 있기 때문이라는 것을 발견했습니다. 하지만 이것이 완벽한 방패는 아닙니다. 연구는 AI 에이전트들이 쿠키, 히스토리, 지문을 온전히 유지함으로써 실제 브라우저 환경을 모방하는 능력이 향상됨에 따라, 결국 이 보이지 않는 게이트들까지 속일 수 있게 될 것이라고 암시합니다.
요약하자면, "똑똑한 인턴들"은 점점 더 똑똑해지고 있지만, 현재로서는 그들이 진짜 사람임을 증명할 "신분증"(브라우저 기록과 쿠키)을 가지고 있지 않기 때문에 여전히 붙잡히고 있습니다. 이 논문이 시사하는 바에 따르면, 웹 보안의 미래는 퍼즐이 얼마나 어려운가보다는, 실제 디지털 삶과 가짜 삶 사이의 차이를 얼마나 잘 포착할 수 있느냐에 달려 있을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.