Agentic Security: A Systematization of Tools, Failure Modes, and Design Laws for LLM-Driven Penetration Testing
이 논문은 실무 중심의 평가를 통해 LLM 기반 침투 테스트 도구의 운영 실패를 체계화하고, Inspectra 플랫폼으로 예시되는 견고한 에이전트 기반 보안 시스템 구축을 가이드하기 위한 정량적 설계 법칙과 4차원 마찰 지수를 도출한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터 보안의 세계에는 나쁜 놈들이 하기 전에 시스템에 침투할 숙련된 인간을 고용하는 오랜 전통이 있습니다. 침투 테스터(penetration tester)로 알려진 이 전문가들은 소프트웨어, 네트워크, 클라우드 인프라의 숨겨진 결함을 찾아내는 데 시간을 보냅니다. 그들은 범죄자가 데이터를 훔치거나 제어권을 탈취할 수 있게 만드는 취약한 비밀번호, 패치되지 않은 구멍, 그리고 로직 오류를 찾습니다. 수십 년 동안 이 작업은 수동적이고 인간 중심적인 기술이었습니다. 그러나 이제 새로운 힘이 이 분야에 등장했습니다. 바로 인공지능입니다. 구체적으로, 방대한 양의 텍스트를 학습하여 인간의 언어를 이해하고 생성할 수 있는 시스템인 대규모 언어 모델(LLM)이 이제 보안 전문가의 역할을 수행하도록 요청받고 있습니다. 그 아이디어는 '에이전틱(agentic)' 시스템, 즉 코드를 읽고 네트워크를 스캔할 뿐만 아니라 공격을 계획하고, 실행하며, 인간의 도움 없이 보고서까지 작성할 수 있는 소프트웨어를 구축하는 것입니다. 이러한 변화는 보안 테스트를 더 빠르고 저렴하게 만들 것을 약속하지만, 동시에 새로운 문제들을 야기합니다. 확실성이 아닌 확률로 사고하는 기계에게 복잡하고 위험한 업무를 맡길 때, 그 기계는 인간이라면 절대 하지 않을 실수를 저지를 수 있으며, 더 나아가 자신이 발견한 것에 대해 자신 있게 거짓말을 할 수도 있습니다.
한 연구팀은 AI 보안 에이전트들이 혼자 남겨졌을 때 정확히 어떻게 행동하는지 이해하기 위해 연구를 시작했습니다. 그들은 단순히 이론적인 모델을 만든 것이 아니라, Inspectra라는 실제 작동하는 플랫폼을 구축하고 다양한 보안 도구들을 대상으로 성능을 시험했습니다. 그들의 목표는 이러한 에이전트들이 무엇을 '할 수 있는지'에 대한 환상을 넘어, 문제가 발생했을 때 실제로 '무엇을 하는지'에 대한 냉혹한 엔지니어링 현실을 기록하는 것이었습니다. 그들이 발견한 것은 기술이 고장 난 것이 아니라, 설계자가 의도하지 않은 방식으로 기술이 사용되고 있기 때문에 동일한 실패가 반복해서 발생하는, 이제 막 걸음마를 떼는 단계의 학문이었습니다. 연구원들은 가장 큰 장애물이 AI의 지능 부족이 아니라, 시스템이 구축된 방식의 구조적 결여라는 것을 발견했습니다. 그들은 AI가 너무 많은 것을 기억하려고 하거나, 자신의 작업을 스스로 판단하려 하거나, 통제할 수 없는 예산을 부여받았을 때 발생하는 구체적이고 예측 가능한 실패 패턴을 식별했습니다.
팀이 직면한 가장 즉각적인 문제 중 하나는 기억력의 문제였습니다. AI 에이전트가 긴 조사를 시작하여 수천 줄의 코드를 읽고 수십 개의 테스트를 실행한다고 상상해 보십시오. 조사가 계속됨에 따라 시스템이 '머릿속'에 유지해야 하는 정보의 양은 늘어납니다. 결국 시스템은 그 모든 정보를 담을 공간이 부족해집니다. 인간의 관점에서 이는 누군가 계속 말을 하는 동안 긴 대화의 모든 세부 사항을 기억하려고 노력하는 것과 같습니다. 초기 세부 사항들은 자연스럽게 희미해집니다. 연구원들은 AI 에이전트가 하나의 길고 연속적인 세션에서 작업할 경우, 스캔 초기에 수집한 증거를 필연적으로 잊어버린다는 것을 발견했습니다. 보고서를 작성하기 위해 끝 단계에 도달했을 때, 에이전트는 실제로 열어본 적도 없는 파일을 자신 있게 설명하거나, 몇 시간 전에 기록되었으나 이미 기억에서 삭제된 취약점을 발견했다고 주장할 수도 있습니다. 그들이 제안한 해결책은 작업을 짧고 뚜렷한 단계로 나누는 것이었습니다. 하나의 긴 대화 대신, 시스템은 일련의 단기적인 에이전트들을 사용합니다. 각 에이전트는 작업의 작은 부분을 수행하고, 그 결과를 영구적이고 조직화된 파일에 기록한 뒤 멈춥니다. 다음 에이전트는 원본 데이터가 아닌 그 파일의 요약본만을 읽습니다. 이 접근 방식은 시스템이 위치를 잃지 않고 훨씬 더 큰 작업을 처리할 수 있게 하며, 정보를 압축하여 전달함으로써 AI가 기억할 수 있는 지평을 효과적으로 확장합니다.
또 다른 결정적인 실패 모드는 시스템이 자신의 성공 여부를 판단하는 방식과 관련되었습니다. AI 레드팀 도구가 시스템을 공격할 때, 공격이 실제로 성공했는지 판단할 방법이 필요합니다. 연구원들은 많은 자동화 도구들이 특정 키워드만 보고도 공격이 실패했음에도 불구하고 너무 성급하게 "네, 성공했습니다"라고 말하는 경절을 발견했습니다. 이는 허위 경보(false alarm)의 홍수로 이어졌습니다. 이를 해결하기 위해 팀은 2단계 검증 프로세스를 설계했습니다. 먼저, 빠르고 저렴한 체크를 통해 명백한 실패를 걸러냅니다. 그런 다음, 첫 번째 체크를 통과한 사례만을 대상으로 더 신중한 두 번째 판독관이 검토합니다. 결정적으로, 이 두 번째 판독관은 첫 번째와 다른 종류의 시스템이어야 합니다. 만약 두 판독관이 같은 유형의 AI라면 똑같은 실수를 저지를 것이고, 그렇게 되면 두 번째 체크는 무용지물이 될 것이기 때문입니다. 서로 다른 두 시스템을 사용하여 결과를 검증함으로써, 팀은 허위 경보를 획기적으로 줄여 최종 보고서의 신뢰도를 높일 수 있었습니다. 또한 그들은 미묘하지만 위험한 편향을 발견했습니다. 만약 공격이 시스템이 이해할 수 없는 방식으로 실패했다면, 소프트웨어는 종종 이를 성공으로 기록하곤 했습니다. 이는 가장 위험하고 교묘한 공격들이 오히려 숨겨지거나 잘못 분류될 가능성이 높다는 것을 의미하며, 이는 잘못된 안전감을 제공합니다.
연구진은 비용과 통제의 문제도 다루었습니다. 보안 도구는 예측 불가능합니다. 어떤 도구는 몇 초 만에 끝나지만, 어떤 도구는 몇 시간 동안 멈추지 않고 돌아가며 막대한 돈과 컴퓨착 자원을 소모할 수 있습니다. 팀은 단순히 텍스트 명령어로 AI에게 "시간을 너무 많이 쓰지 마라"고 말하는 것만으로는 충분하지 않다는 것을 보여주었습니다. AI는 그 명령을 무시하거나, 읽고 있는 내용에 정신이 팔려 규칙을 잊어버릴 수 있습니다. 대신, 시스템에는 AI의 의사결정 과정 외부에 존재하는 강력한 외부 문지기(gatekeeper), 즉 코드 조각이 필요합니다. 이 문지기는 도구가 실행되는 시간과 비용에 대한 엄격한 제한을 강제하며, 한계치에 도달하는 즉시 차단합니다. 이를 통해 AI가 실수로 프로젝트를 파산시키거나 권한이 없는 서버를 스캔하는 것을 방지할 수 있습니다. 연구원들은 AI가 자신의 안전이나 예산에 대한 최종 권한을 가져서는 안 되며, 그 역할은 항상 별도의 변경 불가능한 코드 계층에 속해야 한다고 강조했습니다.
마지막으로, 팀은 도구 자체를 살펴보았습니다. 그들은 10가지의 서로 다른 보안 스캐너를 테스트했으며, 사람이 직접 실행하기 쉬운 도구들이 자동화된 시스템에서는 오히려 사용하기 어렵다는 것을 발견했습니다. 많은 도구들이 인간이 로그인 화면을 클릭한 후 세션을 스캐너에 넘겨주는 방식으로 설계되었습니다. AI가 이를 시도할 때, 로그인 과정이 너무 복-잡하거나 도구가 로그인 상태를 유지하는 방법을 이해하지 못해 자주 실패했습니다. 연구원들은 별도의 브라우저 자동화 도구가 로그인을 처리한 다음, 인증된 깨끗한 링크 목록을 스캐너에 전달하는 패턴을 개발했습니다. 이러한 단순한 역할 분담은 통합 과정에서의 골칫거리들을 해결했습니다. 또한 그들은 AI 안전 정책의 지형이 매우 가변적이라는 점에 주목했습니다. 오늘 보안 테스트를 허용하는 모델이 내일은 제공업체의 규칙 변경으로 인해 차단될 수 있습니다. 이는 이러한 도구들을 기반으로 구축된 시스템이 전체 워크플로우를 망가뜨리지 않고도 기반이 되는 AI 모델을 교체할 수 있을 만큼 유연해야 함을 의미합니다.
논문은 자동화된 보안의 미래가 AI를 더 똑똑하게 만드는 데 있는 것이 아니라, 그 주변에 더 나은 구조를 구축하는 데 있다고 결론짓습니다. 가장 효과적인 시스템은 AI를 강력하지만 실수하기 쉬운 노동자로 취급하며, 엄격한 규칙, 짧은 기억 주기, 그리고 독립적인 검증 체계로 둘러싸는 시스템입니다. AI가 잊어버리고, 실수하며, 때로는 명령을 무시할 것이라는 사실을 받아들임으로써, 엔지니어들은 현실 세계를 감당할 수 있는 견고한 시스템을 구축할 수 있습니다. 연구진의 작업은 실험적인 시연을 넘어 신뢰할 수 있는 배포 제품으로 나아가기 위한 청사진을 제공하며, AI 보안 에이전트가 결함을 발견했다고 말할 때 그것이 실제로 발견된 것이며, 예산이나 규칙을 어기지 않고 수행했음을 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.