← 최신 논문
💻 computer science

Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing

이 논문은 자율 침투 테스트 에이전트의 향후 평가가 성능 향상이 구조적 혁신에서 기인한 것인지 아니면 근본적인 모델 개선에 의한 것인지를 정확하게 구별하기 위해, 통제된 모델 일치형 일반 에이전트 베이스라인을 구축해야 한다고 주장한다.

원저자: Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ananda Dhakal, Krish Neupane, Aarjan Chaudhary

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 끊임없이 변화하는 거대한 디지털 건물의 도시라고 상상해 보십시오. 어떤 건물들은 악의적인 행위자들이 몰래 침입할 수 있는 숨겨진 함정이나 고장 난 자물쇠, 즉 보안 취약점을 가지고 있습니다. 수십 년 동안 이러한 구멍을 찾는 일은 모든 방을 돌아다니며 문과 창문을 테스트하는 디지털 열쇠공와 같은 인간 전문가들의 몫이었습니다. 하지만 도시는 너무 빠르게 성장하고 있습니다. 매초 새로운 건물이 생겨나고 있으며, 열쇠공들은 그 속도를 따라잡을 수 없습니다. 그래서 과학자들은 인공지능을 이용해 "로봇 열쇠공"을 만들기 시작했습니다. 이 로봇들은 대규모 언어 모델(LLM)을 동력으로 사용하는데, LLM은 인터넷의 거의 모든 내용을 읽었으며 코드를 작성하고, 문제를 추론하며, 지시를 따를 수 있는 초지능적인 두뇌와 같습니다.

이 분야의 핵심 질문은 단순히 "로봇이 자물쇠를 찾을 수 있는가?"가 아니라, "로한의 성공 중 얼마나 많은 부분이 그 자체의 두뇌 덕분이며, 얼마나 많은 부분이 우리가 준 화려한 도구 덕분인가?"입니다. 여러분에게 천재적인 학생이 있다고 가정해 봅시다. 만약 여러분이 그에게 단순한 공책과 펜을 준다면, 그는 수학 문제를 풀 수도 있을 것입니다. 하지만 만약 여러분이 고성능 계산기, 튜터 팀, 그리고 특별한 지도를 준다면, 그는 문제를 더 빨리 풀 수도 있을 것입니다. 그렇다면 계산기가 그를 더 똑똑하게 만든 것일까요, 아니면 단지 도움을 준 것일까요? AI 보안의 세계에서 연구자들은 AI 에이전트, 특수 메모리 시스템, 그리고 탐색 도구들로 구성된 복잡한 "하네스(harness)"를 구축하여 AI가 웹사이트를 해킹하도록 도와왔습니다. 하지만 그들이 AI의 두뇌와 도구를 동시에 계속 바꾸고 있었기 때문에, 화려한 도구들이 실제로 핵심적인 역할을 하고 있는 것인지, 아니면 AI가 스스로 더 나아지고 있는 것인지 아무도 알지 못했습니다.

"Baselines Before Architecture"라는 제목의 이 논문은 매우 정교한 실험을 통해 이 논쟁을 종결시키고자 합니다. 연구진은 XBOW 벤치마크라고 불리는 104개의 표준 디지털 과제를 사용하여 통제된 테스트를 설정했습니다. 연구진은 새로운 화려한 로봇을 만드는 대신, Codex, OpenCode, Pi라는 이름의 기존 "평범한" 코딩 어시스턴트 세 개를 가져와서, 하나의 강력한 AI 두뇌(GPT-5)와 별도의 보안 도구 없이 이 과제들을 해결하도록 요청했습니다. 그들은 "벌거벗은" AI가 어떤 부가적인 장치도 없이 얼마나 잘 해낼 수 있는지 확인하고자 했습니다.

결과는 놀라움과 현실적인 진실이 섞여 있었습니다. 첫째, 평범한 코딩 에이전트들은 놀라울 정도로 강력했습니다. GPT-5 모델을 기반으로 하는 "Codex" 에이전트는 첫 번째 시도에서 약 67%의 과제를 해결했습니다. 연구진이 다시 한번 시도할 수 있게 허용했을 때(두 번의 테스트 결과를 결합했을 때), 이 에이전트는 77.9%의 과제를 해결했습니다. 이것은 큰 의미가 있는데, 이는 단순하고 범용적인 코딩 로봇이 복잡한 보안 팀 없이도 이미 업무의 상당 부분을 처리할 수 있음을 의미하기 때문입니다.

또한 이 연구는 많은 이들이 필수적이라고 생각했던 두 가지 특정 아이디어를 테스트했습니다. 하나는 AI에게 해커처럼 생각하라는 특별한 지시서를 주는 "보안 프롬프팅(security prompting)"이었습니다. 다른 하나는 복잡한 다중 에이전트 아키텍처(여러 AI 역할이 서로 대화하는 구조)가 최고의 성능을 내기 위해 필요하다는 아이디어였습니다. 연구 결과, 특별한 "해커 지시사항"은 오히려 AI의 성능을 떨어뜨려, 더 적은 과제를 해결하게 만들고 비용을 더 많이 발생시켰습니다. 또한, 복잡한 아키텍처에 대해서는 평범한 Codex의 결과와 MAPTA 및 PentestGPT V2라는 두 개의 유명하고 하이테크한 시스템을 비교했습니다.

여기에는 미묘한 차이가 있습니다. 화려한 시스템들이 여전히 약간의 우위를 점하고 있기는 했습니다. 동일한 AI 두뇌와 결합했을 때, 특화된 MAPTA 시스템은 평범한 Codex보다 약 9.6 퍼센트 포인트 더 많은 과제를 해결했습니다. 그러나 논문은 이 격차가 생각만큼 크지 않다는 것을 보여주었습니다. 연구진이 평범한 Codex 에이전트를 더 새롭고 똑똑한 두뇌인 GPT-5.5로 업그레이드하자, 이 에이전트는 첫 번째 시도에서 92.3%, 두 번의 실행을 결합했을 때 95.2%의 과제를 해결했습니다. 이 새로운 평범한 에이전트는 화려한 도구 없이도 기존의 복잡한 시스템들이 기록한 성적을 능가했습니다.

이 논문의 주요 교훈은 과학계에 던지는 경고입니다. 새로운 아키텍처가 높은 점수를 얻었다고 해서 그것이 반드시 영웅이라고 가정하지 마십시오. 종종 그 점수는 도구가 더 화려해져서가 아니라, AI 모델 자체가 똑똑해졌기 때문에 발생하는 것입니다. 이 논문은 새로운 "보안 하네스"가 돌파구라고 주장하기 전에, 연구자들이 반드시 동일한 AI 두뇌를 사용하는 단순하고 평범한 코딩 에이전트보다 얼마나 더 나은지를 먼저 보여주어야 한다고 제안합니다. 특화된 도구들이 시간과 비용을 절약하는 데 여전히 도움이 될 수는 있지만, "평범한" AI가 이미 대부분의 핵심적인 일을 수행하고 있으며, 단순히 다음 세대의 AI 모델을 기다리는 것이 더 복잡한 로봇을 만드는 것만큼이나 효과적일 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →