← 최신 논문
💻 computer science

Autonomous LLM Agents & CTFs: A Second Look

본 논문은 CTF 도전 과제에서 범용 에이전트인 Claude Code 가 복잡한 엔지니어링 아키텍처와 동등한 성능을 보이지만, 두 가지 모두 인간 수준의 장벽에 직면해 있으며 구조화된 다중 역할 오케스트레이션이 일관성과 비용 효율성 측면에서 단일 구조 설계보다 우수함을 입증함으로써 오펜시브 보안 분야에서 대규모 언어 모델 에이전트의 능력을 재평가합니다.

원저자: Youness Bouchari, Matteo Boffa, Marco Mellia, Idilio Drago, Thanh Minh Bui, Dario Rossi

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Youness Bouchari, Matteo Boffa, Marco Mellia, Idilio Drago, Thanh Minh Bui, Dario Rossi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 탐정 팀이 숨겨진 보물(플래그)을 찾기 위해 일련의 잠긴 디지털 금고 (CTF 챌린지라고 함) 를 뚫어보려고 한다고 상상해 보세요. 오랫동안 사람들은 인공지능 (AI) 에이전트가 인간 전문가와 거의 비슷하게 이 작업을 수행할 정도로 똑똑해지고 있다고 주장해 왔습니다.

이 논문은 일종의 '현실 점검' 보고서와 같습니다. 저자들은 AI 가 정말로 주류 시대에-ready 한지, 아니면 단순히 운이 좋은 것인지 확인하기 위해 이러한 주장들을 직접 테스트하기로 결정했습니다.

다음은 일상적인 비유를 사용하여 그들의 실험과 발견 사항을 정리한 것입니다:

1. 실험: 다양한 탐정 팀 구성

연구자들은 한 가지 유형의 AI 만 사용하지 않았습니다. 어떤 구조가 가장 효과적인지 확인하기 위해 세 가지 다른 '팀 구조'를 구축했으며, 유명한 오프더셸 (off-the-shelf) AI 탐정인 Claude Code도 테스트했습니다.

  • 혼자서 일하는 탐정 (Executor): 한 사람이 모든 일을 하려고 상상해 보세요. 자물쇠를 보고, 계획을 세우고, 자물쇠를 따고, 보물을 얻었는지 확인하는 것까지요. 논문은 이 사람이 압도당하고 실수를 저지른다고 밝혔습니다.
  • 비평가와 함께하는 탐정 (Executor + Evaluator): 여기서 탐정은 작업을 수행하지만, 두 번째 사람 (비평가) 이 어깨 너머로 지켜봅니다. 탐정이 자물쇠를 따기 전에 비평가는 "잠깐, 그건 나쁜 아이디어야, 다시 시도해 봐"라고 말합니다. 이는 도움이 되지만, 비평가는 때때로 전체 그림을 보지 못하고 사소한 세부 사항만 잡는 경향이 있습니다.
  • 전략가와 비평가와 함께하는 탐정 (Planner + Executor + Evaluator): 이것이 가장 복잡한 팀입니다.
    • 전략가 (Planner): 먼저 금고를 보고 단계별 지도를 작성합니다.
    • 탐정 (Executor): 지도를 따릅니다.
    • 비평가 (Evaluator): 지도에 따라 작업을 점검합니다.
    • 결과: 이 팀이 가장 효율적이었습니다. 목적 없이 배회하지 않았기 때문에 시간과 비용을 가장 적게 낭비했습니다.

또한 고정된 팀 구조가 없이 스스로 조력자를 고용할지 혼자 일할지 결정하는 '스마트한 일반인'과 같은 Claude Code도 테스트했습니다.

2. 결과: "30 개 중 19 개"라는 한계

중요한 소식은 팀을 어떻게 구성하든 AI 는 확실한 한계에 부딪혔다는 것입니다.

  • 점수: 최상의 인간이 설계한 팀과 똑똑한 '일반인' AI(Claude Code) 모두 정확히 30 개 중 19 개의 챌린지를 해결했습니다.
  • 비교: 이는 일부 이전 연구들이 주장한 것보다 낮습니다. 저자들은 이러한 이전 연구들이 지나치게 낙관적이거나 더 쉬운 테스트를 사용했을 가능성을 제기합니다.
  • 효율성 승리: 점수는 동일했지만, '전략가 + 탐정 + 비평가' 팀은 작업 방식에서 훨씬 더 뛰어났습니다. 그들은 혼자 일하는 탐정보다 단계를 적게 밟고 실행 비용도 더 적게 들었습니다. 마치 두 명의 주자가 같은 시간에 경기를 finish 했지만, 한 사람은 직선으로 달리고 다른 사람은 원을 그리며 달린 것과 같습니다.

3. AI 가 막히는 곳 (이유)

연구자들은 나머지 11 개의 챌린지에서 AI 가 실패한 이유를 깊이 파고들었습니다. 그들은 AI 가 두 가지 매우 다른 이유로 실패한다는 사실을 발견했습니다:

A. "도구 부족" 문제 (기술적 한계)
때로는 AI 가 무엇을 해야 할지 정확히 알지만, 적절한 장비를 갖추지 못한 경우입니다.

  • 비유: AI 가 자물쇠를 따는 법을 알고 있지만, 두꺼운 오븐 장갑을 낀 채로 시도한다고 상상해 보세요.
  • 예시: 일부 챌린지는 AI 가 브라우저에서 웹페이지를 보고 (숨겨진 코드를 확인) 해야 했지만, AI 는 텍스트만 있는 환경에서 작업했습니다. 다른 경우에는 두 가지를 동시에 수행해야 하는 경우 (경쟁 조건과 같은) 가 있었지만, AI 는 엄격하게 한 단계씩만 작업했습니다.

B. "뇌 안개" 문제 (인지적 한계)
때로는 AI 가 모든 도구를 가지고 있지만, 논리를 전혀 "이해"하지 못하는 경우입니다.

  • 비유: 깨진 창문을 찾는 데 탁월한 탐정 (기술적 해킹) 은 배송 기사에게 화가 난 주인이 뒷문을 열어두었다는 사실 (비즈니스 로직) 을 완전히 놓치는 상황을 상상해 보세요.
  • 예시:
    • 비즈니스 로직 결함: AI 는 웹사이트 작동 방식의 이야기를 이해하지 못해 속일 수 없었습니다.
    • 긴 연쇄: 20 단계가 필요한 작업에서 20 단계가 1 단계에 의존하는 경우, AI 는 혼란을 겪고 끝에 도달할 때쯤이면 이야기의 시작을 잊어버렸습니다.
    • 맹목적인 추측: 일부 복잡한 퍼즐의 경우, AI 는 생각해보는 대신 시간이 다 날 때까지 무작위로 계속 시도했습니다.

4. 결론

이 논문은 AI 에이전트가 나아지고 있지만, 아직 '인간 수준'에는 미치지 못한다고 결론지었습니다.

  • 좋은 소식: AI 에게 명확한 계획과 팀 구조 (전략가 + 탐정 + 비평가) 를 주면 매우 효율적이고 일관되게 작동합니다.
  • 나쁜 소식: '유리 천장'이 존재합니다. 맞춤형 팀을 사용하든 범용 AI 를 사용하든, 모두 같은 지점 (30 개 중 19 개) 에서 멈춥니다.
  • 실제 병목 현상: 주요 문제는 AI 가 계획을 수행하는 방식이 아니라, AI 가 종종 처음에 올바른 유형의 문제를 인식하지 못한다는 점입니다. 일단 AI 가 취약점을 올바르게 식별하면 보통 해결하는 데 능숙합니다. 하지만 무엇이 문제인지 파악하지 못하면 시작조차 할 수 없습니다.

요약하자면: AI 는 매우 효율적인 노동자이지만, 여전히 어떤 일이 실제로 필요한지 알려줄 인간이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →