← 최신 논문
🤖 AI

AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges

이 논문은 현실적인 웹 익스플로잇 및 포스트 익스플로잇 시나리오 전반에 걸쳐 프런티어 AI 시스템의 자율적 공격 능력을 벤치마킹하기 위해 설계된 개방형 멀티 호스트 인프라인 AgentCyberRange를 소개하며, 현재의 모델들이 제한적인 성공을 보이고 있음에도 불구하고 현실적인 조건 하에서 여전히 알려지지 않은 취약점을 발견하고 방어를 우회할 수 있음을 밝히고 있습니다.

원저자: Fengyu Liu, Jiarun Dai, Yihe Fan, Wuyuao Mai, Ziao Li, Bofei Chen, Jie Zhang, Zheng Lou, Bocheng Xiang, Qiyi Zhang, Xudong Pan, Geng Hong, Yuan Zhang, Min Yang

게시일 2026-06-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fengyu Liu, Jiarun Dai, Yihe Fan, Wuyuao Mai, Ziao Li, Bofei Chen, Jie Zhang, Zheng Lou, Bocheng Xiang, Qiyi Zhang, Xudong Pan, Geng Hong, Yuan Zhang, Min Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 요약: "디지털 도조(Digital Dojo)"에서 AI를 테스트하다

새롭고 매우 똑똑한 로봇이 위험한지 알고 싶다고 가정해 봅시다. 단순히 로봇에게 "너 위험하니?"라고 물어볼 수는 없습니다. 로봇이 거짓말을 할 수도 있기 때문입니다. 그렇다고 수학 시험을 치르게 할 수도 없습니다. 수학을 잘한다고 해서 집 안으로 침입할 수 있는 것은 아니니까요.

이 로봇이 정말로 문제를 일으킬 수 있는지 알기 위해서는, 실제 도둑처럼 침입을 시도해야 하는 가상 마을(즉, "사이버 레인지")에 로봇을 넣어두어야 합니다.

이 논문은 바로 그 역할을 하는 AGENTCYBERRANGE를 소개합니다. 이것은 세계에서 가장 똑똑한 AI 시스템들이 얼마나 현실적인 사이버 공격을 수행할 수 있는지 테스트하기 위해 설계된 거대하고 오픈 소스인 "디지털 도조"입니다.

문제점: "비디오 게임" vs "현실 세계"

이 논문이 나오기 전까지 AI 보안을 테스트하는 것은 한 번에 하나의 퍼즐만 풀면 되는 비디오 게임을 하는 것과 같았습니다.

  • 기존의 테스트: "여기에 잠긴 문이 있습니다. 자물쇠를 따보세요." (이를 '취약점 재현(Vulnerability Reproduction)'이라고 합니다).
  • 현실: 실제 해커는 단순히 자물쇠 하나만 따는 것이 아닙니다. 해커는 먼저 뒷문을 찾기 위해 동네를 돌아다니고, 몰래 침입한 뒤, 복도에서 마스터 키를 찾아내고, 모든 방의 문을 여는 과정을 거칩니다.

저자들은 이전의 테스트들이 너무 단순하다고 주장합니다. 기존 테스트들은 "문을 찾는 것"에서부터 "집 전체를 장악하는 것"까지 점과 점을 연결하는 AI의 능력을 제대로 테스트하지 못했습니다.

해결책: 2단계 강도질

AGENTCYBERRANGE 벤치마크는 실제 강도질을 모방하여 AI에게 두 가지 주요 과제를 부여합니다.

  1. 웹 익스플로잇 (앞문 뚫기): AI는 실제 웹사이트(은행이나 블로그 등)를 살펴보고 숨겨진 뒷문이나 약한 창문을 찾아내야 합니다. AI는 알려주지 않아도 어디를 살펴봐야 할지 스스로 알아내야 합니다.
  2. 포스트 익스플로잇 (내부 침투): 일단 하나의 문을 통해 들어온 AI는 그 상태를 유지해야 합니다. "루트(Root, 관리자 권한)"를 얻기 위해 사다리를 타고 올라가야 하고, 보안 요원(백신 프로그램)을 몰래 지나쳐야 하며, 네트워크 전체를 제어할 때까지 한 컴퓨터에서 다른 컴퓨터로 이동해야 합니다.

이 과정이 공정하고 반복 가능하도록, 그들은 CAGE라는 도구를 만들었습니다. CAGE는 심판이자 무대 감독이라고 생각하면 됩니다. CAGE는 가짜 집들을 설정하고, AI 로봇들이 실행되도록 하며, 그들이 무엇을 하는지 관찰하고, 그들이 실제로 성공했는지 아니면 단순히 운이 좋았던 것인지를 자동으로 확인합니다.

실험: 누가 최고의 도둑인가?

연구진은 세계에서 가장 진보된 6개의 AI 시스템(GPT, Claude 등의 버전 포함)을 이 디지털 도조에서 테스트했습니다. 그들은 AI에게 침입을 시도할 수 있는 "예산"(단계 제한 시간과 같은 개념)을 주었습니다.

결과:

  • 승자: 코딩 도구인 Codex와 결합된 AI 시스템 GPT-5.5가 가장 뛰어났습니다.
  • 점수: 가장 뛰어난 AI조차 "앞문 뚫기" 과제에서는 약 16%, "내부 침투" 과제에서는 약 **32%**의 성공률을 보였습니다.
  • 시사점: 이 AI들은 무서워질 정도로 똑똑해지고 있습니다. 이들은 단순히 퍼즐을 푸는 것이 아니라, 실제로 실제 소프트웨어에 침입하고 네트워크를 통해 이동하고 있습니다. 하지만 아직 완벽하거나 신뢰할 수 있는 해커가 되기에는 갈 길이 멉니다. 이들은 종종 길을 잃거나, 숨겨진 문을 놓치거나, 보안 알람에 걸리기도 합니다.

"놀라운" 발견들

논문은 원래의 테스트 계획에는 없었던 두 가지 흥สนใจ로운 사실을 발견했습니다.

  1. 새로운 비밀을 찾아냄: 테스트 웹사이트를 해킹하는 동안, AI들은 심지어 인간 개발자들도 아직 모르고 있었던 유명 소프트웨어의 **새로운 미지의 취약점(Zero-days)**을 우연히 발견했습니다.
  2. 적응력: 테스트 환경이 그들을 막으려고 할 때(예: 백신 프로그램), AI들은 때때로 방어를 우회하기 위해 자신들의 "도구"나 "방법"을 변경했습니다. 이는 그들이 임기응변으로 생각할 수 있음을 보여줍니다.

결론: 우리에게는 새로운 거울이 필요합니다

저자들은 우리가 더 이상 AI를 단순한 퍼즐로만 테스트해서는 안 된다고 결론짓습니다. AI 시스템이 복잡한 공격을 연쇄적으로 수행하는 능력(문 찾기, 침입하기, 장악하기)을 보이기 시작했기 때문에, 우리는 AGENTCYBERRANGE와 같은 현실적이고 끝에서 끝까지 이어지는(end-to-end) 테스트 환경이 필요합니다.

우리는 안전하고 통제된 "도조" 안에서 그들이 정확히 어떻게 실패하고 어떻게 성공하는지를 목격해야 하며, 그래야만 실제 세상에서 사용되기 전에 그 위험을 이해할 수 있습니다. 이 논문은 비록 이 AI들이 강력하지만 아직 "신뢰할 수 있는" 공격자는 아니라고 강조하면서도, 그 잠재력이 빠르게 성장하고 있으므로 주의 깊게 지켜봐야 한다고 말합니다.

요약하자면: 이 논문은 초지능 AI가 인간처럼 해킹할 수 있는지 테스트하기 위해 현실적인 시뮬레이션을 구축했습니다. 연구 결과, 가장 똑똑한 AI들은 이미 실제 시스템에 침입하고 구멍을 찾아낼 수 있지만, 여전히 많은 실수를 저지른다는 것을 발견했습니다. 우리의 디지털 세상을 안전하게 지키기 위해서는 이러한 테스트가 반드시 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →