← 최신 논문
💻 computer science

Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense

이 논문은 공공의 교차 벤더 평가 데이터에 존재하는 결정적인 격차를 메우기 위해, 정적이고(frozen) 총체적이며 쿼리가 가능한 보안 환경과 정답(ground-truth)을 제공함으로써 기업 사이버 방어를 위한 자율형 AI 에이전트를 평가하고 신뢰를 구축하도록 설계된 새로운 프레임워크인 Open Security Benchmark(OSB)를 소개한다.

원저자: Gal Engelberg, Michael Arenzon, Leon Goldberg

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gal Engelberg, Michael Arenzon, Leon Goldberg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 명령을 따르는 것을 넘어, 나쁜 놈들이 침입하기 전에 거대하고 무질서한 사무실 건물에서 보안 허점을 찾아내는 주니어 탐정처럼 행동하는 세상을 상상해 보십시오. 이것이 바로 '자율 사이버 방어(autonomous cyber defense)'의 꿈입니다. 여기서 AI 에이전트는 조직의 디지털 상태를 끊임없이 스캔합니다. 누가 서버실 열쇠를 가지고 있는지, 어떤 소프트웨어가 구식인지, 그리고 누군가 몰래 돌아다니고 있지는 않은지 확인하는 식입니다. 하지만 여기에는 함정이 있습니다. 탐정이 신뢰를 얻으려면, 그들이 실제로 사건을 해결하고 있는 것인지 아니 else면 그저 추측만 하고 있는 것인지 알아야 합니다. 현재 큰 문제가 하나 있습니다. 실제 기업 데이터는 기밀이기 때문에, 연구자들이 이러한 AI 탐정들을 동일한 복잡하고 실제적인 시나리오에서 테스트할 수 없다는 점입니다. 이는 마치 조종사에게 실제 폭풍 속에서 조종간을 한 번도 잡아보게 하지 않고, 오직 구름 사진만을 보여주며 비행법을 가르치려는 것과 같습니다. 공유된 공정한 테스트 환경 없이는, 이 AI 에이전트들이 우리를 구하기 위해 준비된 것인지 아니면 그저 말을 지어내고 있는 것인지 알 방법이 없습니다.

이 논문은 **오픈 보안 벤치마크(Open Security Benchmark, OSB)**라고 불리는 솔루션을 소개합니다. 이는 본질적으로 이러한 AI 탐정들을 테스트하기 위해 특별히 구축된, 거대하고 동결된 가상의 '디지털 도시'입니다. 이것은 가짜 직원, 가짜 클라우드 서버, 가짜 비밀번호를 갖춘, 실제 기업과 똑같이 보이고 느껴지는 거대하고 변하지 않는 비디오 게임 레벨이라고 생각하면 됩니다. 저자들은 이론과 현실 사이의 간극을 메우기 위해 이 '도시'를 만들었습니다. 그들은 AI 에이전트에게 "지난달에 해고되었지만 여전히 회사의 기밀 파일에 접근 권한이 있는 직원을 모두 찾아라"와 같은 미스터리를 부여하는 프레임워크를 구축했습니다. 그리고 에이전트는 두 가지 방법 중 하나를 사용하여 답을 찾아야 합니다. 즉, 거대한 데이터베이스를 검색하기 위해 특수 언어(SQL)로 쿼리를 작성하거나, AWS나 Google Workspace와 같은 실제 벤더 도구들을 클릭하며 돌아다니는 인간 운영자인 것처럼 행동하는 것입니다.

이 논문은 단순히 "보라, 우리가 게임을 만들었다"라고 말하는 데 그치지 않습니다. 저자들은 에이전트가 실행될 때마다 '그라운드 트루스(ground truth, 정답)'가 정확히 동일하게 유지되도록 환경을 동결함으로써, 이 에이전트들을 테스트하기 위한 엄격한 프레임워크를 제시합니다. 이를 통해 연구자들은 AI가 단순히 정답을 맞혔는지뿐만 아니라, 어떻게 그 답에 도달했는지까지 평가할 수 있습니다. 적절한 질문을 던졌는가? 서로 다른 시스템 간의 점들을 연결했는가? 이 연구는 합성된 가짜 조직들을 통해 이 프레임워크를 구현하며, 이를 통해 다양한 규모의 기업(75명 규모의 소규모 팀부터 2,000명의 직원을 가진 대기업까지)에 걸친 테스트를 가능하게 합니다. 이 프레임워크는 AI 에이전트가 실제 세계의 복잡한 과업, 예를 들어 인사 기록을 서로 다른 벤더를 사용하는 클라우드 계정과 연결하는 작업(단일 벤더 도구로는 매우 어려운 작업임)을 처리할 수 있는지 밝혀내도록 설계되었습니다.

결정적으로, 이 논문은 AI 에이전트가 자신감 넘치는 답변을 내놓는다고 해서 그들을 신뢰할 수 없다고 주장합니다. 저자들은 이러한 에이전트들을 고립된 상태에서 혹은 작고 깨끗한 데이터셋만으로 평가하는 아이디어를 명시적으로 배제하며, 공정하기 위해서는 환경이 반드시 "동결"되어야 하고 여러 벤더를 가로질러야 한다고 강조합니다. 그들은 AI가 사이버 방어를 해결했다고 주장하는 것이 아닙니다. 대신, 이 벤치마크가 진보를 측정하기 위한 필수적인 도구라고 제안하며, "이 AI는 안전한가?"라는 모호한 질문을 구체적인 성적표로 바꾸고자 합니다. 공유되고 재현 가능한 목표를 제공함으로써, OSB는 이 분야를 추측의 영역에서 측정의 영역으로 옮겨, 우리가 마침내 우리의 실제 디지털 도시에서 AI 에이전트에게 운전대를 맡길 때 그들이 정확히 어떻게 수행할지를 알 수 있도록 하는 것을 목표로 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →