← 최신 논문
💬 NLP

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

본 논문은 마이크로소프트 센티널 로그와 조사 그래프에서 7,542 개의 질문을 생성하여 사이버 위협 조사를 위한 LLM 에이전트를 평가하도록 설계된 최초의 벤치마크인 ExCyTIn-Bench 를 소개하며, 현재 최상위 모델들이 0.606 의 보상 점수만 달성하고 있음을 밝혀 향후 개선의 여지가 크다는 점을 강조합니다.

원저자: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

게시일 2026-05-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

ExCyTIn-Bench 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 제시합니다.

큰 그림: AI 탐정을 위한 새로운 "운전 면허 시험"

매우 똑똑하고 새로운 AI 로봇들이 대거 있다고 상상해 보세요. 이들이 사이버 보안 탐정이 될 만큼 충분한지 알고 싶다면 어떨까요? 산더미처럼 쌓인 지저분한 데이터를 살펴보고 나쁜 놈들을 찾아내며, 해킹 동안 정확히 무슨 일이 일어났는지 파악할 수 있을까요?

이 논문의 저자들은 이렇게 말합니다. "바이러스가 무엇인지 같은 사소한 질문을 하는 것만으로는 안 됩니다. 그런 질문은 그들의 기억력만 테스트할 뿐이니까요. 그들이 실제로 그 일을 해낼 수 있는지 확인해야 합니다."

그래서 그들은 ExCyTIn-Bench를 만들었습니다. 이를 AI 에이전트를 위한 고난이도 운전 면허 시험이라고 생각하세요. 자동차 대신 AI 가 디지털 범죄 현장에서 운전합니다. 시험 코스 대신 가짜 (하지만 현실적인) 보안 로그로 가득 찬 시뮬레이션된 회사의 컴퓨터 네트워크를 통과합니다.

시험을 어떻게 만들었는지 (범죄 현장)

시험을 공정하고 현실적으로 만들기 위해 연구자들은 단순히 임의의 질문을 만들어낸 것이 아니라, 세 단계로 시험을 구성했습니다.

  1. 범죄 현장 (데이터): 그들은 "Alpine Ski House"라는 가짜 Microsoft Azure 회사를 설정했습니다. 그리고 실제 세계에서 일어난 8 가지 사이버 공격 (랜섬웨어나 이메일 사기 등) 을 시뮬레이션했습니다. 경찰 보고서, 전화 기록, 보안 카메라 영상과 같은 수천 개의 항목이 포함된 57 개의 다양한 로그 테이블을 수집했습니다.
  2. 지도 (그래프): 인간 탐정이 수사를 할 때 모든 것을 한 번에 보지 않습니다. 그들은 흔적을 따라갑니다. 경보 A사용자 B로 이어지고, 이는 의심스러운 파일 C로 이어집니다. 연구자들은 이러한 흔적들을 **지도 (그래프)**로 변환했습니다.
    • 노드: 지도에는 '경보'(경찰 사이렌) 와 '개체'(관련된 사람이나 컴퓨터) 를 나타내는 점들이 있습니다.
    • 엣지: 이들을 연결하는 선들은 서로 어떻게 관련되어 있는지를 보여줍니다.
  3. 질문 (시험): 인간이 질문을 작성하는 대신, AI 가 이 지도를 보고 7,542 개의 질문을 생성하도록 했습니다.
    • 예시: "IP 주소 X 에서 의심스러운 로그인이 감지되었습니다. 지도에 따르면 해커가 비밀번호를 훔치기 위해 사용한 파일은 무엇입니까?"
    • AI 에이전트는 지도의 선을 따라 '운전'하며 데이터베이스를 조회하고 점들을 연결하여 답을 찾아야 합니다.

AI 가 시험을 보는 방법

AI 에이전트는 MySQL 데이터베이스 환경(거대한 서류 캐비닛) 에 배치됩니다. 캐비닛의 배치를 알지 못합니다. 따라서 다음과 같이 해야 합니다.

  1. 지도 요청: "어떤 테이블이 있나요?"
  2. 단서 읽기: "이 IP 주소에 대한 로그를 보여주세요."
  3. 점 연결: "알겠습니다. 그 IP 주소는 이 사용자와 연결되어 있군요. 그 사용자가 무엇을 했는지 확인해 보겠습니다."
  4. 답 제출: "해커는 ntdsutil.exe 파일을 사용했습니다."

AI 가 정답을 맞추면 점수를 얻습니다. 막히거나 잘못된 질문을 하면 점수가 낮아집니다. 시험은 AI 가 최종 답은 아니더라도 일부 단서를 찾으면 부분 점수를 주는 방식도 포함합니다. 마치 선생님이 풀이 과정을 보여준 학생에게 점수를 주는 것과 같습니다.

그들이 발견한 것 (결과)

연구자들은 이 시험에서 OpenAI, Google, Anthropic 같은 대기업의 다양한 AI 모델과 오픈소스 모델들을 테스트했습니다.

  • 어렵다: 가장 똑똑한 AI 모델조차도 어려움을 겪었습니다. 최고의 모델 (Claude-Opus-4.5) 은 1.0 점 만점에 0.606점만 받았습니다. 이는 여전히 개선의 여지가 많다는 것을 의미합니다.
  • '아하!' 순간: 가장 잘 수행한 AI 모델들은 단계별로 추론할 수 있는 모델들이었습니다. 그들은 단순히 추측하지 않았습니다. 데이터베이스를 탐색하고, 첫 번째 추측이 틀렸음을 깨닫고, 인간 탐정처럼 새로운 경로를 시도했습니다.
  • 오픈소스 vs 빅테크: 놀랍게도 일부 작은 오픈소스 모델이 거대하고 비싼 모델들과 거의 비슷한 성능을 보여, 격차가 좁혀지고 있음을 보여주었습니다.

왜 이것이 중요한가

이 논문은 이것이 동종 최초의 벤치마크라고 주장합니다. 이전에는 AI 가 사이버 보안 사실을 얼마나 잘 암기하는지 주로 테스트했습니다. 이제 우리는 AI 가 증거를 분류하고 복잡한 사건 연쇄를 추론하며 실제로 범죄를 수사할 수 있는지 테스트할 수 있는 방법을 갖게 되었습니다.

간단히 말해: 저자들은 AI 에이전트가 사이버 보안 조사관이 될 수 있는지 보기 위해 현실적인 "범죄 현장"과 일련의 "탐정 퍼즐"을 만들었습니다. 결과는 AI 가 점점 나아지고 있지만, 인간 보안 분석가를 대체하기까지는 아직 갈 길이 멀다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →