Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations
이 논문은 리눅스 및 윈도우 시스템에 걸친 50개 이상의 보안 시나리오를 아우르는 종합적인 벤치마크 데이터셋인 AuditBench를 소개하며, 이를 통해 네 가지 핵심 사고 대응 작업에 걸쳐 다섯 가지 최첨단 거대언어모델(LLM)의 성능, 오류 프로필 및 설명 능력을 평가하고 분석한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 북적이는 도시의 보안 책임자라고 상상해 보십시오. 매일 수천 대의 카메라와 센서(이를 **감사 로그(audit logs)**라고 부릅니다)가 모든 발걸음, 문 열림, 자동차 엔진 시동 소리를 기록합니다. 대부분의 시간 동안 사람들은 그저 출근을 하거나 식료품을 사러 가는 중입니다(정상 활동). 하지만 가끔은 도둑이 몰래 침입하여 자물쇠를 따거나 금고를 훔치기도 합니다(공격).
문제는? 도시가 생성하는 데이터가 너무 방대해서 인간 보안 요원들이 그 모든 것을 지켜볼 수 없다는 점입니다. 그들은 너무 많은 가짜 알람에 압도당하거나, 소음 속에서 실제 범죄를 놓치기도 합니다.
여기에 **대규모 언어 모델(LLM)**이 등장합니다. 이들을 아주 똑똑하고 지치지 않는 '탐정 인턴'이라고 생각하십시오. 이들은 초 단위로 수백만 페이지의 로그를 읽을 수 있습니다. 하지만 이들을 고용하기 전에, 우리는 알아야 합니다. 그들이 실제로 범죄를 해결하는 데 능숙한가, 아니면 그저 공황 상태에 빠져 무고한 사람을 범인으로 몰아세우는가?
이 논문은 이 AI 탐정들이 보안 로그를 조사하는 능력을 테스트하기 위해 설계된 특별한 "기말고사"인 AuditBench를 소개합니다.
시험: AuditBench
연구진은 51가지의 서로 다른 시나리오로 구성된 테스트 세트를 구축했습니다.
- "교실" (실험실 데이터): 해커가 파일을 훔치는 것부터 일반 사용자가 단순히 소프트웨어를 설치하는 것까지 모든 상황을 시뮬레이션하여, 가상 컴퓨터 위에 25개의 가짜 시나리오를 만들었습니다.
- "실제 세상" (OpTC 데이터): 이미 알려진 "정답(ground truth)"이 포함된 거대한 실제 세계 데이터셋(DAR�A OpTC)에서 26개의 복잡한 시나리오를 가져왔습니다.
이 시험은 탐정의 체크리스트처럼 네 가지 주요 과제로 구성되었습니다:
- 트리아지/선별 (분류): "이 경보는 실제 범죄인가, 아니면 가짜 알람인가?"
- 은신처 (지속성): "범인이 시스템에 영구적으로 머물기 위해 비밀 백도어를 설치했는가?"
- 탈출 경로 (측면 이동): "범인이 감염을 퍼뜨리기 위해 한 컴퓨터에서 다른 컴퓨터로 넘어갔는가?"
- 강도질 (데이터 유출): "범인이 민감한 파일을 훔쳐서 외부로 보냈는가?"
결과: AI가 맞힌 것 (그리고 틀린 것)
연구진은 다섯 가지 최상위 AI 모델(GPT-5 및 Gemini 2.5 Pro와 같은 거물급 모델 포함)을 대상으로 이 시험을 치르게 했습니다. 연구 결과를 일상적인 용어로 번역하면 다음과 같습니다.
1. "편집증적인 탐정" 문제
대부분의 AI 탐정들은 지나치게 의심스러워했습니다. 마치 어떤 사람이 가방을 들고 있는 것을 보고 즉시 폭탄이라고 단정 짓는 보안 요원과 같았습니다.
- 결과: AI들은 "강도질(데이터 유출)"을 포착하는 데는 뛰어났지만, 무고한 사람들을 무시하는 데는 서툴렀습니다. 그들은 엄청난 양의 정상 활동을 "공격"으로 분류하여 가짜 알람의 홍수를 만들어냈습니다.
2. 크다고 항상 더 좋은 것은 아니다
당신은 가장 크고 비싼 AI 모델이 최고의 탐정이 될 것이라고 생각할지도 모릅니다. 놀랍게도, 항상 그렇지는 않았습니다.
- 결과: 때때로 더 작고 저렴한 모델들이 거대한 모델들만큼, 혹은 그보다 더 나은 성능을 보여주었습니다. 이 특정 작업에서는 반드시 슈퍼컴퓨터가 필요한 것이 아니라, 똑똑하고 압축된 모델만으로도 충분할 수 있다는 것이 밝혀졌습니다.
3. 로그의 언어가 중요하다
연구진은 두 가지 방식으로 AI에게 로그를 입력했습니다:
- 원시 로그 (Raw Logs): 일어난 모든 일의 편집되지 않은 가공되지 않은 기록 (마치 혼란스러운 방의 생생한 오디오 녹음과 같습니다).
- 엣지 표현 (Edge Representation): 이벤트 간의 연결 관계를 강조하여 정리하고 요약한 버전 (마치 용의자들을 선으로 연결한 탐정의 화이트보드와 같습니다).
- 결과: 일부 모델의 경우, "정리된" 버전이 그들을 훨씬 더 똑똑하고 빠르게 만들었습니다. 다른 모델들에게는 원시 데이터가 적절했습니다. 이는 모델의 "학습 스타일"에 따라 다릅니다.
4. "프롬프트"는 설명서이다
AI에게 질문을 던지는 방식이 답변을 바꿉니다. 연구진은 지시사항(프롬프트)을 작성하는 두 가지 방법을 시도했습니다.
- 결과: 한 AI 탐정을 천재로 만드는 프롬프트가 다른 AI를 서투르게 만들 수도 있습니다. 모든 AI에게 통용되는 "만능 설명서"는 없습니다. 사용하는 특정 AI에 맞춰 지시사항을 조정해야 합니다.
5. AI의 "추론"은 종종 훌륭했다
AI가 실제 공격을 올바르게 포착했을 때, 그 설명은 대개 매우 훌륭했습니다. AI는 범죄를 입증하는 정확한 파일이나 명령어를 지목할 수 있었습니다.
- 함정: 하지만 AI가 틀렸을 때(가짜 알람의 경우), 그 추론은 종종 이상한 이름이나 높은 빈도에 기반하고 있었습니다.
- 예시: 만약 파일 이름이
delete_logs.bat라면, AI는 그것이 단순한 시스템 정리 스크립트임에도 불구하고 증거를 숨기려는 범죄자의 행동이라고 가정했습니다. - 예시: 만약 어떤 프로그램이 1초에 1,000번 실행되었다면, AI는 그것이 정상적인 소프트웨어 업데이트임에도 불구하고 "수상하다!"라고 생각했습니다.
- 예시: 만약 파일 이름이
핵심 요점
이 논문은 "AI가 아직 보안 팀을 대체할 수 있다"라고 말하는 것이 아닙니다. 대신 이렇게 말합니다: "여기 AI가 이 업무를 얼마나 잘 수행하는지 측정할 수 있는 자(ruler)가 있으며, 피해야 할 함정들도 여기 있다."
- 보안 팀을 위해: 단순히 가장 비싼 AI를 구매하지 마십시오. 더 작은 모델들을 테스트하십시오. 가짜 알람을 만들어내는 "편집증적" 성향을 주의하십시오.
- AI 개발자를 위해: 모델이 크다고 해서 항상 더 나은 것은 아님을 명심하십시오. 최선의 결과를 얻으려면 데이터를 제공하는 방식(엣지 표현)을 바꾸거나 지시사항(프롬프트)을 미세하게 조정해야 할 수도 있습니다.
- 모두를 위해: AI는 강력한 도구이지만, 특히 AI가 무고한 사람들을 지나치게 의심할 때는 인간의 검토가 필요합니다.
연구진은 다른 사람들이 이 디지털 탐정들을 계속 테스트하고 개선할 수 있도록 모든 데이터, 코드, 그리고 시험 문제를 공개합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.