Benchmarking LLM-Assisted Blue Teaming via Standardized Threat Hunting
본 논문은 LLM 을 안내하기 위해 30 개의 작업과 9 개의 운영 모듈로 구성된 구조화되고 모듈화된 워크플로우로 블루 팀 위협 헌팅을 표준화하는 벤치마크 프레임워크인 CyberTeam 을 소개하며, 이 접근 방식이 개방형 추론 전략에 비해 위협 분석 성능을 크게 향상시킨다는 것을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
복잡한 범죄를 해결하려는 형사가 되어 보십시오. 여러분에게는 수백만 권의 책을 읽고 거의 모든 언어를 이해할 수 있는 천재적인 새로운 조수, 즉 인공지능 (AI) 이 있습니다. 하지만 이 AI 에게 단순히 "이 범죄를 저지른 범인을 찾아내고 막아라"라고만 말한다면, AI 는 혼란에 빠질 수 있습니다. 잘못된 범인을 지목하거나, 가짜 증거를捏造하거나, 실제로 작동하지 않는 해결책을 제안할 수도 있습니다.
이 논문은 이러한 AI 형사들이 더 잘 일할 수 있도록 돕는 새로운 도구인 CYBERTEAM을 소개합니다. 그 작동 원리를 간단히 설명하면 다음과 같습니다:
1. 문제: "개방형" 함정
과거에는 연구자들이 AI 모델에게 "이 로그를 분석하라"와 같은 프롬프트만 주어 사이버 보안 문제를 해결하도록 요청했습니다. 이는 형사에게 지저분한 서류 더미를 건네주며 "이걸 해결해라"라고 말하는 것과 같습니다.
- 문제점: AI 는 환각 (허위 사실 생성) 을 일으키거나, 중요한 단계를 건너뛰거나, 순서를 잘못 잡을 수 있습니다. 예를 들어, 어떤 바이러스가 감염되었는지 파악하기도 전에 컴퓨터에 패치를 적용하라고 제안할 수 있습니다.
- 현실: 실제 사이버 보안은 단일 질문이 아닙니다. 그것은 일련의 사건들입니다. 나쁜 사람을 찾아내고, 그들이 어떻게 이동했는지 이해하며, 얼마나 위험한지 판단한 다음에 그들을 막아야 합니다.
2. 해결책: "표준화된 워크플로우"
저자들은 AI 가 자유롭게 방황하지 않고 특정 경로를 따르도록 강제하는 엄격한 단계별 레시피와 같은 CYBERTEAM 을 구축했습니다.
이를 공장 조립 라인처럼 생각하십시오:
- 1 단계 (컨베이어 벨트): AI 는 "해커들의 이름을 찾아라"와 같은 특정 작업을 부여받습니다. 이 작업을 완료하기 전까지는 다음 단계로 이동할 수 없습니다.
- 2 단계 (전문 도구): AI 는 모든 것을 한 번에 "생각"하지 않습니다. 각 작업마다 특정 "도구" (이를 운영 모듈이라고 함) 를 사용합니다:
- NER (이름 찾기): 이름, 날짜, IP 주소만 찾는 도구입니다.
- REX (패턴 스캐너): 이메일 주소나 파일 해시와 같은 특정 코드만 찾는 도구입니다.
- RAG (도서관 사서): 답변하기 전에 최신 정보를 찾기 위해 실제 세계의 보안 데이터 도서관으로 가는 도구입니다.
- SUM (요약기): 길고 지루한 보고서를 짧고 명확한 불릿 포인트로 압축하는 도구입니다.
이러한 도구들을 체인처럼 연결함으로써 AI 는 체계적으로 행동하도록 강제됩니다. "이름 찾기"를 건너뛰고 바로 "해결책"으로 뛰어갈 수 없습니다.
3. 테스트: 현장 투입
연구자들은 MITRE 와 NIST 와 같은 출처의 45 만 개 이상의 실제 사이버 위협 사례를 포함한 방대한 도서관을 사용하여 이 새로운 "조립 라인"을 기존의 "자유 사고" 방식과 비교 테스트했습니다.
연구자들은 AI 에게 다음과 같은 30 가지 다른 작업을 수행하도록 요청했습니다:
- 공격자가 누구인지 식별하기.
- 그들이 시스템에 어떻게 침입했는지 파악하기.
- 위협의 긴급성을 결정하기.
- 공격을 막을 계획 작성하기.
4. 결과: 구조의 승리
결과는 명확했습니다: 구조화된 단계별 접근 방식 (CYBERTEAM) 이 자유 형식 접근 방식보다 훨씬 더 우수했습니다.
- 오류 감소: AI 는 순서대로 특정 도구를 사용해야 할 때 환각 (허위 사실) 을 훨씬 덜 일으켰습니다.
- 정확도 향상: 올바른 "플레이북" (공격 차단 계획) 을 찾고 올바른 소프트웨어 패치를 제안하는 데 훨씬 더 능했습니다.
- 이유: 논문은 AI 가 체인 오브 씽킹 (Chain-of-Thought) 과 같은 방법을 사용하여 자유롭게 "생각"하도록 허용했을 때, 종종 길을 잃거나 중요한 세부 사항을 놓쳤다고 밝혔습니다. 하지만 조립 라인을 따르도록 강제했을 때는 베테랑 전문가처럼 수행했습니다.
5. 함정: 노이즈의 중요성
논문은 또한 AI 에게 "노이즈"가 있거나 지저분한 데이터 (오타나 혼란스러운 표현이 포함된 보고서 등) 가 주어졌을 때 어떤 일이 발생하는지 테스트했습니다.
- 좋은 소식: AI 는 작은 오타 (예: 글자 누락) 정도는 잘 처리할 수 있었습니다.
- 나쁜 소식: 텍스트의 의미가 왜곡되거나 혼란스러울 경우 (의미론적 노이즈), 새로운 도구를 사용하더라도 AI 는 어려움을 겪었습니다. 이는 도구가 도움이 되지만, 인간이 작성한 보고서의 품질이 여전히 매우 중요함을 시사합니다.
요약
간단히 말해, 이 논문은 사이버 공격을 막기 위해 AI 를 유용하게 만들려면 AI 가 문제 해결을 위해 단순히 "대화"하도록 내버려 두어서는 안 된다고 주장합니다. 대신, AI 가 facts 를 수집한 다음 이를 분석하고 마지막으로 해결책을 제안하는 ** disciplined detective**처럼 행동하도록 강제하는 구조화된 모듈식 워크플로우를 구축해야 합니다. CYBERTEAM 은 바로 그 규율 있는 워크플로우를 구축하기 위한 청사진입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.