Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports
이 논문은 인간이 주석을 달한 2,076개의 문장으로 구성된 데이터셋을 도입하고 7개의 오픈 소스 LLM을 평가함으로써 복잡한 비정형 사이버 위협 인텔리전스 보고서에 대한 멀티 레이블 ATT&CK 분류의 새로운 경험적 기준을 확립하며, 이 모델들은 파라미터 크기와 성능 사이의 양의 상관관계에도 불구하고 집합적으로 0.22라는 낮은 마이크로 평균 F1 점수를 기록하여 현재의 모델들이 프로덕션 등급의 배포에는 여전히 불충분함을 나타냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 혼란스러운 범죄자가 쓴 천 페이지 분량의 지저분한 일기(CTI 보고서)를 읽어야 하는 보안 요원이라고 상상해 보십시오. 이 일기는 단순히 "나는 차를 훔쳤다"라고 말하지 않습니다. 대신 "나는 자물쇠를 따고, 엔진에 불을 붙여 시동을 건 뒤, 은행으로 운전해서 가서 보안 카메라의 기록을 지웠다"라고 말합니다.
당신의 임무는 모든 문장을 읽고, 그 문장에 맞는 '범죄 코드'를 거대한 규칙집인 MITRE ATT&CK에서 찾아 태그를 다는 것입니다. 이 규칙집에는 가능한 모든 공격 방식에 대한 211개의 서로 다른 코드가 있습니다. 문제는 하나의 문장이 한 번에 여러 개의 범죄를 포함할 수 있으며, 언어가 매우 까다롭다는 점입니다.
오랫동안 컴퓨터는 이 작업에 서툴렀습니다. 마치 단순하고 짧은 메모만 읽을 수 있는 로봇과 같았습니다. 만약 메모가 복잡해지면 로봇은 혼란에 빠졌습니다.
그러다 **거대 언어 모델(LLM)**이 등장했습니다. 이들을 똑똑하고 박학다식한 인턴이라고 생각하십시오. 이들은 문맥과 뉘앙스를 이해할 수 있습니다. 사람들은 이 인턴들이 마침내 이 지저분한 일기를 읽고 범죄를 완벽하게 분류할 수 있기를 기대했습니다.
이 논문은 이 일곱 명의 오픈 소스 인턴들에 대한 성적표입니다. 연구자들은 이 AI 인턴들이 실제로 이 일을 할 준비가 되었는지, 아니면 여전히 경험이 부족한 상태인지 확인하고자 했습니다.
연구진이 수행한 내용과 발견한 점을 쉽게 설명해 드리겠습니다.
1. 테스트: "실전형" 시험
이전의 AI 인턴 테스트는 쉬운 단답형 질문(예: "범죄자가 열쇠를 사용했다." -> 태그: 자물쇠 따기)을 주는 것과 같았습니다.
연구진은 이 논문에서 "그것은 실제 상황이 아니다"라고 말했습니다. 그들은 더 어렵고 현실적인 시험을 만들었습니다:
- 인간 전문가들이 작성한 83개의 실제 지저한 보안 보고서를 가져왔습니다.
- 이를 2,076개의 개별 문장으로 나누었습니다.
- 인간 전문가들이 모든 문장에 대해 올바른 범죄 코드를 수동으로 태그했습니다. 어떤 문장은 코드가 없었고, 어떤 문장은 하나였으며, 어떤 문장은 한 번에 최대 9개의 코드를 포함하기도 했습니다!
- 이것이 AI를 채점하기 위한 "정답지(Ground Truth)"가 되었습니다.
2. 참가자
그들은 7개의 서로 다른 오픈 소스 AI 모델을 선정했습니다.
- 이 모델들을 다양한 크기의 학생이라고 생각하십시오. 어떤 모델은 작고(80억 개의 '뇌세포' 또는 파라미터), 어떤 모델은 거대합니다(2,360억 개).
- 그들은 다음과 같은 다양한 "모드"로 테스트했습니다:
- Zero-Shot (제로샷): 지시 사항만 전달함.
- Few-Shot (퓨샷): AI에게 먼저 공부할 수 있도록 몇 가지 예시를 제공함.
- Chain-of-Thought (생각의 사슬): AI에게 답변하기 전에 단계별로 "생각을 밖으로 내뱉도록" 요청함.
- Temperature (온도): AI의 "창의성" 조절 노브를 높이거나 낮춤 (0 = 엄격한 로봇, 0.5 = 약간 더 창의적임).
3. 결과: 인턴들은 아직 배우는 중입니다
결과는 다소 냉혹한 현실을 보여주었습니다.
- 점수: 가장 뛰어난 AI 모델조차 22%의 점수를 받았습니다 (100%가 만점인 척도 기준).
- 비유: 학생이 어려운 기말고사를 치르고 D-를 받은 것과 같습니다. 통과는 했지만, 대부분의 정답을 놓친 상태입니다.
- 크기가 중요하다 (대체로): 가장 크고 복잡한 모델들(이른바 "거인" 모델들)이 작은 모델들보다 일반적으로 더 나은 성적을 거두었습니다. 즉, "큰 뇌 = 약간 더 높은 점수"라는 명확한 상관관계가 있었습니다.
- "마법 같은" 설정들은 효과가 없었습니다:
- AI에게 예시를 주는 것(Few-Shot)은 별로 도움이 되지 않았습니다.
- AI에게 "단계별로 생각하라"고 요청하는 것(Chain-of-Thought)도 별로 도움이 되지 않았습니다.
- "창의성" 노브(Temperature)를 조절하는 것도 거의 차이를 만들지 못했습니다.
- 비유: 이는 학생에게 다른 색깔의 연필을 주거나 "더 열심히 해봐"라고 말하는 것과 같습니다. 만약 학생이 내용을 모른다면 점수는 변하지 않습니다.
4. 유일하게 도움이 된 것: "컨닝 페이퍼"
연구진은 마지막으로 한 가지를 더 시도했습니다. 그들은 검색 증강 생성(RAG) 설정을 제공했습니다.
- 비유: AI가 암기한 것에만 의존하는 대신, 시험을 치는 동안 옆에 두고 볼 수 있는 "오픈 북(공식 규칙집)"을 준 것입니다.
- 결과: 점수가 22%에서 32%로 뛰어올랐습니다.
- 이것이 가장 큰 개선점이었습니다. 이는 AI가 "멍청해서" 실패하는 것이 아니라, 현재의 규칙을 눈앞에 두고 있지 않기 때문에 실패한다는 것을 증명했습니다.
5. 무엇이 잘못되었나?
연구진은 AI가 저지른 실수를 분석했습니다:
- False Positives (가양성/오탐): AI가 "회피(evade)"라는 단어를 보고, 문장의 실제 내용과 상관없이 "하이재킹(Hijacking)"이라고 추측했습니다. 즉, 문맥을 이해하기보다 키워드에 기반해 짐작한 것입니다.
- False Negatives (가음성/미탐): AI가 "랜섬웨어 바이너리 스테이징(staging a ransomware binary)"이 사실은 특정 유형의 전송(transfer)이라는 것을 이해하지 못해 범죄를 놓쳤습니다. 깊은 문맥 이해가 부족했던 것입니다.
결론
이 논문은 현재의 오픈 소스 AI 모델들이 복잡한 사이버 위협을 분류하는 독자적인 보안 요원이 될 준비가 아직 되지 않았다고 결론짓습니다. 이들은 너무 부정확하여(22~32%의 점수), 인간의 도움 없이 실제 보안 센터에서 단독으로 신뢰받기 어렵습니다.
성능을 유의미하게 향고시킨 유일한 방법은 테스트 중에 공식 규칙집에 접근할 수 있도록 하는 것(RAG)이었습니다. 단순히 질문 방식을 바꾸거나(프롬프트) 모델을 더 크게 만드는 것은 핵심적인 문제를 해결하지 못했습니다.
요약하자면: AI 인턴들은 똑똑하지만, 현재로서는 너무 많은 오류를 범하고 있어 혼자 일하기에는 부적합합니다. 이들은 제대로 된 업무 수행을 위해 인간 감독자와 참조 매뉴얼이 반드시 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.