From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs
이 논문은 사이버 위협 인텔리전스 보고书中的 지표를 정규식으로 자동 변환하여 보안 운영을 효율화하는 'IOCRegex-gen' 시스템을 제안하고, MITRE ATT&CK 평가 프레임워크 기반 실험을 통해 높은 정확도와 낮은 오탐지율을 입증했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🕵️♂️ 배경: 왜 이 연구가 필요한가요?
1. 상황: 범인 (해커) 에 대한 보고서가 쏟아집니다.
사이버 보안 회사들은 매일 수백 장의 '위협 보고서 (CTI)'를 냅니다. 이 보고서에는 해커가 쓴 악성 파일 이름, 컴퓨터의 특정 폴더 경로, 명령어 같은 **'범인 단서 (IOC)'**가 적혀 있습니다.
2. 문제: 단서만으로는 범인을 잡을 수 없습니다.
보고서에 적힌 단서가 "범인은 C:\Users\Public\11.bat 파일을 실행했다"고 했다고 칩시다.
하지만 실제 컴퓨터 로그를 검색할 때는 다음과 같은 변형이 있을 수 있습니다.
C:\Users\Public\12.bat(파일 이름이 바뀜)c:\users\public\11.bat(대소문자가 다름)C:\Users\Public\11.bat(경로가 조금 다름)
단순히 "11.bat"이라고 딱 맞춰서 검색하면, 변형된 파일들은 다 놓쳐버리게 됩니다.
3. 해결책: '정교한 수색 명령어 (Regex)'가 필요합니다.
보안 전문가들은 이 단서들을 **"정규식 (Regex)"**이라는 복잡한 수색 명령어로 바꿔야 합니다.
예를 들어, .*Public\\.*\.bat 처럼 "Public 폴더 안에 있는 .bat 파일은 뭐든 다 잡아라"라고 명령을 내리는 거죠.
- 하지만: 이 정규식을 만드는 건 매우 어렵고 지루한 일입니다. 사람이 일일이 손으로 짜야 하니까 시간이 너무 오래 걸리고, 실수도 많이 나옵니다.
🤖 이 논문이 제안한 해결책: "IOCRegex-gen"
이 연구팀은 **AI(대형 언어 모델, LLM)**를 이용해 이 귀찮고 어려운 작업을 완전 자동화하는 시스템을 만들었습니다. 이름은 IOCRegex-gen입니다.
이 시스템은 마치 현명한 수사관 보조처럼 작동합니다.
1. 단계 1: "무엇을 고정하고, 무엇을 변형으로 볼까?" (Capture Group Finding)
범인 단서 (IOC) 를 분석할 때, AI 는 두 가지로 나눕니다.
- 고정된 부분 (Capture Group): 해커가 변하지 않는 시스템 기본 경로 (예:
C:\Windows\System32\). 이건 수색의 핵심입니다. - 변하는 부분 (Non-Capture Group): 해커가 임의로 바꿀 수 있는 파일 이름이나 날짜 (예:
11.bat,20240101). 이건 유연하게 잡아야 합니다.
비유: 범인이 "서울시 강남구 OO 빌딩에서 OO라는 옷을 입고 도망쳤다"고 했을 때, AI 는 "서울시 강남구"와 "OO 빌딩"은 고정된 단서로, "OO"라는 옷은 어떤 옷이든 될 수 있는 변형 단서로 구분합니다.
이전 AI 들은 이 구분을 잘 못해서 "옷"까지 고정시켜서 범인을 놓치거나, 반대로 너무 넓은 범위로 잡아서 엉뚱한 사람을 잡는 실수를 했습니다. 이 시스템은 지식 데이터베이스를 활용해 이 구분을 아주 정확하게 합니다.
2. 단계 2: "실수하지 않고 명령어를 다듬기" (Iterative Reasoning)
AI 가 처음에 만든 수색 명령어 (정규식) 는 종종 문법 오류가 있거나, 너무 광범위해서 "전 세계 모든 파일"을 다 잡는 식으로 엉뚱한 명령어가 나오기도 합니다.
이 시스템은 스스로를 검증하는 과정을 거칩니다.
- AI 가 명령어를 만듭니다.
- **디버거 (검사관)**가 "이 명령어는 문법 오류가 있네?" 또는 "이 명령어는 너무 광범위해서 엉뚱한 파일까지 다 잡네?"라고 지적합니다.
- AI 는 지적을 듣고 명령어를 다시 고칩니다.
- 10 번 이상을 반복해서 완벽한 명령어가 나올 때까지 고쳐냅니다.
비유: 마치 요리사가 요리를 만들고, 셰프가 "소금이 너무 많네, 다시 해봐"라고 지적하면, 요리사가 다시 맛을 보고 고치는 과정을 반복해서 완벽한 요리를 만드는 것과 같습니다.
🏆 결과: 얼마나 잘 작동하나요?
이 시스템은 실제 해킹 사례 3,000 건 이상과 MITRE ATT&CK(사이버 보안 평가 기관) 의 데이터를 가지고 테스트했습니다.
- 정확도 (Hit Rate): 실제 범인 흔적을 **99.1%**나 찾아냈습니다. (기존 방식보다 훨씬 좋음)
- 오류 (False Positive): 엉뚱한 사람을 범인으로 오인하는 경우는 **0.8%**밖에 안 되었습니다.
- 효율: 사람이 수시간 걸려서 만들던 작업을 AI 가 순식간에 해냈습니다.
💡 한 줄 요약
**"AI 가 해커 보고서의 단서를 읽고, 사람이 수작업으로 하던 복잡한 '수색 명령어'를 스스로 만들어내어, 보안팀이 해커를 훨씬 빠르고 정확하게 잡을 수 있게 도와주는 시스템"**입니다.
이 기술이 도입되면, 보안 전문가들은 더 이상 지루한 명령어 작성을 하느라 밤을 새지 않아도 되고, AI 가 만든 정교한 명령어로 실시간으로 해커를 막아낼 수 있게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.