AsmRAG: LLM-Driven Malware Detection by Retrieving Functionally Similar Assembly Code
AsmRAG는 어셈블리 코드의 의미론적 임베딩과 검색 증강 생성(RAG) 기술을 활용하여, 난독화에 강하고 분석 근거를 명확히 제시할 수 있는 설명 가능한 악성코드 탐지 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🕵️♂️ 기존 방식의 문제점: "범인은 아닌 것 같은데, 느낌이 수상해!"
기존의 AI 악성코드 탐지기들은 마치 '경험 많은 탐정' 같지만, 치명적인 단점이 있습니다. 이 탐정들은 범인을 잡을 때 "이 녀석은 99% 확률로 범인입니다!"라고 말은 하지만, **"왜?"**라고 물으면 대답을 못 합니다.
게다가 범인들이 아주 영리해서, 옷을 갈아입거나(코드 변형), 가짜 가방을 들고 다니거나(불필요한 코드 삽입), 얼굴에 분장을 하면(난독화), 탐정은 "어? 내가 알던 범인 스타일이 아닌데?"라며 놓쳐버리곤 합니다. 즉, 겉모습(통계적 특징)에만 너무 의존하기 때문입니다.
💡 AsmRAG의 혁신: "겉모습이 아니라, '범죄 수법'을 기억한다!"
AsmRAG는 단순히 겉모습을 보는 게 아니라, 범인이 **'어떤 동작을 하는지(수법)'**를 꿰뚫어 보는 **'지능형 프로파일러'**입니다.
1. 🎭 "분장을 해도 수법은 못 속여" (의미론적 임베딩)
범인이 옷을 갈아입고(레지스터 변경), 신발을 바꿔 신어도(명령어 교체), "금고를 따는 손동작" 자체는 변하지 않습니다. AsmRAG는 코드의 겉모습(문법)이 아니라, 그 코드가 실제로 하는 **'행동의 의미(Semantics)'**를 숫자로 변환해서 기억합니다. 그래서 범인이 아무리 변장을 해도, "어? 이 손동작은 예전에 봤던 그 도둑놈 수법인데?"라고 알아차립니다.
2. 🔍 "증거를 직접 가져와 보여줄게" (RAG 기술)
기존 AI가 "범인인 것 같아요"라고 추측만 했다면, AsmRAG는 **"이 녀석이 범인인 이유는, 이 부분의 동작이 예전에 잡았던 'A 조직'의 금고 털기 수법과 똑같기 때문입니다!"**라고 말하며, 실제 범인의 과거 범죄 기록(코드 조각)을 증거물로 딱 제시합니다. 이것을 논문에서는 '검색 증강 생성(RAG)'이라고 부릅니다.
3. 🎯 "핵심 범죄 현장만 콕 집어내기" (앵커 함수)
악성코드는 마치 '평범한 시민들 사이에 숨어든 범죄자'와 같습니다. 악성코드는 자기가 안 들키려고 수많은 정상적인 코드(시민들)를 섞어 놓거든요. AsmRAG는 이 수많은 코드 중에서 **가장 결정적인 범죄 수법이 담긴 '핵심 코드(Anchor Function)'**를 귀신같이 찾아내어 집중 분석합니다.
🚀 요약하자면?
- 기존 AI: "이 파일은 96% 확률로 나쁜 놈입니다. (이유는 모름)" ➡️ 불안함
- AsmRAG: "이 파일은 나쁜 놈입니다. 왜냐하면 이 부분의 동작이 예전 'X 악성코드'의 암호 해독 수법과 95% 일치하기 때문입니다. 여기 증거(코드)를 보세요!" ➡️ 확신과 증거
결론적으로, AsmRAG는 악성코드가 아무리 겉모습을 바꿔도 그 '본질적인 행동 패턴'을 찾아내어, 보안 전문가들에게 명확한 '증거'와 함께 범인을 지목해 주는 아주 똑똑한 디지털 수사관입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.