← 최신 논문
💻 computer science

Proactively Detecting Threats: A Novel Approach Using LLMs

이 논문은 비정형 웹 기반 위협 인텔리전스에서 침해 지표를 선제적으로 추출하기 위한 대규모 언어 모델의 첫 체계적인 평가를 제시하며, Gemini 1.5 Pro가 479개의 보고서 전반에 걸쳐 악성 위협을 식별하는 데 있어 완벽한 재현율과 높은 정밀도를 달성함을 입증한다.

원저자: Aniesh Chawla, Udbhav Prasad

게시일 2026-01-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aniesh Chawla, Udbhav Prasad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 거대한, 북적이는 도시라고 상상해 보세요. 이곳에는 나쁜 행위자들(해커)이 건물(여러분의 회사의 컴퓨터)에 침입하려고 끊임없이 시도하고 있습니다. 보통 보안 요원들은 도둑이 자물쇠를 따거나 창문을 부수는 것을 본 후에야 경찰을 부릅니다. 이것을 "반응형(reactive)" 보안이라고 합니다. 즉, 범죄가 발생하기를 기다리는 것이죠.

이 논문은 새로운 방식인 선제적(proactive) 보안을 제안합니다. 침입이 일어나기를 기다리는 대신, 범죄가 발생하기 전에 지역 신문, 가십 칼럼, 경찰 기록을 읽어 누가 나쁜 놈들이고 어떤 도구를 사용하는지에 대한 단서를 찾기 위해 "정찰병"을 보내고자 하는 것입니다.

다음은 연구진이 수행한 내용과 발견한 사실에 대한 간단한 요약입니다.

문제점: 너무 많은 소음, 너무 다양한 형식

이 도시의 "신문"은 온라인에 게시되는 수천 개의 사이버 보안 보고서입니다. 문제는 이 보고서들이 모두 서로 다르게 작성되어 있다는 점입니다. 어떤 보고서는 나쁜 컴퓨터 주소를 숫자로 나열하고, 다른 것은 링크로, 또 다른 것은 코드로 표시합니다. 이는 마치 어떤 레시피는 '컵'을 사용하고, 어떤 것은 '그램'을 사용하며, 어떤 것은 그냥 '한 꼬집'이라고 적혀 있는 요리책에서 특정 재료를 찾는 것과 같습니다.

이러한 혼란 때문에 보안 팀은 이 보고서들을 일일이 직접 읽으며 "침해 지표(Indicators of Compromise, IOC)"—즉, 나쁜 놈들의 디지털 지문(나쁜 IP 주소나 웹사이트 링크 등)—을 찾아내야 합니다.

해결책: AI "슈퍼 리더" 고용하기

저자들은 이 지저난 보고서들을 자동으로 수집하는 로봇 시스템을 구축했습니다. 그리고 이 작업을 인간 분석가의 역할 대신 수행하도록 6가지 유형의 대규모 언어 모델(LLM)—방대한 양의 텍스트를 학습하여 매우 똑똑해진 AI 독자들—에게 맡겼습니다.

그들은 AI에게 간단한 임무를 주었습니다: "이 웹페이지 전체를 읽으세요. 이 특정 정보(예: 웹사이트 링크 또는 IP 주소)가 해커가 공격을 계획 중이라는 단서인가요, 아니면 그저 일반적인 노이즈인가요?"

실험: "시승 테스트"

그들은 이 실험을 2,600개 이상의 단서가 포함된 479개의 웹페이지를 대상으로 테스트했습니다. 그들은 어떤 AI 모델이 최고의 "정찰병"인지 확인하고자 했습니다.

  • 목표: 실수로 무고한 것을 나쁘다고 표시하지 않으면서(높은 정밀도, High Precision), 모든 나쁜 단서를 잡아내는 것(높은 재현율, High Recall).
  • 경쟁자들: 그들은 구글(Gemini), 알리바바(Qwen), 메타(Llama)의 모델들을 테스트했습니다.

결과: 누가 경주에서 승리했나?

결과는 마치 공을 잡되(나쁜 단서), 공을 떨어뜨리지 않으면서도(무고한 데이터) 잔디에 걸려 넘어지지 않는(실수하지 않는) 스포츠 경기와 같습니다.

  1. 챔피언 (Gemini 1.5 Pro): 이 모델이 업무에 가장 뛰어났습니다. 실제 나쁜 단서를 100% 잡아냈습니다(완벽한 재현율). 또한 무엇이 나쁘지 않은지를 파악하는 능력도 뛰어나서 실수가 거의 없었습니다. 이는 도둑을 절대 놓치지 않으면서도, 무해한 배달원에게 "멈춰!"라고 외치는 일이 거의 없는 경비원과 같습니다.
  2. 고전한 모델 (Qwen 32B): 이 모델은 많은 나쁜 단서들을 놓쳤습니다. 마치 도둑이 옆을 지나가는데 하늘만 바라보느라 너무 바쁜 경비원과 같았습니다.
  3. 복합적인 결과 (Llama 70B): 이 모델은 (승자와 마찬가지로) 모든 나쁜 단서를 잡아냈지만, 다소 과하게 예민했습니다. 무고한 것들을 나쁜 것으로 분류하여 인간 보안 팀이 이를 분류하는 데 추가적인 업무를 만들었습니다.

함정: 왜 AI는 여전히 혼란스러워하는가?

최고의 AI조차 실수를 저질렀으며, 논문은 그 이유를 아주 좋은 비유를 통해 설명합니다: 맥락(Context)이 핵심입니다.

예를 들어, 뉴스 보고서에 *"빌런 'Darkside'가 'TrueSight' 건물 근처에서 목격되었다"*라고 적혀 있다고 가정해 봅시다.

  • 인간 분석가는 "Darkside"가 해커 그룹이고 "TrueSight"가 보안 도구라는 것을 알기에, 이것이 나쁜 이야기라는 것을 압니다.
  • AI는 때때로 혼란을 겪습니다. 만약 URL에 "Darkside"나 "abuse"라는 단어가 포함되어 있다면, AI는 그 웹사이트 자체가 악의적이라고 생각할 수 있습니다. 설령 그 웹사이트가 단지 해당 해커에 관한 파일을 호스팅하는 도서관 웹사이트일지라도 말입니다.

연구 결과, AI는 도메인 이름(웹사이트 주소)에서 가장 큰 어려움을 겪었습니다. AI는 나쁜 파일을 호스팅하는 웹사이트와 웹사이트 자체가 나쁜 것 사이의 차이를 잘 구분하지 못했습니다. 이는 경비원이 "피자" 간판을 보고, 누군가 그 피자집에서 피자를 주문했다는 이유만으로 그 피자집을 범죄 현장이라고 가정하는 것과 같습니다.

결론

이 논문은 AI가 지저분하고 구조화되지 않은 뉴스 보고서 속에서 해커의 단서를 선제적으로 찾아내는 강력한 도구가 될 수 있음을 증명하며, 이를 통해 보안 팀이 모든 단어를 수동으로 읽어야 하는 수고를 덜어줄 수 있음을 보여줍니다.

하지만 AI는 아직 완벽하지 않습니다. AI는 단순히 단서 자체를 보는 것이 아니라, 그 단서 뒤에 숨겨진 이야기를 이해하는 능력을 키워야 합니다. 저자들은 향-후 이 AI 정찰병들이 PDF를 읽고, 스크린샷을 보고, 훨씬 더 복잡한 유형의 위협을 이해할 수 있도록 교육되어 우리의 디지털 도시를 첫 번째 벽돌이 던져지기도 전에 더 안전하게 만들 수 있을 것이라고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →