← 최신 논문
🤖 AI

CTIConnect: A Benchmark for Retrieval-Augmented LLMs over Heterogeneous Cyber Threat Intelligence

이 논문은 9가지의 이질적인 사이버 위협 인텔리전스(CTI) 태스크에 걸쳐 검색 증강 LLM을 체계적으로 평가하기 위해 설계된 종합적인 벤치마크 및 평가 하네스트인 CTIConnect를 소개하며, 효과적인 성능을 위해서는 일반적인 검색 개선보다는 도메인 특화된 구조적 개입이 필요함을 밝힌다.

원저자: Yutong Cheng, Yang Liu, Changze Li, Dawn Song, Peng Gao

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yutong Cheng, Yang Liu, Changze Li, Dawn Song, Peng Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 복잡한 범죄를 해결하려는 사이버 보안 탐정이라고 상상해 보십시오. 당신에게는 방대한 단서의 도서관이 있지만, 이 단서들은 완전히 다른 다섯 가지 언어와 형식으로 작성되어 있습니다. 어떤 것들은 엄격하고 기술적인 스프레드시트(예: 소프트웨어 버그 데이터베이스) 형태인 반면, 어떤 것들은 서로 다른 기자들이 작성한 길고 어수선한 뉴스 기사이며, 그 안에는 범죄자들을 지칭하는 은어나 별명이 섞여 있습니다.

이것이 바로 **사이버 위협 인텔리전스(CTI)**의 세계입니다. 문제는 인간이 이 모든 정보를 읽고 점들을 연결하기에는 정보가 너무 많다는 것입니다.

여기에 **대규모 언어 모델(LLM)**이 등장합니다. 이 AI 모델들을 거의 무엇이든 읽고 이해할 수 있는 천재적이고 매우 빠른 탐정이라고 생각하십시오. 하지만 함정이 하나 있습니다. 이 AI들에게는 "메모리 제한"이 있다는 것입니다. 그들은 매일 쏟아져 나오는 새로운 위협 보고서를 모두 암기할 수 없습니다. 만약 최신 보고서를 아직 "읽지" 못했다면, 새로운 바이러스에 대한 질문을 받았을 때 잘못된 추측을 할 수도 있습니다.

이 문제를 해결하기 위해 우리는 **검색 증강 생성(RAG)**을 사용합니다. 이것은 마치 AI 탐정에게 마법의 도서관 카드를 쥐여주는 것과 같습니다. 질문을 받으면, AI는 먼저 도서관으로 달려가 가장 관련성이 높은 문서들을 가져온 다음, 방금 읽은 내용을 바탕으로 답변합니다.

문제점: "번역 오류"의 간극

이 논문의 저자들인 CTIConnect 팀은 단순히 AI에게 도서관 카드를 쥐여주는 것만으로는 충분하지 않다는 것을 발견했습니다. 도서관이 엉망진창이기 때문입니다.

  • 용어 불일치: 한 문서는 해커 그룹을 "APT29"라고 부르는 반면, 다른 문서는 "Cozy Bear"라고 부르고, 세 번째 문서는 "Nobelium"이라고 부를 수 있습니다. 만약 당신이 "APT29"에 대한 모든 보고서를 찾아달라고 요청한다면, 일반적인 검색은 다른 이름들로만 작성된 보고서들을 놓칠 수 있습니다.
  • 형식 불일치: 한 문서는 "공격자가 메모리에서 비밀번호를 훔쳤다"라고 말하는 반면, 기술적인 데이터베이스에는 이를 "T1003.001 – LSASS Memory"라고 나열할 수 있습니다. AI는 이 둘이 같은 것임을 깨닫지 못할 수 있습니다.

이 논문은 단순한 단어 유사성만을 찾는 표준 검색 도구들이 여기서 실패한다고 주장합니다. 이 도구들은 의미나 별명을 이해하지 못한 채 글자 그대로의 단어 대 단어 번역만 수행하는 번역가와 같습니다.

해결책: CTIConnect

연구팀은 AI 탐정이 이 엉망이고 다국어인 도서관을 얼마나 잘 검색할 수 있는지 확인하기 위해 CTIConnect라는 새로운 벤치마크(표준화된 테스트)를 구축했습니다.

그들은 세 가지 주요 유형의 탐정 업무를 다루는 1,860개의 전문가 검증 질문을 만들었습니다:

  1. 엔티티 연결 (점 연결하기):

    • 과업: "이 소프트웨어 버그(CVE)는 어떤 특정 취약점(CWE)에 의해 발생하는가?"
    • 비유: 특정 자동차 모델을 특정 엔진 유형과 매칭하는 것과 같습니다. AI는 두 개의 서로 다른 기술 카탈로그 사이를 번역해야 합니다.
    • 해결책: AI는 검색하기 전에 질문을 데이터베이스가 사용하는 정확한 기술 용어로 "번역"해야 합니다.
  2. 엔티티 속성 부여 (범인 지목하기):

    • 과업: "'공격자가 .cuba 확장자로 파일을 암호화했다'라는 보고가 있다. 이것은 어떤 구체적인 해킹 기술을 설명하는가?"
    • 비유: 목격자의 묘사("그는 빨간 모자를 쓰고 빠르게 달렸다")를 읽고 이를 경찰 파일("용의자: 존 도, 빠른 달리기기로 알려짐")과 매칭하는 것과 같습니다.
    • 해결책: AI는 문장을 작은 단위의 원자적 행동으로 분해하고, 각 행동을 공식 경찰 코드로 번역해야 합니다.
  3. 다중 문서 합성 (이야기 구성하기):

    • 과업: "다섯 개의 서로 다른 뉴스 매체 보고를 결합하여 해커 그룹 'APT29'의 프로필을 작성하라."
    • 비유: 다섯 명의 목격자가 동일한 파티에 대해 설명하고 있습니다. 한 명은 주최자를 "Bob"이라 부르고, 다른 한 명은 "Bobby", 또 다른 한 명은 "The Boss"라고 부릅니다. AI는 이들이 모두 동일 인물임을 깨닫고 이들의 이야기를 하나의 타임라인으로 합쳐야 합니다.
    • 해결책: AI는 본격적으로 읽기 전에 "Bob" = "Bobby" = "The Boss"임을 알아차릴 만큼 똑똑해야 합니다.

연구 결과

연구진은 이 새로운 테스트를 사용하여 10가지의 서로 다른 AI 모델(오픈 소스 및 유료 모델 모두 포함)을 테스트했습니다. 주요 발견 사항은 다음과 같습니다:

  • 만능형은 없다: "하나의 방식이 모두에게 통하는" 검색 전략은 처참하게 실패했습니다. 기술적 버그를 검색하는 데 가장 좋은 방법(엔티티 연결)은 해커의 별명을 검색하는 데 가장 좋은 방법(다중 문서 합성)과 완전히 다릅니다.
  • 특화된 도구가 승리한다: AI에게 특화된 전략(예: "질문을 먼저 번역하기" 또는 "문장을 부분으로 나누기")을 제공했을 때, AI의 성능은 극적으로 향상되었습니다. 때로는 **35%**까지 상승했습니다. 반면 표준 검색 도구는 성능을 아주 조금(1~5%)만 개선했습니다.
  • 병목 현상의 이동:
    • 기술적 연결 과업의 경우, 문제는 검색 도구였습니다. AI가 올바른 문서를 찾기만 하면, 훨씬 "작은" AI라도 정확하게 답할 수 있었습니다.
    • 이름 지정 및 이야기 구성 과업의 경우, 문제는 AI의 두뇌였습니다. 올바른 문서가 있더라도, 맥락을 이해하고 별칭들을 연결하기 위해서는 AI가 매우 똑똑해야 했습니다.
  • 더 큰 뇌보다 스마트한 검색 >: 일부 과업에서는 특화된 검색 도구를 사용하는 "작은" AI가 "거대하고 비싼" AI를 사용하는 것보다 더 나은 성능을 보였습니다. 이는 항상 가장 비싼 AI가 필요한 것이 아니라, 정보를 찾는 올바른 방법이 필요하다는 것을 의미합니다.

결론

이 논문은 효과적인 AI 보안 도구를 구축하기 위해서 단순히 더 큰 AI 모델이나 일반적인 검색 엔진에만 의존해서는 안 된다고 결론짓습니다. 우리는 사이버 보안 세계의 독특한 "방언"과 "별명"을 이해하는 특화된 검색 시스템을 구축해야 합니다.

이렇게 생각하십시오. 범죄를 해결하기 위해 더 큰 도서관이 필요한 것이 아닙니다. 제목이 당신이 구사하지 못하는 코드로 쓰여 있더라도, 정확히 어떤 책을 찾아야 하는지 아는 사서가 필요한 것입니다. CTIConnect는 그 사서를 만들기 위한 지도와 테스트를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →