← 최신 논문
🤖 AI

CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence

본 논문은 결정론적 온톨로지 그래프와 스팬 기반(span-grounded) 보고서를 통해 사이버 위협 인텔리전스의 잠재적 구조를 구체화함으로써, 기존의 평면적 검색 기질과 비교하여 에이전트 기반 조사 성능과 효율성을 크게 향상시키는 에이전트 네이티브 코퍼스 스캐폴드인 CTIFoundry를 소개한다.

원저자: Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yutong Cheng, Changze Li, Qian Cui, Wei Ding, Lingzhi Wang, Yan Chen, Peng Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 세상에서 보안 전문가들은 누가 자신들을 공격하고 있는지, 그리고 어떻게 공격하는지에 대한 단서를 찾기 위해 끊임없이 추적합니다. 사이버 위협 인텔리전스라고 알려진 이 작업은 서로 다른 기업과 조직이 작성한 방대한 보고서 모음에 의존합니다. 수년 동안 이러한 보고서를 인공지능과 함께 사용하는 표준적인 방법은 이들을 정리되지 않은 책들이 가득한 도서관처럼 취급하는 것이었습니다. 컴퓨터 프로그램이 질문을 던지면, 시스템은 텍스트에서 가장 유사해 보이는 단어들을 검색하여 몇 페이지를 뽑아냅니다. 이 방식은 단순한 질문에는 잘 작동하지만, 여러 문서에 걸쳐 점들을 연결해야 하는 조사가 필요할 때는 어려움을 겪습니다. 하나의 해커 그룹이 세 개의 보고서에서 각각 세 가지 다른 이름으로 불릴 수도 있고, 특정 소프트웨어 결함과 알려진 공격 방식 사이를 연결하는 공식 기록들이 긴 문단 속에 깊숙이 숨겨져 있는 경우도 많습니다. 컴퓨터가 이러한 숨겨진 연결 고리를 볼 수 없다면, 인공지능 프로그램이 아무리 똑똑하더라도 퍼즐을 풀 수 없습니다.

한 연구팀은 문제가 컴퓨터의 지능이 아니라 정보가 저장되는 방식에 있다는 것을 발견했습니다. 그들은 CTIFoundry라는 새로운 시스템을 구축했는데, 이는 컴퓨터가 읽기 전에 보안 보고서들을 정리하기 위한 특화된 프레임워크 역할을 합니다. 데이터를 뒤섞인 텍스트 덩데기로 남겨두는 대신, 이 시스템은 먼저 사실들의 명확한 지도를 만듭니다. 시스템은 네 개의 주요 보안 데이터베이스에서 가져온 공식 기록을 바탕으로, 어떤 소프트웨어 약점이 어떤 공격 패턴으로 이어지는지를 정확한 선으로 연결하여 보여줍니다. 그런 다음, 난잡한 벤더 보고서들을 읽고 특정 그룹이나 결함을 언급하는 구체적인 문장들을 찾아내어, 원래 텍의 정확한 위치와 함께 태그를 붙입니다. 이 과정은 평면적인 문서 더미를 모든 정보가 자신의 이웃과 출처를 알고 있는 구조화된 네트워크로 탈바꿈시킵니다.

연구진은 동일한 인공지능 에이전트에게 동일한 보안 데이터에 접근하는 두 가지 서로 다른 방법을 제공하여 이 새로운 시스템을 테스트했습니다. 한 시나리오에서 에이전트는 기존의 정리되지 않은 방식을 사용했습니다. 다른 시나리오에서는 새로운 구조화된 지도를 사용했습니다. 결과는 놀라웠습니다. 에이전트가 새로운 시스템을 사용했을 때, 연구진이 더 작고 성능이 낮은 컴퓨터 모델을 사용했음에도 불구하고 정답을 맞히는 능력이 크게 뛰어올랐습니다. 실제로 새로운 지도를 사용한 작은 모델이 기존의 정리되지 않은 텍스트 더미를 사용하는 가장 강력한 모델보다 더 나은 성능을 보였습니다. 이 개선은 컴퓨터가 더 열심히 검색하거나 더 많은 페이지를 읽었기 때문이 아니었습니다. 오히려 새로운 시스템을 사용하는 에이전트는 정보를 찾아보기 위한 시도를 약 절반 정도로 줄이면서도 정답을 찾아냈습니다. 그것은 단순히 따라갈 수 있는 더 나은 경로를 가지고 있었던 것입니다.

이 연구는 왜 기존 방식이 자주 실패했는지도 밝혀냈습니다. 미리 만들어진 지도 없이는 컴퓨터가 유사한 단어를 찾다가 막다른 길이나 혼란스러운 결과로 이어지는 텍스트 속에서 길을 잃기 일쑤였습니다. 컴퓨터는 전문가들이 이미 작성해 둔 공식적인 연결 고리들을 놓치곤 했는데, 그 연결 고리들이 긴 문장 안에 숨겨져 있었기 때문입니다. 새로운 시스템은 컴퓨터가 공식적인 연결을 먼저 따르도록 강제하며, 텍스트를 주요 가이드가 아닌 부차적인 세부 정보원으로 취급합니다. 이 접근 방식은 매우 효과적이어서, 연구진은 데이터의 구조가 컴퓨터 모델의 원시적인 힘 자체보다 더 중요하다는 것을 발견했습니다. 명확한 지도를 가진 작은 모델이 엉망인 지도를 가진 거대 모델보다 더 뛰어난 성과를 냈습니다.

시스템의 신뢰성을 보장하기 위해 연구진은 정보를 지어내는 것을 방지하는 엄격한 규칙을 구축했습니다. 지도의 모든 연결은 반드시 공식 기록에서 나와야 했으며, 보고서에서 추출한 모든 텍스트 조각은 원래 문서의 정확한 지점을 가리켜야 했습니다. 이는 컴퓨터가 사실을 꾸며내거나 답을 추측할 수 없음을 의미합니다. 또한 시스템에는 유사한 단어를 검색하기 전에 공식 지도를 먼저 확인하는 것과 같은, 컴퓨터가 따라야 할 간단한 지침 또는 습관을 포함했습니다. 이러한 습로와 명확한 지도가 결합되어 상보적 효과(super-additive effect), 즉 두 부분이 단독으로 존재할 때보다 함께 있을 때 더 잘 작동하는 효과를 만들어냈습니다.

이 새로운 시스템을 구축하는 비용은 놀라울 정도로 낮았으며, 초기 데이터를 처리하는 데 아주 적은 양의 컴퓨팅 파워만을 필요로 했습니다. 일단 구축되면, 시스템은 질문당 약 2센트로 컴퓨터가 복잡한 조사를 해결할 수 있게 해주었습니다. 연구진은 정보가 고도로 구조화되어 있고 공식적인 연결에 의존하는 분야에서는, 가장 큰 병목 현상이 인공 에이전트의 지능이 아니라 주어진 데이터의 품질이라는 결론을 내렸습니다. 데이터를 에이전트가 자연스럽게 이해하고 통과할 수 있는 형태로 정리함으로써, 시스템은 조사 과정을 더 빠르고, 저렴하며, 훨씬 더 정확하게 만들었습니다. 이 연구는 향후 전문 분야에서 인공지능을 개선하는 가장 효과적인 방법은 더 똑똑한 뇌를 만드는 것이 아니라, 그들이 읽을 수 있는 더 나은 도서관을 만드는 것일 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →