← 최신 논문
💻 computer science

DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

이 논문은 69개의 다양한 시나리오와 증거 기반 공격 체인 재구성에 대한 LLM 에이전트 평가를 위한 ECRAG 프레임워크를 특징으로 하는 진단 벤치마크인 DiagChain을 소개하며, 대규모 모델은 증거의 순서 결정에 어려움을 겪는 반면 소규모 모델은 기본적인 증거 통합에 실패한다는 점을 밝힘으로써, 총체적 정확도보다 단계별 평가의 필요성을 강조한다.

원저자: Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao

게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 되어 미스터리를 해결하고 있다고 상상해 보세요. 하지만 범죄 현장 대신, 당신은 디지털 범죄 현장을 보고 있습니다. "단서"들은 곳곳에 흩어져 있습니다: 수백만 줄의 컴퓨터 로그, 보안 경고, 그리고 시스템 기록들 말이죠. 사이버 보안의 세계에서 전문가들은 대규모 언어 모델(LLM)—방대한 양의 텍스트를 학습한 매우 똑똑한 AI 챗봇—을 사용하여 디지털 탐정 역할을 수행하게 합니다. 이 AI 에이전트들은 엉망진창인 단서들을 읽고, 무슨 일이 일어났는지 파악한 뒤, 공격의 과정을 올바른 순서대로 이야기로 써 내려가야 합니다. 이 과정은 **공격 체인 재구성(attack chain reconstruction)**이라고 불립니다. 이것은 마치 수천 개의 무작위 프레임으로 잘려 나간 영화를 보고, 그 프레임들을 다시 올바른 순서로 배치하여 이야기를 완성하라고 요청하는 것과 같습니다.

하지만 여기에 문제가 있습니다. 대부분의 AI 탐정 테스트는 그들이 쓴 최종 결과물(이야기)만을 확인합니다. 만약 이야기가 틀렸다면 테스트는 "실패"라고 판정하지만, 틀렸는지는 알려주지 않습니다. 탐정이 단서를 놓친 것일까요? 아니면 단서는 찾았지만 기록하는 것을 잊어버린 것일까요? 혹은 올바른 단서들을 찾았지만 순서를 잘못 배치한 것일까요? 우리는 AI 탐정이 작업하는 동안 그들의 뇌 내부를 들여다보며 정확히 어느 지점에서 길을 잃는지 알아낼 방법이 필요합니다. 여기서 새로운 논문인 DiagChain이 등장합니다. 이 논문은 단순히 최종 답변을 채점하는 것이 아니라, AI 탐정이 어느 단계에서 추적을 놓치는지 구체적으로 진단하도록 설계된 특별한 테스트 환경을 소개합니다.

이 논문의 저자인 칭화대학교와 CRRC 코퍼레이션의 연구진은 이 사각지대를 해결하기 위해 DiagChain이라는 새로운 벤치마크를 구축했습니다. 그들은 단순한 수준부터 매우 복잡한 수준까지 아우르는 69개의 서로 다른 "범죄 현장(시나리오)"으로 구성된 MAIN-69라는 데이터셋을 만들었습니다. 이 장면들은 리눅스 로그, 윈도우 이벤트, 클라우드 경고와 같은 실제 데이터에서 가져왔습니다. 현실감을 더하기 위해, 그들은 AI가 주의를 뺏길 수 있도록 단서에 무해한 배경 소음(chatter)을 추가하는 등 다양한 수준의 "노이즈"를 삽입했습니다. 또한, 짧은 활동의 폭발부터 길게 이어진 침입에 이르기까지 공격 체인의 길이를 다양하게 조절했습니다.

AI를 테스트하기 위해 그들은 ECRAG(Evidence-Centric Retrieval-Augmented Generation)라는 특별한 워크플로우를 사용했습니다. 이것은 AI 탐정에게 돋보기와 스스로 업데이트되는 노트를 주는 것과 같습니다. AI는 단서를 검색하고, 그것들을 그룹화하고, 타임라인을 파악한 다음, 자신의 작업을 끊임없이 확인하면서 이야기를 써 내려가야 합니다. 연구진은 단 하나의 최종 성적 대신 다섯 가지의 구체적인 "건강 검진" 항목을 사용하여 AI의 성능을 측정했습니다:

  1. 검색(Retrieval): AI가 단서를 찾아냈는가?
  2. 그룹화(Grouping): 관련 있는 단서들을 올바른 바구니에 담았는가?
  3. 순서 지정(Ordering): 사건들을 올바른 시간 순서대로 배열했는가?
  4. 근거 제시(Grounding): 찾은 단서들을 바탕으로 자신의 이야기를 뒷받침했는가?
  5. 속성 간극(Attribution Gap): 단서를 발견하고 살펴보았음에도 불구하고, 최종 보고서에 언급하는 것을 잊어버렸는가?

결과는 놀라웠습니다. 가장 똑똑한 AI 설정조차도 MAIN-69 데이터셋의 849개 참조 단계 중 이전 단계의 실수를 범하지 않고 완전히 맞춘 비율이 **39.6%**에 불과했습니다. 논문은 AI 모델의 유형이 어디에서 실패하는지에 큰 영향을 미친다고 시사합니다. 작은 모델들은 주로 기초적인 부분에서 고전합니다. 즉, 단서는 찾았지만 이를 최종 이야기에 포함시키는 데 실패하여, 말하자면 증거를 떨어뜨리는 식입니다. 반면, 더 크고 강력한 모델들은 단서를 찾고 유지하는 능력은 뛰어나지만, 이를 올바른 순서로 배치하는 과정에서 자주 비틀거립니다. 이는 총을 찾아놓고는 기록하는 것을 잊어버리는 작은 탐정과, 총과 지문, 지도까지 모두 찾아놓고도 강도 사건의 타임라인을 완전히 뒤섞어 버리는 거대한 탐정의 차이와 같습니다.

연구진은 AI에게 더 많은 시간이나 더 많은 "검색 예산"(더 많은 단서를 살펴볼 수 있는 권한)을 주었을 때 어떤 일이 일어나는지도 테스트했습니다. 그들은 단순히 AI에게 더 많은 자원을 준다고 해서 문제가 자동으로 해결되지는 않는다는 것을 발견했습니다. 더 많은 단서를 보는 것이 AI가 더 많은 증거를 찾는 데는 도움이 되지만, 그것이 AI가 증거를 올바르게 조직하거나 최종 조립 과정에서의 실수를 멈출 것이라고 보장하지는 않습니다. 사실, 어떤 모델들에게는 더 나은 전략 없이 너무 많은 단서를 보는 것이 오히려 작업을 더 어렵게 만들기도 했습니다.

궁극적으로, 이 논문은 우리가 단순히 최종 점수만을 볼 것이 아니라 과정을 진단해야 한다고 주장합니다. 이러한 결과는 AI 모델을 크게 만드는 것이 "체인 조립" 문제를 해결하는 것이 아니라, 병목 현상을 "단서 찾기"에서 "단서 조직화"로 옮길 뿐이라는 점을 시사합니다. 진정으로 신뢰할 수 있는 사이버 보안 에이전트를 구축하려면, 단순히 더 큰 모델이 알아서 해주기를 바라는 것이 아니라, 발견한 증거를 가져와 일관되고 순서가 있으며 근거가 확실한 이야기로 엮어내는 데 특화된 시스템을 설계해야 합니다. 저자들은 다른 이들이 이 디지털 탐정들을 계속 테스트하고 개선할 수 있도록 코드와 데이터를 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →