← 최신 논문
🤖 AI

Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning

본 논문은 의사결정 이론 기반의 롤아웃 계획(rollout planning)을 디지털 트윈 및 경량 LLM 에이전트와 통합하여 상위 수준의 전략과 실행 가능한 명령을 생성하는 원칙적인 에이전트 기반 사고 대응 프레임是否워크를 제안하며, 이는 다양한 공격 시나리오에서 복구 시간을 단축하고 복구율을 높임으로써 프런티어 LLM 베이스라인 모델들을 유의미하게 능가한다.

원저자: Yiran Gao, Tao Li, Kim Hammar

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiran Gao, Tao Li, Kim Hammar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 수백만 명의 사람, 기업, 그리고 기계들이 끊임없이 서로 대화를 나누는 거대하고 북적이는 도시라고 상상해 보십시오. 때때로 불청객들이 몰래 잠입하여 비밀을 훔치거나 발전소의 전원을 차단하려고 시도합니다. 현실 세계에서 사이버 공격이 발생하면, 보통 숙련된 인간 탐정들(보안 운영자라고 불리는)이 무엇이 잘못되었는지 파악하고, 어떤 건물을 먼저 폐쇄할지 결정한 뒤, 이를 해결하기 위해 직접 명령어를 입력해야 합니다. 이는 마치 건물이 여전히 불타고 있는 고층 빌딩 속에서, 어쩌면 구식이 되어버린 매뉴얼을 들고 불을 끄려고 노력하는 것과 같습니다. 이 과정은 느리고 소모적이며, 완전히 복구하는 데 종종 몇 달이 걸리기도 하여 그동안 도시는 취약한 상태로 남게 됩니다.

속도를 높이기 위해 과학자들은 두 가지 주요 기술을 시도해 왔습니다. 첫 번째는 "수학적 두뇌"(알고리즘)를 사용하는 것입니다. 이는 완벽한 계획을 계산할 수 있지만, 너무 추상적이라는 단점이 있습니다. 즉, 이론적으로는 무엇을 해야 할지는 알지만, 실제 서버를 고치기 위한 명령어를 직접 입력할 수는 없습니다. 두로 번째 기술은 "초지능형 챗봇"(거대 언 언어 모델 또는 LLM)을 사용하는 것입니다. 이들은 로그를 읽고 코드를 작성할 수 있습니다. 하지만 이 챗봇들은 신뢰하기 어려울 때가 있습니다. 때로는 사실이 아닌 것을 지어내거나(환각 현상), 확고한 게임 플랜이 부족하여 엉뚱한 것을 고치려 하며 루프에 빠지기도 합니다. 여기서 큰 질문이 생깁니다. 수학자의 전략적 두뇌와 챗봇의 실무 능력을 모두 갖추면서도, 실제 도시를 건드리기 전에 테스트할 수 있을 만큼 안전한 시스템을 구축할 수 있을까요?

이 논문은 바로 이 문제를 해결하고자 하는 "에이전틱 인시던트 리스폰스(Agentic Incident Response, 에이전트 기반 사고 대응)"라는 영리한 새로운 시스템을 소개합니다. 이것을 도시 네트워크의 완벽한 가상 복사본인 "디지털 트윈"과 함께 협력하는 2단계 구조의 구조 팀이라고 생각하십시오. 이 팀은 실제 피해를 입히지 않고 연습할 수 있는 가상의 공간에서 작동합니다.

팀이 작동하는 방식은 다음과 같습니다:

  1. 전략 사령관 (전술적 규모): 먼저, 수학적 플래너가 큰 그림을 봅니다. 이 단계에서는 아직 명령어를 입력하는 아주 세세한 디테일에 신경 쓰지 않습니다. 대신, "불이 번지는 것을 막기 위해 지금 가장 중요한 건물은 어디인가?"라고 묻습니다. 이들은 "롤아웃(rollout)" 방식을 사용하는데, 이는 마치 수천 가지의 가능한 미래를 시뮬레이션 속에서 실행해 보며, 어떤 순서로 건물을 구해내는 것이 가장 빠른 복구로 이어지는지 확인하는 것과 같습니다.

  2. 현장 요원 (운영적 규모): 사령관이 "지하실에 있는 서버를 먼저 구하라"라고 결정을 내리면, 특화된 AI 에이전트(경량화되고 미세 조정된 챗봇)가 바통을 이어받습니다. 이들의 임무는 그 높은 수준의 명령을 실제로 실행 가능한 명령어들로 번역하는 것입니다.

  3. 안전망 (디지털 트윈): 현장 요원이 실제 네트워크로 명령을 보내기 전, 시스템의 가상 복제본인 디지털 트윈에서 명령을 테스트합니다. 만약 명령어가 시뮬레이션에서 제대로 작동한다면 승인됩니다. 만약 가상 세계에서 실패하거나 시스템 충돌을 일으킨다면, 해당 명령은 버려지고 에이전트는 다른 명령어를 다시 시도합니다. 이는 AI가 실수로 실제 시스템을 망가뜨리는 것을 방지합니다.

연구진은 이 시스템을 5개의 서버와 세 가지 유형의 사이버 공격(취약한 비밀번호, 소프트웨어 버그, 커맨드 인젝션 등)이 존재하는 통제된 환경에서 테스트했습니다. 그들은 이 시스템을 오늘날 사용 가능한 가장 진보된 "프런티어" 챗봇들 및 다른 기존 자동화 방식들과 비교했습니다.

결과는 유망했습니다. 시뮬레이션 결과, 이 새로운 2부 구성의 팀은 최고의 단독 챗봇들보다 평균적으로 15.1% 더 빠르게 시스템을 복구했습니다. 더욱 중요한 점은, 이 새로운 방식이 기존 챗봇들보다 33.6% 더 자주 시스템 복구에 성공했다는 것입니다. 최상위 챗봇들이 약 50%에서 75% 정도의 성공률을 보인 반면, 이 새로운 방법은 성공률을 90% 이상으로 유지했습니다.

이 논문은 핵심 비결이 단순히 더 똑똑한 챗봇을 사용하는 것이 아니라, 챗봇의 코드 작성 능력과 엄격한 수학 기반 전략, 그리고 가상 세계에서의 안전 점검을 결리하는 데 있다고 제안합니다. 저자들은 이 시스템이 완벽하지는 않다고 언급했습니다. 만약 공격자가 움직이는 방식에 대한 초기 추측이 틀린다면, 계획의 효과가 떨어질 수 있기 때문입니다. 그러나 범용적인 거대 모델 대신 사고 데이터에 특화되어 훈련된 경량 모델을 사용함으로써, 탁월한 결과를 얻기 위해 반드시 슈퍼컴퓨터가 필요한 것은 아님을 보여주었습니다. 대신, 언제 계획을 세우고, 언제 행동하며, 언제 안전한 가상 샌드박스에서 자신의 작업을 재확인해야 하는지를 아는 시스템이 필요하다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →