← 최신 논문
💻 computer science

Training Versus Hiring in Security Operations Centers: Agent-Based and Reinforcement Learning Simulations of Training Duration Effects on CyberTeam Performance

본 연구는 에이전트 기반 모델링과 강화 학습을 활용하여 보안 운영 센터(SOC)에서의 훈련 기간이 비선형적 성능 향상을 가져온다는 점을 입증하며, 최적의 투자는 500회에서 1,000회 사이의 에피소드 구간에서 발생하고 고도로 숙련된 팀은 20~25명의 추가 인력을 채용하는 것과 맞먹는 효율성 이점을 달성함을 보여준다.

원저자: Max N. Yaw, Ferdinand Kpieleh, Aos Mulahuwaish, Basheer Qolomany, Jacques Bou Abdo

게시일 2026-06-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Max N. Yaw, Ferdinand Kpieleh, Aos Mulahuwaish, Basheer Qolomany, Jacques Bou Abdo

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

보안 운영 센터(SOC)를 고도의 긴장감이 흐르는 비디오 게임 토너먼트라고 상상해 보십시오. 조직은 예산을 가지고 중대한 선택을 해야 합니다. 수많은 신입 플레이어 군단을 고용할 것인가, 아니면 기존의 소규모 팀을 데리고 강도 높고 장기적인 훈련 캠프를 진행할 것인가?

이 논문은 컴퓨터 시뮬레이션을 사용하여 그 질문에 대한 답을 제시합니다. 실제 사람들을 몇 년 동안 관찰하는 대신, 연구진은 '에이전트'(인간을 나타내는 컴퓨터 프로그램)들이 사이버 공격과 방어 게임을 수행하는 디지털 세계를 구축했습니다. 이들은 **강화 학습(Reinforcement Learning)**이라는 특수한 형태의 AI를 '훈련 시뮬레이터'로 사용했습니다. 인간 게이머가 더 많이 플레이할수록 실력이 향상되는 것처럼, 이 AI 에이전트들은 승리 시에는 보상을 받고 패배 시에는 벌칙을 받는 방식으로 수천 라운드를 플레이하며 전략을 학습했습니다.

연구 결과는 다음과 같이 쉬운 개념들로 나누어 설명할 수 있습니다.

1. "3막 구성"의 훈련 이야기

논문은 훈련이 일정하고 직선적인 형태로 진행되지 않는다는 것을 발견했습니다. 마치 연극의 막처럼 세 가지 뚜렷한 단계로 진행됩니다.

  • 제1막: 서툰 초보자 단계 (에피소드 1–500):
    컨트롤러를 막 집어 든 신입 플레이어를 상상해 보십시오. 이들은 탐색하고, 무작위로 기술을 시도하며, 대부분 실패합니다. 시뮬레이션에서 이 단계의 팀들은 거의 승리하지 못했습니다(승률 0%~15%). 그들은 그저 규칙을 파악하는 중이었습니다.
  • 제2막: "아하!" 모먼트 (에피소드 500–2,000):
    이곳이 바로 핵심적인 구간입니다. 팀은 추측을 멈추고 이해하기 시작합니다. 그들은 어떻게 협력해야 하는지 깨닫고, 성과가 급격히 치솟습니다. 승률이 약 15%에서 50% 이상으로 뛰어오릅니다. 이곳에서 가장 큰 가치가 창출됩니다.
  • 제3막: 숙련된 마무리 (에피소드 2,000–5,000):
    이제 팀은 프로가 되었습니다. 그들은 거의 매번 승리합니다(93%~95%). 하지만 여기서 추가되는 모든 훈련 시간은 아주 미미한 실력 향상만을 가져옵니다. 이는 마치 마스터 셰프가 요리의 맛을 단 1% 더 좋게 만들기 위해 시간을 더 쓰는 것과 같습니다. 좋은 일이긴 하지만, 거대한 도약은 이미 끝난 상태입니다.

2. 지갑을 위한 "스윗 스팟(최적의 지점)"

만약 당신이 팀을 얼마나 오래 훈련시킬지 결정하는 상사라면, 논문은 구체적인 전략을 제안합니다. 너무 일찍 멈추지도 말고, 그렇다고 영원히 훈련하지도 마십시오.

  • 위험 구역: 만약 첫 500번의 "게임" 후에 훈련을 멈춘다면, 당신은 가장 가치 있는 과정을 버리는 것입니다. 당신은 여전히 "서툰" 단계에 머물러 있습니다.
  • 골든 존: 가장 좋은 투자 수익(ROI)은 500회에서 1,000회 게임 사이에서 발생합니다. 이 구간은 팀이 "초보자"에서 "유능한 프로"로 변모하며 가장 큰 실력 향상을 보이는 지점입니다.
  • 수익 체감의 법칙: 2,000회 이후에는 여전히 발전하고 있지만, 아주 작은 개선을 위해 많은 시간과 비용이 소요됩니다.

3. "마법의 배수": 소규모 팀 vs 대규모 군단

이것은 가장 놀라운 발견입니다. 연구진은 고도로 훈련된 소규모 팀훈련받지 않은 대규모 팀(그저 기본 규칙만 따르며 배우지 않는 팀)을 비교했습니다.

  • 결과:5명의 훈련된 공격자 팀이 25명에서 35명의 훈련받지 않은 공격자 팀만큼의 성과를 냈습니다.
  • 비유: 이를 5명의 엘리트 특수 부대원과 30명의 훈련받지 않은 민간인 집단에 비유해 보십시오. 5명의 훈련된 병사들은 무엇을 해야 할지 정확히 알고 어떻게 협력해야 하는지를 알기 때문에 훨씬 더 큰 집단을 이길 수 있습니다.
  • 수치: 논문은 훈련된 공격자 한 명의 가치가 훈련받지 않은 공격자 3~7명과 대등하다고 주장합니다.

조직을 위한 결론

논문은 만약 당신이 20명을 새로 채용할 것인지, 아니면 현재의 5명을 오랫동안 훈련시킬 것인지 선택해야 한다면, 훈련이 더 현명한 선택이라고 결론짓습니다.

  • 채용은 크지만 느리고 서투르며, 많은 인력이 투입되어야 업무를 수행할 수 있는 팀을 제공합니다.
  • 훈련은 소규모 팀을 훨씬 더 큰 집단의 일을 해낼 수 있는 매우 효율적인 기계로 탈바꿈시킵니다.

이 연구는 조직이 "서툰" 단계를 지나 "전문가" 단계(약 1,000~2,000회의 시뮬레이션 세션)에 도달할 수 있을 만큼 충분히 긴 훈련 프로그램을 설계해야 한다고 제안합니다. 그렇게 함으로써 단순히 인력을 늘리는 것보다 훨씬 더 효과적이고 비용 효율적인 팀을 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →