← 최신 논문
💻 computer science

Cybersecurity AI (CAI) Dataset

본 논문은 실제 사이버보안 LLM 상호작용으로 구성된 대규모 코퍼스인 CAI 데이터셋을 소개하며, 전문가 운영자 궤적의 치명적인 병목 현상을 부각시키고 동시에 민감한 공격 및 방어 데이터를 최첨단 모델 API 제공업체에 중앙 집중화함으로써 발생하는 체계적 위험을 완화하기 위한 온프레미스 및 사설 호스팅 모델의 시급한 필요성을 강조합니다.

원저자: Víctor Mayoral-Vilches

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Víctor Mayoral-Vilches

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사이버 보안의 세계를 매일 수백만 명이 참여하는 거대하고 고도의 stakes 가 걸린 체스 게임으로 상상해 보세요. 일부 플레이어는 성을 지키려는 '블루 팀'(수비수) 이고, 다른 이들은 침입을 시도하는 '레드 팀'(공격자) 입니다. 오랫동안 이 플레이어들은 자신의 두뇌와 수동 도구를 활용해 게임을 진행했습니다.

최근 그들은 새로운 초지능 조력자, 즉 인공지능(AI)을 사용하기 시작했습니다. 하지만 문제가 있었습니다. AI 는 똑똑했지만, 전문가들이 실제로 게임을 어떻게 치는지 알지 못했습니다. 규칙은 알았지만, 전장의 열기 속에서 인간이 사용하는 속임수, 실수, 그리고 messy 한 실제 전략은 몰랐습니다.

이 논문은 CAI 데이터셋을 소개합니다. 이는 AI 가 실제 사이버 보안 전문가처럼 생각하도록 가르치기 위해 설계된 거대한 도서관입니다. 간단한 용어로 정리하면 다음과 같습니다:

1. 문제: '전문가' 격차

AI 모델 (대화형 모델 등) 을 전 세계 모든 교과서를 읽은 천재 학생들로 상상해 보세요. 하지만 사이버 보안 분야에서는 그들이 마스터들의 실제 작업을 지켜보지 못했기 때문에 실패하고 있었습니다.

  • 발견: 연구자들은 AI 가 지능이 부족해서 실패한 것이 아니라, 실제 전문가들의 '근육 기억'이 부족해서 실패했다고 발견했습니다. 인간이 시스템을 해킹하거나 방어할 때의 실제 단계별 로그, 즉 막다른 길, 오타, 그리고 '아하!' 순간까지 포함해 인간이 어떻게 행동하는지 직접 보아야 했습니다.

2. 해결책: '블랙박스' 레코더

이를 해결하기 위해 저자들은 CAI(Cybersecurity AI)라는 도구를 개발했습니다. 이 도구를 인간 전문가와 AI 사이에 놓인 투명한 유리 상자로 상상해 보세요.

  • 작동 원리: 인간 전문가가 CAI 도구를 사용해 업무를 수행할 때 (테스트 시스템 해킹, 버그 수정, 네트워크 방어 등), 이 도구는 모든 것을 기록합니다. 인간이 입력하는 모든 명령어, 사용하는 모든 도구, 저지르는 모든 실수와 이를 수정하는 방법까지 기록합니다.
  • 수집: 14 개월 동안 이 도구는 123 개국16,000 명이 넘는 사람들로부터 230,000 세션을 기록했습니다. 이는 2,600 만 개의 프롬프트(지시사항) 와 18 테라바이트의 데이터에 해당합니다. 이는 10 억 번의 체스 게임에서 모든 수를 기록한 것과 같습니다.

3. 도서관 안에는 무엇이 있을까요?

이것은 단순히 '좋은' 답변들의 목록이 아닙니다. 실제 업무의 생생하고 필터링되지 않은 모습입니다:

  • 좋음과 나쁨: 데이터의 약 **36%**는 공격 (침입 시도) 관련이며, **20%**는 명백한 악의적 의도, **27%**는 비즈니스 업무 (시스템 통합), **4%**는 방어 관련입니다.
  • 이론이 아닌 현실: 컴퓨터가 생성한 (합성) 다른 데이터셋과 달리, 이 데이터는 실제입니다. 사람들은 AI 가 지금 당장 작동하도록 하기 위해 실제 비밀번호, 서버 이름, 비밀 키를 채팅에 붙여넣습니다.
  • '유출'의 현실: 논문은 놀랍고 약간 무서운 사실을 지적합니다. AI 가 너무 유용하기 때문에, 전문가들은 작업을 더 빠르게 처리하기 위해 실제 비밀(비밀번호, 비밀 키 등) 을 채팅에 붙여넣는 경우가 많습니다. 데이터가 기록된다는 것을 알지만, 속도와 편의성이 그들에게는 위험을 감수할 만한 가치가 있습니다. 이로 인해 세계의 가장 민감한 비밀들이 소수의 AI 기업 내부에 대량으로 집중되고 있습니다.

4. 이것이 중요한 이유 (더 나은 AI 를 위한 '레시피')

저자들은 이 데이터셋이 차세대 사이버 보안 AI 를 훈련시키는 데 필요한 '비밀 소스'라고 말합니다.

  • 현재 상태: 대부분의 AI 훈련은 깨끗하고 완벽한 예시를 사용합니다.
  • CAI 데이터셋: 이는 messy 한 실제 세계의 예시를 사용합니다. 이는 AI 에게 고장 난 도구를 어떻게 처리하고, 오류에서 어떻게 회복하며, 여러 단계를 거쳐 복잡한 공격이나 방어를 어떻게 연결하는지 가르칩니다.
  • 목표: 단순히 취약점이 무엇인지 아는 AI 가 아니라, 인간 전문가처럼 실제 환경에서 취약점을 찾고 수정하는 방법을 아는 AI 를 구축하는 것입니다.

5. 큰 경고와 해결책

이 논문은 안전과 개인정보 보호에 관한 중요한 관찰로 마무리됩니다:

  • 위험: 현재 모든 실제 세계의 비밀과 공격 전략이 소수의 대형 AI 기업 서버로 흘러가고 있습니다. 만약 이러한 기업 중 하나가 해킹당하거나 데이터가 오용된다면 전 세계적 혼란을 초래할 수 있습니다.
  • 해결책: 비밀을 유출하지 않으면서 AI 의 속도와 힘을 유지할 수 있는 유일한 방법은 데이터를 통제할 수 있는 자사 건물 내부(온프레미스) 에서 전용 AI 를 실행하는 것입니다.
  • 기여: CAI 데이터셋은 파트너와 고객에게 공개되어, 그들이 이러한 사설 온사이트 AI 전문가를 구축하도록 돕기 위해 제공됩니다. 이렇게 하면 조직은 실제 업계의 속임수를 알고 있으면서도 모든 비밀을 자사 내부에 안전하게 보관할 수 있는 초지능 사이버 보안 조력자를 갖게 됩니다.

한 마디로 요약

이 논문은 다음과 같이 말합니다: "우리는 실수까지 포함해 14 개월 동안 실제 사이버 보안 전문가들이 업무를 수행하는 모습을 기록하여 AI 를 위한 궁극적인 훈련 매뉴얼을 만들었습니다. 이 데이터는 전문가들이 업무를 처리하기 위해 이미 AI 에게 가장 깊은 비밀을 신뢰하고 있음을 증명합니다. 효율성을 유지하면서 그 비밀들을 안전하게 지키기 위해서는, 공개된 AI 거인에 의존하기보다는 이 실제 세계 데이터를 기반으로 훈련된 사설 전용 AI 전문가를 구축해야 합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →