← 최신 논문
💻 computer science

Between Zeros and Ones: Behavioral Characterization Beyond Binary Labeling Across Public ICS Datasets

본 논문은 ICS 프로세스 트레이스를 5가지 물리적 프리미티브로 매핑하는 행동 특성화 프레임워크를 제안하며, 이를 통해 전통적인 이진 레이블링에 의해 가려진 상당한 행동적 다양성과 데이터셋 간의 편향을 드러내고, 성능의 사각지대를 노출하며 사고 대응을 더 잘 지원하기 위한 행동 계층화 평가를 주장한다.

원저자: Konstantinos E. Kampourakis, Vyron Kampourakis, Georgios Spathoulas, Constantinos Kolias

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Konstantinos E. Kampourakis, Vyron Kampourakis, Georgios Spathoulas, Constantinos Kolias

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 복잡한 공장의 보안 요원이라고 상상해 보십시오. 당신의 임무는 제어실 화면을 지켜보다가 무언가 잘못되면 "비상!"이라고 외치는 것입니다.

오랫동안 보안 연구자들은 당신에게 매우 단순한 규칙책을 주었습니다: "화면이 이상해 보이면 공격(Attack)이다. 정상으로 보이면 정상(Normal)이다." 그들은 이것을 "이진(binary)" 레이블(두 가지 선택지)이라고 부릅니다.

이 논문의 저자들은 이 규칙책이 너무 단순하다고 주장합니다. 이는 마치 의사가 "열이 있습니까?"라고만 묻고 정작 어떤 종류의 병인지 묻지는 않는 것과 같습니다. 열은 독감 때문일 수도 있고, 고장 난 온도계 때문일 수도 있으며, 더운 날씨 때문일 수도 있습니다. 공장에서 "화면이 이상하다"는 것은 밸브가 쾅 하고 닫히는 것일 수도 있고, 센서가 서서히 벗어나는 것일 수도 있으며, 펌프가 루프에 갇혀 멈춘 것일 수도 있습니다.

다음은 이 논문의 이야기를 쉬운 개념으로 나누어 설명한 것입니다:

1. 문제점: "천편일률적인" 레이블

연구자들은 컴퓨터가 공격을 감지하도록 가르치는 데 사용되는 세 가지 유명한 "훈련용 공장"(SWaT, WADI, HAI라는 데이터셋)을 살펴보았습니다. 그들은 모든 사람이 모든 공격을 똑같은 것, 즉 **나쁨(BAD)**으로 취급한다는 점을 발견했습니다.

하지만 실제 산업 공격은 서로 다른 종류의 날씨와 같습니다:

  • 드리프트(Drift): 느리고 점진적인 변화 (예: 천천히 새는 현상).
  • 스파이크(Spike): 갑작스럽고 격렬한 충격 (예: 번개 낙뢰).
  • 오실레이션(Oscillation): 흔들리거나 요동치는 움직임 (예: 자동차 엔진의 불규칙한 떨림).
  • 레피티션(Repetition): 같은 음을 반복해서 재생하는 고장 난 레코드판.
  • 스위칭(Switching): 전등 스위치를 너무 빠르게 껐다 켰다 하는 동작.

단순히 컴퓨터에게 "이것은 공격이다"라고만 말한다면, 컴퓨터는 (스파이크를 위해) 공장 전체를 즉시 폐쇄해야 할지, 아니면 (드리프트를 위해) 나중에 수리 일정을 잡을지만 결정할 수 없습니다.

2. 해결책: 새로운 "행동적 렌즈"

저자들은 새로운 도구인 **행동 특성화 프레임워크(Behavioral Characterization Framework)**를 구축했습니다. 이 도구는 단순히 "공격인가 정상인가"를 보는 것이 아니라, 공격이 어떻게 행동하고 있는지를 보는 특수 안경이라고 생각하면 됩니다.

그들은 모든 데이터의 순간을 다섯 가지 단순한 "프리미티브(기본 구성 요소)"로 나누었습니다:

  1. 드리프트(Drift): 서서히 미끄러져 내려가는가?
  2. 스파이크(Spike): 갑자기 튀어 올랐는가?
  3. 오실레이션(Oscillation): 앞뒤로 흔들리는가?
  4. 레피티션(Repetition): 패턴을 반복하는가?
  5. 스위칭(Switching): 상태가 빠르게 변하는가?

그들은 이 안경을 세 가지 유명한 데이터셋에 적용하여 그것들이 실제로 어떤 모습인지 확인했습니다.

3. 발견: 공장마다 다르다

새로운 안경을 통해 들여다보았을 때, 그들은 이 세 가지 데이터셋이 실제로 매우 다른 동네라는 것을 발견했습니다:

  • HAI 데이터셋: 이 데이터셋은 **스파이크(Spike)**와 드리프트(Drift) 공격으로 가득 차 있었습니다. 마치 사람들이 끊임없이 문을 쾅 닫거나 가구를 천천히 옮기는 동네와 같았습니다.
  • SWaT 데이터셋: 이 데이터셋은 **오실레이션(Oscillation, 흔들림)**이 지배적이었고 반복성이 부족했습니다. 마치 물건들이 흔들리거나 멈춰 서 있지만, 반복적인 패턴은 없는 동네와 같았습니다.
  • WADI 데이터셋: 이 데이터셋은 주로 **레피티션(Repetition, 반복)**이 나타났습니다. 마치 모든 것이 루프에 갇힌 동네와 같았습니다.

핵심적인 폭로: 만약 당신이 보안 요원(AI 모델)을 HAI 데이터셋으로만 훈련시킨다면, 그들은 "스파이크" 공격을 찾아내는 데는 매우 뛰어나겠지만, SWaT 데이터셋에서 발생하는 "오실레이션" 공격은 놓칠 수도 있습니다. 현재의 테스트 방식(단순히 "공격" 또는 "아님"이라고 말하는 방식)은 이러한 차이점을 숨기고 있습니다.

4. 테스트: "단순한" 레이블은 거짓말을 하는가?

연구자들은 자신들의 주장을 증명하기 위해 간단한 테스트를 수행했습니다. 그들은 표준 보안 AI를 가져와 두 가지 질문을 던졌습니다:

  1. 질문 A (기존 방식): "이것은 공격입니까?" (예/아니오)
  2. 질문 B (새로운 방식): "이것은 드리프트, 스파이크, 오실레이션, 레피티션, 스위칭 중 무엇입니까?"

결과:

  • 질문 A: AI는 매우 높은 점수(약 85% 정확도)를 기록했습니다. 마치 천재처럼 보였습니다.
  • 질문 B: AI의 점수는 급락했습니다 (약 37~42%로 떨어짐).

이것이 의미하는 바: AI는 무언가 잘못되었다는 것은 잘 잡아냈지만, 무엇이 잘못되었는지는 파악하는 데 매우 서툴렀습니다. "단순한" 점수는 AI가 느린 누출과 갑작스러운 폭발의 차이를 구분하지 못한다는 사실을 숨기고 있었습니다.

5. 결론: 우리는 "예/아니오" 이상의 것이 필요하다

이 논문은 우리가 단순한 "공격/정상" 레이블을 완전히 사용하지 말아야 한다고 결론짓지는 않습니다. 그것들은 여전히 첫 번째 경보로서 유용합니다.

하지만, 오직 그 단순한 점수에만 의존하는 것은 위험합니다. 그것은 마치 태풍인지, 토네이도인지, 우박인지 알려주지 않고 단지 "폭풍"이라고만 말하는 일기예보와 같습니다.

저자들은 **행 행동 계층화 평가(Behavior-Stratified Evaluation)**라는 두 번째 평가 층을 추가해야 한다고 제안합니다. 즉, 우리는 보안 시스템이 단순히 나쁜 행동이 존재하는지를 탐지하는 것을 넘어, 서로 다른 종류의 나쁜 행동을 실제로 구별할 수 있는지 확인해야 합니다. 이는 운영자가 알람이 울렸을 때 정확히 어떻게 대응해야 할지 알 수 있도록 도와줍니다.

요약하자면: 이 논문은 우리가 현재 산업 보안 시스템을 "불이야!"라고 얼마나 잘 외치느냐로 판단하고 있지만, 정작 그들이 기름 화재와 가스 폭발의 차이를 아는지 여부는 확인하지 않고 있다고 주장합니다. 우리는 그 차이를 구별할 수 있도록 가르쳐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →