← 최신 논문
🤖 machine learning

Contrastive Learning and Correlation Clustering for Sequences of Network Telescope Data

이 논문은 의미론적 주석 없이 네트워크 플로우 레코드 시퀀스를 임베딩하고 클러스터링하기 위한 트랜스포머 기반의 대조 학습 접근 방식을 제안하며, 인터넷 스캐너 간의 관계를 식별하고 미지의 소스로 일반화하는 데 있어 그 효과를 입증한다.

원저자: Jannik Presberger, Alexander Männel, Maynard Koch, Thomas C. Schmidt, Matthias Wählisch, Bjoern Andres

게시일 2026-06-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jannik Presberger, Alexander Männel, Maynard Koch, Thomas C. Schmidt, Matthias Wählisch, Bjoern Andres

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 수백만 명의 사람들(컴퓨터)이 서로에게 편지(데이터 패킷)를 끊임없이 보내는 거대하고 혼란스러운 도시라고 상상해 보십시오. 대부분의 편지는 일반적인 우편물입니다. 하지만 가끔은 "스캐너(scanners)"들이 나타납니다. 이들은 마치 공격적인 방문 판매원이나 보안 테스터처럼, 어떤 문이 열려 있는지 확인하기 위해 도시의 모든 문을 일일이 두드려 봅니다.

문제는 보안 전문가들에게 이 판매원들이 너무 많고, 그 형태도 제각각이라는 점입니다. 어떤 이는 빠르게 두드리고, 어떤 이는 느리게 두드리며, 어떤 이는 서로 다른 도구를 사용합니다. 이들에게 이름표(라벨)가 붙어 있지 않고 도시가 너무 커서 모든 사람을 감시하는 것이 불가능하기 때문에, 이 판매원이 어느 회사 소속인지 수동으로 파악하는 것은 불가능에 가깝습니다.

이 논문은 "스마트 거울"과 "그룹 나누기 게임"을 사용하여 이 문제를 해결하는 영리한 방법을 제안합니다.

스마트 거울 (트랜스포머 모델)

연구진은 트랜스포머 모델(Transformer model)이라는 특별한 컴퓨터 프로그램을 만들었는데, 이는 '스마트 거울' 역할을 합니다. 이 모델은 편지의 내용 대신, 특정 판매원이 문을 두드리는 방식의 '패턴'을 관찰합니다.

  • 학습 방법: 보통 컴퓨터에게 패턴을 인식하도록 가르치려면, "이것은 판매원 A이고, 저것은 판매원 B이다"라고 말해주는 선생님이 필요합니다. 하지만 여기에는 선생님이 없습니다.
  • 비결: 프로그램은 **대조 학습(Contrastive Learning)**이라는 기술을 사용합니다. 사진 더미가 있다고 가정해 봅시다. 당신은 컴퓨터에게 이렇게 말합니다. "같은 사람의 사진 두 장을 가져와라(설령 그 사람이 다른 모자를 쓰고 있거나 다른 곳에 서 있더라도). 그리고 마음속에서 두 사진을 매우 유사하게 만들어라. 반대로, 서로 다른 사람의 사진은 서로 매우 다르게 만들어라."
  • 결과: 컴퓨터는 누구인지 알려주지 않아도, 각 판매원의 두드리는 습관을 바탕으로 고유한 "지문(fingerprint)"을 만드는 법을 배웁니다. 컴퓨터는 "5초 안에 100개의 문을 두드리는 것"은 특정한 스타일이고, "1분 동안 10개의 문을 두드리는 것"은 또 다른 스타일임을 학습합니다.

그룹 나누기 게임 (상관 클러스터링)

컴퓨터가 이러한 지문들을 생성하고 나면, 연구진은 **상관 클러스터링(Correlation Clustering)**이라는 게임을 진행합니다.

  • 목표: 연구진은 지문의 유사성을 바탕으로 모든 판매원을 그룹으로 분류하고자 합니다.
  • 과제: 그들은 그룹이 몇 개나 있어야 하는지, 그리고 각 그룹의 크기가 얼마인지 알지 못합니다.
  • 해결책: 알고리즘은 지문 사이의 "거리"를 살펴봅니다. 만약 두 판매원의 지문이 매우 유사하다면, 알고리즘은 "이들을 같은 방에 넣어라"라고 판단합니다. 만약 다르다면, 이들을 다른 방에 넣습니다. 이 과정은 사전에 정해진 그룹 수 없이도 자연스러운 군집을 찾아내며 자동으로 수행됩니다로 됩니다.

연구 결과

연구진은 이 모델을 방대한 인터넷 트래픽 데이터셋(마치 도시 전체를 한 시간 동안 관찰하는 것과 같은)을 통해 테스트했습니다. 결과는 다음과 같았습니다.

  1. 동일 인물 인식: 컴퓨터에게 학습 과정에서 본 적 없는 동일한 판매원의 서로 다른 두 가지 두드림 패턴을 보여주었을 때, 컴퓨터는 이를 "유사하다"고 정확히 식별했습니다. 패턴이 똑같지 않더라도 컴퓨터는 그들이 같은 사람임을 알아냈습니다.
  2. 다른 사람 인식: 서로 다른 판매원의 패턴을 보여주었을 때, 컴퓨터는 이를 "다르다"고 정확히 식별했습니다.
  3. "회사"별 그룹화: 가장 흥lı로운 부분은, 지문을 바탕으로 판매원들을 그룹화했을 때, 연구진이 이미 알고 있는 실제 세계의 스캐너 기업들(Censys나 Shodan 등)과 그룹이 일치했다는 점입니다. 컴퓨터는 이 기업들의 이름을 배운 적이 없음에도 불구하고, 자연스럽게 "Censys" 판매원들을 묶고 "Shodan" 판매원들을 따로 묶었습니다.

한계점 (회색 지대)

논문은 이 그룹화가 완벽하지는 않았다고 언급합니다. 때때로 서로 다른 회사의 판매원들이 너무 비슷하게 보여서(예를 들어, 같은 도구를 사용하거나 같은 문을 두드리는 경우), 컴퓨터가 혼동하여 섞어버리는 경우가 있었습니다. 이는 컴퓨터가 많은 것을 배웠지만, 이 "지문"이 완벽한 신분증은 아니라는 점을 시사합니다. 즉, 지문은 공격의 '스타일'을 포착하는 것이며, 이 스타일은 그룹 간에 서로 겹칠 수 있습니다.

결론

이 논문은 데이터를 먼저 라벨링하는 인간의 도움 없이도, 단지 행동을 관찰하는 것만으로 컴퓨터가 인터넷 스캐너의 "성격"을 이해하도록 가르칠 수 있음을 보여줍니다. 스마트 거울을 통해 유사성을 학습하고 그룹 나누기 게임을 통해 분류함으로써, 이들은 혼란스러운 인터넷 트래픽을 의미 있는 그룹으로 자동 정리하여, 보안 전문가들이 이전에는 볼 수 없었던 패턴을 포착할 수 있도록 돕습니다.

요약하자면: 그들은 컴퓨터에게 갱단의 이름을 알려주지 않고도, 오직 두드리는 리듬을 듣는 것만으로 "누가 두드리고 있는지"와 "누가 어느 갱단에 속해 있는지"를 인식하는 법을 가르친 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →