Unsupervised Anomaly Detection of Information Operations Users via Behavioral and Language Patterns
본 논문은 시간적 점 과정(Temporal Point Processes)을 통해 이들의 협응된 시간적 행동을 모델링하고, 거대 언어 모델(LLM)을 통한 텍스트 콘텐츠 분석에서 도출된 정량적 점수로 이러한 신호를 정교화함으로써 기존 방식보다 실제 데이터셋에서 더 우수한 성능을 보이는 새로운 비지도 학습 프레임워크인 TENSOR를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 수백만 명의 사람들이 대화를 나누고, 뉴스를 공유하고, 정치에 대해 논쟁하는 거대하고 북적이는 마을 광장이라고 상상해 보십시오. 보통 대부분의 사람들은 그저 평범한 사람들(이들을 "컨트롤 유저(Control Users)"라고 부릅시다)로서 각자의 삶을 살아갑니다. 하지만 때때로, 작고 비밀스러운 집단의 행위자들(이들을 "정보 작전(Information Operation)" 또는 "IO 유저"라고 부릅시다)이 광장에 들어옵니다. 이들은 단순히 대화를 나누러 온 것이 아닙니다. 이들은 대화를 조작하고, 거짓말을 퍼뜨리며, 소란을 피우기 위해 왔으며, 종종 잘 짜인 합창단처럼 함께 움직입니다.
문제는 이 조작자들이 매우 잘 숨는다는 점입니다. 이들은 평범한 사람처럼 보이려고 노력하지만, 이들을 드러내 주는 특유의 비밀스러운 리듬과 특정한 말투를 가지고 있습니다.
기존의 탐지 방식 (그리고 그것이 실패한 이유)
이전에는 탐정들이 이 조작자들을 잡기 위해 두 가지 방법을 사용했습니다.
- "목록을 찾는" 방식 (지도 학습): 알려진 악성 행위자들의 목록을 사용하여 컴퓨터를 훈련시켰습니다. 하지만 악성 행위자들이 그들의 전술을 바꾸자마자(그들은 매우 빠르게 바꿉니다), 컴퓨터는 혼란에 빠졌고 새로운 수법을 찾아내지 못했습니다.
- "함께 움직이는" 방식 (비지도 클러스터링): 이들은 악성 행위자들이 마치 행진하는 밴드처럼 완벽하게 일치하여 행동한다고 가정했습니다. 만약 두 사람이 정확히 같은 내용의 글을 정확히 같은 시간에 게시하면, 이들은 표적이 되었습니다. 하지만 현실에서 악성 행위자들은 더 영리합니다. 그들은 항상 발맞추어 행진하지는 않으며, 따라서 이 방식은 많은 이들을 놓쳤습니다.
새로운 해결책: TENSOR
이 논문의 저자들은 TENSOR라는 새로운 탐지 도구를 만들었습니다. TENSOR를 두 가지 요소를 동시에 살피는 두 부분으로 구성된 보안 시스템이라고 생각하십시오: 언제 게시하는지와 무엇을 말하는가입니다.
파트 1: 리듬 감시자 (템포럴 포인트 프로세스 - Temporal Point Process)
사람들의 움직임이 발생하는 '타이밍'에 집착하는 보안 요원을 상상해 보십시오.
- 일반 사람들은 불규칙하게 게시합니다. 아침일 수도 있고, 점심시간일 수도 있고, 혹은 늦은 밤일 수도 있습니다. 그들의 리듬은 무질서하고 자연스럽습니다.
- 악성 행위자들은 종종 이상하고 조율된 리듬을 가집니다. 그들은 너무 빠르게 게시하거나, 스크립트를 따르고 있기 때문에 모두가 정확히 같은 초에 게시할 수도 있습니다.
TENSOR는 광장의 "심장 박동"을 배우기 위해 수학적 도구(템포럴 포인트 프로세스)를 사용합니다. 이는 정상적인 리듬이 어떤 모습인지 학습합니다. 만약 너무 완벽하거나 이상한 리듬이 포착되면 경보를 울립니다.
함정: 보안 요원에게는 문제가 있습니다. 학습 데이터(요원이 연구한 사람들의 목록)가 "오염"되어 있습니다. 이는 마치 보안 요원에게 무엇이 "정상"인지 가르치려 하는데, 그 수업에 정상인 척하는 악성 행위자들이 포함되어 있는 것과 같습니다. 요원은 실수로 악성 행위자의 이상한 리듬을 "정상"으로 학습할 수도 있습니다.
파트 2: 언어 탐정 (LLM)
이 보안 요원의 실수를 바로잡기 위해, TENSOR는 두 번째 전문가인 **거대 언어 모델(LLM)**을 투입합니다. 이것을 수백만 권의 책을 읽어 진정한 인간의 목소리와 로봇의 스크립트를 구분할 줄 아는 초능력을 가진 문학 비평가라고 생각하십시오.
LLM은 사람들이 게시하는 실제 단어를 읽습니다. 단순히 타이밍만 보는 것이 아니라, 스타일을 봅니다.
- 이 사람은 자신의 고양이, 직업, 그리고 정치에 대해 이야기하는가? (그렇다면 컨트롤 유저일 가능성이 높습니다).
- 이 사람은 오직 하나의 특정 정치적 주제에 대해서만 이야기하며, 이상하고 반복적인 문구를 사용하고, 다른 모든 것은 무시하는가? (그렇다면 IO 유저일 가능성이 높습니다).
결합하기: "증거 함수 (Evidence Function)"
이것이 마법의 핵심입니다. TENSOR는 단순히 두 전문가가 투표하게 두는 것이 아니라, 두 사람의 의견을 결합하는 특별한 공식(증거 함수)을 사용합니다.
- 리듬 감시자가 말합니다. "이 사람의 타이밍이 수상합니다."
- 언어 탐정이 말합니다. "이 사람의 단어는 스크립트처럼 들립니다."
- 증거 함수는 언어 탐정의 의견을 가져와 리듬 감시자를 교정하는 데 사용합니다.
만약 훈련 데이터에 포함된 악성 행위자들 때문에 리듬 감시자가 혼란을 겪고 있었다면, 언어 탐정이 개입하여 이렇게 말합니다. "잠깐, 단어를 보세요. 타이밍이 다소 정상적으로 보일지라도, 이 사람은 분명히 악성 행위자입니다." 이를 통해 TENSOR는 훈련 데이터가 "더러웠던" 상황에서도 악성 행위자들을 찾아낼 수 있습니다.
연구 결과
연구진은 이집트, 중국, 이란, 러시아, UAE 등 5개국의 실제 데이터를 사용하여 TENSOR를 테스트했습니다. 이들은 TENSOR를 다른 방법들과 비교하였으며 다음과 같은 사실을 발견했습니다:
- TENSOR가 가장 우수했습니다: 기존의 방법들보다 더 많은 악성 행위자를 잡아냈고 실수는 더 적게 했습니다.
- 두 부분이 모두 필요합니다: 만약 "언어 탐정"(LLM)이나 "리듬 감시자"(타이밍 분석) 중 하나를 제거한다면, 시스템의 성능은 훨씬 떨어집니다. 제대로 작동하려면 언제와 무엇을 모두 필요로 합니다.
- 다양한 두뇌와도 잘 작동합니다: 연구진은 다양한 유형의 "언어 탐정"(AI 모델)을 사용하여 TENSOR를 테스트했으며, TENSOR는 거의 모든 모델에서 잘 작동했습니다.
핵심 요약
TENSOR는 미리 만들어진 악성 행위자 목록 없이도 인터넷 조작자들을 찾아내는 새로운 방법입니다. 이는 악성 행위자들이 이상한 "춤"(타이밍)과 가짜 "목소리"(언어)를 가지고 있다는 점을 포착함으로써 작동합니다. AI를 사용하여 목소리를 확인하고 춤 분석을 교정함으로써, TENSOR는 조작자들이 군중 속에 섞여 있으려고 노력할 때조차 그들을 찾아낼 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.