← 최신 논문
💻 computer science

OrgForge-IT: A Verifiable Synthetic Benchmark for LLM-Based Insider Threat Detection

이 논문은 기존 벤치마크의 한계를 극복하고 교차 일관성을 보장하는 검증 가능한 합성 내부자 위협 벤치마크 'OrgForge-IT'를 제안하며, 이를 통해 다양한 LLM 모델의 성능을 평가하고 내부자 위협 탐지 및 판별의 복잡성을 규명했습니다.

원저자: Jeffrey Flynt

게시일 2026-03-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jeffrey Flynt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ OrgForge-IT: "가짜 회사"에서의 스파이 찾기 대회

이 논문은 "내부자 위협 (Insider Threat)", 즉 회사 내부 직원이 악의적으로 정보를 유출하거나 실수로 기밀을 털어가는 사건을 인공지능 (AI) 이 어떻게 찾아낼 수 있는지 테스트한 연구입니다.

저자 제프리 플린트 (Jeffrey Flynt) 는 기존에 있던 테스트 방법의 문제점을 지적하고, 완전히 새로운 **"OrgForge-IT"**라는 도구를 소개합니다. 이를 쉽게 이해하기 위해 몇 가지 비유를 들어보겠습니다.


1. 왜 새로운 도구가 필요했을까요? (기존의 문제점)

기존의 테스트 데이터 (CERT 데이터셋) 는 마치 **"완성된 퍼즐 조각"**처럼 보이지만, 실제로는 조각들이 서로 맞지 않을 수 있는 가짜 데이터였습니다.

  • 문제: AI 가 "3 시에 Slack 에서 메시지를 보냈다"고 기록했는데, 정작 "9 시에 JIRA 티켓을 만들었다"는 기록과 시간이 겹치거나 모순되는 경우가 있었습니다. AI 가 이 모순을 알아차릴 수 없으니, 정확한 평가를 할 수 없었습니다.
  • 비유: 마치 가짜 뉴스를 만들어서 사실 확인 능력을 테스트하는 것과 같습니다. 뉴스 자체가 엉터리라면, 누가 사실을 찾아내는지 알 수 없죠.

2. OrgForge-IT 의 핵심 아이디어: "진실의 엔진"

이 연구의 가장 큰 특징은 **"물리 엔진 (Physics Engine)"**과 **"작가 (AI)"**를 분리한 것입니다.

  • 물리 엔진 (진실): 컴퓨터 프로그램이 모든 '사실'을 통제합니다. "누가, 언제, 어디서, 무엇을 했다"는 기록은 이 엔진이 100% 정확하게 관리합니다.
  • 작가 (AI): 오직 '말'만 씁니다. "안녕하세요, 오늘 회의가 있었어요" 같은 문장만 생성합니다.
  • 비유: 드라마 촬영을 생각해보세요.
    • 감독 (엔진): "배우 A 는 3 시에 커피를 마셨고, 4 시에 문을 나갔다"는 대본과 시간표를 완벽하게 통제합니다.
    • 배우 (AI): 대본에 따라 대사를 말하고 표정을 짓습니다.
    • 결과: 감독이 대본을 완벽하게 통제하므로, "배우가 커피를 마셨는데 문이 닫혀 있었다"는 모순이 발생할 수 없습니다. 이것이 바로 **검증 가능한 진실 (Verifiable Ground Truth)**입니다.

3. 테스트 내용: 51 일간의 미스터리

이 벤치마크는 51 일 동안의 회사 생활을 시뮬레이션했습니다.

  • 데이터 양: 약 2,900 개의 기록 (Slack 메시지, 이메일, 로그인 기록 등).
  • 소음 (Noise): 이 중 96% 는 평범한 일상 (소음) 이고, 진짜 위험한 사건은 4% 만입니다.
  • 미션: AI 가 이 '소음' 속에서 진짜 스파이 3 명을 찾아내야 합니다.

네 가지 어려운 미션:

  1. 유령 로그인 (Ghost Login): 누군가 로그인은 했지만, 그 후 아무것도 하지 않았습니다. "무엇이 없었는지"를 찾아야 합니다.
  2. 보이스 피싱 (Vishing): 해커가 전화를 걸어 직원의 비밀번호를 훔쳤습니다. 로그인은 피해자 이름으로 남지만, 실제 범인은 해커입니다. AI 가 "누가 범인이고 누가 피해자인지" 구분해야 합니다.
  3. 데이터 도둑질 (3 단계): 파일을 복사하고, 압축하고, 클라우드에 올리는 3 단계 과정이 3 일 동안 이어집니다. 하루만 보면 놓칩니다.
  4. 신뢰 쌓기: 처음엔 친절한 사람이지만, 며칠 뒤 공격을 합니다. 긴 시간의 간격을 기억해야 합니다.

4. AI 들의 성적표 (10 개 모델 비교)

10 개의 AI 모델을 테스트한 결과는 매우 흥미로웠습니다.

  • 1 단계 (수색): 대부분의 AI 가 "의심스러운 사람이 있네?"라고 80% 정도는 잘 찾아냈습니다. (모두 비슷함)
  • 2 단계 (판단): 하지만 "이 사람이 진짜 범인인가, 아니면 억울한 피해자인가?"를 판단하는 단계에서 두 그룹으로 갈라졌습니다.
    • Tier A (최고급): Devstral 2Claude Opus가 100% 정답을 맞췄습니다. 특히 보이스 피싱 사건에서 "이 사람은 범인이 아니라 피해자야!"라고 정확히 판단했습니다.
    • Tier B (일반): 나머지 8 개 모델은 범인은 찾았지만, 피해자를 범인으로 오인했습니다. "로그인이 이상하니까 이 사람이 나쁜 거야!"라고 잘못 판단한 것입니다.

5. 중요한 교훈: "거짓 경보"가 진짜 문제다

이 연구에서 가장 중요한 발견은 "정답률 (F1)"만 보면 안 된다는 것입니다.

  • 어떤 AI 는 범인을 다 찾아냈지만, 무고한 직원 39 명까지 "의심스럽다"고 신고했습니다. (실제 운영에서는 불가능한 일입니다. 너무 많은 거짓 경보에 시달리게 되니까요.)
  • 비유: 불조심 경보가 100 번 울렸는데, 99 번은 연기 (거짓) 였다면, 사람들은 경보를 무시하게 됩니다.
  • 결론: 범인을 찾는 능력도 중요하지만, **무고한 사람을 얼마나 적게 의심하느냐 (거짓 경보율)**가 훨씬 중요합니다.

6. AI 의 약점: "말"과 "이해"의 차이

AI 는 상황을 잘 이해해도, 말을 잘못 표현하면 점수를 못 받았습니다.

  • 비유: AI 가 "범인은 파일을 압축해서 보냈어"라고 정확히 이해했는데, 정답 키에 있는 단어는 "데이터 도둑질"이었습니다. AI 가 "압축"이라는 단어를 썼으니 0 점 처리된 것입니다.
  • 해결: AI 가 상황을 정확히 이해했는지 (이해력) 와 정해진 용어를 썼는지 (표현력) 를 따로 평가해야 한다는 제안이 나왔습니다.

📝 요약: 이 연구가 우리에게 주는 메시지

  1. 진짜 테스트가 필요하다: AI 를 평가할 때는 모순 없는 '진짜' 데이터를 기반으로 해야 합니다.
  2. 판단력이 핵심: 단순히 이상한 것을 찾는 것보다, 누가 진짜 범인이고 누가 억울한지 구분하는 능력이 중요합니다.
  3. 소음에 속지 말자: 범인을 잘 찾아도, 무고한 사람을 너무 많이 의심하면 시스템은 쓸모가 없습니다.
  4. AI 의 한계: AI 는 상황을 잘 이해할 수 있지만, 우리가 정해준 '말'을 쓰지 않으면 점수를 못 받습니다.

이 연구는 AI 가 보안 전문가 (SOC) 를 도울 때, 단순히 "이상한 것"을 찾는 로봇이 아니라, 복잡한 상황을 종합적으로 판단하고 무고한 사람을 보호할 수 있는 지능이 필요함을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →