← 최신 논문
💻 computer science

Parser-Free Querying of Security Logs

본 논문은 자연어 보안 쿼리에 대한 실행 가능 코드를 생성하기 위해 자동으로 추출된 로그 형식 컨텍스트에 기반한 대규모 언어 모델을 활용하는 Sieve라는 시스템을 소개하며, 이는 수동 스크립팅에 비해 복잡한 시계열 및 교차 이벤트 로그 분석에서의 오류율을 현저히 감소시킵니다.

원저자: Evan Luo, Julien Piet, David Wagner

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Evan Luo, Julien Piet, David Wagner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 범죄를 해결하려는 보안 탐정이라고 상상해 보세요. 당신은 서버, 방화벽, 사용자 계정 등 다양한 사람들과 시스템이 남긴 수백만 페이지 분량의 손으로 쓴 메모, 영수증, 로그로 이루어진 거대한 증거 더미를 가지고 있습니다. 문제는 모든 사람이 각자의 messy하고 일관성 없는 필체로 쓴다는 점입니다. 한 사람은 날짜를 "Jan 1"로 쓰고, 다른 사람은 "01/01"로 쓰며, 또 다른 이는 그냥 "Monday"라고 씁니다. 어떤 메모는 스티키 노트에, 다른 것은 냅킨에 적혀 있고, 잉크 색상도 다양합니다.

사건을 해결하려면 "새벽 2 시에서 4 시 사이에 건물에 침입하려 시도한 모든 기록을 보여줘"와 같은 구체적인 질문을 던져야 합니다.

구식 방법: 과로한 사서

전통적으로 보안 팀은 이 문제를 해결하기 위해 사서들 (파서) 팀을 고용하여 모든 메모를 하나씩 읽고, 필체 스타일을 파악한 뒤, 완벽한 통일된 스프레드시트로 모든 내용을 다시 작성하려 합니다.

  • 장점: 스프레드시트가 완성되면 질문을 던지는 것이 빠르고 쉽습니다.
  • 단점: 스프레드시트를 만드는 데는 영원히 걸립니다. 누군가 약간 다른 방식으로 메모를 쓰기 시작할 때마다 사서들은 작업을 멈추고 새로운 스타일을 배운 뒤 규칙을 다시 작성해야 합니다. 만약 이전에 본 적 없는 새로운 유형의 메모가 나타나면, 사서들이 이를 수정할 때까지 전체 시스템이 마비됩니다.

대안: 그립 (grep) 탐정

다른 옵션은 사서들을 완전히 건너뛰는 것입니다. 당신은 돋보기 (grep 과 같은 도구) 를 들고 직접 원본이고 messy 한 메모들을 스캔합니다.

  • 장점: 즉시 시작할 수 있습니다. 사서들을 기다릴 필요가 없습니다.
  • 단점: 가능한 모든 필체 스타일이 정확히 어떻게 생겼는지 알아야 합니다. '침입 (break-in)'이라는 단어의 변형 중 하나라도 놓치면 그 단서를 놓치게 됩니다. 또한, "60 초 이내에 두 개의 다른 문으로 들어온 사람들을 찾아라"와 같은 복잡한 질문은 텍스트 줄을 수동으로 스캔하는 것만으로는 수행하기 매우 어렵습니다.

새로운 해결책: 체 (Sieve, 스마트 번역가)

이 논문은 당신을 위해 즉시 맞춤형 도구를 작성할 수 있는 초지능 번역가처럼 작동하는 Sieve라는 시스템을 소개합니다.

다음은 간단한 비유를 통해 Sieve 가 작동하는 방식입니다:

  1. 질문: Sieve 에게 평범한 영어로 질문을 던집니다. "5 분 시간 창에서 10 회 이상 침입을 시도한 모든 IP 주소를 찾아줘."
  2. 빠른 스캔: Sieve 는 백만 페이지 분량의 책을 처음부터 끝까지 읽는 대신, 처음 몇 페이지를 빠르게 넘겨 필체가 어떻게 생겼는지 확인합니다. 메모가 쓰이는 다양한 방식을 보여주는 작은 '요약 시트'를 작성합니다 (예: "아, 때로는 'Failed password'라고 하고, 때로는 'Auth failure'라고 하네").
  3. 코드 작성자: Sieve 는 당신의 질문과 이 작은 요약 시트를 매우 똑똑한 AI(대규모 언어 모델) 에게 보냅니다. AI 는 책 전체를 읽지 않고, 요약 시트를 활용하여 당신의 답변을 찾기 위해 특별히 설계된 맞춤형 컴퓨터 스크립트(작은 로봇 프로그램과 같은) 를 작성합니다.
  4. 실행: 이 맞춤형 스크립트가 원본 메모에서 실행됩니다. AI 가 요약 시트를 기반으로 작성했기 때문에, 'Failed password'와 'Auth failure'를 정확히 어떻게 찾아내고 어떻게 카운트해야 하는지 정확히 알고 있습니다.
  5. 결과: 스크립트가 답변을 제공합니다. 만약 스크립트에 실수 (오타 등) 가 있으면, Sieve 는 오류를 감지하고 AI 에게 알려 스크립트를 다시 작성하도록 요청합니다. 올바르게 될 때까지 최대 4 번까지 시도합니다.

이것이 중요한 이유

이 논문은 5 가지 다른 유형의 로그에 걸쳐 133 가지의 다양한 보안 질문으로 Sieve 를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  • 어려운 경우 인간보다 더 똑똑함: 질문이 단순할 때 (예: 'error'라는 단어 찾기), Sieve 는 빠른 스크립트를 작성하는 인간 전문가만큼 좋았습니다. 하지만 질문이 어려울 때 (예: 시간과 다른 사람들 간의 패턴 찾기), Sieve 는 처음부터 스크립트를 작성하려는 인간보다 실수를 3 배나 적게 범했습니다.
  • 완벽한 사서가 먼저 필요하지 않음: Sieve 는 미리 만들어진 스프레드시트가 필요하지 않습니다. messy 한 원본 메모에서 직접 작동합니다.
  • 단순함이 더 낫다: 논문은 필체 스타일을 파악하기 위해 고급스럽고 비싼 AI 가 필요하지 않음을 발견했습니다. 특정 구절이 얼마나 자주 나타나는지 단순히 세는 간단한 빠른 알고리즘이 복잡한 방법만큼이나 잘 작동합니다.
  • 안전하고 신뢰할 수 있음: AI 는 단순히 답을 추측하는 것이 아니라, 일반 컴퓨터 프로그램처럼 실행되는 코드를 작성합니다. 이는 결과가 결정적임을 (동일한 질문은 항상 동일한 답변을 얻음) 의미하며, 작동 방식을 정확히 파악하기 위해 코드를 살펴볼 수 있습니다.

결론

Sieve 는 원본 텍스트 검색의 속도와 구조화된 데이터베이스의 힘을 연결합니다. 이는 보안 분석가들이 복잡한 질문을 평범한 영어로 던져 즉시 정확한 답변을 얻을 수 있게 하며, 엔지니어들이 새로운 데이터베이스 스키마를 구축하거나 복잡한 스크립트를 직접 작성하는 데 애쓰는 기다림 없이 가능하게 합니다. Sieve 는 'messy 한 노트'를 한 번의 질문씩 실시간으로 검색 가능한 데이터베이스로 변환합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →