← 최신 논문
💻 computer science

Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering?

본 논문은 도메인 전문가들과의 연구를 통해 네트워크 침입 탐지 시스템(NIDS) 규칙 엔지니어링에서 거대 언어 모델의 신뢰성을 조사하며, 거대 모델들이 구문론적으로는 올바른 규칙을 생성하지만 의미론적 부정확성과 환각 현상이 자율적인 생성보다는 보조적인 초안 작성 역할로의 배포를 제한한다는 점을 밝혀낸다.

원저자: Lorenzo di Filippo, Enkeleda Bardhi, Andrea Agiollo, Alessandro Palma, Silvia Bonomi, Fernando Kuipers

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lorenzo di Filippo, Enkeleda Bardhi, Andrea Agiollo, Alessandro Palma, Silvia Bonomi, Fernando Kuipers

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 북적이는 도시의 보안 책임자라고 상상해 보십시오. 당신의 업무는 보안 요원(네트워크 침입 탐지 시스템, NIDS)에게 무엇을 감시해야 하는지 정확히 알려주는 "법(규칙)"을 작성하는 것입니다. 만약 자동차가 일방통행 도로에서 역주행을 한다면, 보안 요원은 이를 막기 위한 구체적인 법이 필요합니다. 만약 도둑이 자물쇠를 따려고 시도한다면, 보안 요원은 경보를 울릴 규칙이 필요합니다.

수년 동안 이러한 법을 작성하는 것은 고되고 수동적인 작업이었습니다. 이는 도시가 어떻게 돌아가는지, 도둑들이 어떻게 움직이는지, 그리고 법전의 정확한 문법이 무엇인지에 대한 깊은 지식을 요구합니다. 하지만 범죄가 그 어느 때보다 빠르게 진화함에 따라, 인간 전문가들은 지치고, 압도당하며, 시간이 부족한 상황에 직면해 있습니다.

여기에 **대규모 언어 모델(LLM)**이 등장합니다. 이들을 모든 책을 다 읽은 아주 똑똑한 AI 기반의 법률 사무관이라고 생각해보십시오. 이 논문이 던지는 핵심 질문은 이것입니다: "우리는 이 AI 사무관들이 우리 보안 요원들을 위한 실제 법을 작성하도록 믿고 맡길 수 있을까, 아니면 그저 종이 위에서만 그럴싸해 보이는 헛소리를 써 내려갈 것인가?"

연구진은 단순히 AI에게 규칙을 쓰라고 요청한 것이 아니라, 10명의 실제 보안 전문가(판사)들로 구성된 엄격한 테스트를 설정하여 어떤 결과가 나타나는지 확인했습니다. 그 결과를 알기 쉽게 설명해 드립니다.

1. "완벽한 문법, 틀린 의미"의 역설

AI 사무관들은 문법에는 매우 뛰어납니다. 보안 규칙을 작성하라는 요청을 받았을 때, AI는 철자, 구두점, 구조를 거의 항상 완벽하게 맞춥니다. 이는 마치 철자와 구두점은 완벽하지만, 실제 세상에서는 전혀 말이 안 되는 말을 하는 학생과 같습니다.

  • 발견된 사실: AI는 컴퓨터가 오류 없이 받아들일 수 있는 규칙(구문론적으로 올바른 규칙)을 작성할 수 있습니다. 하지만 인간 전문가들이 검토했을 때, 그 규칙들은 너무 모호하거나 논리적으로 결함이 있는 경우가 많았습니다. 약 12%의 경우, AI는 "환각 현상(Hallucination)"을 일으켜, 공식적인 문서처럼 보이지만 실제로는 범죄자를 잡지 못하는 규칙을 만들어냈습니다.

2. 크기가 중요하다 (큰 뇌 vs 작은 뇌)

연구진은 다양한 크기의 AI 모델을 테스트했습니다.

  • 작은 모델: 훈련이 거의 되지 않은 인턴이라고 생각하면 됩니다. 이들은 거의 완전히 실패했습니다. 컴퓨터가 수용할 수 있는 규칙조차 제대로 쓰지 못했습니다.
  • 큰 모델: 이들은 숙련된 교수님이라고 생각하면 됩니다. 이들은 훨씬 더 나았으며, "문법"을 85~90% 정도 정확하게 맞췄습니다.
  • 함정: "교수님"들조차 많은 도움이 필요했습니다. 이들은 종종 첫 번째 초안을 틀리게 작성했으며, 사용 가능한 규칙이 되기까지 여러 번의 수정을 거쳐야 했습니다.

3. "너무 일반적이다"라는 문제

이것은 인간 전문가들의 가장 큰 불만이었습니다.

  • 비유: 보안 요원이 "어떤 차든 훔친 차일 수도 있다"며 모든 차량을 세운다고 상상해 보십시오. 그것은 도움이 되지 않습니다. 교통을 방해하고 혼란을 야기할 뿐입니다.
  • 실제 상황: AI는 규칙을 너무 광범위하게 작성하는 경향이 있었습니다. "번호판이 ABC-123인 빨간 트럭을 세워라"라고 말하는 대신, AI는 "모든 차량을 세워라"라고 말하곤 했습니다. 전문가들은 이러한 규칙들이 너무 많은 오경보(노이즈)를 발생시켜 실제 위협을 찾기 어렵게 만들 것이라고 지적했습니다. AI는 정확한 트래픽 유형이나 단서의 정밀한 위치와 같은 구체적인 세부 사항을 파악하는 데 어려움을 겪었습니다.

4. 여전히 인간이 주인이다

연구진은 AI가 조수가 아닌 조력자 역할을 하는 시스템을 구축했습니다. 전문가들에게 AI와 대화하며 작업을 확인하고 실수를 바로잡을 수 있는 도구를 제공한 것입니다.

  • 결과: 전문가들은 초안 작성 및 설명 용도로 이 도구를 사용하는 것을 매우 좋아했습니다. 그들은 도구가 사용하기 쉽고 복병한 규칙을 더 빨리 이해하도록 도와준다고 말했습니다.
  • 신뢰 문제: 그러나 그 누구도 AI가 단독으로 작동하는 것을 신뢰하지 않았습니다. 그들은 AI를 "규칙 작성자"가 아닌 "초안 작성 보조자" 또는 "맞춤법 검사기"로 보았습니다. AI가 규칙을 작성하더라도, 전문가들은 그것을 실제 시스템에 적용하기 전에 처음부터 다시 쓰거나 대폭 수정해야 했습니다.
  • 판결: 전문가들은 이렇게 말했습니다. "우리는 업무 속도를 높이기 위해 이 도구를 사용하겠지만, AI가 단독으로 최종 결정을 내리게 하지는 않을 것입니다."

5. "맥락(Context)"이라는 단서

AI는 "개념 증명(Proof of Concept, 해커가 공격하는 방식의 샘플)"과 같은 배경 정보를 더 많이 제공받았을 때 더 나은 성능을 보였습니다. 이는 법률 사무관에게 단순히 범죄자의 설명만 주는 것이 아니라, 범죄자의 사진을 함께 주는 것과 같습니다. 하지만 AI가 이러한 추가 정보를 혼란 없이 처리하려면 반드시 "큰 뇌(대규모 모델)"를 가져야 했습니다.

결론

이 논문은 AI가 보안 전문가를 위한 훌륭한 보조자—문법을 확인하고, 복잡한 개념을 설명하며, 거친 초안을 작성하는 데 탁월한—가 될 수는 있지만, 보안 규칙의 설계자가 되기에는 아직 준비가 되지 않았다고 결론짓습니다.

전문가들은 AI가 업무 속도를 높여주는 미래를 보고 있지만, "인간이 과정에 개입(Human in the loop)"해야 한다는 점을 강조합니다. 그들은 실수(해커를 들여보내거나 정당한 사용자를 차단하는 것)의 비용이 너무 크기 때문에, 기계에게 모든 것을 맡길 수 없으며 직접 검토하고 싶어 합니다.

요약하자면: AI는 완벽한 문장을 쓰는 아주 유능한 서기이지만, 이야기가 실제로 말이 되는지 확인하기 위해서는 여전히 인간 편집자가 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →