← 최신 논문
🤖 machine learning

RuleForge: Automated Generation and Validation for Web Vulnerability Detection at Scale

이 논문은 CVE 의 급증에 대응하기 위해 구조화된 Nuclei 템플릿을 기반으로 웹 취약점 탐지 규칙을 자동 생성하고, LLM 을 활용한 심층 검증 및 피드백 루프를 통해 오검출을 67% 감소시킨 AWS 의 'RuleForge' 시스템 아키텍처와 운영 성과를 제시합니다.

원저자: Ayush Garg, Sophia Hager, Jacob Montiel, Aditya Tiwari, Michael Gentile, Zach Reavis, David Magnotti, Wayne Fullen

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ayush Garg, Sophia Hager, Jacob Montiel, Aditya Tiwari, Michael Gentile, Zach Reavis, David Magnotti, Wayne Fullen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏭 1. 문제 상황: "해커 공장" vs "수동 경비원"

상상해 보세요. 해커들이 매일 수천 개의 새로운 '침입 도구' (취약점, CVE) 를 만들어냅니다.

  • 과거: 보안 팀은 이 도구들을 하나하나 분석하고, "이런 공격이 오면 저런 경보를 울려라"라는 규칙 (Rule) 을 직접 손으로 작성했습니다.
  • 현재: 2025 년만 해도 새로운 취약점이 4 만 8 천 개나 쏟아졌습니다. 인간이 이 속도로 규칙을 만들면, 해커가 이미 100 번 공격하고 떠난 뒤에야 규칙이 만들어지는 꼴이 됩니다.

RuleForge는 바로 이 '규칙 작성 공장' 입니다. 해커의 공격 패턴을 설명하는 문서를 읽어서, 자동으로 경보 규칙을 만들어냅니다.


🤖 2. RuleForge 가 어떻게 일하는가? (3 단계 과정)

이 시스템은 크게 세 가지 단계로 작동합니다.

① 재료 준비 (CVE 선별)

모든 취약점을 다 만들 필요는 없습니다. 중요한 것만 골라야 하죠.

  • 비유: 요리사가 모든 재료를 다 사지 않고, '오늘 가장 유행하는 해산물'과 '위험한 독버섯'만 골라내는 과정입니다.
  • 시스템은 해커들이 실제로 공격을 시도하고 있는지 (CISA KEV 등) 를 확인하고, 가장 위험한 취약점부터 순서대로 골라냅니다.

② 요리하기 (규칙 생성 - 5x5 전략)

여기서 RuleForge 의 핵심 아이디어가 나옵니다.

  • 비유: 한 가지 요리를 만들 때, 한 명의 요리사가 한 번만 해보는 게 아니라, 5 명의 요리사가 동시에 5 가지 다른 레시피로 요리를 해봅니다. 그리고 실패하면 다시 5 번까지 수정해볼 기회를 줍니다.
  • 기술적 설명: AI(대형 언어 모델) 가 한 번에 5 개의 규칙 후보를 만듭니다. 만약 첫 번째가 실패하면, AI 는 "왜 실패했지?"라는 피드백을 받아 5 번까지 수정하며 더 좋은 규칙을 만들어냅니다. 이렇게 하면 '최고의 요리'가 나올 확률이 훨씬 높아집니다.

③ 맛보기와 검사 (검증 시스템)

만든 규칙이 정말 잘 작동하는지 확인해야 합니다. 여기서 가장 혁신적인 부분이 나옵니다.

  • 가짜 해커 테스트 (Synthetic Testing): AI 가 만든 가짜 해킹 시나리오를 규칙에 넣어보며 "해킹을 잡아냈는가?"를 확인합니다.
  • AI 심사위원 (LLM-as-a-judge): 이것이 이 논문의 하이라이트입니다.
    • 비유: 규칙을 만든 AI 가 "내 요리 완벽해요!"라고 자부심을 느끼는 게 아니라, 다른 AI 심사위원이 "이 규칙은 너무 민감해서 innocent(무고한) 사람까지 잡을 수 있진 않나?", "혹시 해커를 놓칠 뻔한 건 없나?"라고 비판적으로 질문합니다.
    • 이 심사위원 AI 는 규칙의 민감도 (해커 놓치지 않기) 와 특이도 (무고한 사람 잡지 않기) 점수를 매깁니다.
    • 결과: 이 시스템을 도입한 후, 잘못된 경보 (거짓 양성) 가 67% 줄어든 것으로 나타났습니다. 즉, "아니, 그 사람은 해커가 아니야!"라고 외치는 소음이 크게 줄어든 것입니다.

🚀 3. 실제 성과와 미래

  • 생산성 폭발: 이 시스템을 도입한 후, AI 가 만든 규칙의 양이 인간이 만드는 것보다 336% 더 많아졌습니다. 인간은 38% 늘어난 반면, AI 는 4 배 이상 성장한 셈입니다.
  • 정확도 유지: 양이 많아졌다고 해서 질이 떨어지지 않았습니다. 오히려 AI 심사위원이 걸러내서, 실제 운영 환경에서 쓸모없는 규칙은 걸러냈습니다.

🌟 미래의 확장 (생각해 볼 거리)

현재는 주로 웹사이트 (HTTP) 공격을 막지만, 앞으로는 더 넓은 영역으로 확장할 계획입니다.

  • 문서 읽기: 해커가 블로그나 뉴스에 쓴 복잡한 글 (구조화되지 않은 데이터) 에서도 규칙을 뽑아낼 수 있도록 발전 중입니다.
  • 에이전트 워크플로우: 마치 한 팀의 조사관처럼, "이건 웹 공격이야, 저건 서버 공격이야"라고 스스로 판단해서 각기 다른 방어 규칙을 만들어내는 지능형 에이전트 시스템을 구상 중입니다.

💡 핵심 교훈 (요약)

이 논문이 우리에게 주는 메시지는 간단합니다:

  1. AI 는 혼자 믿으면 안 된다: AI 가 규칙을 만들 때, 또 다른 AI 가 "비판가" 역할을 해서 꼼꼼히 검증해야 합니다. (특히 "잘못된 점"을 찾으라고 물어보는 것이 "올바른 점"을 물어보는 것보다 더 정확합니다.)
  2. 여러 번 시도하라: 한 번에完美的한 것을 만들려 하지 말고, 여러 개의 후보를 만들어서 서로 경쟁시키고 수정하는 과정이 중요합니다.
  3. 인간의 손길이 필요하다: AI 가 99% 를 해내지만, 마지막 1% 의 결정과 피드백은 보안 전문가의 손이 필요합니다.

한 줄 요약:

"RuleForge 는 해커들의 빠른 공격 속도를 따라잡기 위해, AI 가 규칙을 만들고 또 다른 AI 가 엄격하게 심사하며, 인간이 최종 확인하는 자동화된 보안 공장입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →