← 최신 논문
💻 computer science

RealVuln: Benchmarking Rule-Based, General-Purpose LLM, and Security-Specialized Scanners on Real-World Code

이 논문은 26 개의 실제 취약점 Python 저장소를 기반으로 규칙 기반 SAST, 범용 LLM, 보안 특화 스캐너 등 15 가지 도구를 비교한 'RealVuln' 벤치마크를 소개하며, 보안 특화 도구가 범용 LLM 과 규칙 기반 도구를 압도하는 3 단계 성능 계층 구조를 확인했다고 요약할 수 있습니다.

원저자: John Pellew, Faizan Raza

게시일 2026-04-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: John Pellew, Faizan Raza

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"실제 해킹이 일어나는 현장 (실제 코드) 에서, 누가 가장 잘 범인을 잡을 수 있을까?"**를 테스트한 실험 결과입니다.

마치 치안 유지를 위해 세 가지 다른 종류의 **'수사관'**을 불러와서, 실제 범죄가 발생한 26 개의 가짜 마을 (교육용 취약한 프로그램) 에서 범인을 얼마나 잘 찾아내는지, 그리고 엉뚱한 사람을 잡지 않았는지 비교한 이야기라고 생각하시면 됩니다.

이 실험의 주인공들은 다음과 같습니다.

1. 세 가지 수사관 (스캐너) 종류

  1. 규칙 기반 수사관 (Rule-Based SAST):

    • 비유: "범인은 항상 검은 모자를 쓴다"라는 매뉴얼만 믿는 형사입니다.
    • 특징: 미리 정해진 패턴 (예: "SQL 인젝션은 이런 문법으로 쓴다") 과 딱딱 맞아떨어지는 경우만 잡습니다. 하지만 범인이 모자를 안 쓰고 다른 옷을 입으면 놓쳐버립니다.
    • 결과: 범인을 잡는 능력 (재현율) 이 매우 낮았습니다.
  2. 일반적인 AI 수사관 (General-Purpose LLM):

    • 비유: 만능 지능형 형사입니다. 범인 잡는 법은 배우지 않았지만, 언어를 이해하고 추론하는 능력이 탁월합니다.
    • 특징: "이 문맥을 보면 수상해"라고 생각하며 범인을 찾아냅니다. 규칙만 따르는 형사보다는 훨씬 똑똑하지만, 보안 전문가로 훈련받은 건 아니라 가끔 헷갈리기도 합니다.
    • 결과: 규칙 기반 형사보다는 훨씬 잘 잡았지만, 전문 수사관보다는 조금 부족했습니다.
  3. 보안 전문 수사관 (Security-Specialized Scanner):

    • 비유: 오직 범인 잡는 일만 위해 태어난 특수부대입니다.
    • 특징: 범인의 심리, 범죄 수법, 숨은 흔적을 찾아내는 데 특화된 훈련을 받았습니다.
    • 결과: 압도적인 1 위를 차지했습니다.

2. 실험 결과: 누가 이겼나?

이 실험에서는 **"범인을 놓치는 것 (실수)"**이 **"무고한 사람을 잡는 것 (오보)"**보다 훨씬 치명적이라고 가정했습니다. (한 명의 범인을 놓치면 마을이 파괴될 수 있으니까요.)

  • 🏆 1 위: 보안 전문 수사관 (Kolega.Dev)

    • 성적: 73 점 (만점 100 점 기준).
    • 특징: 범인을 80% 이상 찾아냈습니다. 물론 엉뚱한 사람도 잡는 경우가 좀 있었지만 (정밀도는 낮음), 중요한 건 범인을 놓치지 않았다는 점입니다.
    • 비유: "범인일 가능성이 있는 사람 10 명을 잡아서 조사하면, 그중 4 명은 범인이지만 나머지 6 명은 무고할 수도 있어. 하지만 진짜 범인은 절대 놓치지 않아!"
  • 🥈 2 위: 만능 AI 형사 (Claude Sonnet 등)

    • 성적: 51 점.
    • 특징: 범인을 50% 정도만 잡았습니다. 엉뚱한 사람을 잡는 일은 적었지만, 진짜 범인을 놓치는 경우가 많았습니다.
    • 비유: "수사관이 똑똑해서 무고한 사람을 잘 안 잡지만, 범인이 위장술을 쓰면 놓쳐버려."
  • 🥉 3 위: 규칙 기반 형사 (Semgrep 등)

    • 성적: 17 점.
    • 특징: 범인을 20% 미만만 잡았습니다.
    • 비유: "매뉴얼에 없는 범인은 아예 못 봄. 범인이 조금만 변장해도 놓쳐버림."

3. 핵심 교훈 (이 논문이 말하고자 하는 것)

  1. "똑똑한 AI"만으로는 부족합니다:
    범인을 잡는 일은 단순히 "지식"이 많은 것만으로는 해결되지 않습니다. 보안이라는 특수한 목적에 맞춰 설계된 시스템이 있어야 합니다. 일반적인 AI 는 범인 잡는 데는 '아마추어'일 뿐입니다.

  2. 놓치는 것보다 잡는 게 중요합니다:
    보안에서는 "무고한 사람을 잡아서 조사하는 수고"보다 "진짜 범인을 놓쳐서 해를 입는 것"이 훨씬 큰 문제입니다. 그래서 **범인을 놓치지 않는 능력 (재현율)**을 가장 중요하게 평가했습니다.

  3. 비용 효율성:
    전문 수사관 (Kolega.Dev) 이 가장 비싼 만능 AI 보다 더 싸고 더 잘 잡았습니다. (비용 대비 성능이 가장 뛰어났습니다.)

4. 결론

이 실험은 **"보안 문제를 해결하려면, 범인 잡는 데 특화된 전문 도구 (Security-Specialized) 를 써야 한다"**는 것을 증명했습니다.

지금까지 많은 기업들이 "범인 잡는 법을 알려줘"라고 일반적인 AI 에게 물어보며 시간을 보냈지만, 이 연구는 **"범인 잡는 법을 배운 특수부대 (전문 도구) 를 써야 진짜 안전하다"**고 말합니다.

이 실험 결과와 데이터는 모두 공개되어 있어, 누구나 다시 검증하거나 새로운 수사관 (스캐너) 을 시험해 볼 수 있습니다. 마치 치안 유지 시스템을 계속 발전시키기 위해 모든 자료를 공개한 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →