← 최신 논문
💻 computer science

Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection

이 논문은 이해관계자별 우선순위를 반영한 다차원 평가 프레임워크인 'SecLens-R'을 제안하여, 기존 단일 지표로는 파악하기 어려운 다양한 역할 (CISO, 엔지니어 등) 에 따라 LLM 의 취약점 탐지 성능이 크게 달라질 수 있음을 입증합니다.

원저자: Subho Halder, Siddharth Saxena, Kashinath Kadaba Shrish, Thiyagarajan M

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Subho Halder, Siddharth Saxena, Kashinath Kadaba Shrish, Thiyagarajan M

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🕵️‍♂️ 비유: "보안 검사관"을 뽑는 면접

상상해 보세요. 한 회사가 새로운 **보안 검사관 (AI)**을 뽑으려고 합니다. 기존에는 모든 검사관을 한 가지 점수 (예: 100 점 만점에 85 점) 로만 평가했습니다. 하지만 이 논문은 "그건 너무 단순하다"고 말합니다.

왜냐하면 회사 내의 서로 다른 사람들은 검사관에게서 서로 다른 것을 원하기 때문입니다.

1. 다섯 가지 눈 (역할) 과 그들의 요구사항

이 논문은 5 가지 다른 관점 (역할) 을 설정하고, 각자가 어떤 검사관을 원하는지 정의했습니다.

  • 🛡️ CISO (정보 보안 책임자): "실수하면 안 돼!"

    • 관점: "이 검사관이 진짜 위험한 해킹 구멍을 놓치지 않을까?"
    • 중요한 것: 놓치지 않기 (Recall). 아주 작은 구멍이라도 놓치면 큰일 나니까, "아마도 위험할 것 같다"라고 많이 알려주는 검사관을 좋아합니다. (오탐은 좀 있어도 괜찮음)
    • 비유: "집에 도둑이 들지 않았는지 확인하는 경비원. 도둑이 하나도 없으면 좋겠지만, 만약 도둑이 있을 때 '아마도 있을 거야'라고 100 번 말해주는 게 낫다."
  • 🏗️ 엔지니어링 팀장: "일 방해하지 마!"

    • 관점: "이 검사관이 개발자들의 일하는 속도를 늦추거나, 엉뚱한 곳을 '위험하다'고 떠들지 않을까?"
    • 중요한 것: 정확도 (Precision). "위험하다"고 말하면 100% 위험해야 함. 거짓 경보가 많으면 개발자들이 검사관을 무시하게 됨.
    • 비유: "현장 감독. "여기 위험해!"라고 소리치면 진짜 위험해야 함. 안 그런 소리만 계속하면 사람들이 귀를 막고 무시해버림."
  • 🤖 CAIO (최고 AI 책임자): "돈과 성능의 균형"

    • 관점: "이 검사관이 너무 비싸지 않고, 스스로 문제를 해결할 수 있을까?"
    • 중요한 것: 비용 대비 성능.
  • 🔬 보안 연구원: "이해가 깊어야 해"

    • 관점: "이 검사관이 왜 위험한지 논리적으로 설명할 수 있을까?"
    • 중요한 것: 이유와 증거.
  • 🤖 AI 에이전트 (스스로 작동하는 로봇): "내가 할 수 있는 한도 안에서는 잘 해"

    • 관점: "이 검사관이 프로그램이 멈추거나 (크래시), 엉뚱한 형식으로 답을 내놓지 않을까?"
    • 중요한 것: 안정성과 형식 준수.

📊 놀라운 결과: 같은 검사관, 다른 점수

이 논문의 가장 충격적인 발견은 **"동일한 AI 모델이 보는 사람에 따라 점수가 완전히 달라진다"**는 것입니다.

  • 예시 1: Qwen3-Coder 모델

    • 엔지니어링 팀장이 보면: "A (76.3 점)" 🌟
      • 이유: 거짓 경보가 거의 없어서 개발자들이 좋아함.
    • **CISO(보안 책임자)**가 보면: "D (45.2 점)" 💀
      • 이유: 진짜 위험한 구멍을 너무 많이 놓쳐서.
    • 결과: 같은 모델이 31 점이나 차이 남!
  • 예시 2: GPT-5.4 모델

    • 엔지니어링 팀장이 보면: "A (76.7 점)" 🌟
    • **CISO(보안 책임자)**가 보면: "D (48.4 점)" 💀
    • 이유: 매우 신중해서 "위험하다"고 말하기는 하지만, 진짜 위험한 건 놓치는 경우가 많음.
  • 예시 3: Gemini 3 Flash 모델

    • CISO가 보면: "B (73.3 점)" (전체 순위 1 등)
    • 하지만 엔지니어링 팀장이 보면: "B (66.2 점)" (조금 떨어짐)
    • 이유: 위험을 많이 찾아내지만, 가끔 엉뚱한 곳도 위험하다고 해서 개발자들이 조금 짜증남.

💡 이 논문이 우리에게 주는 교훈

  1. "최고의 AI"는 없다.

    • "누가 1 등인가?"라고 묻는 것은 의미가 없습니다. "우리 회사의 보안 책임자가 원한다면 A 모델이 최고지만, 개발 팀장이 원한다면 B 모델이 최고"일 뿐입니다.
  2. 단일 점수는 속임수다.

    • 기존 평가는 모든 것을 합쳐서 하나의 점수만 줬습니다. 하지만 이는 중요한 정보 (예: "이 모델은 보안 책임자에게는 쓸모없다") 를 가려버립니다.
  3. 상황에 맞는 선택이 필요하다.

    • 예산이 부족하고 빠른 개발이 중요하다면? -> 엔지니어링 점수가 높은 모델을 고르세요.
    • 보안 사고가 절대 일어나서는 안 된다면? -> CISO 점수가 높은 모델을 고르세요.

🎯 결론

이 논문은 **"하나의 점수로 모든 것을 판단하지 말라"**고 외치고 있습니다. 마치 **"가장 빠른 차"**를 고를 때, 레이서에게는 최고지만, 가족을 태우고 안전하게 이동하려는 아빠에게는 최악일 수 있는 것과 같습니다.

SecLens-R은 각자의 역할 (CISO, 엔지니어 등) 에 맞춰 **"우리에게 가장 적합한 AI 는 누구인가?"**를 찾아낼 수 있는 나침반을 제공해 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →