← 최신 논문
🤖 AI

Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks

본 논문은 사이버 보안 작업에서 최첨단 대규모 언어 모델이 높은 오검출률과 낮은 취약점 커버리지로 어려움을 겪는 반면, 구조화된 테스트 방법론을 적용한 도메인 특화 모델은 더 뛰어난 정밀도를 달성함을 보여주며, 이는 전문 데이터와 구조화된 공격 체인에 기반한 수직적 기초 모델이 효과적인 보안 응용에 필수적임을 시사한다.

원저자: Vivek Dahiya, Sunny Nehra, Vipul Dholariya, Bhavik Shangari, Chandra Khatri

게시일 2026-05-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vivek Dahiya, Sunny Nehra, Vipul Dholariya, Bhavik Shangari, Chandra Khatri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 일련의 복잡한 실제 건물 (웹 애플리케이션) 에 숨겨진 함정을 찾기 위해 천재적이고 범용적인 형사 팀 (프런티어 LLM) 을 고용했다고 상상해 보세요. 그들이 이 일을 할 준비가 되었는지 알고 싶습니다. 귀하가 제공한 논문은 엄격한 시험의 성적표이며, 소식은 엇갈립니다: 형사들은 똑똑하지만, 현재는 너무 서툴고 지나치게 조심스러워 혼자서 이 일을 맡길 수 없습니다.

다음은 그들의 성과를 간단한 비유를 통해 설명한 내용입니다.

1. 형사들을 테스트한 두 가지 방법

연구자들은 단순히 형사들에게 "주변을 살펴보라"고 요청하지 않았습니다. 그들은 두 가지 구체적인 방법으로 테스트를 진행했습니다:

  • "화이트박스" 테스트 (설계도 살펴보기): 형사들에게 소프트웨어의 실제 소스 코드 (설계도) 를 제공하여 함정이 정확히 어디에 있는지 지적하도록 했습니다.
  • "블랙박스" 테스트 (침입 및 무단 침입): 형사들에게 건물의 정문만 제공했습니다. 그들은 설계도를 보지 못한 채 도둑처럼 행동하여 몰래 침입하고, 자물쇠를 시험하며 약점을 찾아내야 했습니다.

2. "범용" 형사들의 문제점

연구자들은 이용 가능한 가장 진보된 여섯 가지 범용 AI 모델 (GPT-5.4, Claude, Gemini 등) 을 테스트했습니다. 여기서 문제가 발생했습니다:

  • "거짓 경보" 위기 (False Positives):
    설계도 테스트에서 범용 형사들은 극도로 paranoid 했습니다. 그들은 거의 모든 것을 함정으로 표시했습니다.
    • 비유: 공항의 금속 탐지기가 총뿐만 아니라 열쇠, 동전, 벨트 버클에도 경보음을 울린다고 상상해 보세요. 논문은 이러한 모델들이 안전한 코드의 10% 에서 50% 까지 위험하다고 잘못 표시했다고 밝혔습니다. 만약 이를 실제 업무에 사용한다면, 보안 팀은 실제로 고장 난 것이 아닌 모든 "경보"를 수동으로 확인해야 하므로 수 시간을 낭비하게 됩니다.
  • "거부" 문제:
    일부 가장 진보된 형사들 (특히 GPT-5.4) 은 아예 일을 거부했습니다.
    • 비유: 당신이 자물쇠가 약한지 확인하기 위해 테스트해 보라고 형사에게 요청하자, 그들이 "그건 못 해요! 누군가 침입하도록 부추길 수도 있어요!"라고 말합니다. 그들은 '안전'하도록 훈련받아서 너무 지나쳐 합법적인 보안 테스트조차 수행하지 않았습니다.
  • "미로에서 길을 잃음" 문제:
    "블랙박스" 테스트 (침입 시도) 에서 범용 형사들은 형편없었습니다. 그들은 실제 함정의 4% 에서 8% 만 발견했습니다. 심지어 그들에게 특수 도구 (마스터 키나 자물쇠 따기 세트 등) 를 제공하더라도 10–19% 로 약간만 개선되었습니다.
    • 비유: 그들은 도구를 가지고 있지만, 그것을 체계적으로 사용하는 방법을 모릅니다. 그들은 목적 없이 방황하고, 무작위로 시도하다가 포기하며, 전문가라면 쉽게 찾을 수 있는 명백한 함정을 놓칩니다.

3. 해결책: 전문화된 "수직" 형사들

이 논문은 모든 것을 조금씩 아는 범용 형사를 고용하는 대신, 전문 보안 전문가 (수직 기반 모델) 가 필요하다고 주장합니다.

  • "전문 공격" 에이전트:
    연구자들은 공격적 보안에 특화되도록 훈련된 전문 AI 를 구축했습니다. 범용 모델과 달리, 이 모델은 일을 거부하지 않았습니다. 그것은 침투 테스트의 전문적인 방법을 알고 있었습니다.
    • 결과: 이 전문 에이전트가 엄격한 단계별 체크리스트 (방법론) 를 따랐을 때, 함정의 50% 이상을 발견했습니다. 이는 큰 두뇌를 갖는 것보다 좋은 계획을 세우는 것이 더 중요함을 증명했습니다.
  • "전문 방어" 에이전트:
    연구자들은 코드에서 버그를 찾는 (방어) 전문 AI 도 구축했습니다.
    • 결과: 이 모델이 이 분야의 스타였습니다. 이는 가장 높은 정확도와 가장 적은 "거짓 경보" (거짓 긍정 9.7%) 를 보였습니다. 또한 거대한 범용 모델보다 훨씬 빠르고 저렴하게 실행할 수 있었습니다.

4. 비결: "에이전트 추론 그래프 (ARG)"

가장 인상적인 결과는 에이전트 추론 그래프 (Agentic Reasoning Graph, ARG) 라는 새로운 시스템에서 나왔습니다.

  • 비유: "창의적 형사 (LLM)"이 침입 방법을 생각해 내지만, "엄격한 판사 (AI 가 아닌 컴퓨터 프로그램)"가 증거를 검토하는 팀을 상상해 보세요.
  • AI 가 문을 해킹하는 방법을 제안하면, "판사"는 그것이 실제로 작동하는지 확인하기 위해 엄격하고 변경 불가능한 테스트를 실행합니다. 테스트가 실패하면 AI 의 추측은 폐기됩니다.
  • 왜 작동하는가: 이는 AI 가 (거기에 없는 함정을 상상하는) "환각"을 일으키는 것을 막습니다. 논문은 이 시스템이 실제 함정을 여전히 발견하면서도 거짓 경보를 크게 줄였음을 발견했습니다.

5. 왜 실패하는가? (부족한 데이터)

논문은 범용 모델이 실패하는 이유는 특정 훈련 데이터가 부족하기 때문이라고 결론지었습니다.

  • 비유: 자동차 사진만 보여주고 학생에게 운전하는 법을 가르친다고 상상해 보세요. 그들은 자동차가 어떻게 생겼는지 알지만, 핸들을 돌리거나 브레이크를 밟거나 펑크 난 타이어를 처리하는 법은 모릅니다.
  • 현재의 AI 모델들은 일반적인 인터넷 텍스트로 훈련되었습니다. 그들은 사이버 보안에 대한 "운전 수업"이 부족합니다: 그들은 단계별 공격 체인, 실패한 시도, 그리고 취약점이 실제로 악용 가능하다는 실제 증거에 대한 충분한 예시를 보지 못했습니다.

결론

이 논문의 판결은 명확합니다: 범용 AI 모델은 당신의 사이버 보안 팀이 될 준비가 되지 않았습니다. 그들은 거짓 경보에 너무 취약하고, 쉽게 혼란을 겪으며, 때로는 일을 수행하는 것을 두려워합니다.

이를 해결하기 위해서는 보안 데이터에 특화되어 훈련된 전문 AI 모델이 필요하며, 엄격한 단계별 방법론으로 작동하고, 발견 사항을 검증하기 위해 컴퓨터화된 검사를 사용해야 합니다. 이는 AI 를 일반적으로 "더 똑똑하게" 만드는 것이 아니라, 더 훌륭하고 규율 있는 전문가로 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →