← 최신 논문
💻 computer science

AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation

이 설문 조사는 "AI 슬롭(slop)"과 환각 현상으로 인해 발생하는 AI 기반 취약점 평가의 신뢰성 위기를 조사하며, 확률적 LLM 생성과 전문가의 연역적 추론 사이의 간극을 메우기 위해서는 수동적 탐지에서 능동적 뉴로-심볼릭 검증으로 전환하고 CVE-Bench 및 Slop-Score와 같은 수학적으로 검증 가능한 평가 지표를 도입해야 한다고 주장한다.

원저자: Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

게시일 2026-08-27
📖 1 분 읽기☕ 가벼운 읽기

원저자: Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: 취약점 평가에서의 AI 슬롭(Slop) 및 환각(Hallucinations)

1. 문제 정의

사이버 보안 취약점 평가에 대규모 언어 모델(LLM)이 통합되면서, **"AI 슬롭(AI slop)"**의 확산으로 인한 "신뢰성 위기"가 발생했습니다. 보수적인 규칙 기반 정적 애플리케이션 보안 테스트(SAST)에서 발생하는 전통적인 오탐(False Positive)과 달리, AI 슬롭은 언어적 유창성과 구조적 그럴듯함은 갖추었으나 의미론적 타당성이나 실행 가능한 근거가 결여된 보안 산출물(보고서, 개념 증명(PoC), 패치 등)을 의미합니다.

이러한 산출물에는 다음이 포함됩니다:

  • 환각된 취약점: 조작된 CVE(Common Vulnerabilities and Exposures), 존재하지 않는 API, 그리고 단절된 실행 경로를 만들어내는 현상.
  • 부적절한 패치 합성: 근본 원인을 무시한 채 표면적인 증상만을 해결하거나, 새로운 회귀(Regression)를 유발하는 패치.
  • 의미론적 재포장: 기존 지식이나 "침묵된(공개되지 않은)" 수정 사항을 마치 새롭고 권위 있는 보고서인 것처럼 변형하는 행위.

이 현상은 인간의 분류(Triage) 파이프라인에 서비스 거부(DoS) 공격과 유사한 인지적 부담을 가중시킵니다. 핵심 문제는 근본적인 **추론 격차(Reasoning Gap)**에 있습니다. 인간 보안 전문가는 시스템 제약 조건에 근거한 인과적, 다단계 연역 추론에 의존하는 반면, 자기회귀적(Autoregressive) LLM은 통계적 상관관계에 기반한 확률적 토큰 생성에 의교합니다. 정보가 LLM의 추론 지평을 넘어설 때, 모델은 검증된 사실 대신 통계적으로 그럴듯한 연속된 토큰을 생성하는 방식으로 기본 동작합니다.

2. 방법론

본 논문은 실증적 증거를 조사하고 문제를 공식화하기 위해 체계적 문헌 검토(Systematic Literature Review)개념적 분석을 수행합니다.

  • 문헌 조사: 저자들은 IEEE Xplore, ACM Digital Library, arXiv를 대상으로 LLM 및 보안 관련 키워드를 사용하여 쿼리를 수행했습니다. 두 명의 독립적인 검토자가 결과를 스크리닝하여, 보안 맥락에서 LLM의 실패 모드에 대한 실증적 증거를 보유한 연구들을 선정했습니다.
  • 분류 체계 구축: 실패 사례들을 추론 실패의 성격에 따라 세 가지 주요 분기로 범주화했습니다.
  • 격차 분석: 인간의 인지 모델(연역적, 불변성 보존적)과 LLam의 아키텍처적 제약(확률적, 컨텍스트 윈도우 제한적)을 대조합니다.
  • 지표 제안: 저자들은 **연역적 커버리지 점수(Deductive Coverage Score, DCS)**라는 측정 가능한 대리 지표를 통해 추론 격차를 정량화하며, 새로운 평가 도구(CVE-Bench, Slop-Score)를 제안합니다.
  • 아키텍처 검토: 기존의 완화 전략(수동적 탐지, 워터마킹)을 검토 및 비판한 후, 능동적 뉴로-심볼릭(Neuro-symbolic) 검증 아키텍처를 제안합니다.

3. 주요 기여

A. AI 슬롭의 공식화 및 분류

본 논문은 사이버 보안에서의 AI 슬롭을 정의하고, 세 가지 뚜렷한 실패 모드로 구성된 분류 체계를 수립합니다:

  1. 환각된 취약점: 모델이 프롬프트의 기대치를 충족하기 위해 결함(예: 조작된 CVE, 존재하지 않는 API)을 발명하는 현상. 여기에는 아첨형 환각(Sycophantic Hallucination)(안전한 코드에서 버그를 찾아냄)과 토큰 편향 혼동(Token-bias Confounding)(표면적인 구문 변화에 따라 판단이 변함)이 포함됩니다.
  2. 부적절한 패치 합성: 모델이 컴파일되고 표면적인 검사를 통과하지만, 근본적인 문제를 해결하지 못하거나 새로운 보안 회귀를 도입하는(예: 하나의 CWE를 다른 것으로 교체하는) 패치를 생성하는 현상.
  3. 의미론적 재포장: 모델이 기존 정보(오픈 소스 커밋의 침묵된 수정 사항 포함)를 "새로운" 보고서로 재구성하는 현상. 이는 공개된 근거(Ground Truth)가 없는 수정 사항을 이용하며, 이를 통해 재포장된 주장이 조회 기반 검증법으로는 탐지되지 않도록 만듭니다.

B. 추론 격차 분석

논문은 근본 원인이 인간의 연역적 추론LLM의 확률적 생성 사이의 괴리에 있다고 식별합니다:

  • 인간 전문가: 정신적 모델을 구축하고, 절차적 경계를 가로지르는 데이터 흐름을 추적하며, 제약 조건을 검증합니다. 이들은 증명될 때까지 발견 사항에 대해 회의적인 태도를 유지합니다.
  • LLM: 훈련 분포에 기반하여 토큰 확률을 추정합니다. 이들은 단일 실행 경로를 검증하지 않고 익숙한 패턴(API 호출, 변수 이름 등)을 짜 맞춥니다.
  • 현재 완화 전략의 한계: 저자들은 생각의 사슬(Chain-of-Thought, CoT) 프롬프팅과 도구 사용 에이전트가 격차를 좁힐 수는 있으나 완전히 닫지는 못한다고 주장합니다. CoT는 종종 더 길지만 똑같이 틀린 추론 사슬을 생성하며, 도구 사용은 에이전트가 도구 출력을 잘못 해석하는 "도구 사용 환각(Tool-use Confabulation)"으로 이어지곤 합니다.

C. 수동적 탐지 및 워터마킹에 대한 비판

본 논문은 출처(텍스트가 기계에 의해 작성되었는지 여부)를 겨냥한 현재의 완화 전략이 정확성의 필요성과 일치하지 않는다고 주장합니다.

  • 통계적 탐지: 보안 보고서는 본질적으로 정형화되어 있어(낮은 어휘 다양성), 인간이 작성한 보고서에 대해서도 높은 오탐율을 유발하므로 실패합니다.
  • 워터마킹: 보안 로직과 호환되지 않습니다. 제약된 코드 도메인에서 워터마크가 찍힌 토큰 선택을 강제하면 로직이 깨지거나 유효하지 않은 페이로드가 생성될 수 있습니다.

D. 제안된 솔루션 및 평가 도구

  • 뉴로-심볼릭 검증(Neuro-Symbolic Verification): 저자들은 LLM이 가설 생성기 역할을 하고, 그 출력이 인간 분석가에게 도달하기 전에 결정론적 검증(정적 분석, 동적 퍼징, 심볼릭 실행)을 거치는 아키텍처를 옹호합니다.
  • 연역적 커버리지 점수(DCS): 취약점 주장이 통계적 보간(Interpolation)이 아닌, 명시적이고 검증 가능한 증거(예: 특정 코드 참조, 실행 트레이스)에 얼마나 근거하고 있는지를 정량화하는 지표입니다.
  • CVE-Bench: 실행으로 검증된 근거(Ground Truth)를 사용하여, 유창하지만 허구적인 공격 경로와 근거 있는 보고서를 구분하는 분류 시스템의 능력을 테스트하도록 설계된 벤치마크입니다.
  • Slop-Score: 언어적 유창성과 검증 가능한 실체 사이의 간극을 정량화하는 연속 지표로, 유창하지만 증거 밀도나 제약 조건 충족이 부족한 산출물에 페널티를 부여합니다.

4. 결과 및 발견

  • 실증적 증거: 본 조사는 일부 버그 바운티 프로그램(예: 2025년 중반 기준 HackerOne)에서 약 20%의 보고서가 저품질 AI 슬롭으로 식별되었으며, 이로 인해 유효한 보고서와 AI 생성 노이즈를 구분할 수 없게 되어 특정 프로그램(예: 2026년 cURL의 바운티 프로그램)이 중단되는 사례를 강조합니다.
  • 근거 결핍(Grounding Deficit): 대표적인 연구들을 검토한 결과(표 1), LLM 출력의 실행 수준 검증을 제공하는 연구가 전무함을 밝혀냈습니다. 가장 강력한 근거는 컴파일 체크나 정적 분석인데, 이는 엄격한 보안 추론의 요구 사항보다 훨씬 낮은 수준에서 작동합니다.
  • 부분적 가교의 실패: ReAct나 RAG(검색 증강 생성)와 같은 도구들이 사실적 환각(예: 존재하지 않는 CVE 생성)은 줄여주지만, 논리적 환각(정확한 사실로부터 인과적으로 잘못된 추론을 도출하는 것)은 해결하지 못합니다.

5. 의의 및 주장

본 논문은 스스로를 조사, 개념적 분석 및 로드맵으로 포지셔닝합니다. 주요 의의는 평가 패러다임을 언어적 유창성에서 수학적 검증 가능성으로 전환하는 데 있습니다.

  • 구조적 실패: 저자들은 AI 슬로프가 단순한 성능 문제가 아니라, 확률적 생성이 인과적 검증을 대체하는 구조적 실패라고 단언합니다.
  • 신뢰성: AI 기반 분류에 대한 신뢰는 더 나은 프롬프팅이나 출처 추적만으로는 달성될 수 없습니다. 이는 각 파이프라인 구성 요소를 문서화된 한계(예: 심볼릭 실행의 경로 폭발 제한)를 가진 기존 시스템에 매핑하는 능동적 뉴로-심볼릭 검증을 필요로 합니다.
  • 향 향후 방향: 본 논문은 보안 분야의 신뢰할 수 있는 AI는 생성을 검증 파이프라인의 시작점으로 취급하는 시스템으로부터 탄생할 것이라고 결론짓습니다. 즉, 생성된 내용이 결정론적 테스트를 통과한 경우에만 인간의 판단이 개입되도록 보장해야 합니다. 제안된 지표(DCS, Slop-Score)와 벤치마크(CVE-Bench)는 이러한 구조적 실패를 시스템에서 제거하기 위한 인프라를 제공하기 위해 고안되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →