← 최신 논문
🤖 AI

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

이 논문은 에이전트 기반 LLM이 알려진 취약점을 재현할 때는 높은 안정성을 보이지만, 새로운 문제를 발견하는 능력은 매우 불일치한다는 점을 입증하며, 이는 LLM 기반의 보안 검토가 결정론적인 정적 애플리케이션 보안 테스트(SAST)를 대체하기보다는 이를 보완해야 함을 시사한다.

원저자: Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 매우 엄격하고 규칙을 준수하는 보안 요원(이하 SAST)과, 아주 똑똑하고 창의적이지만 때로는 주의력이 산만한 탐정(이하 LLM)이 있다고 상상해 보세요. 두 사람은 숨겨진 함정(취약점)을 찾아내기 위해 동일한 작은 자바스크립트 건물을 조사하도록 고용되었습니다.

"Snyk VulnBench JS 1.0"이라는 논문은 다음과 같은 단순하지만 매우 중요한 질문을 던집니다. 만약 이들에게 똑같은 건물을 다섯 번 연속으로 조사하게 한다면, 그들은 매번 정확히 똑같은 보고서를 제출할까요?

연구 결과는 다음과 같이 일상적인 개념으로 나누어 설명할 수 있습니다.

1. 엄격한 경비원 vs. 창의적인 탐정

  • 엄격한 경비원 (SAST): 이 도구는 체크리스트를 가진 로봇과 같습니다. 코드가 변경되지 않았다면, 로봇은 매번 정확히 똑같은 보고서를 내놓습니다. 로봇은 지치지도 않고, 주의가 산만해지지도 않으며, 똑같은 것을 두 번 놓치는 일도 없습니다. 이 연구에서 이 도구의 일관성은 100%였습니다.
  • 창의적인 탐정 (LLM): 이것은 '생각'하고 추론할 수 있는 AI입니다. 이 탐정은 로봇이 놓칠 수 있는 까다롭고 기묘한 함정을 포착하는 데 탁로합니다. 하지만 인간과 같아서, 때로는 예리하다가도, 때로는 피곤해하거나, 때로는 존재하지 않는 것을 보고 환상을 보기도 합니다.

2. "다섯 번의" 테스트

연구진은 AI 탐정을 다섯 번 연속으로 코드 조사에 투입했습니다. 결과는 다음과 같았습니다.

  • AI가 "알려진" 함정을 발견했을 때: 만약 AI가 엄격한 경비원이 이미 식별한 함정을 발견했다면, AI는 매우 신뢰할 만했습니다. AI는 거의 모든 실행(85%의 경우)에서 동일한 함정을 찾아냈습니다. 즉, 규칙에 부합하는 내용에 대해서는 매우 일관적이었습니다.
  • AI가 "새로운" 함정을 발견했을 때: 여기서부터 상황이 복잡해졌습니다. AI는 엄격한 경비원이 보지 못한 새롭고 독특한 함정들을 보고하기 시작했습니다.
    • 문제점: 이 "새로운" 보고 중 거의 절반은 단 한 번만 나타났다 사라지는 '일회성 현상'이었습니다. 이 보고들은 다섯 번의 실행 중 단 한 번만 나타났다가 사라졌습니다.
    • 비유: 탐정이 월요일에는 "복도에서 유령을 봤어요!"라고 말합니다. 화요일에는 "아니요, 유령은 없어요"라고 합니다. 수요일에는 "사실, 그냥 옷걸치였어요"라고 말합니다. 목요일에는 다시 "유령이에요!"라고 외칩니다. 만약 당신이 건물 주인이라면, 지금 당장 겁을 먹어야 할지 아니면 탐정이 그냥 헛것을 보고 있는 것인지 알 수 없게 됩니다.

3. "노이즈(소음)" 요인

연구는 AI의 "추가적인" 보고들이 매우 노이즈가 심하다는 것을 발견했습니다.

  • "일회성" 보고: AI가 보고한 독특한 내용 중 약 50%는 단 한 번만 발생했습니다. 만약 다섯 번의 스캔을 실행한다면, 당신이 어떤 실행 결과를 얻느냐에 따라 '추가적인 경고' 목록이 완전히 달라질 것입니다.
  • "안정적인" 보고: AI와 엄격한 경비원이 일치하는 부분은 안정적이었습니다. 그것들은 변하지 않았습니다.

4. 더 크다고 해서 더 나은 것은 아니다

연구진은 "초고가" 및 "초지능형" 버전을 포함하여 다양한 버전의 AI를 테스트했습니다.

  • 결과: 가장 비싸고 강력한 AI가 반드시 최고의 성능을 보이는 것은 아니었습니다. 사실, 그 모델은 더 많은 비용과 컴퓨터 자원을 사용하면서도, 더 작고 저렴한 버전보다 일관성이 떨어졌습니다.
  • 교훈: 단순히 가장 "똑똑한" 탐정에게 더 많은 비용을 지불한다고 해서 반드시 더 신뢰할 수 있는 보고서를 받는 것은 아닙니다. 때로는 더 단순하고 집중된 데가 더 일관적일 수 있습니다.

5. 서로 다른 강점, 서로 다른 사각지대

논문은 둘 중 하나를 선택하는 것이 아니라, 둘 다 필요하다고 결론짓습니다.

  • 엄격한 경비원은 모든 파이프와 전선을 체계적으로 점검하는 데 탁월합니다(예: 반복되는 데이터 흐름 확인). 경비원은 똑같은 누출을 절대 두 번 놓치지 않습니다.
  • 창의적인 탐정은 체크리스트에는 없지만 수상해 보이는 패턴(예: 엄격한 경비원이 놓친 수상한 SQL 인젝션 패턴)을 포착하는 데 능숙합니다.
  • 함정: 탐정은 가끔 엄격한 경비원이 잡아내는 명백하고 반복적인 누출을 놓치기도 하며, 때로는 가짜 함정에 혼란을 느끼기도 합니다.

핵심 요약

만약 당신이 AI 탐정에게만 의존한다면, 매번 확인할 때마다 다른 보안 보고서를 받게 될 것이며, 그녀가 보고하는 "유령"이 진짜인지 아니면 그저 옷걸치인지 구분하는 데 엄청난 시간을 허비하게 될 것입니다.

만약 당신이 엄격한 경비원에게만 의존한다면, 까다롭고 창의적인 함정들을 놓칠 수 있습니다.

최선의 전략: 엄격한 경비원을 사용하여 (그는 결코 마음을 바꾸지 않으므로) 명백하고 반복적인 누출을 잡아내고, 창의적인 탐정을 사용하여 까다롭고 특이한 것들을 찾아내되, 그의 "추가적인" 발견이 일시적인 착각일 수 있으므로 반드시 재검증할 준비를 하십시오. 두 방식은 서로를 대체하는 것이 아니라, 서로를 보완할 때 가장 잘 작동합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →