Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment
이 실증적 연구는 Ollama 모델을 기반으로 하는 현재의 오픈 소스 범용 LLM 에이전트가 실제 사이버 보안 시나리오에서 Bandit과 같은 기존의 정적 애플리케이션 보안 테스트(SAST) 도구를 대체하기에는 아직 적합하지 않다는 결론을 내리고 있습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 거대한 책(코드) 도서관이 있고, 그 안에 숨겨진 모든 오타, 설정 오류, 혹은 위험한 비밀을 찾아내야 한다고 상상해 보십시오. 당신에게는 이 일을 수행할 두 명의 조력자가 있습니다.
- 베테랑 사서 (Bandit): 이 조력자는 전통적인 도구입니다. 그는 "생각"하거나 "상상"하지 않습니다. 대신 이미 작성된 엄격한 체크리스트(예: "뒷문을 열어두지 마시오" 또는 "녹슨 자물쇠를 사용하지 마시오")를 가지고 있습니다. 그는 매우 빠르고 체계적으로 책을 스캔하여 문제가 있는 위치를 정확히 알려줍니다. 지루할 수 있지만, 신뢰할 수 있습니다.
- 창의적인 인턴 (AI 에이전트): 이 조력자는 새로운 기술인 대규모 언어 모델(LLM)입니다. 그는 인터넷 전체를 읽은 똑똑한 학생과 같습니다. 그는 체크리스트 대신, "위험해 보이는 것은 무엇이든 찾아내라"라는 직무 설명서를 받습니다. 그는 자신의 상상력을 동원하여 무엇이 잘못되었을지 추측합니다.
실험
연구진들은 이 두 조훌을 서로 맞붙여 보기로 했습니다. 그들은 세 가지 서로 다른 "도서관"(오픈 소스 소프트웨어 프로젝트)을 스캔 대상으로 주었습니다.
- 은퇴했지만 여전히 튼튼한 패키지 관리자 (Yum).
- 개인 습관 추적 앱 (Beaverhabits).
- 잘못된 로그인 시도를 차단하는 보안 도구 (Fail2ban).
그들은 먼저 베테랑 사서에게 스캔을 시켜 실제 문제들의 "골드 표준(기준)" 목록을 만들게 했습니다. 그다음, 세 가지 서로 다른 AI 모델(Gemma, Llama, Qwen)로 구성된 창의적인 인턴에게도 동일한 작업을 요청했습니다.
결과는 어떠했는가? (결과)
결과는 창의적인 인턴에게 다소 처참했습니다. 간단한 비유를 통해 그 내역을 살펴보겠습니다.
- "환각(Hallucination)" 문제: 인턴은 존재하지 않는 문제를 계속해서 만들어냈습니다. 그는 아주 정상적인 코드 한 줄을 보고는 "아하! 이것은 비밀번호 유출이다!"라고 외쳤지만, 사실 그것은 표준적인 설정값일 뿐이었습니다. 논문에서는 이를 **가짜 양성(False Positive)**이라고 부릅니다. 인턴은 문제를 찾으려는 의욕이 너무 앞선 나머지, 무해한 것들을 위험한 것으로 분류했습니다.
- 비유: 마치 빨간 사과를 들고 있는 사람을 보고 "빨간색은 위험하니까 저 사람은 폭탄을 들고 있다"라고 생각하는 보안 요원과 같습니다.
- "위치 상실" 문제: 인턴이 실제 문제를 발견했을 때조차, 그는 종종 그것이 어디에 있는지 말하지 못했습니다. 그는 "코드에 버그가 있습니다"라고 말하면서도, "어느 파일인가? 몇 번째 줄인가?"라고 물으면 존재하지 않는 파일 이름을 만들어내거나 빈 줄을 가리켰습니다.
- 비유: 마치 탐정이 "도둑이 집에 있습니다"라고 말하면서도, "어느 방인가요?"라고 묻자 도둑이 실제로는 지하실에 있는데도 "다락방입니다"라고 추측하는 것과 같습니다.
- "기회를 놓친" 문제: 인턴은 베테랑 사서가 찾아낸 실제 문제 중 엄청난 양을 놓쳤습니다. 그는 실제 문제의 약 25%만을 잡아냈습니다.
- 비유: 사서는 100개의 오타를 찾아냈습니다. 인턴은 그중 25개만 찾아냈고, 그가 찾아낸 것들 중 50개는 애초에 오타조차 아니었습니다.
- "속도" 문제: 베테랑 사서는 1분도 채 되지 않아 업무를 마쳤습니다. 반면 창의적인 인턴은 동일한 작업을 수행하는 데 몇 시간(도서관당 1~4시간)이 걸렸습니다.
- 비유: 사서는 고속열차입니다. 인턴은 선로를 따라가며 꽃 향기를 맡느라 멈춰 서는 달팽이입니다.
최종 판결
이 논문은 현재 창의적인 인턴이 베테랑 사서를 대체할 준비가 되지 않았다고 결론짓습니다.
인턴이 이야기를 쓰거나 이메일을 요약하는 데는 뛰어나지만, 보안 스캐닝이라는 특정한 고위험 작업에는 현재 너무 신뢰도가 낮습니다. 그는 너무 많은 "소음"(가짜 경보)을 만들어내고, 실제 위험은 놓치며, 작업 시간도 너무 오래 걸립니다.
연구진들은 인턴이 사서의 보조자로 사용될 수는 있다고 제안합니다. 예를 들어 사서가 놓친 부분을 찾아내는 용도로 말이죠. 하지만 이는 인간이 인턴의 모든 추측을 먼저 검토한다는 전제하에 가능합니다. 하지만 기존의 신뢰할 수 있는 방법들을 대체하는 단독 도구로서의 역할에 대해서는, 논문은 아니오라고 답합니다. "환각"(지어내는 현상)과 정밀함의 부족은 현재 보안 업무를 맡기기에 너무 위험하기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.