← 최신 논문
🤖 AI

An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors

본 실증 연구는 DeepSeek-R1 과 같은 추론 최적화 대형 언어 모델이 보안 코드 검토에서 최첨정 정적 분석 도구보다 현저히 뛰어난 성능을 보이며, 동시에 프롬프트 엔지니어링 전략, 코드 복잡도, 파일 크기가 탐지 정확도와 응답 품질에 영향을 미치는 핵심 요인임을 규명했다.

원저자: Jiaxin Yu, Peng Liang, Yujia Fu, Amjed Tahir, Mojtaba Shahin, Chong Wang, Yangxiao Cai

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiaxin Yu, Peng Liang, Yujia Fu, Amjed Tahir, Mojtaba Shahin, Chong Wang, Yangxiao Cai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 수천 명의 사람이 거대한 공유 스토리에 끊임없이 새로운 장을 써 내려가는 거대하고 혼란스러운 도서관의 편집자라고요. 당신의 임무는 전체 스토리를 붕괴시킬 수 있는 위험한 줄거리 구멍, 스토리 전개를 망칠 수 있는 반전, 혹은 도둑이 책들을 훔쳐갈 수 있게 하는 페이지들을 찾아내는 것입니다. 이것이 바로 보안 코드 리뷰입니다.

전통적으로 당신은 이 작업을 수행하기 위해 두 가지 방법을 사용해 왔습니다:

  1. 인간 편집자: 모든 단어를 읽는 지친 전문가입니다. 그들은 맥락을 이해하는 데 뛰어나지만 느리고 비용이 많이 듭니다.
  2. 자동 맞춤법 검사기: 알려진 나쁜 단어를 스캔하는 로봇입니다. 빠르지만, 문제가 없을 때도 "오류!"라고 외치는 경우가 많으며 (거짓 경보), 미묘하고 교묘한 수법을 놓치기도 합니다.

이 논문은 묻습니다: 새로운 종류의 "수퍼 리더" (대규모 언어 모델 또는 LLM) 가 구식 맞춤법 검사기보다 더 나은 성과를 낼 수 있을까요?

연구자들이 발견한 내용을 간단한 비유를 통해 설명해 드리겠습니다:

1. 경쟁자들: 누가 도서관에 왔나요?

연구자들은 **일곱 가지 다른 "수퍼 리더" (LLM)**를 데려왔습니다. 일부는 범용 모델 (시와 이메일 작성에 뛰어남) 이고, 한 가지는 "추론 최적화" 모델 (탐정처럼 단계별로 생각하도록 훈련됨) 입니다. 또한 누가 이기는지 보기 위해 구식 "자동 맞춤법 검사기" (정적 분석 도구) 도 데려왔습니다.

결과: 수퍼 리더들이 구식 맞춤법 검사기를 압도했습니다. "추론 최적화" 탐정 (이름하여 DeepSeek-R1) 이 명백한 우승자였으며, 그 뒤를 GPT-4 (ChatGPT 로 잘 알려진 모델) 가 바짝 추격했습니다. 구식 도구들은 주로 복잡한 스토리라인 (코드에서의 레이스 컨디션과 같이 스토리의 서로 다른 부분들이 시간 경과에 따라 어떻게 상호작용하는지 이해해야 하는 경우) 에 혼란을 겪기 때문에 먼지 속에 남겨졌습니다.

2. 마법의 프롬프트: 어떻게 묻느냐가 중요합니다

도서관 사서에게 질문하는 것처럼, 수퍼 리더에게 어떻게 묻느냐가 중요합니다. 연구자들은 다섯 가지 다른 방식으로 질문해 보았습니다:

  • 기본 질문: "버그를 찾아라."
  • 맥락 질문: "여기 커밋 메시지가 있습니다 (작성자가 변경 사항에 대해 남긴 메모). 단계별로 생각하세요."
  • 요령 질문: "여기 알려진 범죄 유형 목록 (CWE 목록) 이 있습니다. 이것들을 찾아보세요."

승자:

  • DeepSeek-R1의 경우, 작성자의 메모 (커밋 메시지) 를 제공하고 "단계별로 생각하라" (Chain-of-Thought) 고 지시하는 것이 가장 좋은 방법이었습니다. 이는 용의자의 일기를 탐정에게 주고 논리적으로 범죄 현장을 walkthrough 하도록 하는 것과 같습니다.
  • GPT-4의 경우, "요령" (알려진 범죄 목록) 을 건네주는 것이 가장 좋은 방법이었습니다. 따를 구체적인 체크리스트가 있을 때 가장 잘 작동합니다.

3. 결함들: 수퍼 리더들도 실수를 합니다

연구자들은 누가 버그를 찾았는지뿐만 아니라, 수퍼 리더들이 버그를 어떻게 보고했는지도 살펴봤습니다. 그들은 두 가지 뚜렷한 성격적 결함을 발견했습니다:

  • GPT-4 (모호한 시인): 종종 올바른 문제를 찾지만 안개처럼 모호하고 불분명하게 묘사합니다. 정확한 줄을 가리키지 않고 "이 파일 어딘가에 보안 위험이 있습니다"라고 말할 수 있습니다. 또한 버그가 없을 때 "버그 없음"이라고 말해야 한다는 지시를 잊는 등 지시를 무시하기도 합니다.
  • DeepSeek-R1 (과신한 사실 확인자): 이 모델은 매우 구체적입니다. 정확한 줄 번호와 코드 스니펫을 가리킵니다. 그러나 때로는 환각을 일으킵니다. 42 번 줄이 실제로는 안전함에도 불구하고 "이 줄은 위험합니다"라고 자신 있게 42 번 줄을 가리킬 수 있습니다. 이는 사건을 해결하려는 열의가 너무 강해 존재하지 않는 증거를 만들어내는 탐정과 같습니다.

4. "건초더미 속의 바늘" 문제

연구자들은 이 수퍼 리더들이 스토리가 너무 길어지면 어려움을 겪는다는 사실을 발견했습니다.

  • 짧은 파일: 그들은 짧고 간결한 코드 파일에서 버그를 찾는 데 뛰어납니다.
  • 긴 파일: 코드가 길어질수록 (더 많은 "토큰"이 늘어날수록) 수퍼 리더들은 산만해집니다. 거대한 파일의 중간에 묻혀 있는 작고 위험한 세부 사항을 놓칩니다. 500 페이지 분량의 소설에서 오타 하나를 찾으려 하는 것과 같습니다. 눈이 흐려져서 그것을 놓치게 됩니다.

5. 복잡성의 역설

여기에는 놀라운 반전이 있습니다:

  • 보통 우리는 복잡한 코드를 검사하는 것이 더 어렵다고 생각합니다.
  • 하지만 DeepSeek-R1의 경우, 코드가 더 복잡할수록 실제로 특정 유형의 버그를 찾는 데 도움이 되었습니다 (메모리 관련 버그는 제외).
  • 왜? 연구자들은 복잡한 코드에는 종종 파일 자체 내에 더 많은 "단서"와 구조가 있다고 제안합니다. 수퍼 리더는 이러한 내부 단서를 사용하여 문제를 추론할 수 있습니다. 단순하고 지저분한 코드는 단서가 적어 AI 가 무슨 일이 일어나고 있는지 파악하기 어렵게 만듭니다.

결론

이 논문은 AI 수퍼 리더들이 현재 코드 내 보안 구멍을 찾는 데 있어 전통적인 자동 스캐너보다 뛰어난 강력한 새로운 도구라고 결론 내립니다. 그러나 아직 인간 편집자를 완전히 대체할 수는 없습니다.

  • DeepSeek-R1은 문제를 사고하는 데 가장 뛰어나지만, 사실을 지어내지 않도록 주의 깊게 지켜봐야 합니다.
  • GPT-4는 체크리스트를 따르는 데 좋지만 너무 모호할 수 있습니다.
  • 전략: 인간을 대체하는 것이 아니라, 이러한 AI 도구를 1 차 검토로 사용하는 것이 최선의 접근법입니다. AI 가 먼저 짧고 복잡한 파일을 스캔하게 한 다음, 인간 편집자들이 AI 의 작업을 특히 AI 가 너무 자신 있거나 너무 모호할 때 이중으로 확인하게 하십시오.

이 논문은 이러한 도구들이 도서관을 혼자 운영할 준비가 되었다고 주장하지도, 완벽하다고 제안하지도 않습니다. 단순히 세심한 관리가 필요한 매우 유망한 새로운 조력자임을 보여줄 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →