← 최신 논문
🤖 AI

LLM-based Vulnerable Code Augmentation: Generate or Refactor?

이 논문은 취약점 데이터 불균형 문제를 해결하기 위해 LLM을 활용한 두 가지 데이터 증강 방식(새로운 취약 코드 생성 및 기존 코드의 의미 보존형 리팩토링)을 비교 분석하였으며, 두 방식을 결합한 하이브리드 전략이 취약점 분류기의 성능을 가장 효과적으로 향상시킨다는 것을 입증했습니다.

원저자: Dyna Soumhane Ouchebara, Stéphane Dupont

게시일 2026-02-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Dyna Soumhane Ouchebara, Stéphane Dupont

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🛡️ 상황 설정: "보안관 AI를 키우는 법"

우리가 아주 뛰어난 **'보안관 AI'**를 만들고 싶다고 가정해 봅시다. 이 보안관의 임무는 수만 개의 코드 중에서 해커가 침입할 수 있는 '구멍(취약점)'을 찾아내는 것입니다.

그런데 큰 문제가 하나 있습니다. 보안관을 훈련시키려면 "이건 구멍이야!"라고 적힌 나쁜 코드 샘플을 엄청나게 많이 보여줘야 하는데, 실제로 세상에 존재하는 '완벽하게 정리된 나쁜 코드'는 양이 너무 적습니다. (이것을 논문에서는 **'데이터 불균형'**이라고 부릅니다.)

마치 수학 시험을 준비하는데, '미분' 문제는 1,000문제나 있는데 '적분' 문제는 딱 1문제밖에 없는 상황과 같습니다. 이러면 AI는 미분은 잘하지만, 적분 문제는 아예 못 풀게 됩니다.


💡 해결책: "AI가 AI를 위한 연습문제를 만든다!"

연구팀은 이 문제를 해결하기 위해 'Qwen'이라는 똑똑한 생성형 AI를 투입했습니다. 이 AI에게 두 가지 방식으로 '가짜 연습문제(데이터 증강)'를 만들라고 시켰습니다.

1. "무에서 유를 창조하라!" (Generation 방식)

  • 비유: 수학 선생님이 "자, 여기 적분 문제 유형이 이런 식이야. 이걸 참고해서 완전히 새로운 적분 문제 100개를 만들어봐!"라고 시키는 것입니다.
  • 방법: 기존의 취약한 코드 스타일을 보고, AI가 아예 새로운 코드 뭉치를 통째로 새로 써 내려가는 방식입니다.

2. "문제의 옷을 갈아입혀라!" (Refactoring 방식)

  • 비유: 이미 있는 적분 문제를 가져와서, **"숫자만 바꾸거나, 식을 좀 더 복잡하게 꼬거나, 변수 이름만 바꿔서 똑같은 문제처럼 보이게 변형해봐!"**라고 시키는 것입니다.
  • 방법: 원래 있던 취약한 코드를 가져와서, 기능(취약점)은 그대로 유지하되 겉모습(변수 이름, 코드 구조 등)만 살짝 바꾸는 방식입니다.

🧪 실험 결과: "섞어야 제맛!"

연구팀은 이렇게 만든 '가짜 문제'들로 보안관 AI(CodeBERT)를 다시 훈련시켰습니다. 결과는 어땠을까요?

  1. **새로운 문제 만들기(Generation)**만 했을 때보다, **기존 문제 변형하기(Refactoring)**를 했을 때 보안관의 실력이 조금 더 좋아졌습니다.
  2. 하지만 최고의 방법은? 두 가지를 '섞어서(Hybrid)' 공부시키는 것이었습니다!
    • 새로운 문제를 풀면서 응용력을 키우고,
    • 기존 문제를 변형해서 풀면서 디테일을 잡으니,
    • 보안관 AI의 전체적인 성적(F1 Score)이 가장 높게 나왔습니다.

📝 요약하자면

이 논문은 **"데이터가 부족해서 공부를 못 하는 보안 AI를 위해, 생성형 AI를 활용해 맞춤형 연습문제를 대량으로 찍어내어 훈련시켰더니, 보안관 AI가 훨씬 더 똑똑해졌다!"**는 내용을 담고 있습니다.

특히, 단순히 새로운 문제를 만드는 것보다 기존 문제를 살짝 비틀어서 만드는 방식이 효과적이며, 이 두 가지를 적절히 섞는 것이 가장 강력한 훈련법이라는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →