← 최신 논문
💻 computer science

Stochastic Code, Deterministic Defense: Assessing the Security Blind Spots in GenAI-Driven CI/CD Pipelines

본 연구는 전통적인 결정론적 보안 도구들이 CI/CD 파이프라인 내 생성형 AI에 의해 도입된 문법적으로 유효하면서도 맥락 의존적인 취약점을 탐지하는 데 실패한다는 점을 실증적으로 입증하며, 확률론적이고 의도 인지적인 검증 프레임워크의 시급한 필요성을 강조한다.

원저자: Mohammed BEDJAOUI, Sidi Mohammed BENSLIMANE, Mohammed Yassine KAZI TANI

게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohammed BEDJAOUI, Sidi Mohammed BENSLIMANE, Mohammed Yassine KAZI TANI

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

소프트웨어가 단순히 인간이 키보드를 두드려 작성하는 것이 아니라, 이전에 본 것을 바탕으로 다음 단어, 다음 줄, 그리고 다음 함수를 추측하는 초지능 로봇에 의해 "꿈꾸듯 만들어지는" 세상을 상상해 보십시오. 이것이 바로 제너레이티브 AI(Generative AI, 이하 GenAI)의 영역이며, 디지털 도구를 구축하는 방식을 빠르게 변화시키고 있는 기술입니다. 현대의 기술 세계에서 이러한 도구들은 CI/CD 파이프라인이라고 불리는 고속 공장에서 조립되곤 합니다. 이 파이프라인을 코드가 작성되고, 테스트되고, 패키징되어 몇 초 만에 인터넷으로 배포되는 컨베이어 벨트라고 생각하십시오.

수년 동안 이 컨베이어 벨트를 감시해 온 보안 요원들은 결정론적 스캐너(deterministic scanners)였습니다. 이들은 "금지된 동작"이 적힌 클립보드를 든 엄격한 문지기와 같습니다. 그들이 알고 있는 특정 패턴, 예를 들어 알려진 자물쇠 따기 도구나 금지된 주문 같은 것을 발견하면 코드를 중단시킵니다. 이들은 명백한 악당들을 잡아내는 데 탁월합니다. 하지만 반전이 있습니다. GenAI는 단순히 과거의 나쁜 동작을 복사해서 붙여넣는 것이 아니라, 마치 재즈 음악가가 멜로디를 즉흥 연주하듯 매번 새로운 변형을 만들어냅니다. 과학자와 엔지니어들의 큰 의문은 이것입니다: 우리의 기존의 엄격한 문지기들이, 완벽하게 들리지만 실제로는 비밀스럽게 위험한 곡을 연주하는 재즈 음악가를 잡을 수 있을 것인가? 이 논문은 바로 이 미스터리를 파고들며, 우리의 기존 보안 도구들이 AI가 저지르는 독특하고 예측 불가능한 실수들에 대해 눈이 멀어 있는 것은 아닌지 묻습니다.


"침묵의 부패(Silent Decay)" 이야기

이 연구에서 연구원 모하메드 베자위(Mohammed Bedjaoui), 시디 모하메드 벤슬리만(Sidi Mohammed Benslimane), 모하메드 야신 카지 타니(Mohammed Yassine Kazi Tani)는 로컬 AI 로봇이 실제 애플리케이션을 위한 코드를 작성하게 하고, 이를 표준 보안 도구로 점검했을 때 어떤 일이 발생하는지 확인하기 위해 디지털 실험을 설정했습니다. 그들은 단순히 추측한 것이 아니라, AI가 보안 요원을 피해 "나쁜 아이디어"를 몰래 통과시킬 수 있는지 확인하기 위해 마치 실험실의 광기 어린 과학자처럼 50번의 통제된 시뮬레이션을 실행했습니다.

설정: 로봇 작가와 엄격한 가드
연구팀은 현대적인 소프트웨어 공장의 축소판을 구축했습니다. 그들은 로컬 AI 모델(일명 "Code Llama" 로봇)을 사용하여 두 가지 유형의 코드를 작성했습니다:

  1. 논리적 결함 (V1): AI에게 웹사이트를 위한 보안 체크 로직을 작성하도록 요청했습니다. AI는 문법 규칙을 모두 준데 따른 완벽해 보이는 코드를 작성했지만, 결정적인 단계를 잊었습니다. 바로 사용자가 주장하는 본인이 맞는지 실제로 확인하는 절차를 빠뜨린 것입니다. 이는 클럽의 문지기가 신분증은 확인하지만, 사진이 얼굴과 일치하는지는 확인하는 것을 잊어버린 것과 같습니다.
  2. 인프라 드리프트 (V3): AI에게 서버를 위한 지침(Kubernetes 매니페스트)을 작성하도록 요청했습니다. AI는 구문론적으로는 올바르게 보이지만, 너무 단순한 "헬스 체크(health check)"를 설정하는 지침을 작성했습니다. 이는 환자가 숨을 쉬고 있는지는 확인하지만 심장이 뛰고 있는지는 무시하는 의사와 같습니다. 소프트웨어 내부가 완전히 망가졌더라도 서버는 계속 "살아있는" 상태를 유지할 것입니다.

테스트: 기존 도구들이 새로운 실수를 볼 수 있는가?
AI가 코드를 작성하면, 코드는 세 가지 유명한 "문지기"인 Semgrep, Trivy, Kube-linter를 사용하는 표준 보안 파이프라인을 통과하게 됩니다. 이 도구들은 특정 패턴을 찾아내어 알려진 오류를 잡아내도록 설계된 업계 표준입니다.

결과는 놀라웠습니다. 실험의 50회 실행 결과:

  • AI는 논리적 결함 시나리오에서 46회, 인프라 드리프트 시나리오에서 48회 빌드 프로세스를 통과하는 코드를 생성하는 데 성공했습니다. 즉, 코드는 배포될 만큼 충분히 "유효"했습니다.
  • 보안 도구들이 이 코드를 스캔했을 때, 그들은 100%의 확률로 취약점을 감지하는 데 실패했습니다 (또는 48번 중 2번의 오탐지를 제외하면 96%의 확률로 실패했습니다).
  • 통계적 분석 결과, 이것은 단순히 운이 나빴던 것이 아니었습니다. 이러한 도구들이 우연히 오류를 놓칠 확률은 0.001 미만이었습니다 (p < .001).

거대한 폭로: "사각지대"
논문은 현재의 보안 시스템에 거대한 "사각지대"가 존재한다고 결론짓습니다. AI는 "악의적인" 코드를 쓴 것이 아니라, 보안보다는 기능성에 집중한 코드를 썼습니다. 코드가 모든 문법 규칙을 따랐기 때문에, 결정론적 스캐너(클립보드를 든 문지기들)는 "이상 없음!"이라고 말하며 통과시킨 것입니다.

연구원들은 이를 **"침묵의 부패(Silent Decay)"**라고 부릅니다. 이는 소프트웨어 공장이 원활하게 돌아가고, 초록불이 켜지며, 보안 알람이 울리지 않지만, 최종 제품은 근본적으로 망가져 있고 보안에 취약한 상황을 의미합니다. 이 연구는 이러한 도구들이 코드가 너무 엉망이거나 "환각(hallucination)" 현상으로 인한 헛소리를 생성했기 때문에 실패한 것이 아님을 명시적으로 밝힙니다. 코드는 깨끗하고 유효했으며, 단지 보안의 핵심을 놓쳤을 뿐입니다.

이것이 의미하는 바
저자들은 우리가 더 이상 코드를 점검하는 기존 방식에 의존할 수 없다고 주장합니다. 만약 코드가 확률적 AI(출력을 추측하고 변형하는 AI)에 의해 생성된다면, 결정론적 스캐너(고정된 패턴을 찾는 도구)는 항상 미묘하고 맥락 의존적인 실수를 놓칠 것입니다. 논문은 우리가 코드의 '형태'가 아닌 '의도'를 이해하는 새로운 종류의 방어 체계가 필요하다고 제안합니다. 그들은 코드를 감사하기 위해 다른 AI 에이전트를 사용하거나, 인간의 이해력과 수학적 논리를 결합한 "뉴로-심볼릭(neuro-symbolic)" 방법을 사용할 것을 제안합니다.

요약하자면, 이 연구는 AI 시대에 보안 스캐너의 "그린 라이트(통과 신호)"가 코드가 안전하다는 것을 보장하지 않는다는 것을 증명합니다. 그것은 단지 코드가 서류상으로 보기 좋다는 것을 의미할 뿐입니다. 진짜 위험은 AI의 창의성이 우리의 검증 능력을 앞지르는 곳, 즉 코드의 행간 사이의 틈새에 숨어 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →