Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation
이 논문은 7개의 대규모 및 소규모 언어 모델을 대상으로 보안이 확보된 AWS 테라폼 코드를 생성하는 성능을 벤치마킹하여, 구문적 유효성과 보안 준수가 대체로 독립적인 속성이며 모델의 성능이나 프롬프트 엔지니어링 전략과 관계없이 자동화된 멀티 툴 스캐닝이 여전히 필수적이라는 점을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 디지털 벽돌로 만들어진 거대하고 투명한 하늘 위의 도시를 짓고 있다고 상상해 보세요. 현실 세계에서 집을 지을 때 기초가 흔들리거나 현관문을 활짝 열어둔 채로 둔다면 그것은 재앙이 됩니다. 디지털 세계에서도 이 "도시"를 클라우드(Cloud)라고 부릅니다. 그리고 이 도시를 짓는 데 사용되는 설계도는 코드형 인프라스트럭처(Infrastructure-as-Code, IaC)라는 특별한 언어로 작성됩니다. IaC를 컴퓨터에게 서버, 스토리지, 보안 잠금장치를 정확히 어떻게 설정할지 알려주는 매우 정밀한 레시피라고 생각하세요. 오랫동안 인간이 이 레시피를 작성해 왔지만, 그들은 종종 실수를 저질러 디지털 문을 열어두거나 도둑들이 몰래 들어오게 만들곤 했습니다.
최근에 새로운 종류의 조력자가 도착했습니다. 바로 인공지능(AI)입니다. 구체적으로는 대규모 언어 모델(LLM)과 그보다 작고 빠른 형제 격인 소규모 언어 모델(SLM)들입니다. 이들은 수백만 개의 레시피를 읽고 몇 초 만에 새로운 레시피를 써 내려갈 수 있는 매우 똑똑한 로봇과 같습니다. 모두의 머릿속에 있는 큰 질문은 이것입니다. 이 AI 로봇들이 단순히 '정확한(그래서 건물이 무너지지 않는)' 레시피뿐만 아니라, '안전한(그래서 아무도 침입할 수 없는)' 레시피를 쓸 수 있을 것인가 하는 점입니다. 이는 마치 로봇 셰프가 맛있는 케이크를 구울 수는 있지만, 실수로 그 안에 숨겨진 폭탄을 넣지는 않을 것인지 묻는 것과 같습니다. 만약 AI가 문법은 맞췄지만 잠금장치를 잊어버린다면, 도시 전체가 위험에 처하게 됩니다. 이것이 바로 브라질의 연구팀이 해결하고자 했던 바로 그 퍼즐입니다.
위대한 AI 셰프 경연 대회
연구진은 일곱 가지 서로 다른 AI 셰프를 "클라우드"라는 거대한 주방에서 테스트하기로 했습니다. 그들은 단순히 로봇에게 레시피를 써달라고 요청한 것이 아니라, 테라폼(Terraform)이라는 도구를 사용하여 안전한 디지털 구조물을 구축하는 17가지 유형의 서로 다른 레시피를 작성하도록 요청했습니다. 그들은 세 가지 "대형 뇌(Big Brain)" 모델(Claude Opus 4, GPT-5.4, Gemini 2.5 Pro와 같은 폐쇄형의 비싼 모델들)과 네 가지 "주머니 뇌(Pocket Brain)" 모델(WizardCoder와 CodeLlama 같은 오픈 소스의 작은 모델들)을 테스트했습니다.
레시피가 좋은지 확인하기 위해 연구진은 단순히 눈으로 검사하지 않았습니다. 그들은 매우 엄격한 자동 검사 라인을 구축했습니다. 먼저, 레시피가 문법적으로 올바른지(구문적 유효성) 확인했습니다. 레시피에 오타가 있다면 건물은 시작조차 할 수 없기 때문입니다. 하지만 진짜 테스트는 그다음이었습니다. 그들은 열린 창문, 잠기지 않은 문, 숨겨진 함정을 찾는 디지털 보안 요원 역할을 하는 두 가지 서로 다른 보안 스캐너, Checkov와 Trivy를 실행했습니다. 또한, 연구진이 "이봐요, 문을 하나 열어두었잖아요"라고 말했을 때 로봇들이 자신의 실수를 스스로 고칠 수 있는지, 그리고 보안에 대한 더 자세한 지침을 주는 것이 실제로 도움이 되는지도 테스트했습니다.
충격적인 결과: 문법은 완벽하지만, 잠금장치는 엉망
여기서 연구진이 발견한 반전, 즉 예상치 못한 전개가 있습니다. 완벽한 레시피를 쓰는 것과 안전한 레시피를 쓰는 것은 완전히 다른 기술이라는 점입니다.
연구진은 AI가 문법적으로 완벽하고 오류 없이 실행되는 테라폼 레시피를 쓸 수 있다고 해서, 그 레시피가 반드시 안전하다는 것을 의미하지 않는다는 사실을 발견했습니다. 사실, 이 두 가지 기술은 거의 관련이 없었습니다. 한 작은 모델인 WizardCoder-33B는 문법의 챔피언이었습니다. 이 모델은 77.8%의 확률로 유효한 레시피를 작성했습니다! 하지만 보안 요원들이 그 레시피들을 검사했을 때, 이 모델은 모든 보안 검사를 통과하지 못했습니다. 그것은 마치 셰프가 아름답고 완벽한 모양의 케이크를 만들었지만, 그 안에 든 독약 병의 뚜껑을 닫는 것을 잊어버린 것과 같았습니다.
반면에 "대형 뇌" 모델들은 훨씬 더 나은 성과를 보였지만, 여전히 많은 도움이 필요했습니다. 최고의 성능을 보인 Claude Opus 4조차 기본적인 지침만 주어졌을 때는 완전히 안전한 레시피를 약 23%의 확률로만 작성할 수 있었습니다. 그러나 연구진이 매우 구체적이고 상세한 보안 체크리스트(어떤 잠금장치를 설치하고 어떤 알람을 설정해야 하는지 정확히 알려주는 것)를 제공하자, 하나의 보안 스캐너에 대해서는 성능이 92.5%까지 치솟았습니다. 이는 거대한 뇌들이 능력이 있긴 하지만, 무엇을 해야 할지 '정확히' 알려주지 않으면 옳은 일을 하지 않을 것이라는 점을 증명했습니다.
"주머니 뇌"의 한계
작은 모델들(SLM)은 높은 벽에 부딪혔습니다. 연구진이 아무리 상세한 보안 지침을 주려고 노력해도, 작은 모델들은 이를 따라올 수 없었습니다. 그들은 망가진 레시피를 쓰거나, 아니면 유효하지만 완전히 불안전한 레시피를 쓰곤 했습니다. 연구진은 이 작은 모델들의 문제가 지침의 문제가 아니라, 모델 자체가 복잡한 보안 규칙을 이해할 수 있는 "두뇌 능력"이 부족하다는 점임을 발견했습니다. 그들은 패턴을 복사하는 데는 뛰어나지만, 스스로 안전한 솔루션을 만들어내는 데는 어려움을 겪습니다.
스스로 실수를 고칠 수 있는가?
연구팀은 또한 로봇들이 자신의 오류로부터 배울 수 있는지 테스트했습니다. 그들은 로봇에게 레시피를 쓰게 하고, 스캔한 다음, 오류 목록(예: "이 파일의 암호화를 누락했습니다")을 로봇에게 보여주고 다시 시도하라고 요청했습니다.
- 좋은 소식: 로봇들은 Trivy 스캐너가 찾아낸 단순하고 구체적인 실수(예: 특정 문에 잠금장치가 빠진 경우)를 고치는 데 놀라울 정도로 뛰어났습니다. 많은 모델이 오류 목록을 본 후 점수가 크게 향상되었습니다.
- 나쁜 소식: 그들은 Checkov 스캐너가 찾아낸 크고 구조적인 문제들을 고치는 데는 젬병이었습니다. 이러한 문제는 "이 건물에 대해 완전히 새로운 보안 시스템을 구축해야 합니다"와 같은 것이었습니다. 로봇들은 자신의 작업을 한 번에 재설계할 수는 없었습니다. 그들은 느슨한 나사를 조일 수는 있었지만, 기초를 다시 설계할 수는 없었습니다.
결론
이 연구의 가장 중요한 시사점은 AI에게 당신의 디지털 도시를 짓게 하려는 사람들에게 주는 경고입니다. 당신은 AI가 보안 요원이 될 것이라고 믿어서는 안 됩니다.
연구진은 2024년에서 2026년 사이에 AI 모델들이 '올바르게 보이는' 코드를 쓰는 능력은 훨씬 좋아졌지만, '안전한' 코드를 쓰는 능력은 전혀 나아지지 않았다는 것을 발견했습니다. 사실, "보기 좋은 것"과 "안전한 것" 사이의 간극은 오히려 더 넓어졌습니다.
연구는 결론짓습니다. 단순히 AI에게 "안전하게 만들어줘"라고 요청하고 결과가 좋기를 바라는 것은 안 된다는 것입니다. 가장 똑똑한 AI 모델이라 할지라도 인간(또는 매우 엄격한 자동화 시스템)이 그들의 작업을 재검토해야 합니다. AI가 생성한 모든 코드에 대해, 모델이 얼마나 뛰어나든 혹은 지침이 얼마나 상세하든 상관없이 반드시 여러 개의 보안 스캐너를 실행해야 합니다. AI는 강력한 조수이지만, 클라우드 보안의 세계에서 아직 안전 검사관을 대체할 수는 없습니다. 만약 검사를 건너뛴다면, 당신은 문에 잠금장치가 하나도 없는, 아름답고 완벽하게 지어진 디지털 도시를 갖게 될지도 모릅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.