← 최신 논문
🤖 AI

DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle

이 논문은 AI 에이전트의 전체 데브옵스(DevOps) 워크플로우를 평가하기 위해 30개 이상의 Java 및 Go 프로젝트에 걸친 700개 이상의 실제 작업으로 구성된 최초의 엔드 투 엔드 벤치마크인 DevOps-Gym을 소개하며, 현재의 최첨단 모델들이 이슈 해결, 테스트 생성, 모니터링, 빌드 구성과 같은 복잡한 작업에서 상당히 어려움을 겪고 있음을 밝혀낸다.

원저자: Yuheng Tang, Kaijie Zhu, Bonan Ruan, Chuqi Zhang, Michael Yang, Hongwei Li, Suyue Guo, Tianneng Shi, Zekun Li, Christopher Kruegel, Giovanni Vigna, Dawn Song, William Yang Wang, Lun Wang, Yangruibo Di
게시일 2026-01-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuheng Tang, Kaijie Zhu, Bonan Ruan, Chuqi Zhang, Michael Yang, Hongwei Li, Suyue Guo, Tianneng Shi, Zekun Li, Christopher Kruegel, Giovanni Vigna, Dawn Song, William Yang Wang, Lun Wang, Yangruibo Ding, Zhenkai Liang, Wenbo Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 뛰어난 새로운 견습생이 있다고 상상해 보세요. 이 견습생은 개별 문장과 문단을 쓰는 데는 정말 천재적입니다. 당신이 이 견습생에게 이야기를 하나 써달라고 부탁했고, 견습생은 아주 훌륭하게 해냈습니다. 하지만 이제 당신은 이 견습생이 출판사 전체를 운영할 수 있는지 확인하고 싶습니다. 이는 단순히 이야기를 쓰는 것을 넘어, 인쇄기를 설치하고, 기계가 과열되는지 지켜보고, 기계가 걸렸을 때 고치며, 다음 책에서는 똑같은 문제가 발생하지 않도록 체크리스트를 작성하는 것까지 포함합니다.

이것이 바로 DEVOPS-GYM이라는 논문이 테스트하고 있는 내용입니다.

핵심 아이디어: "작가"에서 "공장 매니저"로

한동안 AI는 코드를 작성하는 것(견습생이 문장을 쓰는 것과 같은)에는 매우 뛰어난 모습을 보여왔습니다. 하지만 실제 소프트웨어는 단순히 작성하는 것에 그치지 않고, DevOps라고 불리는 전체 생명 주기를 다룹니다. 여기에는 다음이 포함됩니다:

  1. 빌드(Building): 코드가 컴파일되고 실행되도록 만드는 것.
  2. 모니터링(Monitoring): 실행 중인 프로그램이 이상하게 작동하는지 지켜보는 것(마치 기계가 과열되는지 살피는 것과 같습니다).
  3. 수정(Fixing): 버그를 디버깅하고 패치하는 것.
  4. 테스트(Testing): 수정 사항이 실제로 작동하는지, 그리고 다른 것을 망가뜨리지는 않는지 확인하는 것.

연구진은 DEVOPS-GYM이라는 거대한 "체육관" 또는 훈련장을 구축했습니다. 여기에는 700개가 넘는 실제 세계의 도전 과제들이 담겨 있습니다. 그들은 AI 에이전트가 단순히 글을 쓰는 단계를 넘어, 이 네 가지 단계를 모두 처리하는 풀타임 공장 매니저처럼 행동할 수 있는지 확인하고자 했습니다.

"체육관" 구성

연구진은 JavaGo(AI 학습에 자주 쓰이는 Python과 달리 대기업에서 흔히 사용되는 두 언어)로 작성된 실제 소프트웨어 프로젝트를 사용하여 현실적인 환경을 설계했습니다.

그들은 AI를 위해 네 가지 유형의 운동 프로그램을 만들었습니다:

  • "설정" 운동 (빌드 및 구성): AI는 엉망인 프로젝트를 가져와서 올바르게 빌드되도록 만들어야 합니다. 이는 마치 설명서 없이 복잡한 가구를 조립하거나, 도구의 브랜드를 바꾸는 것과 같습니다.
  • "감시" 운동 (모니터링): AI는 실행 중인 프로그램을 관찰하며 메모리 누수(프로그램이 컴퓨터의 메모리를 서서히 잡아먹는 현상)나 느린 네트워크 연결과 같은 미묘한 문제를 포착해야 합니다. 이는 마치 지하실이 침수되기 전에 파이프의 미세한 누수를 알아차려야 하는 보안 요원과 같습니다.
  • "수리" 운동 (이슈 해결): AI는 보고서에 기술된 버그를 찾아 코드를 수정해야 합니다.
  • "품질 검사" 운동 (테스트 생성): AI는 버그가 사라졌음을 증명하기 위한 테스트를 작성해야 합니다.

그들은 또한 엔드 투 엔드 파이프라인(End-to-End Pipeline) 과제도 만들었는데, 이는 마치 계주 경기와 같습니다. AI는 설정을 완료한 후, 감시를 수행하고, 수리를 거쳐, 마지막으로 품질 검사까지 한 번에, 바통을 떨어뜨리지 않고 완수해야 합니다.

결과: 견습생는 아직 초보 매니저입니다

연구진은 현재 사용 가능한 가장 똑똑한 AI 에이전트들(Claude, OpenAI의 o4-mini 등을 사용)을 테스트했습니다. 결과는 다음과 같았습니다.

  1. "설정"은 어렵습니다: 최고의 AI조차 프로젝트를 올바르게 빌드하는 데 어려움을 겪었습니다. AI는 코드를 컴파일하는 복잡한 규칙들에 자주 혼란을 느꼈습니다. 가장 뛰어난 에이전트도 성공률은 약 **52%**에 불행히도 그쳤습니다.
  2. "감시"는 악몽입니다: 이것이 가장 큰 실패였습니다. AI는 실행 중인 시스템을 관찰하는 데 형편없었습니다. 그들은 문제를 알아차내지 못하거나 주의력을 잃곤 했습니다. 성공률은 충격적으로 낮았으며, 종종 0%에서 20% 사이였습니다. 이는 마치 보안 요원이 잠들거나 엉뚱한 카메라만 보고 있는 것과 같습니다.
  3. "수리"는 언어에 의존적입니다: AI는 (학습 데이터가 많은) Python의 버그를 고치는 데는 능숙했지만, Java와 Go로 전환하자 성능이 크게 떨어졌습니다. 이는 프랑스어는 완벽하게 구사하지만 기술 매뉴얼을 독일어로 번역하라고 하면 더듬거리는 번역가와 같습니다.
  4. 계주 경기는 완전히 실패했습니다: 네 단계를 연속으로 수행하도록 요청했을 때, AI 에이전트 중 단 하나도(0%) 성공하지 못했습니다. 그들은 전체적인 그림을 머릿속에 유지하지 못했습니다. 빌드는 고칠 수 있었지만, 모니터링 확인을 잊어버리거나, 버그를 고쳤지만 테스트 작성을 실패하는 식이었습니다.

왜 실패했을까요?

논문은 이러한 "공장 매니저"들이 아직 준비되지 않은 몇 가지 이유를 제시합니다:

  • 도구를 알지 못함: AI는 특정 시스템 도구(예: 메모리 사용량 확인 또는 빌드 파일 관리)를 사용하는 훈련이 충분히 되어 있지 않습니다.
  • 주의력이 산만함: 시스템을 장시간 관찰할 때, AI는 자신이 무엇을 보고 있는지 놓치곤 합니다. 시스템이 몇 시간 동안 실행되는 "긴 이야기"를 감당하지 못합니다.
  • 깊은 지식이 부족함: 간단한 오타는 고칠 수 있지만, 거대 소프트웨어 시스템이 어떻게 구축되고 실행되는지에 대한 깊고 복잡한 규칙은 이해하지 못합니다.

결론

DEVOPS-GYM은 현실을 직시하게 해주는 지표입니다. AI가 코드 조각을 작성하는 데는 놀라운 능력을 보이지만, 현재로서는 스스로 전체 소프트웨어 공장을 운영할 준비가 되어 있지 않습니다. AI는 실제 세계의 소프트웨어를 빌드하고, 관찰하고, 수정하고, 테스트하는 복잡하고 길고 까다로운 작업에 어려움을 겪고 있습니다. 연구진은 AI가 진정으로 전체 소프트웨어 개발 주기를 자동화하기 위해서는 훨씬 더 많은 작업이 필요하다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →