RepoZero: Can LLMs Generate a Code Repository from Scratch?
본 논문은 API 명세를 통해 처음부터 완전한 소프트웨어 저장소를 생성하는 LLM 에 대한 완전 자동화된 실행 기반 검증을 위한 최초의 벤치마크인 RepoZero 와 에이전트 코드-테스트 진화 (ACE) 프레임워크를 소개하며, 최첨단 에이전트조차도 이 복잡한 작업에서 높은 성공률을 달성하는 데 어려움을 겪고 있음을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"RepoZero" 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 제시합니다.
핵심 아이디어: AI 가 청사진만으로 집을 지을 수 있을까?
상상해 보세요. 아주 똑똑한 로봇 도우미 (AI) 가 있는데, 이 로봇은 수도꼭지 고치기나 벽 한 면 페인트 칠하기에는 매우 능숙합니다. 하지만 이제 여러분은 훨씬 더 어려운 질문을 던집니다. "원래의 청사진이나 완성된 집을 보지 않고, 지시사항 목록만으로 처음부터 집 전체를 지을 수 있는가?"
이 논문, RepoZero는 정확히 그 질문을 던집니다. 다만 집 대신 소프트웨어 코드 저장소(소프트웨어 프로그램을 구성하는 파일들의 모음) 를 다루는 것입니다.
문제: "만들기 전까지 속여라"의 함정
이전에는 연구자들이 이 AI 로봇들을 테스트할 때 작은 버그를 수정하거나 단일 파일을 작성하도록 요청했습니다. 하지만 처음부터 전체 프로그램을 구축하는 경우, AI 가 실제로 그 구축 방법을 이해했는지, 아니면 훈련 데이터에서 답을 암기했을 뿐인지 (수학을 배운 대신 교과서 답안을 외운 학생처럼) 구분하기 어렵습니다.
대부분의 기존 테스트는 인간이나 다른 AI 가 코드를 읽어 "괜찮아 보인다!"라고 말하는 방식에 의존합니다. 이는 수학 시험을 채점할 때 풀이 과정을 확인하지 않고 최종 숫자만 훑어보는 것과 같습니다. 이는 사기 치기 쉽고 신뢰성이 매우 낮습니다.
해결책: "RepoZero" 챌린지
저자들은 RepoZero라는 새로운 초강력 테스트를 만들었습니다. 작동 방식을 요리 비유로 설명해 보겠습니다.
- 원래 요리 (소스): 유명한 셰프가 복잡한 케이크의 비밀 레시피를 가지고 있다고 상상해 보세요. 우리는 그 맛과 행동 방식을 정확히 알고 있습니다.
- 도전: 우리는 AI 로봇에게 재료 목록과 케이크가 해야 할 일을 설명해 줍니다 (예: "가열되면 부풀어 오를 것", "달콤한 맛이 날 것").
- 반전 (크로스 언어): 로봇은 원래 레시피를 사용할 수 없습니다. 더 나쁜 것은, 완전히 다른 도구들이 있는 완전히 다른 주방에서 케이크를 만들어야 한다는 점입니다.
- 원래 케이크가 Python 주방에서 만들어졌다면, 로봇은 JavaScript 주방에서 만들어야 합니다.
- 원래가 **C++**였다면, 로봇은 Rust에서 만들어야 합니다.
- 왜? 이는 로봇이 레시피를 단순히 복사하는 것을 막기 위함입니다. 로봇이 논리를 진정으로 이해하고 처음부터 다시 구축하도록 강제합니다.
- 맛보기 (검증): 로봇이 자신의 케이크를 만듭니다. 그런 다음 두 케이크를 나란히 맛봅니다. 로봇의 케이크가 원래 케이크와 정확히 같은 방식으로 행동한다면 (같은 부풀음, 같은 맛, 같은 식감), 합격입니다. 조금이라도 다르면 불합격입니다.
"ACE" 프레임워크: 로봇의 자기 수정 루프
이 논문은 로봇이 작업하는 동안 학습하는 새로운 방법인 ACE(Agentic Code-Test Evolution) 도 소개합니다.
이를 큰 경기 전 연습 세션으로 생각해 보세요.
- 한 번만 집을 짓고 최선을 바라는 대신, 로봇은 작은 부분을 만든 후 즉시 테스트합니다.
- 테스트가 실패하면 (예: "문이 열리지 않음"), 로봇은 오류를 보고 문을 고친 후 다시 테스트합니다.
- 이 사이클을 반복합니다: 구축 -> 테스트 -> 수정 -> 구축.
- 논문은 이 "연습 루프"를 사용한 로봇들이 한 번에 구축하려는 로봇들보다 최종 제품을 구축하는 데 훨씬 더 능숙해졌음을 발견했습니다.
그들은 무엇을 발견했는가?
결과는 놀랍고 다소 냉소적이었습니다.
- 가장 똑똑한 로봇조차 고전: 오늘날 이용 가능한 가장 첨단 AI 모델들 (Claude, DeepSeek, Kimi 등) 은 전체 소프트웨어 "집"을 성공적으로 구축하는 비율이 고작 **30% 에서 55%**에 불과했습니다.
- 격차는 큽니다: 이러한 AI 들이 단일 코드 행 작성에는 놀라울 정도로 뛰어나지만, 처음부터 복잡하고 작동하는 소프트웨어 시스템을 자율적으로 구축하는 데는 여전히 멀었습니다.
- 자기 점검이 핵심: 자신의 작업을 테스트하고 수정하는 "ACE" 루프를 사용한 로봇들이 훨씬 더 좋은 성과를 거두었습니다. 이는 AI 가 진정한 소프트웨어 엔지니어가 되려면 단순히 추측하는 것이 아니라 자신의 작업을 점검하는 능력을 향상시켜야 함을 시사합니다.
요약
RepoZero는 AI 로봇들을 위한 새로운 엄격한 체육관입니다. 이 테스트는 AI 가 답을 암기하여 사기 치는 것이 아님을 증명하기 위해 복잡한 소프트웨어를 다른 언어로 재구축하도록 강요합니다. 이 테스트는 AI 가 작은 작업에는 점점 능숙해지고 있지만, 전체 소프트웨어 프로젝트를 독립적으로 구축할 수 있기까지는 아직 갈 길이 멀다는 것을 보여줍니다. 이 논문은 그 길에 도달하는 열쇠는 AI 가 구축하는 동안 자신의 실수를 테스트하고 수정하도록 가르치는 데 있다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.