RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
RoadmapBench 은 실제 오픈소스 버전 업그레이드를 기반으로 한 115 개의 복잡하고 장기적인 코딩 작업으로 구성된 벤치마크를 도입하여, 최신 최첨단 AI 에이전트들이 대규모 다중 목표 소프트웨어 개발에서 크게 어려움을 겪으며 가장 진보된 모델을 사용하더라도 작업의 40% 미만을 해결한다는 점을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 초지능 AI 기반의 주니어 개발자 팀을 채용한다고 가정해 봅시다. 당신은 그들이 실제 업무를 수행할 수 있는지 알고 싶어 합니다. 단순히 레시피의 오타 하나를 수정하는 것이 아니라, 500 페이지 분량의 거대한 요리책을 완전히 재작성하여 새로운 장을 추가하고, 재료 측정 방식을 변경하며, 고장 난 오븐을 고치는 것입니다. 그리고 모든 작업을 기존 버전으로 여전히 레시피를 사용하는 사람들을 위해 기존 레시피가 작동하도록 유지하면서 수행해야 합니다.
바로 이것이 논문 ROADMAPBENCH가 다루는 내용입니다.
이 논문을 쉽게 설명해 드리겠습니다:
1. 문제: "오타 수정" 대 "리모델링"
오랜 기간 동안 우리는 AI 코딩 어시스턴트를 작고 쉬운 과제로 테스트해 왔습니다. 마치 "이 단락의 이 한 문장을 수정할 수 있나요?"라고 묻는 것과 같습니다. AI는 보통 "네!"라고 답하며 A+를 받습니다.
하지만 현실 세계의 소프트웨어 개발은 한 문장을 수정하는 것이 아닙니다. 그것은 고층 빌딩을 리모델링하는 것과 같습니다. 건물이 붕괴되지 않도록 50 개 층에 걸쳐 배관, 전기 배선, 엘리베이터 시스템을 동시에 변경해야 합니다.
저자들은 기존 테스트가 너무 쉬웠음을 깨달았습니다. 마치 건축가에게 누수되는 수도꼭지를 고치게 하는 것은데, 실제 업무는 병원에 새로운 동을 설계하는 것이기 때문입니다. 그래서 그들은 ROADMAPBENCH라는 훨씬 더 어려운 새로운 테스트를 개발했습니다.
2. 새로운 테스트: "버전 업그레이드" 도전
ROADMAPBENCH 는 AI 에게 버그를 수정하라고 요구하는 대신 로드맵을 제시합니다.
- 설정: AI 는 실제 소프트웨어 프로젝트 (인기 있는 오픈소스 도구 등) 의 이전 버전이 포함된 디지털 작업장에 투입됩니다.
- 미션: AI 는 "로드맵" 문서를 받습니다. 이 문서는 "이 소프트웨어의 다음 버전에서는 이 5 가지 새로운 기능을 추가하고, 이 3 가지 작동 방식을 변경하며, 이 2 가지 버그를 수정해야 한다"고 명시합니다.
- 규모: 이는 사소한 변경이 아닙니다. 평균적으로 AI 는 51 개의 서로 다른 파일에 걸쳐 3,700 줄의 코드를 재작성해야 합니다. 마치 AI 에게 영화 대본 전체를 다시 쓰고, 의상을 바꾸고, 장면을 다시 촬영하라고 한 번에 지시하는 것과 같습니다.
- 규칙: AI 는 "정답 키"(소프트웨어의 새 버전) 를 엿볼 수 없습니다. 오직 지시사항만으로 해결책을 찾아야 합니다.
3. 결과: AI 는 여전히 "주니어"입니다
연구자들은 Anthropic, OpenAI, Google 등 회사의 최신 버전을 포함한 이용 가능한 가장 똑똑한 AI 모델 13 개를 테스트했습니다. 이 모델들을 ROADMAPBENCH 테스트에 통과시켰습니다.
결과는 냉담했습니다:
- 가장 똑똑한 AI(Claude-Opus-4.7)조차도 작업의 **39.1%**만 성공했습니다.
- 가장 약한 AI는 작업의 **5.2%**만 성공했습니다.
비유:
만약 인간 주니어 개발자에게 집을 리모델링하라고 요청했는데, 10 번 중 4 번만 올바르게 작업을 완료했다면, 당신은 "아직 배우는 중이야"라고 말했을 것입니다. 이 논문은 복잡한 장기 소프트웨어 프로젝트에 있어 우리 최고의 AI 조차도 여전히 "학습" 단계에 있음을 보여줍니다.
4. 어디에서 실패하는가?
이 논문은 실패 횟수만 세는 것이 아니라, 왜 실패했는지 살펴봤습니다. 그들은 AI 의 "지능" 수준에 따른 패턴을 발견했습니다.
- 더 강력한 모델: 그들은 보통 코드를 컴파일 (빌드) 하고 대부분의 기능을 작성할 수 있었습니다. 하지만 세부 사항에서 실패했습니다. 완벽한 집을 지었지만 문 손잡이가 잘못된 쪽에 있거나, 스위치가 실제로 불을 켜지 않는 것과 같습니다. 그들은 큰 그림은 이해했지만 작고 정확한 논리는 놓쳤습니다.
- 더 약한 모델: 그들은 종종 집조차 지을 수 없었습니다. 지붕을 설치하는 것을 잊거나, 부엌을 지하에 만들려고 했습니다. 그들은 기본적인 건설 수준에서 실패했습니다.
5. 이것이 중요한 이유 (논문에 따르면)
저자들은 AI 를 "오타 수정"으로 테스트하는 것을 중단해야 한다고 주장합니다. 그렇게 하면 안도감을 주는 잘못된 인상을 주기 때문입니다. AI 가 버그를 수정할 수 있다고 해서 새로운 기능을 구축할 수 있다는 뜻은 아닙니다.
ROADMAPBENCH는 새롭고 정직한 자입니다. 그것은 AI 가 발전하고 있지만, 길고 복잡하며 다단계인 소프트웨어 프로젝트를 처리하는 능력은 여전히 해결되지 않은 거대한 과제임을 알려줍니다. 현재 AI 는 몇 단계의 지시사항은 잘 따르는 매우 재능 있는 견습공과 같지만, 프로젝트가 너무 크고 복잡해지면 혼란에 빠집니다.
요약
- 기존 테스트: "이 깨진 단어 하나를 수정할 수 있나요?" (AI: 네!)
- ROADMAPBENCH: "전체 소프트웨어 시스템을 업그레이드할 계획입니다. 할 수 있나요?" (AI: 해보겠지만, 세부 사항을 망치거나 단계를 잊어버릴 것 같습니다.)
- 결론: 우리는 아직 그 지점에 도달하지 않았습니다. AI 는 똑똑하지만, 주요 소프트웨어 프로젝트의 수석 엔지니어가 되기에 아직 준비되지 않았습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.