A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents
이 논문은 최종 패치 성공뿐만 아니라 요구사항 명확화 및 구현 계획과 같은 중간 추론 단계까지 평가하는 코딩 에이전트를 위한 통합 벤치마크인 SWE-RPG를 소개하며, 암시적 요구사항 복구가 현재 에이전트의 레포지토리 수준 작업 성능을 제한하는 주요 병목 현상임을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 코드를 작성할 수 있는 아주 똑똑한 로봇 비서가 있는 세상을 상상해 보세요. 당신이 "이 게임의 버그를 고쳐줘" 또는 "새로운 레벨을 추가해줘"와 같은 간단한 지시를 내리면, 로봇은 바로 작업에 착수합니다. 이것이 바로 AI 코딩 에이전트의 꿈입니다. 오랫동안 과학자들은 이 로봇들에게 과제를 주고 최종 결과물이 제대로 작동하는지 확인하며 테스트해 왔습니다. 만약 게임이 튕기지 않고 잘 실행되면 로봇은 금색 별을 받습니다. 만약 게임이 멈추면 로봇은 빨간색 X표를 받습니다.
하지만 여기에 문제가 있습니다. 빨간색 X표는 로봇이 왜 실패했는지 알려주지 않습니다. 로봇이 당신의 지시를 오해한 것일까요? 나쁜 계획을 세운 것일까요? 아니면 단순히 코드를 잘못 타이핑한 것일까요? 이것은 마치 학생이 수학 시험에서 틀렸을 때, 어디서 틀렸는지에 대한 선생님의 메모 없이 그저 "0/10점"이라는 점수만 받는 것과 같습니다. 이 로봇들을 진정으로 더 똑똑하게 만들기 위해서는, 우리는 최종 결과물뿐만 아니라 그들의 사고 과정을 들여다봐야 합니다. 이것이 바로 이 논문이 다루는 핵심 질문입니다: 어떻게 하면 단순히 최종 패치를 채점하는 것을 넘어, 로봇의 두뇌를 진단하기 시작할 수 있을까요?
여기, 로봇의 마음속을 들여다보기 위해 설계된 매우 상세한 테스트인 SWE-RPG가 등장합니다. 연구진은 31개의 서로 다른 소프트웨어 프로젝트에서 추출한 163개의 실제 코딩 과제를 사용하여 벤치마크(표준화된 테스트)를 구축했습니다. 단순히 코드가 마지막에 작동하는지만 확인하는 대신, 그들은 로봇의 여정 속 모든 단계에 대해 "골드 트루스(Gold Truth)" 참조 데이터를 만들었습니다. 이것은 마치 마스터 셰프의 레시피 북을 가진 것과 같습니다. 그 책에는 완성된 요리뿐만 아니라, 셰프가 추측해야 했던 모든 숨겨진 재료, 모든 조리 계획의 단계, 그리고 로봇이 경로를 이탈했을지도 모르는 정확한 순간까지 기록되어 있습니다.
연구진은 세 가지 인기 있는 코딩 에이전트(Claude Code, Codex, OpenCode라는 이름의)를 여섯 가지 서로 다른 "두뇌" 모델(LLM)과 결합하여 테스트에 투입했습니다. 결과는 다소 냉혹한 현실을 보여주었습니다. 가장 뛰어난 로봇조차 과제의 약 **31.5%**만을 해결했습니다. 즉, 그들은 거의 3분의 2의 확률로 실패했다는 뜻입니다! 하지만 SWE-RPG의 진짜 마법은 그들이 어디에서 실패했는지를 밝혀낸 데 있었습니다. 연구 결과, 가장 큰 병목 현상은 실제로 코드를 작성하는 것이 아니라, 숨겨진 규칙을 이해하는 것이었습니다. 실패 원인의 약 **24.5%에서 46.0%**는 로봇이 "암묵적 요구사항(implicit requirements)"—즉, 일을 제대로 수행하기 위해 로봇이 알아야 했지만 당신이 직접 말하지 않은 것들—을 파악하지 못했기 때문에 발생했습니다.
예를 들어, 만약 당신이 로봇에게 "TSV 임포트 기능을 고쳐줘"라고 요청했다면, 로봇은 코드는 고칠 수 있겠지만, 두 기능이 서로 연관되어 있다는 사실을 깨닫지 못해 실수로 CSV 임포트 기능을 망가뜨릴 수도 있습니다. 이 연구는 이러한 에이전트들을 진정으로 유용하게 만들기 위해서, 우리가 단지 더 빠른 코드를 쓰도록 만드는 데 집중하는 것을 멈추고, 사용자의 요청 행간을 읽을 수 있는 더 뛰어난 탐정이 되는 법을 가르쳐야 한다고 제안합니다. 논문은 결론적으로, 이러한 에이전트들이 인상적이기는 하지만 여전히 소프트웨어 개발의 복잡하고 인간적인 측면에서 어려움을 겪고 있으며, SWE-RPG가 그 까다로운 숨겨진 요구사항들을 헤쳐 나가는 데 필요한 새로운 지도라고 밝히고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.