Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance
이 실증 연구는 7,156 개의 풀 리퀘스트를 분석하여, 디빈이 수락에서 독특한 긍정적 시간적 추세를 보이지만 작업 유형이 성공률에 영향을 미치는 주된 요인이며, 단일 에이전트가 모든 작업 유형에서 탁월한 성과를 내지는 못함에도 불구하고 오픈에이아이 코드엑스가 다양한 카테고리에서 가장 일관된 고성능을 보임을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
바쁜 건설 현장의 관리자가 되어 상상해 보세요. 인간 노동자 대신 코드를 작성하고, 버그를 수정하며, 문서를 작성할 수 있는 다섯 가지 다른 AI 로봇 (OpenAI Codex, GitHub Copilot, Devin, Cursor, Claude Code) 을 보유하고 있습니다. 당신의 목표는 현장 검사관 (즉, "풀 리퀘스트 승인률") 에 의해 작업이 승인되는 데 있어 어떤 로봇이 가장 뛰어난지 확인하는 것입니다.
이 논문은 몇 달 동안 이 다섯 가지 로봇을 비교한 상세한 성적표와 같습니다. 여기 그들이 발견한 내용을 간단히 설명합니다.
1. 로봇보다 "업무 유형"이 더 중요합니다
가장 큰 놀라움은 어떤 로봇이 가장 빠른지가 아니라, 그들이 수행하던 업무의 종류였습니다.
- 비유: 로봇에게 "시를 써라"라고 요청하는 것과 "다리를 건설하라"고 요청하는 것을 상상해 보세요. 시를 쓰는 것이 일반적으로 다리 건설보다 승인을 받기 쉽습니다.
- 발견: 논문은 업무 유형이 가장 중요한 요소임을 발견했습니다.
- 로봇들에게 문서 작성 (매뉴얼이나 주석 작성 등) 을 요청했을 때, 승인률은 **82%**였습니다.
- 새로운 기능 (집에 새로운 방을 추가하는 것 등) 을 구축하도록 요청했을 때, 승인률은 **66%**에 불과했습니다.
- 교훈: 로봇의 전체 점수만으로 판단하면 속을 수 있습니다. 주로 쉬운 "시 쓰기" 작업을 수행하는 로봇은 "다리 건설"에는 매우 서툴더라도 스타처럼 보일 수 있습니다.
2. 모든 카테고리를 이기는 단일 로봇은 없습니다
모든 일에 가장 뛰어난 "최고의 로봇"은 없습니다. 각각은 특정 초능력을 가지고 있습니다.
- OpenAI Codex: 이는 신뢰할 수 있는 만능 선수입니다. 거의 모든 유형의 업무에서 일관되게 좋은 성과를 내며, 결코 적정 점수 이하로 떨어지지 않았습니다.
- Claude Code: 이는 문서 전문가는입니다. 매뉴얼 작성과 새로운 기능 생성에 가장 뛰어났지만, 이 연구에서 다른 많은 작업을 수행하지 않았으므로 주의해야 합니다.
- Cursor: 이는 버그 수정자입니다. 고장 난 것을 고르는 데 있어서는 최고의 수행자였습니다.
- Devin: 이 로봇은 느리게 시작했지만 시간이 지남에 따라 더 나아졌습니다. 주마다 명확한 개선 추세를 보인 유일한 로봇으로, 승인률이 약 60% 에서 80% 로 상승했습니다.
3. 시간이 변화를 가져옵니다 (하지만 모두에게 그런 것은 아닙니다)
연구자들은 이 로봇들이 학습하거나 개선되는지 확인하기 위해 수개월 동안 관찰했습니다.
- 비유: 매주 시험을 보는 학생을 생각해 보세요.
- Devin은 열심히 공부하여 매주 점수가 오르는 학생과 같습니다.
- 나머지 로봇들은 이미 똑똑한 학생들과 같습니다. 그들은 높은 점수로 시작해 높은 점수를 유지하지만, 시간이 지나도 큰 개선을 보이지 않습니다. 그들은 그저 일관성을 유지할 뿐입니다.
4. 왜 "전체 점수"는 오해의 소지가 있는가
이 논문은 로봇에 대한 단일 "평균 점수"를 보는 것을 경계합니다.
- 비유: 두 명의 요리사를 상상해 보세요. 요리사 A 는 누구나 좋아하는 간단한 샐러드만 요리합니다. 요리사 B 는 맞추기 어려운 복잡하고 매운 스튜만 요리합니다. "평균 고객 평점"만 보면 요리사 A 가 더 좋아 보일 수 있습니다. 하지만 그렇다고 해서 요리사 A 가 더 뛰어난 요리사라는 뜻은 아닙니다. 단순히 더 쉬운 재료를 받았을 뿐입니다.
- 발견: 연구자들은 공정한 비교를 위해 로봇들을 그들이 수행한 업무 유형별로 분리해야 했습니다. 그렇게 했을 때, 버그 수정, 테스트 작성, 문서 업데이트 등 업무 종류에 따라 "최고"의 로봇이 달라진다는 것을 발견했습니다.
요약
AI 코딩 어시스턴트를 고용하고 싶다면, 단순히 "누가 가장 뛰어난가?"라고 묻지 마세요.
- 버그 수정이 필요하다면 Cursor나 OpenAI Codex를 보세요.
- 새로운 기능이나 문서가 필요하다면 Claude Code나 OpenAI Codex가 최선의 선택일 수 있습니다.
- 시간이 지남에 따라 학습하고 개선되는 로봇을 원한다면 Devin을 주목하세요.
가장 중요한 교훈은 맥락이 왕이라는 점입니다. 정확히 어떤 일을 하도록 요청받았는지 알지 않고는 도구를 판단할 수 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.