← 최신 논문
💻 computer science

On the Use of Agentic Coding: An Empirical Study of Pull Requests on GitHub

157개의 오픈 소스 프로젝트에 걸쳐 Claude Code 에이전트가 생성한 567개의 GitHub 풀 리퀘스트를 대상으로 한 이 실증적 연구는, 에이전트가 지원한 기여의 83.8%가—종종 수정 없이—수용되지만, 여전히 버그 수정, 문서화 및 프로젝트 표준 준수를 위해 인간의 감독을 빈번하게 필요로 한다는 것을 보여준다.

원저자: Miku Watanabe, Hao Li, Yutaro Kashiwa, Brittany Reid, Hajimu Iida, Ahmed E. Hassan

게시일 2026-02-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Miku Watanabe, Hao Li, Yutaro Kashiwa, Brittany Reid, Hajimu Iida, Ahmed E. Hassan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

소프트웨어 개발을 수천 개의 팀이 디지털 마천루(오픈 소스 프로젝트)를 건설하고 있는 거대하고 북적이는 건설 현장이라고 상상해 보십시오. 수년 동안 노동자들(개발자들)은 스스로 청사진을 작성하고 벽돌을 쌓으며 힘든 일을 도맡아 왔습니다.

최근 이 현장에 "에이전틱 코딩(Agentic Coding)"(구체적으로는 Claude Code라는 도구)이라 불리는 새로운 유형의 초지능형 로봇 조수가 도착했습니다. 단순히 질문에 답하는 계산기와 달리, 이 로봇은 렌치를 잡고, 청사진을 살펴보고, 새는 파이프를 고치고, 새로운 작업 지침서를 작성하며, 심지어 작업 승인을 받기 위한 서류 작업까지 스스로 처리할 수 있습니다.

이 논문은 이 로봇들이 실제 세상에서 얼마나 일을 잘하고 있는지에 대한 성적표입니다. 연구진은 이 로봇이 작업을 수행한 567개의 건설 프로젝트(풀 리퀘스트, Pull Requests)를 조사하여 이를 인간이 수행한 프로젝트와 비교하였고, 네 가지 큰 질문을 던졌습니다.

결과를 쉬운 비유를 통해 설명하면 다음과 같습니다.

1. 로봇은 어떤 종류의 일을 하는가? (RQ1)

발견된 사실: 인간과 로봇 모두 고장 난 것을 고치거나(버그 수정) 새로운 방을 만듭니다(기능 구현). 하지만 로봇은 리모델링과 청소에 특별한 재능이 있습니다.

  • 비유: 만약 인간 작업자에게 "집을 고쳐라"라고 요청하면, 그들은 지붕을 고치거나 새로운 차고를 지을 수도 있습니다. 하지만 로봇에게 "집을 고쳐라"라고 요청하면, 로봇은 가구를 재배치(리팩토링)하거나, 수납장에 더 나은 라벨을 붙이고(문서화), 보안 카메라를 더 추가하는 것(테스트)을 매우 좋아합니다.
  • 결과: 로봇은 인간이 지루하게 느끼는 데이데이션(tedious)하고 규칙 기반적인 정리 작업에 놀라울 정도로 능숙합니다. 또한 로봇은 자신이 무엇을 했는지 정확히 설명하는 훨씬 길고 상세한 "작업 지시서"(PR 설명)를 작성하는 경향이 있습니다.

2. 관리자(Maintainers)들은 로봇의 작업을 수락하는가? (RQ2)

발견된 사실: 네, 대부분 그렇습니다! 하지만 인간의 작업만큼 자주 수락되지는 않습니다.

  • 통계: 로봇의 작업 중 약 **84%**가 승인되어 병합(merge)됩니다. 비교하자면, 인간의 작업은 약 **91%**가 승인됩니다.
  • 왜 거절되는가? 로봇이 "잘못된 벽"을 쌓았기 때문인 경우는 드뭅니다. 보통 작업이 거절되는 이유는 다음과 같습니다:
    • 타이밍: 다른 팀원이 이미 다른 방식으로 문제를 해결했습니다.
    • 규모: 로봇이 집 전체를 한꺼번에 고치려 시도하여 검토하기에 청사진이 너무 거대해졌습니다.
    • 시대 뒤떨어짐(Obsolescence): 로봇이 작업하는 동안 프로젝트의 방향이 바뀌었습니다.
  • 시사점: 로봇은 일반적으로 신뢰할 수 있지만, 팀이 현재 실제로 원하는 것이 무엇인지에 대한 "큰 그림"의 맥락을 놓칠 때가 있습니다.

3. 로봇은 일을 끝내기 위해 도움이 필요한가? (RQ3)

발견된 사실: 놀랍게도 로봇과 인간 모두 작업이 완벽해지기 전까지 거의 비슷한 수준의 "다듬기" 과정이 필요합니다.

  • 비유: 당신이 맞춤 케이크를 주문했다고 상상해 보십시오. 때때로 제과사(로봇)는 처음부터 100% 완벽하게 만들어냅니다. 때로는 90% 정도만 완성하여 프로스팅(장식)만 살짝 손봐야 할 때도 있습니다.
  • 통계: 로봇이 만든 케이크 중 약 **55%**가 그대로 사용하기에 완벽합니다. 이는 인간 제과사(58.5%)와 거의 비슷합니다.
  • 노력: 만약 케이크를 손봐야 할 경우, 로봇의 케이크를 수정하는 데 드는 노력은 인간의 케이크를 수정하는 데 드는 노력과 통계적으로 동일합니다. 로봇이 더 많은 실수를 해서 더 많은 일을 유발하는 것이 아니라, 단지 다른 종류의 작은 실수를 할 뿐입니다.

4. 인간은 정확히 무엇을 고쳐야 하는가? (RQ4)

발견된 사실: 인간이 개입하여 로봇의 작업을 수정해야 할 때, 주로 안전 점검, 지침, 그리고 스타일을 수정합니다.

  • 버그 수정 (48%): 로봇은 가끔 지나치게 낙관적으로 행동합니다. 문이 절대 고장 나지 않을 것이라고 가정하여 백업 계획을 세우지 않습니다. 인간은 그 백업 계획을 추가해야 합니다.
  • 문서화 (29%): 로봇은 멋진 새 방을 만들었지만 집의 지도(map)를 업데이트하는 것을 잊을 수 있습니다. 인간은 "README"(사용 설명서)를 업데이트해야 합니다.
  • 리팩토링 (27%): 로봇은 작동하는 벽을 만들었지만, 그 위치가 이상해서 집의 나머지 부분을 이용하기 어렵게 만들 수 있습니다. 인간은 집의 스타일에 맞게 그 벽을 옮겨야 합니다.
  • 스타일 (23%): 로봇은 잘못된 색상의 페인트를 쓰거나 잘못된 글꼴을 사용할 수 있습니다. 인간은 그것이 건물 전체와 어울리도록 만들어야 합니다.

종합적인 결론

**에이전틱 코딩(Agentic Coding)**을 매우 유능하고 빠르며 의욕적인 견습공이라고 생각하십시오.

  • 장점: 특히 지루한 정리 작업이나 테스트 작업에서 엄청난 양의 힘든 일을 대신 해줄 수 있습니다. 또한 즉시 사용할 수 있을 만큼 충분히 좋은 결과물을 만들어냅니다.
  • 단점: 가끔 프로젝트의 "분위기(vibe)"를 놓치기도 하고, 지침을 너무 길거나 짧게 작성하기도 하며, 때때로 안전과 스타일을 확인하기 위해 인간 감독관의 점검이 필요합니다.

결론: 로봇은 아직 인간 작업 반장을 대체할 수 없습니다. 대신, 로봇은 힘든 기초 작업을 수행하고, 인간이 개입하여 계획을 검토하고, 모든 것이 안전하고 스타일리시하며 프로젝트에 완벽하게 부합하는지 최종 결정을 내릴 수 있도록 돕는 강력한 도구입니다. 이 논문은 로봇이 훌륭한 시작점이 될 수는 있지만, "좋은 초안"을 "완성된 걸작"으로 바꾸기 위해서는 여전히 인간의 감독이 필수적이라고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →