← 최신 논문
💻 computer science

Why Agentic-PRs Get Rejected: A Comparative Study of Coding Agents

이 논문은 67.9%의 사례에서 발생하는 리뷰어 피드백 누락 문제를 해결하기 위한 휴리스틱을 제안하는 동시에, 고유하고 에이전트 특유의 거절 패턴을 식별하기 위해 다섯 가지 코딩 에이전트와 인간 베이스라인에 걸친 654개의 거절된 풀 리퀘스트를 분석한다.

원저자: Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Shane Mclntosh, Yasutaka Kamei

게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Shane Mclntosh, Yasutaka Kamei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

소프트웨어 개발을 거대하고 북적이는 건설 현장이라고 상상해 보세요. 보통은 작업자(인간 개발자)가 새로운 방을 완성하거나 누수를 수리하면, 현장 관리자에게 "변경 요청(Pull Request)"을 제출합니다. 관리자는 그것을 검토한 뒤, "좋아요, 이걸 만듭시다"라고 하거나 "아니요, 이건 안 되겠네요"라고 말합니다.

최근에 새로운 유형의 작업자가 도착했습니다: 바로 AI 에이전트들입니다. 이들은 스스로 계획을 세우고, 구축하며, 인간의 손길 없이도 직접 변경 요청을 제출할 수 있는 로봇들입니다. 이 논문은 이 AI 작업자들이 자신의 결과물을 제출할 때 인간 작업자들과 비교하여 어떤 일이 발생하는지를 조사합니다.

다음은 단순한 비유를 사용한 연구 내용의 요약입니다:

1. 거대한 문제: "침묵의 거절"

연구진은 다섯 가지 서로 다른 AI 로봇(Devin, Claude Code, GitHub Copilot 등)이 제출한 654개의 거절된 변경 요청을 조사하여 이를 인간이 만든 요청과 비교했습니다.

가장 충격적인 발견은 무엇이었을까요? 세 건 중 두 건의 거절은 '침묵의 거절'이었습니다.

  • 비유: 당신이 공모전에 그림을 제출했는데, 그 그림이 그냥 쓰레기통에 던져졌다고 상상해 보세요. 당신이 "왜죠?"라고 물었지만, 심사위원은 그저 어깨를 으쓱하며 가버립니다.
  • 실제 상황: 거절된 AI 요청의 67.9%는 리뷰어로부터 아무런 설명이 없었습니다. 요청이 그냥 닫혀버린 것입니다. 이는 연구자들이 AI가 왜 실패했는지 알기 매우 어렵게 만듭니다. 왜냐하면 "심사위원"이 그 이유를 적어두지 않았기 때문입니다.

2. "AI 전용" 실수들

연구진이 거절 이유를 실제로 찾아냈을 때, AI 로봇들이 인간은 거의 저지르지 않는 실수를 한다는 것을 발견했습니다. 연구진은 일곱 가지의 구체적인 거절 사유를 찾아냈는데, 이는 오직 AI에서만 나타나는 현상이었습니다:

  • "너무 큰" 상자: 인간도 가끔 큰 프로젝트를 제출하긴 하지만, AI 로봇은 한꺼번에 거대하고 압도적인 변경 사항을 제출하는 경지(?)에 이릅니다. 마치 AI가 단 하루 만에 마천루 전체를 지으려고 시도하는 것과 같습니다. 관리자들은 이 변경 사항들이 제대로 검토하기에는 너무 커서 거절했습니다.
  • "불신"의 낙인: 어떤 관리자들은 코드가 로봇에 의해 만들어졌다는 이유만으로 단순히 신뢰하지 않았습니다. 그들은 코드가 신뢰할 수 없거나 "환각(hallucinated, 지어낸 것)"을 일으킬 수 있다는 두려움 때문에 AI가 생성했다는 이유만으로 거절했습니다.
  • "슬롭(Slop)" 라벨: 한 사례에서, 프로젝트 소유자는 AI 요청을 거절하며 이를 "SLOP"(저품질의 대량 생산된 콘텐츠를 뜻하는 속어)이라고 명명했습니다. 이는 "이것은 기계가 생성한 쓰레기다"라는 뜻입니다.
  • "실험"의 실패: 일부 AI 요청은 로봇이 실제로 할 수 있는지 확인하기 위해 제출되었을 뿐, 실제로 그 코드를 원해서 제출된 것이 아니었습니다. 이것들은 실제 용도로 쓰일 의도가 아니었기에 거절되었습니다.

3. "로봇 특유의" 기벽

서로 다른 AI 로봇들은 각기 다른 성격과 설정을 가지고 있으며, 이는 독특한 거절 패턴으로 이어집니다:

  • "Devin" 효과: Devin이라는 이름의 특정 로봇은 요청이 너무 오래 방치되면 자동으로 요청을 닫아버리는 설정이 있습니다. 연구진은 많은 Devin의 거절이 코드가 나빠서가 아니라, 7일 동안 아무 반응이 없자 로봇 스스로 "지루해졌으니 이 건을 닫겠다"라고 결정했기 때문이라는 것을 발견했습니다.
  • "컨텍스트(Context)" 함정: 어떤 AI 로봇들은 일을 끝내는 데 필요한 "비공개" 파일이나 데이터에 접근할 수 없어서 거절당했습니다. 이는 마치 로봇이 자물쇠를 고치려는데, 열쇠가 보관된 방에 들어가지 못해 문이 잠겨 있는 상황과 같습니다.

4. 해결책: "쓰레기 필터"

너무 많은 거절에 메모가 없었기 때문에(즉, "침묵의 거절" 문제), 연구진은 데이터를 연구하기 전에 이를 정화할 방법이 필요하다는 것을 깨달았습니다. 그들은 어떤 거절이 진정으로 "침묵"하는 것인지, 그리고 어떤 것이 숨겨진 단서를 포함하고 있는지 추측하기 위한 단순한 필터(일련의 규칙)를 만들었습니다.

  • 필터 규칙: 그들은 다음과 같은 요청들을 찾아냈습니다:
    1. 작성자 본인이 직접 닫은 경우 (Self-closed).
    2. 매우 빠르게 닫힌 경우 (예: 7일 이내).
    3. 아무런 댓글 없이 닫힌 경우.
  • 결과: 이 규칙들을 사용하여, 연구진은 "소음"(침묵하고 도움이 되지 않는 거절들)을 걸러내고, 관리자가 실제로 "왜" 안 되는지를 설명한 사례들에 집중할 수 있었습니다. 이는 향려의 연구자들이 무엇이 잘못되고 있는지 더 명확하게 파악하는 데 도움을 줍니다.

요약

이 논문은 AI 에이전트들이 그 어느 때보다 빠르게 코드를 구축하고 있지만, 인간보다 더 자주 거절당하고 있다고 결론짓습니다. 이는 단순히 그들의 코드가 버그가 많아서가 아닙니다. 그 이유는 다음과 같습니다:

  1. 너무 크거나 복잡한 것을 제출합니다.
  2. 인간 관리자들의 불신을 유발합니다.
  3. 인간에게는 없는 독특한 "로봇 행동"(자동 닫기 등)을 보입니다.
  4. 종종 아무런 설명 없이 거절당하며, 이로 인해 실수로부터 배우기가 어렵습니다.

이 연구는 우리가 미래에 이러한 AI 작업자들을 어떻게 더 신뢰할 수 있게 만들 수 있을지 더 잘 이해할 수 있도록, 데이터를 정화하는 데 도움이 되는 "필터"를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →