← 최신 논문
💻 computer science

Do These Violent Delights Have Violent Ends? Measuring the Post-Merge Fate of Agentic Code

182개의 저장소를 대상으로 한 이 종단적 연구는 에이전트 기반의 코드 기여가 인간의 코드와 대등한 병합률을 달oc하는 반면, 이후에 현저히 높은 수정 유지보수 부담을 초래하고 특히 리뷰율이 낮은 프로젝트에서 더 많은 보안 취약점을 유발한다는 사실을 밝혀냈다.

원저자: Chunqiu Steven Xia, Courtney Miller

게시일 2026-07-14✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chunqiu Steven Xia, Courtney Miller

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 방금 거대하고 광활한 코드의 도시를 건설하기 위해 최신 "에이전트형(agentic)" AI로 구동되는, 지치지 않는 초고속 로봇 조수 군단을 고용했다고 상상해 보십시오. 이 로봇들은 눈 깜짝할 사이에 소프트웨어의 한 구역 전체를 뚝딱 만들어낼 수 있습니다. 기술 거물들은 이 로봇들이 도시의 코드 중 30%에서 75%를 작성하고 있다며 환호하고 있습니다. 지표는 놀랍습니다. 로봇들은 사람이 셀 수 없을 정도로 빠르게 풀 리퀘스트(건축 허가)를 쏟아내고 있으며, 대부분은 승인되어 도시 계획에 병합됩니다.

하지만 여기에 반전이 있습니다: 허가가 서명되고 건물이 공식적으로 도시의 일부가 된 후에는 어떤 일이 벌어질까요?

이것이 바로 이 연구가 조사한 내용입니다. 연구진은 단순히 로봇이 얼마나 많은 건물을 지었는지를 세는 대신, 182개의 실제 프로젝트를 대상으로 1년 동안(2025년 5월부터 2026년 5월까지) 코드를 추적했습니다. 그들은 모든 코드 라인을 마치 용의자를 뒤쫓는 형사처럼 추적하며 다음과 같이 물었습니다. 이 코드는 살아남는가, 아니면 철거되고 다시 지어지는가? 코드가 고장 났을 때 누가 이를 고치는가? 그리고 이 코드는 위험한 함정을 숨기고 있는가?

거대한 반전: 중요한 것은 "얼마나 많이"가 아니라 "얼마나 나쁜가"입니다

여러분은 로봇이 만든 코드가 즉시 무너져 내리는 완전한 재앙이 될 것이라고 예상할 수도 있고, 혹은 완벽할 것이라고 생각할 수도 있습니다. 진실은 조금 더 미묘합니다.

연구 결과, 전반적으로 로봇이 작성한 코드는 인간이 작성한 코드와 비교했을 때 "철거(종료)"되는 비율이 유의미하게 다르지 않았습니다. 단순히 코드가 얼마나 오래 지속되는지에 대한 수치만 본다면, 로봇과 인간은 대등한 수준으로 보입니다.

하지만, 그 코드가 왜 변경되는지를 자세히 들여다보면 그림이 극적으로 바뀝니다.

  • "버그 수정" 자석: 로봇 코드는 수정 작업의 자석입니다. 연구에 따르면 에이전트형 코드는 인간의 코드보다 46% 더 많은 교정 유지보수(고장 난 부분을 고치는 작업)를 필요로 합니다.
  • "버그 수정"의 구체적 내용: 구체적으로, 로봇 코드는 45% 더 많은 버그 수정을 유발합니다. 인간의 코드 역시 많은 버그 수정을 겪지만, 로봇은 인간보다 더 많은 버그를 도입하는 것으로 나타났습니다.
  • "함정" 요소: 로봇 코드는 보안 약점이나 위험한 의존성을 가져올 가능성도 더 높습니다. 연구진은 Semgrep 및 OSV-Scanner와 같은 도구를 사용하여 이를 측정했습니다. 로봇 코드는 인간의 코드보다 보안 취약점을 1.14배 더 많이 도입했으며, 심각도가 높은(매우 나쁜) 취약점의 경우 1.51배 더 높은 비율로 도입했습니다.

이렇게 생각해 보십시오. 로봇은 벽을 세우는 데는 뛰어나지만, 화재 경보기를 설치하거나 가연성 페인트를 사용하는 것을 자주 잊어버립니다. 건물은 서 있지만, 나중에 훨씬 더 많은 화재 안전 점검과 수리가 필요합니다.

"무검토"의 위험 지대

가장 중요한 발견 중 หนึ่ง은 코드가 어떻게 승인되는지에 관한 것입니다. 연구진은 인간의 검토 없이 코드가 병합되는 경우를 조사했습니다.

그들은 직접적인 연관성을 찾아냈습니다: 프로젝트가 인간의 검토 없이 병합하는 코드가 많아질수록, 유지보수 부담은 더 무거워집니다.

  • 구체적으로, 프로젝트의 "무검토율"이 10%포인트 증가할 때마다, 에이전트형 코드의 유지보수 부담은 약 6%씩 증가합니다.

이는 로봇이 단순히 실수를 하는 것이 아니라, 인간 검토자라면 반드시 잡아냈을 실수를 하고 있다는 것을 시사합니다. 검토를 건너뛰면 로봇을 통제 불능 상태로 풀어주는 것이며, 그 실수에 대한 청구서는 나중에 돌아오게 됩니다.

"속도의 비대칭성" 문제

논문은 우리가 "생성-검토 비대칭성(generation-review asymmetry)"이라고 부르는 위험한 불균형을 만들었다고 주장합니다.

  • 생성 (작성): 로봇은 인간의 피로와 상관없이 무한히 빠르게 코드를 작성할 수 있습니다.
  • 검토 (확인): 여전히 인간이 작업을 확인합니다. 인간은 지치고, 바쁘며, 읽는 속도에 한계가 있습니다.

연구는 단순히 "더 빨리 검토"하거나 "검토를 자동화"하는 것이 해결책이 아니라고 제안합니다. 만약 로봇이 인간이 검토할 수 있는 속도보다 더 빠르게 코드를 작성하도록 내버려 둔다면, 결국 엄청난 양의 숨겨진 결함이 쌓이게 됩니다. 논문은 검토 프로세스를 더 얇게 늘리는 것이 아니라, 도구 자체를 개선하여 처음부터 실제로 안전하고 유지보수가 가능한 코드를 생산하도록 해야 한다고 주장합니다.

이 논문이 배제한 내용

이 연구가 발견하지 못한 내용도 아는 것이 중요합니다:

  • 이 연구는 로봇 코드가 모든 면에서 보편적으로 "더 나쁘다"는 것을 찾아내지 못했습니다. 전체적인 생존율(코드가 변경되기 전까지 지속되는 기간)은 인간의 코드와 통계적으로 유사했습니다. 차이점은 변경의 유형(기능 추가가 아닌 버그 수정이 많음)에 있습니다.
  • 이 연구는 문제가 "무작위"라는 것을 증명하지 않았습니다. 유지보수 부담은 단순히 운이 나쁜 것이 아니라, 무검토로 병합되는 코드의 양과 같은 특정 프로젝트 특성과 연결되어 있습니다.
  • 이 연구는 로봇이 "악하거나" "쓸모없다"는 것을 증명한 것이 아닙니다. 단지 현재 로봇이 인간의 사후 처리를 요하는 더 많은 버그와 보안 허점을 도입하고 있음을 측정했을 뿐입니다.

결론

연구의 결론은 로봇이 코드를 만드는 데는 인상적이지만, 현재로서는 코드로 남아 있는 능력(신뢰성)은 떨어진다는 것입니다. 이러한 도구의 "성공"은 얼마나 많은 코드를 생성했는지 또는 얼마나 많은 풀 리퀘스트가 병합되었는지로 측정해서는 안 됩니다. 대신 진짜 테스트는 이것입니다: 코드가 병합된 후에도 안전하고 안정적으로 유지되는가?

논문은 우리가 에이전트에 더 의존함에 따라, 생성의 속도를 찬양하는 것을 멈추고 정리(cleanup) 비용을 걱정해야 한다고 제안합니다. 로봇은 빠르지만, 만약 그들이 버그와 보안 구멍의 흔적을 남긴다면, 이를 치워야 하는 인간들은 초과 근무를 하게 될 것입니다. 목표는 첫날에 멋져 보이는 도시를 짓는 것이 아니라, 1년 후에 끊임없는 긴급 수리가 필요 없는 도시를 짓는 것이어야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →