← 최신 논문
🤖 AI

EvoClaw: Evaluating AI Agents on Continuous Software Evolution

이 논문은 기존 벤치마크가 간과한 장기적 소프트웨어 진화의 복잡성을 평가하기 위해 DeepCommit 파이프라인과 EvoClaw 벤치마크를 제안하고, 이를 통해 현재 AI 에이전트들이 고립된 작업에서는 높은 성능을 보이지만 지속적인 유지보수 환경에서는 성능이 급격히 저하된다는 사실을 규명했습니다.

원저자: Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang

게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

EvoClaw: AI 코딩 에이전트의 '장기전' 실력 테스트

이 논문은 인공지능 (AI) 이 코딩을 할 때, 단순히 한 번만 문제를 푸는 것오랜 시간 동안 소프트웨어를 계속 발전시켜 나가는 것 사이에는 엄청난 차이가 있다는 사실을 발견한 이야기입니다.

마치 한 번의 퀴즈를 푸는 것수십 년을 살아오며 집을 짓고 수리하고 확장하는 것의 차이와 비슷합니다.


1. 문제: AI 는 '일회용' 코딩은 잘하지만, '계속되는' 코딩은 못 한다

지금까지의 AI 평가 기준은 마치 시험지 한 장을 푸는 것과 비슷했습니다.

  • 기존 방식: "이 함수를 만들어줘" → AI 가 코드를 짜고 → "정답!" → 끝.
  • 현실: 실제 소프트웨어는 한 번 만들어지고 끝나는 게 아닙니다. 사용자가 "이 기능 추가해줘", "저기 버그 고쳐줘", "디자인 바꿔줘"라고 계속 요구합니다. AI 는 이 요구사항을 하나씩 받아서 기존 코드를 수정하고, 새로운 기능을 덧붙여야 합니다.

하지만 논문은 충격적인 사실을 발견했습니다.

  • 한 번만 풀 때: AI 는 80% 이상을 맞췄습니다. (훌륭함!)
  • 계속해서 풀 때: AI 는 38% 도 못 맞췄습니다. (참담함!)

왜 그럴까요? 이유는 '기술 부채 (Technical Debt)' 때문입니다.
AI 가 첫 번째 작업을 할 때 "일단 작동하게만 하면 돼"라고 대충 코드를 짜면, 그다음 작업에서 그 대충 만든 코드가 발목을 잡습니다. 오류가 쌓이고 쌓여서 (눈덩이 효과), 나중에는 아무것도 제대로 못 하게 됩니다.

2. 해결책: 'EvoClaw'라는 새로운 시험지

저자들은 AI 의 진짜 실력을 보기 위해 EvoClaw라는 새로운 시험지를 만들었습니다.

  • 비유: 기존 시험지가 "한 문제를 푸는 능력"을 본다면, EvoClaw 는 **"1 년 동안 한 프로젝트를 맡아서 계속 발전시키는 능력"**을 봅니다.
  • 특징:
    • AI 는 같은 코딩 환경에서 계속 일해야 합니다.
    • 앞선 작업의 실수가 다음 작업에 영향을 미칩니다.
    • 새로운 기능을 추가하면서도, 기존 기능이 망가지지 않게 (회귀 방지) 지켜야 합니다.

3. 핵심 도구: 'DeepCommit' (시간 여행을 하는 AI)

실제 소프트웨어 개발 기록 (Git 로그) 은 너무 복잡하고 지저분합니다.

  • "파일명 수정", "주석 추가", "실수 수정" 같은 사소한 것들이 섞여 있어서, AI 가 "어떤 기능이 언제 왜 만들어졌는지"를 이해하기 어렵습니다.

저자들은 DeepCommit이라는 도구를 만들어 이 지저분한 기록을 정리했습니다.

  • 비유: 마치 수천 장의 일기장을 읽어서, '여름방학 프로젝트', '겨울방학 프로젝트'처럼 의미 있는 단위로 묶어주는 편집자 같은 역할입니다.
  • 이 도구는 AI 가 이해하기 쉽게, 기능별로 묶인 '마일스톤 (Milestone)'이라는 지도를 만들어줍니다. 그래야 AI 가 "이제 이 기능을 추가해야 해"라고 알 수 있습니다.

4. 실험 결과: AI 의 치명적인 약점

이 새로운 시험 (EvoClaw) 으로 최신 AI 12 개를 테스트한 결과는 다음과 같습니다.

  1. 새 기능은 잘 만드는데, 기존 건물을 무너뜨립니다.

    • AI 는 새로운 기능을 추가하는 능력 (Recall) 은 계속 좋아졌습니다. 하지만, 기존 기능을 망치지 않는 능력 (Precision) 은 급격히 떨어졌습니다.
    • 비유: 새로운 방을 지을 때는 잘 짓는데, 지을 때마다 기존 방의 벽이 무너지거나 배관이 터지는 식입니다.
  2. 오류가 쌓이면 멈춥니다.

    • 초반에 작은 실수를 하면, 그 실수가 다음 작업으로 전염되어 나중에는 아예 코드가 작동하지 않게 됩니다. 이를 **'눈덩이 효과 (Snowball Effect)'**라고 합니다.
  3. 탐험과 검증이 중요합니다.

    • 성공한 AI 는 코드를 수정하기 전에 코드를 꼼꼼히 읽어보고 (탐험), 수정한 후 **테스트를 여러 번 돌려보 (검증)**는 행동을 했습니다.
    • 실패한 AI 는 검증 없이 무작정 수정을 반복하다가 (Blind Thrashing) 더 큰 오류를 만들었습니다.

5. 결론: AI 가 진짜 '개발자'가 되려면

이 논문의 핵심 메시지는 다음과 같습니다.

"지금의 AI 는 **훌륭한 '단거리 주자'**입니다. 하지만 **마라톤을 뛰는 '장거리 주자'**가 되려면 아직 갈 길이 멉니다."

AI 가 진짜로 우리 생활에 들어와 소프트웨어를 유지보수하려면, 단순히 코드를 짜는 것뿐만 아니라 오래된 코드를 이해하고, 실수를 예방하며, 시간이 지나도 시스템이 무너지지 않게 관리하는 능력을 키워야 합니다.

한 줄 요약:

"AI 가 한 번만 코딩하는 건 잘하지만, 오래된 코드를 계속 고쳐가며 집을 지어가는 '장기전'은 아직 너무 어려워요."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →