← 최신 논문
💬 NLP

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

이 논문은 기존 벤치마크가 간과한 장기 반복적 태스크에서의 코드 품질 저하를 측정하기 위해 'SlopCodeBench'를 제안하고, 현재 코딩 에이전트들이 반복 작업을 수행할수록 코드 중복과 구조적 부패가 심화되어 인간 개발자보다 훨씬 열악한 확장성을 보임을 입증했습니다.

원저자: Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi

게시일 2026-03-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 프로그래머가 혼자서 코드를 계속 수정하고 확장해 나가는 과정에서, 어떻게 코드가 점점 엉망이 되어가는지"**를 연구한 내용입니다.

기존의 AI 평가 방식은 "한 번에 완벽한 코드를 짜낼 수 있는가?"를 보지만, 이 연구는 **"오래된 코드를 계속 고쳐가며 유지보수할 때 AI가 얼마나 무너져 내리는가?"**를 측정했습니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


🏠 비유: "AI 건축가와 망가진 집"

상상해 보세요. 한 명의 AI 건축가가 당신을 위해 집을 짓는 상황입니다.

  1. 기존 방식 (단발성 테스트):

    • 건축가에게 "1 층짜리 작은 집 하나를 지어줘"라고 말합니다.
    • AI가 멋진 집을 짓고, "성공!"이라는 점수를 받습니다.
    • 하지만 여기서 끝납니다. 이 집이 나중에 2 층, 3 층을 더 얹을 때 무너지는지, 혹은 확장하기 얼마나 어려운지는 nobody 가 모릅니다.
  2. 이 연구의 방식 (SlopCodeBench):

    • 건축가에게 "1 층을 짓고, 그다음 2 층을 추가하고, 그다음 3 층을 더하고..."라고 지시사항을 계속 바꿔가며 시킵니다.
    • 문제는 AI 가 자신이 처음 지은 1 층의 설계를 기반으로 계속 2 층, 3 층을 덧붙여야 한다는 점입니다.
    • 연구진은 AI 가 20 개의 프로젝트에서 93 번이나 작업을 반복하게 했습니다.

🔍 발견된 충격적인 사실: "코더 슬롭 (Slop)"의 탄생

AI 는 처음엔 잘 지었지만, 반복될수록 코드가 점점 **'쓰레기 (Slop)'**처럼 변했습니다.

  • 비효율적인 확장 (Verbosity):

    • 비유: 벽을 하나 더 쌓을 때마다, 기존 벽을 부수지 않고 그냥 그 위에 벽돌을 10 배 더 쌓아 올리는 식입니다.
    • 현실: AI 는 필요한 기능 하나를 추가할 때, 불필요하게 긴 코드와 중복된 코드를 쏟아냅니다. 마치 "안녕하세요"라고 말해야 할 때 "안녕하세요, 저는 오늘 기분이 좋습니다, 그리고 하늘은 파랗습니다"라고 길게 설명하는 것과 비슷합니다.
    • 결과: 인간 개발자보다 **2.2 배 더 많은 불필요한 말 (코드)**을 남겼습니다.
  • 구조의 부패 (Structural Erosion):

    • 비유: 집의 기둥 (핵심 구조) 이 하나뿐인데, 모든 방 (기능) 을 그 기둥 하나에 붙여놓은 꼴입니다. 기둥이 너무 무거워져서 언제든 무너질 것 같습니다.
    • 현실: 새로운 기능을 추가할 때, AI 는 깔끔하게 새로운 방을 짓기보다, 이미 복잡해진 기존 함수에 땜질식 코드를 덧붙입니다.
    • 결과: 코드의 복잡도가 특정 함수 하나에 몰려서, 그 함수가 거대하고 이해할 수 없는 괴물이 되어버립니다.

📉 결론: "점수만 좋으면 된다고?"

  • 시험 점수 (Pass Rate) 의 함정:

    • AI 가 만든 코드는 테스트를 통과할 때까지만 점수가 100 점입니다.
    • 하지만 그 코드는 다음에 기능을 추가할 때 완전히 무너집니다. 20 개의 프로젝트 중 아무 AI 도 끝까지 (100%) 성공한 경우가 단 한 건도 없었습니다.
    • 가장 잘한 AI 도 전체 작업의 **17.2%**만 성공적으로 끝냈을 뿐입니다.
  • 인간 vs AI:

    • 인간 개발자: 시간이 지나도 코드의 질이 비슷하게 유지되거나, 아주 천천히 나빠집니다.
    • AI: 작업이 반복될수록 코드는 매번 더 엉망이 됩니다. 마치 "한 번 지은 집을 계속 고치다 보니, 결국 그 집은 더 이상 수리할 수 없는 상태가 된 것"과 같습니다.

💡 왜 중요한가요?

지금까지 우리는 AI 가 "한 번에 잘 짜는지"만 봤습니다. 하지만 실제 소프트웨어 개발은 수십 년에 걸쳐 계속 고치고 확장하는 과정입니다.

이 연구는 **"AI 가 지금 당장 코드를 잘 짜더라도, 그 코드는 미래에 쓸모없고 유지보수하기 힘든 쓰레기가 될 가능성이 매우 높다"**고 경고합니다.

한 줄 요약:

"AI 는 지금 당장 집을 잘 지을 수는 있지만, 그 집을 계속 확장해 나가는 과정에서는 불필요하게 비효율적이고, 구조가 무너진 '쓰레기 집'을 만들어내는 경향이 매우 강합니다."

이 연구는 앞으로 AI 를 개발할 때, 단순히 '정답'을 맞추는 것보다 **'코드가 오래 견딜 수 있는 구조'**를 만드는 능력을 평가해야 함을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →