← 최신 논문
🤖 machine learning

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

이 논문은 코드베이스 Q&A, 테스트 작성, 리팩토링과 같은 소외된 전문 워크플로우에서 코딩 에이전트를 평가하기 위해 기능적 정확성과 소프트웨어 공학 품질을 모두 측정하도록 설계된 새로운 벤치마크 스위트인 SWE Atlas 를 소개하며, 최상위 모델이 앞서고 있지만 엣지 케이스 처리와 모범 사례 준수를 둘러싼 중요한 과제가 여전히 남아 있음을 밝힙니다.

원저자: Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei
게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 SWE Atlas 논문에 대한 설명을 일상적인 언어와 창의적인 비유로 번역한 것입니다.

큰 그림: "패치 작업자"에서 "마스터 건축가"로

상상해 보세요. 거대한 도시 (소프트웨어 코드베이스) 를 건설하고 유지보수하는 데 도움을 주기 위해 매우 똑똑하고 초고속인 건설 로봇들 (AI 코딩 에이전트) 팀을 고용했다고 가정해 봅시다.

지난 몇 년간 우리는 이 로봇들에게 간단하고 구체적인 작업을 주어 테스트해 왔습니다. "이 깨진 창문을 고쳐라" 또는 "이 새로운 문을 설치해라" 같은 작업 말입니다. 로봇이 창문을 고르되 창틀을 손상시키지 않으면 금별을 줍니다. 이것이 이전 테스트들 (SWE-Bench 등) 이 한 일입니다. 그들은 로봇이 무언가를 패치할 수 있는지 측정했습니다.

SWE Atlas는 이렇게 말합니다. "잠깐만요. 훌륭한 건설 노동자가 되는 것은 단순히 깨진 창문을 고르는 것만이 아닙니다. 도시 전체를 이해하고, 안전 매뉴얼을 작성하며, 10 년 후 붕괴하지 않도록 오래된 건물을 재설계하는 것도 중요합니다."

연구진들은 이 로봇들이 단순한 패치 작업자가 아니라 전문 엔지니어처럼 행동할 수 있는지 확인하기 위해 SWE Atlas라는 새롭고 더 어려운 테스트를 만들었습니다.


세 가지 새로운 도전 과제 ("아틀라스" 작업)

단순히 버그를 수정하는 대신, SWE Atlas 는 로봇들에게 세 가지 유형의 전문적인 업무를 부여합니다.

1. 코드베이스 Q&A: "도시 투어 가이드"

  • 옛날 방식: "여기 지도가 있습니다. 도서관이 어디에 있는지 말해 주세요." (로봇은 단순히 지도를 읽습니다).
  • SWE Atlas 방식: "저는 여기가 처음입니다. 비가 오고 전력망이 고장 났을 때 교통등이 어떻게 작동하는지 알고 싶습니다. 단순히 지도만 원하는 게 아니라, 차를 직접 몰아서 실시간으로 교통등을 관찰하며, 문제가 발생했을 때 정확히 어떤 일이 일어나는지 알려주길 바랍니다."
  • 주의할 점: 로봇은 실제로 소프트웨어를 실행하고, 스트레스 하에서 어떻게 고군분투하는지 관찰하며, 실시간 행동을 설명해야 합니다. 단순히 코드를 읽어서 추측해서는 안 됩니다.

2. 테스트 작성: "안전 검사관"

  • 옛날 방식: "문이 열리는지 확인하는 테스트를 작성해 주세요." (로봇은 문이 열리는지 확인하는 테스트를 작성합니다).
  • SWE Atlas 방식: "문을 부수려고 시도하는 테스트를 작성해 보세요. 잠겨 있는 동안 누군가 문을 열려고 한다면 어떨까요? 경첩이 녹슬었다면요? 바람이 너무 강하게 불다면요?"
  • 주의할 점: 로봇은 적대자가 되어야 합니다. 충돌을 일으킬 수 있는 모든 기이한 엣지 케이스 시나리오를 생각해 내야 합니다. 로봇이 '행복한 경로'(모든 것이 완벽하게 작동하는 경우) 만 확인하는 테스트를 작성한다면, 그 테스트는 실패한 것입니다.

3. 리팩토링: "리노베이션 전문가"

  • 옛날 방식: "벽을 파란색으로 칠해 주세요." (로봇은 색만 바꿉니다).
  • SWE Atlas 방식: "이 방은 엉망입니다. 배선이 꼬여 있고, 배관은 잘못된 위치에 있으며, 가구가 문을 막고 있습니다. 방 전체를 재배치해서 살기 쉽게 만들되, 가구나 한 조각도 움직이지 않게 하거나 방의 기능을 변경하지 마세요. 또한 더 이상 필요 없는 낡고 고장 난 도구들은 모두 버리세요."
  • 주의할 점: 로봇은 현재 작동하는 것을 실수로 망치지 않으면서 코드를 정리 (유지보수 가능하게 만들기) 해야 합니다. 환자가 마라톤을 뛰는 동안 심장 수술을 수행하는 것과 같습니다.

로봇들을 어떻게 평가했는지 ("평가 기준")

과거의 테스트는 객관식 퀴즈와 같았습니다. 코드가 실행되었나요? 예/아니요.

SWE Atlas 는 **교사의 평가 기준 (Rubric)**을 사용합니다. 엄격한 미술 선생님이 학생의 그림을 채점한다고 상상해 보세요.

  • 하늘을 그렸나요? (예/아니요)
  • 올바른 붓놀림을 사용했나요? (예/아니요)
  • 붓을 바닥에 두고 갔나요? (예/아니요 - 이는 나쁜 관행이므로 '부정적 평가 항목'입니다).

연구진들은 두 번째 AI(심판) 를 사용하여 로봇의 작업을 살펴보고 이러한 상세한 항목들을 확인했습니다. 그들은 다음 사항을 중요하게 여겼습니다.

  • 청결성: 로봇이 '죽은 코드'(쓰레기) 를 남겼나요?
  • 정리: 새로운 코드가 나중에 사람이 읽기 쉽나요?
  • 완전성: 로봇이 엣지 케이스를 놓쳤나요?

그들이 발견한 것 (결과)

연구진들은 가장 똑똑한 AI 모델들 (GPT-5.4 및 Opus 4.7 등) 과 일부 오픈소스 모델을 테스트했습니다. 그 결과는 다음과 같습니다.

  1. "패치 작업자"는 훌륭하지만 "엔지니어"는 고군분투 중:
    최상위 AI 모델들은 간단한 버그 수정 (패치 작업) 에는 탁월합니다. 하지만 깊은 리팩토링이나 견고한 테스트 작성과 같은 전문 엔지니어링의 messy 하고 복잡한 작업을 요구받으면 점수가 크게 떨어집니다.

  2. "일관성" 문제:
    최상위 로봇에게 같은 문제를 3 번 풀라고 요청하면, 한 번은 맞히고 나머지 두 번은 실패할 수 있습니다. 아직은 중요한 인프라를 맡길 만큼 신뢰할 수 없습니다.

  3. "탐색" 격차:
    가장 뛰어난 로봇들은 성공했는데, 그 이유는 단순히 코드를 읽는 것이 아니라 코드를 실행했기 때문입니다. 그들은 소프트웨어를 설정하고, 고장 내고, 수정하고, 로그를 관찰했습니다. 코드를 실행하지 않고 단순히 '읽기만' 한 로봇들은 '코드베이스 Q&A' 작업을 실패했습니다.

  4. "행복한 경로" 함정:
    테스트를 작성할 때 로봇들은 정상적으로 작동하는지 확인하는 테스트만 작성하는 경향이 있었습니다. 재앙을 확인하는 테스트 (적대적 사고방식) 를 작성하는 데 실패했습니다.

  5. 오픈 모델 vs 폐쇄 모델:
    가장 강력하고 비싼, 대기업에서 제공하는 '폐쇄' 모델들이 무료인 '오픈' 모델들보다 훨씬 잘 수행했습니다. 오픈 모델들은 종종 복잡하고 다단계인 작업을 처리하기에 너무 혼란스러웠습니다.

결론

SWE Atlas는 경각심을 불러일으키는 신호입니다. 이 논문은 AI 가 작은 코드 조각을 작성하거나 간단한 오류를 수정하는 데는 매우 능숙해졌지만, 아직 전문 소프트웨어 엔지니어가 될 준비가 되지 않았음을 알려줍니다.

AI 는 여전히 다음 사항에서 고군분투하고 있습니다.

  • 무엇이 잘못될 수 있는지 미리 생각하기.
  • 망가뜨리지 않고 지저분한 코드를 정리하기.
  • 종이 위가 아니라 실제 세계에서 시스템이 어떻게 작동하는지 이해하기.

이 논문은 우리는 단순히 "작동했나요?"라고 묻는 것을 멈추고 "좋은 엔지니어링인가요?"라고 묻기 시작해야 한다고 결론 내립니다. 왜냐하면 AI 코딩의 미래는 후자에 달려 있기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →