SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
SWE-bench와 같은 기존 벤치마크의 심각한 데이터 오염 및 부적절한 테스트 케이스 문제를 해결하기 위해, 본 논문은 실제 GitHub 이슈를 큐레이션하는 자동화된 파이프라인을 활용하여 소프트웨어 엔지니어링 작업에 대한 대규모 언어 모델의 엄격하고 신뢰할 수 있는 평가 프레임워크를 제공하는 동적이고 지속적으로 업데이트되는 벤치마크인 SWE-MERA를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 고장 난 비디오 게임을 고치는 법을 가르치려 한다고 상상해 보세요. 오랫동안 로봇을 테스트하는 가장 좋은 방법은 이미 모두가 알고 있는 특정 고장 난 레벨들의 목록을 주는 것이었습니다. 하지만 여기에는 문제가 있었습니다. 로봇이 실제로 고치는 법을 배우는 대신, 정답을 그냥 암기하고 있었던 것입니다. 이는 마치 작년 수학 시험의 정답지를 외웠지만, 숫자가 바뀌어 나온 새로운 시험에서는 낙제하는 학생과 같았습니다.
이것이 바로 AI의 코딩 능력을 테스트하는 유명한 테스트인 SWE-bench에서 일어났던 일입니다. 이 논문은 기존의 테스트에서 정답이 유출되고 있었다고 밝혀냈습니다. "성공적인" 수정 사항 중 약 **32.67%**는 AI가 이미 보았던 솔루션을 단순히 복사한 것이었고, 또 다른 **31.08%**는 테스트가 너무 약해서 실제 실수를 잡아내지 못했기 때문에 통과한 것이었습니다. 그것은 망가진 자와 같았습니다.
새로운 역동적 도전자, SWE-MERA가 등장했습니다. SWE-MERA를 정적인 교과서가 아니라, 매달 업데이트되는 살아 숨 쉬는 비디오 게임 서버라고 생각해보세요. 오래되어 암기된 퍼즐을 사용하는 대신, 이 시스템은 인터넷(구체적으로는 수백만 명의 사람들이 코드를 공유하는 GitHub)에서 끊임없이 새롭고 실제적인 문제들을 찾아냅니다.
새로운 테스트의 작동 방식
저자들은 이러한 신선한 문제들을 찾기 위해 매우 체계적인 로봇 파이프라인을 구축했습니다. 이는 클로즈업된 단서들이 진짜인지 확인하기 위한 7가지 엄격한 규칙을 가진 고도의 기술적인 보물찾기와 같습니다:
- 적절한 놀이터 선택: 인기 있고 활발한 Python 프로젝트(별점 10개 이상, 포크 10개 이상)만을 살펴봅니다.
- 단서 맞추기: 특정 문제(이슈)와 그 문제를 해결한 정확한 솔루션(풀 리퀘스트)을 찾아내어, 이들이 완벽한 일대일 쌍이 되도록 만듭니다.
- 규모 확인: 아주 작은 메모나 너무 크고 복잡한 프로젝트는 무시하고, 딱 적당한 규모의 것들만 유지합니다.
- 수정 사항 검증: 솔루션이 실제로 코드를 변경하는지, 그리고 그것이 작동함을 증명하기 위해 테스트를 추가하는지 확인합니다.
- 실험실 구축: 프로젝트를 안전하고 격리된 컨테이너(디지털 샌드박스 같은) 내에서 빌드하여 테스트가 통과하는지 확인합니다.
- 전체 미션 수행: 전체 과정을 처음부터 끝까지 실행하여 재현 가능한지 확인합니다.
- AI 판사: 마지막으로, 또 다른 AI(Qwen3-32B 모델)가 엄격한 선생님 역할을 하며, 정답의 정확성과 완전성을 기준으로 1에서 10 사이의 점수를 매깁니다. 만약 작업이 너무 쉽거나, 너무 어렵거나, 설명이 부족하면 탈락시킵니다.
그 결과는 어떨까요? 약 10,000개의 잠재적 작업 컬렉션이 만들어졌으며, 현재 즉시 사용할 수 있는 728개의 고품질 샘플이 준비되었습니다.
결과: 과연 누가 승리하는가?
연구진은 가장 똑똑한 코딩 AI 십여 개를 이 신선한 문제들에 투입했습니다. 그들은 단순히 AI에게 버그를 한 번 해결하라고 요청한 것이 아니라, AI에게 생각하고 자신의 작업을 재확인할 기회를 주며 버그를 고치기 위한 6번의 시도를 부여했습니다.
결과는 놀라웠습니다:
- 최고의 성과자: DeepSeek-R1-0528 모델이 챔피언이 되었으며, 첫 번째 시도에서 약 **27.8%**의 문제를 해결했고, 6번의 시도 내에는 **40.2%**를 해결했습니다.
- 2위: Devstral-Small-2505가 첫 번째 시도에서 17.2%, 전체적으로 **28.2%**를 해결하며 2위를 차지했습니다.
- 고전하는 모델들: 채팅에는 뛰어나지만 코딩 전용은 아닌 Llama-3.3-70B와 같은 거대하고 강력한 모델조차 첫 번째 시도에서 겨우 **8.7%**를 해결하는 데 그쳤습니다. 가장 작은 모델인 Qwen2.5-Coder-7B는 첫 번째 시도에서 **2.7%**만을 해결할 수 있었습니다.
이 논문은 이러한 새로운 동적 테스트가 스마트한 AI와 암기하는 AI를 구분하는 데 훨씬 더 낫다고 제안합니다. 예를 들어, 기존 테스트에서 훌륭해 보였던 일부 모델들이 새로운 2025년 과제에서는 오히려 성적이 저조했는데, 이는 그들이 단순히 과거의 정답을 암기하고 있었음을 시사합니다.
이 테스트가 하지 않는 것
이 새로운 벤치마크가 무엇을 제외하는지 아는 것도 중요합니다. 논문은 이 테스트가 코드의 가독성, 유지보수성 또는 보안성을 측정하지 않는다고 명시적으로 밝히고 있습니다. 또한 팀워크나 인간과 로봇이 어떻게 협력하는지도 테스트하지 않습니다. 이것은 엄격하게 "로봇이 버그를 고치고 테스트를 통과할 수 있는가?"에 집중합니다.
또한 저자들은 문제가 자동으로 수집되기 때문에, 일부는 다소 기이하거나 인간이 작성한 퍼즐 같은 창의적인 뉘앙스가 부족할 수 있다고 경고합니다. 또한 시스템이 이를 방지하려고 노력함에도 불구하고, AI가 훈련 데이터에서 유사한 문제를 이미 보았을 작은 위험도 존재합니다.
큰 그림
저자들은 SWE-MERA가 발전을 측정하는 훨씬 더 공정한 방법이라고 확신합니다. 끊임없이 새로운, 보지 못한 과제들로 테스트를 갱신함으로써, AI가 정답을 암기하여 속임수를 쓰는 것을 막습니다. 그들은 심지어 누구나 자신의 코딩 로봇이 세계 최고들과 비교해 어느 정도 수준인지 확인할 수 있는 공개 리더보드를 구축했으며, 성능이 시간에 따라 어떻게 변하는지 볼 수 있는 슬라이더 기능도 제공합니다.
요약하자면, SWE-MERA는 이 분야에 필요한 "신선한 공기"입니다. 이는 먼지 쌓인 암기식 교과서에서 벗어나, 진정으로 적응 가능한 코딩 에이전트만이 살아남을 수 있는 역동적이고 끊임없이 변화하는 경기장으로 우리를 안내합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.