← 최신 논문
💬 NLP

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

이 논문은 기존 평가 방식의 결함과 포화 상태를 극복하기 위해 설계된 170개의 대규모 코드 리팩토링 작업으로 구성된 엄격하게 큐레이션된 다국어 벤치마크인 SWE-Bench ProMax를 소개하며, 현재의 최첨단 AI 에이전트들이 여전히 복잡하고 동작을 보존하는 소프트웨어 엔지니어링 과제에 어려움을 겪고 있음을 입증한다.

원저자: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

게시일 2026-08-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 소프트웨어 엔지니어가 되는 법을 배우고 있는 세상을 상상해 보십시오. 수년 동안 과학자들은 이 "AI 코딩 에이전트"들에게 두 숫자를 더하는 단일 함수를 작성하는 것과 같은 아주 작고 고립된 퍼즐을 풀게 함으로써 이들을 테스트해 왔습니다. 이는 마치 조종사에게 비행기를 활주로에서 유도 주행만 시켜보며 테스트하는 것과 같습니다. 하지만 실제 소프트웨어는 한 줄씩 만들어지는 것이 아닙니다. 그것은 거대한, 서로 연결된 코드의 도시와 같아서, 거리의 표지판 하나를 바꾸는 것만으로도 도시 전체의 지도, 신호등, 버스 시간표를 모두 업데이트해야 할 수도 있습니다. 연구자들이 던지는 핵심 질문은 이것입니다. 과연 이 AI 에이전트들이 무언가를 망가뜨리지 않으면서 거대한 규모의 소프트웨어를 재작성하는 복잡하고 무질서한 현실을 감당할 수 있을 것인가? 이것이 바로 "코드 리팩터링(code refactoring)"의 영역입니다. 즉, 건물 내부의 배선을 재구성하면서도 거주자가 전등 스위치를 켰을 때 불이 들어오는 방식은 그대로 유지하는 기술입니다.

여기에 AI 에이전트들이 빅리그에 참여할 준비가 되었는지 확인하기 위해 설계된 새롭고 매우 도전적인 테스트인 SWE-bench ProMax가 등장했습니다. 이전의 테스트들은 AI가 정답을 암기하거나 너무 단순한 문제를 해결할 수 있는 "쉬움 모드"의 비디오 게임과 같았습니다. 이 새로운 벤치마크의 제작자들은 만약 테스트가 너무 쉽거나 설계가 잘못된다면, AI의 높은 점수는 지능의 착각에 불과하다는 것을 깨달았습니다. 그래서 그들은 "어려움 모드"의 가틀릿(gauntlet)을 구축했습니다. 그들은 파이썬, 자바, C++, 러스트를 포함한 7가지 프로그래밍 언어로부터 170개의 실제 세계 소프트웨어 과제를 수집했습니다. 이것들은 작은 수정 작업이 아닙니다. AI가 평균 11.4개의 서로 다른 파일을 가로질러 변경 사항을 조정하고 260줄 이상의 코드를 다시 작성해야 하는 거대한 개편 작업이며, 이 모든 과정에서 소프트웨어가 이전과 똑같이 작동하도록 보장해야 합니다.

결과는 AI 산업에 대한 냉혹한 현실 점검이었습니다. 가장 똑똑하고 값비싼 AI 모델들이 이 경기장에 던져졌을 때, 그들은 테스트를 통과하지 못했습니다. 가장 우수한 모델조차 과제의 단 **41.2%**만을 해결했습니다. 이는 AI가 작은 잡무에는 능숙해지고 있지만, 실제 엔지니어링에 필요한 복잡하고 다단계적인 조정 능력은 여전히 부족하다는 것을 시사합니다. 흥란하게도, 논문은 모델에 더 많은 돈을 쓰는 것이 항상 더 나은 결과로 이어지지는 않는다는 것을 발견했습니다. 일부 저렴한 오픈 소스 모델들이 비싼 거대 모델들과 거의 대등한 성능을 보여주기도 했습니다. AI가 실패한 주요 원인은 무엇이었을까요? AI는 "부분적인" 작업자라는 점이었습니다. AI는 주요 문제는 해결했지만, 지원 파일들을 업데이트하는 것을 잊었습니다. 마치 누수되는 파이프를 고쳐놓고도 수도 계량기에는 알리지 않아 시스템 전체를 실패하게 만드는 것과 같았습니다. 이 벤치마크는 AI를 위한 진정한 소프트웨어 엔지니어링 숙련도는 여전히 진행 중인 과제임을 증명하며, 현재의 에이전트들이 아직 완전히 마스터하지 못한 수준의 계획력과 파일 간의 조정 능력이 필요함을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →