← 최신 논문
💻 computer science

SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

이 논문은 언어 모델이 정확성을 유지하면서 코드 성능을 최적화하는 능력을 평가하기 위해 설계된 498개의 실제 저장소 태스크로 구성된 벤치마크인 SWE-fficiency를 소개하며, 현재의 최첨단 에이전트들이 병목 지점을 국소화하고 복잡한 코드베이스 전반에서 추론하는 데 있어 인간 전문가에 비해 현저히 낮은 성능을 보인다는 점을 밝히고 있다.

원저자: Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 믿을 수 없을 정도로 복잡한 소프트웨어 코드 라이브러리(데이터 과학과 인공지능을 구동하는 것과 같은)가 있다고 상상해 보세요. 이 안에는 특정 작업들이 매우 느리게 실행되는데, 이는 마치 사서가 모든 통로를 하나씩 다 걸어가며 책을 찾는 것과 같습니다.

이 논문은 SWE-FFICIENCY라고 불리는 새로운 도전 과제를 소개합니다. 이것은 AI 에이전트를 위한 "스피드런(speed-running) 대회"라고 생각하면 됩니다. 목표는 단순히 고장 난 책장을 고치는 것(기존의 대부분의 AI 테스트가 집중했던 부분)이 아닙니다. 목표는 도서관의 규칙을 바꾸거나 책을 잃어버리지 않으면서도, 사서가 책을 두 배 더 빠르게 찾을 수 있도록 도서관을 재편성하는 것입니다.

연구진이 수행한 작업과 발견한 사실을 다음과 같이 쉬운 비유를 들어 설명합니다.

1. 문제점: AI는 고치는 데는 능숙하지만, 속도를 높이는 데는 서툴다

현재 대부분의 AI 코딩 어시스턴트는 고장 난 자동차를 고치는 "정비사"가 되도록 훈련되어 있습니다. 자동차 시동이 걸리지 않으면, 그 원인을 찾아내고 고칠 수 있습니다. 하지만 이 논문은 다음과 같이 묻습니다. 이 AI 정비사들이 자동차를 망가뜨리지 않으면서 엔진을 튜닝하여 50% 더 빠르게 달릴 수 있게 만드는 "레이싱 엔지니어"가 될 수도 있을까?

연구진은 AI가 버그를 잡는 데는 익숙해지고 있지만, 코드를 더 빠르게 실행되게 만드는 데는 현재 매우 서투르다는 것을 발견했습니다.

2. 테스트: "실제 환경" 장애물 코스

이를 테스트하기 위해 저자들은 유명한 소프트웨어 라이브러리(pandas, numpy, scipy 등)에서 가져온 498개의 실제 작업을 사용하여 거대한 장애물 코스를 구축했습니다.

  • 설정: 그들은 AI에게 완전한 코드베이스와 특정 "느린 작업"(예: 처리하는 데 시간이 오래 걸리는 무거운 작업량)을 주었습니다.
  • 규칙: AI는 해당 작업을 더 빠르게 만드는 패치(코드 수정안)를 작성해야 했습니다.
  • 함정: AI는 엄격한 "안전 점검"을 통과해야 했습니다. 단순히 특정 테스트 하나를 빠르게 만들기 위해 코드를 해킹해서는 안 되며, 라이브러리의 다른 모든 테스트에 대해서도 코드가 여전히 올바르게 작동하는지 확인해야 했습니다. 만약 AI가 라이브러리를 망가뜨린다면, 그것은 실패로 간주됩니다.

이것은 요리사에게 수프를 10배 더 빨리 끓이도록 요청하되, 수프 맛이 설거지 물처럼 변하거나 주방을 태워 먹지 않도록 레시피를 바꿀 수 없다고 말하는 것과 같습니다.

3. 결과: AI는 아직 운전을 배우는 중이다

결과는 겸허했습니다. 연구진은 AI의 성능을 인간 전문가(속도 향상을 원래 작성했던 "골드 스탠다드" 엔지니어들)와 비교했습니다.

  • 점수: AI 에이전트는 평균적으로 인간 전문가가 얻을 수 있는 속도 향상의 약 **23%**만을 달성했습니다.
  • 비유: 인간 전문가가 10분 걸리는 통근 시간을 2분으로 단축할 수 있다고 가정해 봅시다. AI는 평균적으로 통근 시간을 8분으로 줄이는 데 그쳤습니다.
  • 실수 유형:
    • 잘못된 타겟: AI는 종종 코드의 엉뚱한 부분을 빠르게 만들려고 시도했습니다. 이는 마치 자동차가 느린 이유가 엔진 때문인데, 타이어를 광내서 차를 고치려는 것과 같았습니다.
    • "임시방편"의 함정: AI는 "지름길"을 좋아했습니다. AI는 특정 테스트를 빠르게 만들기 위해 임시적인 해킹(예: 답을 암기하는 방식)을 추가하곤 했는데, 이는 입력값이 조금만 바뀌어도 실패하게 됩니다. 반면 인간 전문가는 시스템 전체를 더 효율적으로 만드는 깊고 구조적인 변화를 추구했습니다.
    • 조기 포기: AI는 작은 속도 향상을 발견하면 그것으로 만족하며 멈추는 경항이 있었습니다. 즉, "이 정도면 충분하다"는 결과에 안주했지만, 인간 전문가는 최선의 속도 향상을 찾을 때까지 계속 파고들었습니다.

4. 이것이 중요한 이유

이 논문은 우리가 더 이상 단순히 버그를 고치는 것에만 의존할 수 없다고 주장합니다. 컴퓨터가 점점 더 비싸지고 에너지를 많이 소비함에 따라, 우리는 효율적으로 실행되는 소프트웨어가 필요합니다.

연구진은 이 벤치마크(SWE-FFICIENCY)를 만들어, AI가 현재 할 수 있는 일과 진정한 "성능 엔지니어"가 되기 위해 필요한 능력 사이의 거대한 격차를 보여주었습니다. 그들은 다른 연구자들이 이 격차를 좁힐 수 있도록 모든 데이터와 도구를 공개했습니다.

요약하자면: AI는 현재 훌륭한 "버그 퇴치사"이지만, 매우 형편없는 "속도 최적화 도구"입니다. AI는 단순히 표면적인 패치를 적용하는 것이 아니라, 거시적인 관점을 갖고 깊고 구조적인 개선을 하는 법을 배워야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →