← 최신 논문
💬 NLP

Evaluating LLMs on Real-World Software Performance Optimization

이 논문은 102개의 전문가 최적화 사례로부터 도출된 엄격한 저장소 수준의 벤치마크인 SWE-Pro를 소개하며, 이는 현재의 거대 언어 모델들이 실제 소프트웨어 최적화에서 인간 수준의 성능을 맞추는 데 현저히 실패하여 전문 엔지니어들이 제공하는 상당한 속도 향상 및 메모리 절감 효과에 비해 미미한 이득만을 달성하고 있음을 드러낸다.

원저자: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "빠른 요리사" vs. "마스터 셰프"

당신에게 거대하고 바쁜 레스토랑 주방(실제 세계의 소프트웨어 코드베이스)이 있다고 상상해 보세요. 당신은 마스터 셰프(인간 전문가)가 더 빠르게 요리하고 에너지를 덜 사용하도록 돕기 위해 AI 셰프 팀(거대 언어 모델 또는 LLM)을 고용했습니다.

마스터 셰프들은 채소를 얼마나 효율적으로 다듬어야 하는지, 단계를 줄이기 위해 식료품 저장실을 어떻게 정리해야 하는지, 연료를 아끼기 위해 가스레인지 온도를 어떻게 조절해야 하는지를 정확히 알고 있습니다. 그들은 수년간의 경험을 가지고 있습니다.

AI 셰프들은 매우 똑똑합니다. 그들은 레시피를 읽고, 재료를 이해하며, 서류상으로는 완벽해 보이는 새로운 레시피를 써낼 수도 있습니다. 하지만 이 논문이 던지는 핵심 질문은 이것입니다: 이 AI 셰프들이 실제로 현실 세계에서 주방을 더 빠르게 돌아가게 하고 에너지를 덜 쓰게 만들 수 있을까요, 아니면 단순히 속도를 개선하지 못한 채 겉모습만 그럴싸하게 만드는 것뿐일까요?

문제점: 기존 테스트는 너무 단순했다

이전에는 연구자들이 AI 셰프에게 "이 당근 하나만 썰어봐"와 같은 아주 작고 단일한 과제를 주어 테스트했습니다.

  • 결함: 실제 주방에서는 당근 하나만 썰지 않습니다. 10개, 1,000개, 혹은 100,000개를 썹니다. 때로는 당근이 젖어 있기도 하고, 때로는 얼어 있기도 합니다.
  • 결과: 기존의 테스트는 조용한 방 안에서 당근 하나를 얼마나 잘 써느냐를 기준으로 셰프를 평가하는 것과 같았습니다. 그 테스트들은 셰프가 1,000개의 주문이 밀려드는 피크 타임을 감당할 수 있는지, 혹은 속도를 높이려다 실수로 물(메모리)을 너무 많이 사용하지는 않는지를 테스트하지 못했습니다.

이 논문은 이러한 기존 테스트들이 너무 쉬웠으며, 실제 컴퓨터에서 발생하는 "노이즈"(무작위적인 변동)를 잡아내지 못했다고 주장합니다.

해결책: SWE-Pro ("실제 주방" 시뮬레이터)

저자들은 SWE-Pro라고 불리는 훨씬 더 어렵고 새로운 테스트를 구축했습니다. 이것은 혼란스러운 실제 주방을 고도로 정밀하게 시뮬레이션한 것이라고 생각하면 됩니다.

  1. 실제 레시피: 그들은 가짜 과제를 만들지 않았습니다. 대신 유명한 오픈 소스 프로젝트(pandas, scikit-learn, xarray 등)에서 인간 전문가들이 성공적으로 코드를 최적화했던 102개의 실제 사례를 조사했습니다. 이것들이 바로 "골드 스탠다드(Gold Standard)" 레시피입니다.
  2. 스트레스 테스트: AI를 단 하나의 입력값으로 테스트하는 대신, SWE-Pro는 다양한 시나리오를 통해 테스트합니다.
    • 비유: 단순히 "당근 10개 썰기"가 아닙니다. "당근 10개 썰기", 그다음엔 "100개", 그다음엔 "10,000개"를 썰게 하고, 젖은 당근, 얼린 당근, 그리고 다양한 크기의 당근을 사용하여 테스트합니다.
  3. 노이즈 필터: 컴퓨터는 복잡합니다. 때로는 프로그램이 느려지는 이유가 컴퓨터가 다른 작업(예: 웨이터가 쟁반을 떨어뜨리는 것과 같은 상황)을 처리하느라 바빴기 때문일 수도 있습니다. SWE-Pro는 테스트를 반복해서 실행하고, 특수한 통계적 "노이즈 필터"를 사용하여 만약 AI가 "내가 더 빨라졌다"라고 말한다면, 그것이 정말로 사실인지 아니면 단순히 운이 좋았던 것인지 확인합니다.
  4. 두 가지 지표: 그들은 두 가지를 측정합니다.
    • 속도: 음식이 얼마나 빨리 제공되는가 (실행 시간/Runtime).
    • 메모리: 셰프가 조리대 공간과 저장 공간을 얼마나 사용하는가 (피크 메모리 및 시간 가중 메모리 사용량).

결과: AI 셰프들은 고전 중이다

최고의 AI 모델들(GPT-5.2, Claude Sonnet 4.6 등)을 이 엄격한 "실제 주방" 테스트에 투입했을 때, 결과는 놀랍고도 실망스러웠습니다.

  • 인간 전문가 (골드 스탠다드): 인간이 코드를 최적화했을 때, 엄청난 개선을 이루어냈습니다.
    • 비비유: 마스터 셰프는 요리 시간을 15배 단축했고, 필요한 조리대 공간을 171배나 줄였습니다. 그들은 엄청난 양의 자원을 아낄 수 있는 영리한 주방 재배치 방법을 찾아냈습니다.
  • AI 셰프:
    • 속도: AI 모델들은 거의 차이를 만들어내지 못했습니다. 대부분의 경우, 그들의 "개선"은 무작위 노이즈와 구별할 수 없을 정도로 미미했습니다.
    • 메모리: AI 모델들은 메모리를 절약하는 데 거의 실패했습니다. 이 영역에서 AI의 성과는 거의 존재하지 않는 수준이었습니다.
    • "신호 없음(No Signal)" 문제: AI가 기본적인 테스트를 통과하는 코드(음식 맛은 제대로 구현된 코드)를 작성했더라도, 측정 가능한 속도 향상을 만들어내는 경우는 드물었습니다. 이는 마치 당근을 깔끔하게 썰긴 했지만, 이전과 정확히 똑같은 시간이 걸리는 셰프와 같습니다.
    • 역행(Regression): 때로는 AI가 오히려 상황을 더 느리게 만들기도 했습니다. 한 모델(GPT-5.2)은 평균적으로 코드를 30% 더 느리게 만들었습니다!

핵심 요약

이 논문은 AI가 규칙을 따르고 올바르게 보이는 코드를 쓰는 데는 뛰어나지만, 실제 환경에서 소프트웨어를 눈에 띄게 빠르게 만들거나 메모리를 적게 사용하게 만드는 깊고 복잡한 엔지니어링 능력은 현재 매우 부족하다고 결론짓습니다.

  • 격차: 오늘날의 AI가 할 수 있는 것과 전문적인 인간 엔지니어가 할 수 있는 것 사이에는 거대한 간극이 존재합니다.
  • 병목 현상: 문제는 AI가 운이 좋으면 큰 개선을 이룰 수 없다는 것이 아닙니다. 문제는 AI가 그러한 개선을 이끌어낼 기회를 신뢰할 수 있는 방식으로 찾아내지 못한다는 점입니다.

요약하자면: 만약 당신이 AI에게 "이 소프트웨어를 더 빠르게 만들어줘"라고 요청한다면, AI는 그럴듯해 보이는 패치를 작성할 수는 있겠지만, 그것이 실제로 당신의 컴퓨터 속도를 높이거나 메모리를 절약할 것이라고 기대해서는 안 됩니다. 현재로서는 그 일은 여전히 인간 전문가의 몫입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →