← 최신 논문
💻 computer science

How Portable Are LLM-Serving Scheduler Rankings Across Workloads, Operating Regions, and Metrics?

이 논문은 LLM 서빙 스케줄러 포터빌리티 벤치마크(LSSP)를 소개하며, 스케줄링 정책 순위가 일부 워크로드 소스 간에는 높은 일치도를 보이지만, 서로 다른 운영 영역 및 평가 지표에 따라 상당한 가변성과 제한된 이식성을 나타내므로 스케줄러 비교는 특정 실험적 맥락에 따라 조건부로 해석되어야 함을 입증한다.

원저자: Soroush Vahidi

게시일 2026-09-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Soroush Vahidi

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대의 디지털 환경에서 대규모 언어 모델은 글쓰기 보조 도구부터 복잡한 코딩 도구에 이르기까지 광범위하고 지능적인 애플리케이션의 핵심 엔진이 되었습니다. 이러한 시스템이 수백만 명의 사용자에게 원활하게 작동하기 위해서는 강력한 그래픽 프로세서가 두뇌 역할을 하는 정교한 서버 팜에 의존합니다. 그러나 이러한 프로세서는 비용이 많이 들고 자원이 한정되어 있습니다. 수천 명의 사람들이 동시에 요청을 보낼 때, 서버는 어떤 요청을 먼저 처리할지, 어떻게 이들을 그룹화할지, 그리고 특정 사용자가 시스템을 막아 다른 사용자들이 기다리게 만들지 않도록 메모리를 어떻게 관리할지를 결정해야 합니다. 이 의사결정 과정은 데이터의 흐름을 끊임없이 재배치하여 모든 것이 효율적으로 움직이도록 유지하는 교통 관제사와 같은 소프트웨어인 '스케줄러(scheduler)'에 의해 처리됩니다.

수년간 연구자들은 기존 방식보다 더 빠르거나 공평한 새로운 스케줄러 개선 방법을 제안해 왔지만, 이러한 주장들은 거의 항상 매우 특정한 조건 하에서 테스트되었습니다. 즉, 단 한 가지 유형의 사용자 트래픽을 사용하고, 특정 수준의 서버 부하에서만 테스트하며, 단 하나의 지표로 성공 여부를 측정했습니다. 이는 사각지대를 만듭니다. 조용하고 예측 가능한 요청 스트림에서 완벽해 보이는 스케줄러가 갑작스럽고 혼란스러운 활동의 폭발(burst)에 직면했을 때는 처참하게 실패할 수 있기 때문입니다. 근본적인 질문은 해결되지 않은 채 남아 있었습니다. 만약 어떤 스케줄러가 한 세트의 데이터에서 최고라고 선언되었다면, 트래픽이 변하거나, 부하가 이동하거나, 성공의 정의가 바뀔 때도 그 순위가 유지될 것인가 하는 점입니다.

이 질문에 답하기 위해 뉴저지 공과대학교(New Jersey Institute of Technology)의 한 연구자는 'LLM 서빙 스케줄러 포터빌리티 벤치마크(LLM-Serving Scheduler Portability Benchmark)'라는 엄격한 테스트를 설계했습니다. 이 연구는 어떤 단일 스케줄러가 절대적으로 최고인지를 묻는 대신, 더 미묘한 질문을 던졌습니다. 바로 이 스케줄러들의 순위가 얼마나 '이식성(portable)'을 갖느냐는 것입니다. 다시 말해, 사용자 트래픽의 출처를 바꾸거나, 부하의 강도를 조절하거나, 성능을 측정하는 방식을 바꿀 때, 최고와 최악의 스케줄러 순위가 그대로 유지되는가, 아니면 뒤집히는가 하는 점입니다. 연구자는 120개의 서로 다른 워크로드 윈도우(window)로 구성된 거대하고 고정된 컬렉션을 대상으로 13가지의 서로 다른 스с케줄링 전략을 실행하는 시뮬레이션을 구축했습니다. 이 윈도우들은 마이크로소프트의 Azure 클라우드 트래픽, 알리바바의 Bailian/Qwen 플랫폼, 그리고 마이크로소프트 Azure 트레이스인 BurstGPT라는 세 가지 독립적인 소스에서 추출되었습니다. 시스템은 경미한 트래픽부터 심각한 과부하에 이르는 6개의 서로 다른 운영 영역에 걸쳐 테스트되었으며, 여러 성능 지표를 사용하여 평가되었습니다.

결과는 단순한 '예' 또는 '아니오'로 답할 수 있는 것이 아니었습니다. 순위는 보편적으로 안정적이지도, 그렇다고 완전히 무작위적이지도 않았으며, 어떤 특정 요소의 조합을 보느냐에 따라 크게 달라졌습니다. 서로 다른 데이터 소스를 비교했을 때, 마이크로소프트 Azure와 알리바바의 Bailian/Qwen 사이의 트래픽은 거의 완벽하게 일치함을 발견했습니다. 만약 어떤 스케줄러가 Azure에서 최고였다면, Bailian/Qwen에서도 거의 확실히 최고였습니다. 그러나 세 번째 소스인 BurstGPT는 다른 이야기를 들려주었습니다. BurstGPT를 비교에 포함했을 때, 상관계수는 0.55까지 떨어지며 일치도가 크게 낮아졌습니다. 이는 Azure와 유사한 트래픽에서 검증된 스케줄러가 BurstGPT와 유사한 트래픽에서는 예상대로 작동하지 않을 수 있음을 시사합니다.

연구는 또한 순위가 실제로 역전되는 빈도, 즉 한 시나리오에서 더 나았던 스케줄러가 다른 시나리오에서는 더 나빠지는 경우를 조사했습니다. 약 1,000번의 비교 중, 통계적으로 유의미하면서도 실무적으로 중요한 수준의 역전이 발생한 경우는 약 3.6%에 불과했습니다. 이러한 역전은 모든 조건에 고르게 분포되어 있지 않았으며, 특히 시스템에 과부하가 걸린 특정 영역에 집중되었습니다. 더욱이, 이러한 유의미한 역전은 모두 동일한 한 쌍의 스케줄링 전략을 포함했으며, 한쪽에는 항상 BurstGPT 데이터가 포함되어 있었습니다. 이는 불안정성이 시스템의 일반적인 결함이 아니라, 특정 스케줄링 메커니즘과 해당 트래픽 소스의 고유한 특성 사이의 특정한 상호작용임을 나타냅니다.

가장 놀라운 발견은 아마도 성능을 판단하는 데 사용된 '지표'에 관한 것이었을 것입니다. 연구진은 완료된 요청 수와 같은 한 가지 지표에서 가장 높은 순위를 차지한 스케줄러가 속도나 공정성과 같은 다른 지표에서도 가장 높은 순위를 차지하는지 테스트했습니다. 그 결과, 지표가 바뀔 때 순위가 놀라울 정도로 취약하다는 것을 발견했습니다. 평균적으로 서로 다른 지표 간의 일치도는 중간 정도에 불과했으며, 68.1%의 테스트 조건에서 어떤 지표를 사용하느냐에 따라 단일 최고 성능 스케줄러가 바뀌었습니다. 이는 '최고의 스케줄러'라는 주장이 추구하는 구체적인 목표에 대해서는 침묵하고 있음을 의미합니다. 즉, 속도에 최적화된 스케줄러가 공정성 측면에서는 최악의 선택이 될 수 있으며, 그 순위는 운영자가 무엇을 가치 있게 여기느냐에 전적으로 달려 있다는 것입니다.

시뮬레이션 결과가 단순히 컴퓨터 모델의 산물이 아님을 확인하기 위해, 연구자는 시뮬레이션에서 발견된 가장 극적인 역전 사례를 선정하여 표준 그래픽 프로세서를 사용하는 실제 물리적 하드웨어에서 테스트했습니다. 시뮬레이션은 한 스케줄러가 한 유형의 트래픽에서는 승리하고 다른 유형에서는 패배할 것이라고 예측(순위의 뒤집힘)했습니다. 실제 하드웨어에서 이 특정 역전은 일어나지 않았으며, 한 스케일러가 두 경우 모두에서 승리했습니다. 그러나 시뮬레이션이 변화가 없다고 예측했던 별도의 안정적인 순위 테스트는 실제 하드웨어에서도 그대로 유지되었습니다. 이는 시뮬레이션이 안정적인 추세를 식별하는 데는 유용하지만, 모든 특정 역전을 완벽하게 예측하지는 못할 수도 있음을 시사하며, 모델의 충실도(fidelity)가 끝나는 경계를 보여줍니다.

궁극적으로, 이 연구는 모든 상황에 작동하는 단 하나의 보편적인 '최고' 스케줄러는 존재하지 않는다는 결론을 내립니다. 스케줄링 전략의 성능은 조건부적입니다. 그것은 사용자 트래픽의 구체적인 출처, 시스템의 현재 부하, 성공을 측정하는 지표, 그리고 서비스 목표의 구체적인 정의에 따라 달라집ers. 한 세트의 데이터에서 견고해 보이는 순위도 검증 없이는 다른 데이터에서도 유효하다고 가정할 수 없습니다. 엔지니어와 연구자들에게 이는 스케줄러를 비교할 때 단순히 단일 데이터셋으로 테스트하는 것을 넘어 훨씬 더 넓고 신중한 접근 방식이 필요함을 의미합니다. 이 연구 결과는 승자를 선언하는 것이 아니라, 순위가 신뢰할 수 있는 곳과 변할 가능성이 높은 곳을 알려주는 지도를 제공함으로써, 향후의 평가들이 필요한 맥락과 주의를 가지고 읽힐 수 있도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →