← 최신 논문
🤖 machine learning

Beyond Binary Priorities: Multi-Tier SLA Scheduling for Large Language Model Serving

본 논문은 Llumnix LLM 스케줄러를 기존의 이진 모델을 넘어 다계층 서비스 수준 협약(SLA)을 지원하도록 확장하며, 고충실도 시뮬레이션을 통해 4계층 구성이 다양한 워크로드 전반에서 강력한 SLO 차별화를 유지하면서도 비용 효율성과 지연 시간 성능을 최적화함을 입증한다.

원저자: Anders Vestrum, Arya Raeesi, Hanna Roed

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anders Vestrum, Arya Raeesi, Hanna Roed

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 세계에서 거대 언어 모델은 텍스트, 코드, 그리고 아이디어를 생성하는 강력한 엔진 역할을 합니다. 하지만 이 엔진을 가동하는 것은 단순히 스위치를 켜고 끄는 간단한 작업이 아닙니다. 사용자가 요청을 보내면, 시스템은 먼저 입력을 처리한 다음 한 번에 한 단어씩 응답을 생성해야 합니다. 이 과정은 예측 불가능합니다. 짧은 질문은 순식간에 끝날 수 있지만, 복잡한 분석은 몇 분 동안 길어질 수 있으며 그 과정에서 막대한 양의 컴퓨터 메모리를 소비합니다. 이러한 요청은 갑작스러운 폭발적 형태로 도착하고 그 길이도 천차만별이기 때문에, 이를 지원하는 인프라는 종종 속도를 맞추는 데 어려움을 겪습니다. 만약 시스템이 모든 요청을 똑같이 취급한다면, 거대하고 느린 작업 하나가 줄을 막아버려 긴급하고 단순한 질문들이 너무 오래 기다리게 만들 수 있습니다. 이것이 인공지능을 서비스할 때 직면하는 핵심 과제입니다. 즉, 비싼 컴퓨팅 자원을 낭비하지 않으면서도 중요한 작업이 즉각적인 주의를 받을 수 있도록 어떻게 혼란스러운 작업 흐름을 관리할 것인가 하는 문제입니다.

UC 버클리의 연구진은 인공지능 시스템이 작업의 우선순위를 정하는 방식을 재구상함으로써 이 문제를 해결했습니다. 그들은 부하를 분산하고 병목 현상을 방지하기 위해 작업을 서로 다른 컴퓨터 서버 간에 이동시키도록 설계된 기존 시스템인 Llumnix를 기반으로 연구를 진행했습니다. 기존 버전의 이 시스템은 효과적이긴 했지만, 긴급한 문제를 위한 '높은 우선순위'와 그 외의 모든 것을 위한 '일반 우선순위'라는 두 가지 단계의 중요도만을 제공한다는 점에서 한계가 있었습니다. 이러한 이분법적 선택은 플래티넘, 골드, 실버, 무료 사용자처럼 각기 다른 속도 보장을 필요로 하는 다섯 단계 이상의 서비스 계층을 구분해야 하는 실제 비즈니스 환경에는 너무 투박했습니다. 연구진은 모든 사용자에게 공정하면서도 기계 측면에서 효율적인 시스템을 만들기 위해 적절한 우선순위 단계의 수는 몇 단계인가라는 근본적인 질문을 던졌습니다.

이 답을 찾기 위해 연구팀은 대규모 AI 데이터 센터의 정교한 시뮬레이션을 구축했습니다. 그들은 물리적인 하드웨어에서 이를 실행하지 않았는데, 이는 테스트 비용이 지나치게 많이 들고 속도가 느려질 수 있었기 때문입니다. 대신 실제 컴퓨터 칩의 동작을 모방하는 고충실도 디지털 모델을 사용했습니다. 이 가상 환경 내에서 그들은 우선순위 시스템을 1단계에서 10단계 사이의 뚜렷한 중요도 수준을 지원하도록 확장했습니다. 또한 각 우선순위 단계가 자신의 작업을 마칠 수 있도록 일정한 '숨 쉴 공간(breathing room)'을 할당받는 새로운 메모리 관리 방식을 도입했습니다. 이 숨 쉴 공간은 균등하게 공유되지 않습니다. 대신 우선순위가 낮아질수록 지수적으로 줄어들도록 설계되어, 가장 중요한 작업은 항상 필요한 공간을 확보하는 동시에 덜 긴급한 작업들이 그 틈새를 채우도록 했습니다.

연구팀은 수천 건의 시뮬레이션 요청을 다양한 조건 하에서 실행하며 이 새로운 시스템을 기존의 여러 방법들과 비교 테스트했습니다. 그들은 사용자 구성을 다양하게 하여 높은 우선순위 요청이 드문 경우, 흔한 경우, 혹은 고르게 분포된 경우의 시나리오를 만들었고, 작업량이 적을 때와 거의 가득 찼을 때 시스템이 어떻게 작동하는지 확인하기 위해 전체 작업량을 조절했습니다. 결과는 명확한 최적점을 보여주었습니다. 시스템이 기술적으로는 10단계의 우선순위까지 처리할 수 있었지만, 4개 이상의 계층을 추가하는 것은 성능 향상에 도움이 되지 않았습니다. 실제로 4단계를 넘어서면 시스템의 효율성이 떨어지기 시작했습니다. 너무 많은 별도의 범주를 관리하는 데 드는 추가적인 복잡성이 절감되는 이점보다 더 많은 자원을 소모하기 시작했고, 작업을 분리함으로써 얻는 이점도 희미해졌기 때문입니다.

최적의 구성은 4단계의 우선순위 계층으로 나타났습니다. 시뮬레이션 결과, 이 설정은 전체 시스템 성능 측면에서 상당한 속도 향상을 달ей했습니다. 시스템의 엔드 투 엔드(end-to-end) P99 지연 시간은 표준 방식 대비 최대 3.13배 개선되었으며, 지연 시간당 비용은 최대 68%까지 감소했습니다. 시스템은 중요한 사용자들에게 전용 차선을 제공함으로써 그들을 만족시키는 동시에, 남은 공간에서 덜 긴급한 백그라운드 작업이 효율적으로 진행될 수 있도록 관리했습니다. 이러한 균형은 하나의 느린 작업이 빠른 작업들의 전체 줄을 막아버리는 '호위 효과(convoy effect)'를 방지했으며, 작업을 서버 간에 동적으로 이동시켜 모두가 계속 움직일 수 있게 했습니다.

또한 연구진은 이러한 세밀한 우선순위 지정의 이점이 시스템이 얼마나 바쁜지에 따라 크게 달라진다는 것을 발견했습니다. 데이터 센터의 부하가 중간 정도일 때는 작업을 서로 다른 차선으로 분리하는 능력이 매우 효과적으로 작용하여, 높은 우선순위의 요청은 빠르게 통과하고 낮은 우선순위의 요청은 대기할 수 있게 합니다. 그러나 모든 서버가 최대 용량으로 가동되어 시스템이 완전히 포화 상태가 되면, 많은 우선순위 단계를 갖는 것의 이점은 줄어듭니다. 극단적인 상황에서는 시스템이 너무 꽉 차 있어서 작업을 이동시킬 여분의 공간이 없으므로, 계층 간의 구분이 효과를 발휘하기 어려워집니다. 이는 4단계 모델이 대부분의 상황에서 이상적인 설계이지만, 부하가 너무 무거워지기 전에 자동으로 더 많은 서버를 추가할 수 있는 시스템과 결합될 때 가장 잘 작동한다는 점을 시사합니다.

궁극적으로 이 연구는 AI 인프라의 미래를 위한 실질적인 청사진을 제공합니다. 이는 단순한 4단계 계층 구조가 실시간 상호작용부터 백그라운드 배치 처리까지 사용자 요구의 전체 범위를 포착하기에 충분하다는 것을 입증합니다. 경직된 2단계 시스템에서 벗어나 설계를 너무 복잡하게 만드는 함정을 피함으로써, 엔지니어들은 더 빠르고 비용 효율적인 AI 서비스를 구축할 수 있습니다. 이 연구는 예측 불가능한 인공지능의 특성을 다루는 열쇠가 시스템을 더 복잡하게 만드는 것이 아니라, 시스템이 숨을 쉴 수 있게 하는 정밀한 조직화 수준을 찾는 데 있음을 확인시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →