← 최신 논문
💻 computer science

DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

본 논문은 런타임 토큰 추정 오차를 수정하기 위해 온라인 피드백 메커니즘을 활용하는 멀티 테넌트 LLM 추론을 위한 QoS 인식 스케줄링 프레임워크인 DriftSched를 제시하며, 적응형 보정이 추정 정확도를 크게 향상시키는 반면, 최단 작업 우선(SJF) 스케줄링 정책이 종단 간 및 꼬리 지연 시간을 가장 실질적으로 감소시킨다는 점을 입증한다.

원저자: Kathiravan Palaniappan

게시일 2026-06-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kathiravan Palaniappan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 단 하나의 주방(GPU)과 한 명의 요리사만을 운영하는 매우 인기 있는 레스토랑을 운영하고 있다고 상상해 보세요. 당신에게는 세 종류의 고객이 있습니다:

  1. VIP (프리미엄): 음식을 빠르게 받길 원하며 추가 비용을 지불할 의사가 있는 분들입니다.
  2. 일반 고객 (스탠다드): 그저 평범한 식사를 원하는 분들입니다.
  3. 대량 구매자 (배치/Batch): 엄청난 양의 케이터링 주문을 하지만, 기다리는 것을 개의치 않는 분들입니다.

문제는 무엇일까요? 주방이 과부하 상태가 된다는 것입니다. 주문이 쌓이고, 어떤 사람들은 영원히 기다려야 하는 반면 다른 이들은 매우 빠르게 서빙됩니다. 요리사는 다음에 누구의 음식을 만들지 결정해야 합니다. 이것을 "스케줄링(Scheduling)"이라고 부릅니다.

핵심 문제: 작업량 추측하기

다음 순서를 결정하기 위해, 스케줄러는 각 주문의 작업량이 얼마나 되는지 알아야 합니다.

  • 단순한 샐러드인가요 (짧은 작업)?
  • 아니면 복잡한 5코스 요리인가요 (긴 작업)?

만약 스케줄러가 잘못 추측하면 혼란이 발생합니다. 만약 대량 케이터링 주문이 작다고 생각한다면, VIP의 간단한 에피타이저보다 먼저 요리를 시작하여 VIP를 너무 오래 기다리게 만들 수 있습니다. 이것을 **"작업량 오분류(Workload Misclassification)"**라고 합니다.

두 가지 추측 방법

논문 DriftSched는 주문의 크기를 추측하는 두 가지 방법을 테스트했습니다:

  1. "게으른 추측" (공백 기반 프록시 - Whitespace Proxy): 주문서에 적힌 단어 수를 세는 것과 같습니다. 단어가 10개라면 아마 작을 것이고, 100개라면 클 것입니다. 이는 호스트가 하기 쉽고 빠르지만, 부정확합니다. 짧은 문장이 요리하기 복잡할 수도 있고, 긴 문장이 단순할 수도 있기 때문입니다.
  2. "전문가적 추측" (토크나이저 인식 - Tokenizer-Aware): 호스트가 실제로 레시피를 읽고 정확히 몇 개의 재료와 단계가 포함되어 있는지 아는 것과 같습니다. 이는 정확하지만, 호스트가 이를 계산하는 데 약간의 시간과 노력이 필요합니다.

해결책: DriftSched

DriftSched는 이 레스토랑을 관리하는 스마트한 시스템입니다. 이 시스템은 "적응형 보정(Adaptive Calibration)"(또는 EMA)이라는 특별한 기능을 가지고 있습니다.

이렇게 생각해 보세요: 만약 호스트가 "게으른 추측"을 사용하다가 "기술 보고서" 메뉴가 실제로는 예상보다 더 오래 걸린다는 것을 지속적으로 깨닫게 된다면, DriftSched는 자신의 실수를 통해 배웁니다. 시스템은 이렇게 말합니다. "아, 우리가 기술 보고서를 작다고 추측할 때마다 실제로는 20% 더 오래 걸리는구나. 다음번에는 추정치에 20%를 더해야겠다."

시간이 흐름에 따라, "게으른 추측"은 실제로 주방에서 일어난 일을 바탕으로 오류를 스스로 수정하기 때문에 "전문가적 추측"만큼이나 정확해집니다.

다섯 가지 스케줄링 전략

이 논문은 다음 다섯 가지 규칙을 테스트했습니다:

  1. FIFO (선입선출 - First-In, First-Out): 일반적인 티켓 줄과 같습니다. 먼저 온 사람이 먼저 서비스를 받습니다. 공정하지만, 대량 구매자가 거대한 주문을 들고 당신 앞에 있다면 당신은 영원히 기다려야 합니다.
  2. 우선순위 (Priority): VIP가 항상 맨 앞으로 점프합니다. 일반 고객과 대량 구매자는 기다립니다. VIP에게는 훌륭하지만, 다른 모든 이들에게는 최악입니다.
  3. 가중치 방식 (Weighted): 절충안입니다. VIP는 50%, 일반 고객은 30%, 대량 구매자는 20%의 확률로 서빙됩니다. 모두가 차례를 갖지만, VIP가 더 많은 기회를 얻습니다.
  4. SJF (최단 작업 우선 - Shortest-Job-First): 요리사는 고객이 누구인지와 상관없이 다음에 할 가장 작고 빠른 주문을 항상 선택합니다. 대량 구매자의 아주 작은 사이드 디쉬가 VIP의 메인 코스보다 먼저 요리될 수 있습니다.
  5. 에이징 우선순위 (Aging Priority): 우선순위 방식과 비슷하지만, 대량 구매자가 너무 오래 기다리면 그들의 티켓에 우선순위를 높여주는 "도장"을 찍어 굶주림(Starvation)을 방지합니다.

연구 결과는 무엇인가요?

1. 정확도도 중요하지만, 전략이 더 중요하다
"전문가적 추측"(토크나이저)을 사용하는 것이 "게으른 추측"(공백)보다 낫습니다. 하지만 다음에 누구를 선택할지 결정하는 규칙(스케줄링 정책)이 주문 크기를 얼마나 정확하게 맞췄느냐보다 대기 시간에 훨씬 더 큰 영향을 미칩니다.

2. SJF는 속도의 왕이다
SJF (최단 작업 우선) 규칙이 가장 빨랐습니다. 이 규칙은 표준 대기열(FIFO)에 비해 평균 대기 시간을 약 42% 감소시켰습니다. 왜일까요? 작고 빠른 주문들을 먼저 처리함으로써 주방을 바쁘고 효율적으로 유지하고, 거대한 주문 뒤에 사람들이 계속 묶여 있는 상황을 줄여주기 때문입니다.

3. 우선순위는 VIP의 왕이다
만약 VIP를 만족시키는 것이 목적이라면, **우선순위 스케줄링(Priority Scheduling)**이 가장 좋습니다. VIP는 약 77초만 기다린 반면, 대량 구매자는 약 427초를 기다렸습니다. 반면, SJF는 고객이 누구인지 신경 쓰지 않고 오직 주문이 얼마나 작은지만을 따집니다. 실제로 SJF 하에서는 대량 구매자의 주문이 더 작을 경우 VIP보다 먼저 서빙되기도 했습니다.

4. "게으른 추측"은 고칠 수 있다
시스템의 자기 수정 기능(EMA)은 효과적이었습니다. 부정확한 "게으른 추측"을 사용할 때, 시스템은 시간이 지남에 따라 추정치를 조정하는 법을 배워서 오류를 약 40% 줄였습니다. 하지만 이미 "전문가적 추측"을 사용하고 있다면, 추측이 이미 정확하기 때문에 자기 수정 기능의 도움은 거의 없습니다.

결론

  • 전체적인 서비스 속도를 높이고 싶다면: **SJF (최단 작업 우선)**를 사용하세요. 대기열을 가장 빠르게 비워줍니다.
  • 가장 중요한 고객을 보호하고 싶다면: **우선순위 스스케줄링 (Priority Scheduling)**을 사용하세요. 다른 이들이 더 오래 기다리더라도 VIP가 먼저 서빙되는 것을 보장합니다.
  • 완벽한 추측에 너무 매달리지 마세요: 주문이 얼마나 걸릴지에 대한 대략적인 추정치를 사용하더라도, 선택한 스케줄링 규칙(SJF vs Priority)이 최종 대기 시간에 훨씬 더 큰 영향을 미칩니다. 하지만 (토크나이저를 사용하여) 정확하게 추측할 수 있다면 시스템은 더 매끄럽게 돌아갑니다.

요약하자면: 고객을 어떻게 줄 세우느냐가 주문 크기를 얼마나 완벽하게 추측하느냐보다 더 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →