Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 바쁜 커피숍을 운영하고 있다고 상상해 보세요. 당신에게는 주문을 하기 위해 줄을 서 있는 고객들(요청/requests)이 있고, 당신은 한 명의 바리스타(대규모 언어 모델/LLM)로서 음료를 하나씩 만들어냅니다.
문제점: "긴 주문"의 병목 현상
전통적인 커피숍에서는 "선입선출(First Come, First Served)" 규칙을 사용합니다. 만약 줄의 맨 앞에 있는 사람이 복잡한 20분짜리 라떼를 주문한다면, 그 뒤에 있는 모든 사람—심지어 에스프레소 한 잔만 주문하려는 사람까지도—20분을 기다려야 합니다. 이것을 헤드 오브 라인(Head-of-Line, HOL) 블로킹이라고 부릅니다.
AI의 세계에서도 이것은 큰 문제입니다. 어떤 AI 질문은 간단해서 답변하는 데 1초도 걸리지 않습니다. 반면, 수학 문제를 풀거나 코드를 단계별로 생각하는 새로운 "추론형" AI 모델들은 응답을 생성하는 데 몇 분이 걸릴 수도 있습니다. 만약 길게 생각해야 하는 요청이 줄의 맨 앞을 가로막고 있다면, 다른 모든 사람의 대기 시간을 지연시켜 전체 시스템을 느리고 답답하게 만듭니다.
해결책: "스마트 예측가" (PARS)
이 논문은 PARS(Prompt-Aware Ranking Scheduler, 프롬프트 인지형 순위 스케줄러)라는 새로운 시스템을 소개합니다. 이것을 카운터 뒤에 서 있는 아주 똑똑하고 보이지 않는 매니저라고 생각해 보세요. 이 매니저는 바리스타가 작업을 시작하기도 전에, 고객의 주문서(프롬프트)를 보고 이 음료를 만드는 데 시간이 얼마나 걸릴지 즉시 추측할 수 있습니다.
PARS는 도착한 순서대로 서비스를 제공하는 대신, 줄을 재배치하여 "빠른 에스프레소" 주문을 먼저 처리하고, 그 다음 "중간" 주문을, 그리고 "20분짜리 라떼" 주문은 뒤로 보냅니다. 이것은 최단 작업 우선(Shortest-Job-First, SJF) 스케줄링이라고 알려져 있습니다.
작동 원리: "페어와이즈(Pairwise)" 기법
까다로운 점은 AI가 예측 불가능하다는 것입니다. 때로는 똑같은 질문이라도 운에 따라 짧은 답변이 나올 수도 있고, 긴 답변이 나올 수도 있습니다. 만약 매니저가 정확한 시간(예: "이것은 42초가 걸릴 것입니다")을 맞추려고 노력한다면, 틀릴 수도 있고 줄을 망칠 수도 있습니다.
이를 해결하기 위해 PARS는 영리한 트릭인 **페어와이즈 학습(Pairwise Learning)**을 사용합니다.
- 기존 방식: 모든 주문에 대해 정확한 시간을 추측하려고 함. (수박의 정확한 무게를 맞추려는 것과 같음)
- PARS 방식: 한 번에 두 개의 주문을 비교함. "주문 A가 주문 B보다 더 오래 걸릴 가능성이 높은가?"라고 질문함. (이 수박이 저 사과보다 확실히 더 무겁다고 말하는 것과 같음)
이 시스템은 미세하고 혼란스러운 차이는 무시하고, 오직 명확한 차이에만 집중하도록 훈련되었습니다 (예: "이 수학 문제는 저 단순한 인사말보다 훨씬 어렵다"). 이러한 명확한 비교에 집중함으로써, 매니저는 AI의 무작위적인 변동성에 혼란을 느끼지 않고도 매우 능숙하게 줄을 세울 수 있게 됩니다.
결과: 모두를 위한 더 빠른 서비스
연구진은 이 시스템을 vLLM이라는 인기 있는 AI 서빙 도구를 사용하여 실제 환경에서 테스트했습니다. 그 결과는 다음과 같습니다:
- 엄청난 속도 향상: 짧은 작업들을 먼저 처리함으로써, 표준적인 "선입선출" 방식에 비해 사용자 평균 대기 시간을 최대 15.7배까지 줄였습니다.
- 추가 비용 없음: "매니저"(예측기)는 매우 가볍습니다. 줄을 세우는 데 거의 시간이 걸리지 않으므로 바리스타의 작업을 방해하지 않습니다.
- 모든 모델에 적용 가능: 이 시스템은 예측 능력이 매우 뛰어나서, 한 종류의 AI(예: GPT-4)로 훈련하더라도 재훈련 없이 완전히 다른 AI(예: Llama 또는 DeepSeek)를 위해 효과적으로 줄을 세울 수 있습니다. 이는 마치 커피숍에서 주문을 분류하는 법을 배운 매니저가 곧바로 차 가게에서도 똑같은 일을 할 수 있는 것과 같습니다.
- 공정성: "20분짜리 라떼" 주문이 영원히 기다리지 않도록, 시스템에는 안전장치가 있습니다. 만약 긴 주문이 너무 오래 기다리면, 해당 주문의 순위를 높여 아무도 굶주리지 않게 합니다.
요약
논문은 AI 요청의 교통 경찰 역할을 하는 스마트 스케줄링 시스템인 PARS를 제시합니다. 긴 시간이 소요되는 복잡한 요청이 줄을 막지 않도록, 비교 기반의 추측 게임을 통해 빠른 요청들이 먼저 통과하게 합니다. 이를 통해 AI 시스템이 훨씬 빠르고 반응성이 좋게 느껴지도록 만들며, 특히 답변하기 전 길게 "생각"하는 것을 좋아하는 새로운 세대의 AI를 다룰 때 더욱 효과적입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.