← 최신 논문
💻 computer science

Astrolabe: Balancing Load in LLM Serving with Randomized Prediction-Guided Scheduling

Astrolabe는 응답 길이 추정, 시뮬레이션 기반 지연 시간 예측, 그리고 power-of-two-choices 분산 정책을 결합함으로써 비용이 많이 드는 마이그레이션 기반 재균형의 필요성을 제거하고, 우수한 부하 분산과 지연 시간 감소를 달성하는 멀티 인스턴스 LLM 서빙을 위한 무작위 예측 가이드 스케줄러이다.

원저자: Wei Da, Evangelia Kalyvianaki

게시일 2026-08-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wei Da, Evangelia Kalyvianaki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수백만 명의 고객을 위해 동시에 '생각-케이크(thought-cakes)'를 굽는 거대하고 첨단 기술이 집약된 베이커리를 운영하고 있다고 상상해 보십시오. 이 베이커리에서 오븐은 믿을 수 없을 정도로 강력하지만, 레시피는 까다롭습니다. 때로는 고객이 간단한 쿠키(짧은 답변)를 요청하기도 하고, 때로는 10단 웨딩 케이크(길고 복잡한 답변)를 요청하기도 합니다. 문제는 제빵사들(컴퓨터들)이 케이크를 굽기 시작하기 전까지는 주문의 크기가 얼마나 될지 모른다는 것입니다. 만약 한 제빵사가 거대한 주문을 맡게 되어 다른 모든 제빵사가 놀고 있는 동안에도 계속 붙들려 있게 된다면, 줄이 길게 늘어지고 고객들은 화가 날 것입니다.

이를 해결하기 위해, 많은 베이커리는 오븐 사이를 뛰어다니며 반쯤 구워진 케이크를 잡아 더 여유로운 오븐으로 옮기는 '러너(runner)'를 두곤 했습니다. 이것을 '마이그레이션(migration)'이라고 부릅니다. 하지만 인공지능의 세계에서 이 반쯤 구워진 케이크들을 옮기는 것은 지저분하고 느린 일입니다. 그것은 마치 거대하고 부서지기 쉬운, 반쯤 얼어붙은 케이크를 들고 붐비는 방을 가로질러 운반하는 것과 같습니다. 그것은 많은 에너지를 소모하고, 통로를 막으며, 종종 베이커리 전체를 더 느리게 만듭니다. "Astrolabe"라는 제목의 이 논문은 대담한 질문을 던집니다. 만약 우리가 케이크를 전혀 옮길 필요가 없다면 어떨까요? 만약 주문이 오븐에 들어가기도 전에 그 크기를 예측하여 즉시 적절한 제빵사에게 보낼 수 있다면 어떨까요?

이 논문의 저자인 케임브리지 대학교의 Wei Da와 Evangelia Kalyvianaki는 바로 이 문제를 해결하기 위해 Astrolabe라는 새로운 시스템을 구축했습니다. 그들은 업무를 이리저리 옮겨 다니며 재배치하는 대신, 영리한 "추측 게임"을 사용하여 주문을 즉시 적절한 곳으로 보낼 수 있다는 것을 발견했습니다.

Astrolabe가 어떻게 작동하는지는 단순한 확률 게임을 통해 설명할 수 있습니다. 당신에게 12명의 제빵사가 있다고 상상해 보십시오. 새로운 주문이 들어오면, 모든 제빵사에게 일일이 물어보는 대신(이는 너무 오래 걸립니다) 혹은 그냥 무작위로 한 명을 고르는 대신(이는 위험합니다), 시스템은 무작위로 두 명의 제빵사를 뽑습니다. 그리고 빠르게 묻습니다. "지금 이 주문을 받는다면, 얼마나 걸리겠습니까?" 한 명은 "약 10초 정도요"라고 말하고, 다른 한 명은 "약 50초 정도요"라고 말할 수 있습니다. 시스템은 즉시 10초라고 답한 제빵사를 선택하여 그곳으로 주문을 보냅니다.

이 기술은 "두 가지 선택의 힘(power-of-two choices)"이라고 불립니다. 이것은 붐비는 구내식당에 들어가서 전체를 다 훑어보는 대신, 단 두 개의 줄만 확인하고 가장 짧은 줄을 고르는 것과 같습니다. 논문은 이 단순한 무작위 확인이 놀라울 정도로 강력하다는 것을 보여줍니다. 이 기술을 AI의 답변이 얼마나 길 될지 추측하는 "수정구슬(예측 모델)"과 결합함으로써, Astrolabe는 대기 줄이 생기기도 전에 요청을 최적의 제빵사에게 전달할 수 있습니다.

결과는 매우 인상적입니다. 테스트에서 Astrolabe는 기존의 "러너(migration)" 방식만큼 많은 요청을 처리하면서도, 데이터를 옮기는 데 드는 번거로운 오버헤드 없이 이를 수행했습니다. 실제로 베이커리가 매우 바빠졌을 때, 기존 방식은 데이터 이동 과정에서 문제가 발생하며 대기 시간이 초 단위에서 분 단위로 급증하며 무너지기 시작했습니다. 그러나 Astrolabe는 상황을 매끄럽게 유지했습니다. Astrolabe는 일부 사례에서 첫 단어가 나오는 시간을 최대 77%까지 단축했으며, 주문이 중단되거나 재시작되는 횟수를 경쟁 모델보다 약 6배 줄였습니다.

논문은 또한 "수정구슬"이 완벽하지 않을 때 어떤 일이 일어나는지도 테스트했습니다. 예측이 약간 틀릴 때도(현실에서는 흔히 일어나는 일입니다) 시스템은 여전히 기존 방식보다 더 잘 작동했습니다. 시스템이 한 번에 두 명의 제빵사만을 비교하기 때문에, 예측의 작은 실수는 생각보다 큰 영향을 미치지 않습니다. 만약 두 제빵사 모두 느릴 것이라고 예측된다면, 시스템은 그중 "덜 느린" 쪽을 선택하게 되며, 수학적으로도 결과가 유효합니다.

저자들은 또한 오븐의 종류나 굽는 케이크의 종류를 바꾸더라도 이것이 작동할지 확인했습니다. 그들은 다양한 모델과 설정을 시도했지만, Astrolabe는 계속해서 승리했습니다. 이 "추측하고 확인하는(guess-and-check)" 접근 방식은 작업 부하가 혼란스럽고 예측 불가능할 때도 시스템을 빠르게 유지하는 견고한 방법인 것으로 보입니다.

요약하자면, 이 논문은 업무를 분산시키기 위해 복잡하고 무거운 시스템을 구축할 필요가 없다는 것을 시사합니다. 대신, 약간의 무작위성과 미래에 대한 좋은 추측만 있다면 훨씬 더 빠르고 효율적으로 일을 처리할 수 있습니다. 이는 때때로 군중을 관리하는 가장 스마트한 방법이 모든 사람을 미세하게 관리하는 것이 아니라, 몇 가지 좋은 옵션을 주고 그들이 최선의 경로를 선택하게 하는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →