ML Inference Scheduling with Predictable Latency
본 논문은 기존의 ML 추론 스케줄링 방식이 가진 결정적인 한계점들, 즉 거친 입도의 간섭 예측과 정적 모델에 대한 의존성을 식별하며, 이는 동적인 워크로드 하에서 부정확한 지연 시간 예측과 SLO 저해를 초래한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 요약: 바쁜 레스토랑 주방
매우 빠르지만 운영 비용이 매우 비싼 고급 레스토랑 주방(GPU)을 상상해 보세요. 비용을 절감하기 위해 주인은 가능한 한 많은 요리를 동시에 만들어내고 싶어 합니다(이용률 향ye 개선).
이 주방에는 다양한 요리(예: 머신러닝 모델)에 대한 주문이 들어옵니다. 효율성을 높이기 위해 셰프는 비슷한 주문들을 하나의 "배치(batch)"로 묶어 한꺼번에 요리합니다. 예를 들어, 버거 하나를 만들고, 감자튀김 두 개를 만들고, 다시 버거 하나를 만드는 대신, 다섯 개의 버거를 한 쟁반에 담아 동시에 요리하는 식입니다.
하지만 주방에는 문제가 하나 있습니다. 바로 **간섭(Interference)**입니다.
만약 셰프가 같은 가스레인지 위에서 버거 한 쟁반과 아주 섬세한 수플레 한 쟁반을 동시에 요리하려고 한다면, 서로 방해가 될 수 있습니다. 열이 불균일해지거나, 셰프가 도구를 너무 자주 바꿔야 할 수도 있습니다. 이는 모든 과정을 늦추고, 결국 음식이 늦게 도착하게 만듭니다.
AI의 세계에서 "음식이 늦는 것"은 **지연 시간(Latency)**을 의미합니다. 자율주행 자동차나 화상 통화가 주방이 너무 붐벼서 답변이 늦어진다면, 그것은 실패를 의미합니다. 이 논문의 목표는 음식이 늦지 않으면서도 주방을 계속 바쁘게 유지할 수 있도록 이러한 요리 배치들을 어떻게 스케줄링할지 찾아내는 것입니다.
문제점: 추측은 위험하다
이 논문은 얼마나 많은 "혼잡도(간섭)"가 발생할지 예측하는 현재의 방법들이 두 가지 주요 측면에서 결함이 있다고 주장합니다.
1. "정적 스냅샷" 문제 (Coarse-Grained)
비유: 당신이 교통 관제사라고 상상해 보세요. 지도를 보니 고속도로에 빨간 트럭 한 대와 파란 자동차 한 대가 있습니다. 당신은 이들이 전체 여정 동안 나란히 달릴 것이라고 예측합니다.
현실: 주방에서는 빨간 트럭(배치 1)이 10초 후에 고속도로를 빠져나갈 수도 있고, 거대한 세미 트럭(배치 3)이 갑자기 끼어들어 5분 동안 머물 수도 있습니다.
논문의 주장: 현재의 AI 스케줄러는 저 교통 관제사와 같습니다. 그들은 지금 당장 주방에 누가 있는지만 보고, 그 상태가 계속 유지될 것이라고 가정합니다. 배치가 서로 다른 시간에 들어오고 나간다는 사실을 무시하는 것입니다.
- 결과: 예측이 틀립니다. 시스템은 주방이 평온할 것이라고 생각하지만, 갑자기 무거운 새로운 배치가 도착하여 교통 정체를 일으키고 배달을 지연시킵니다.
2. "오래된 지도" 문제 (Non-Adaptive/Static Models)
비유: 당신이 작년 메뉴를 사용하여 요리 시간을 예측하도록 로봇 셰프를 훈련시켰다고 상상해 보세요. 작년에는 모두가 버거를 주문했습니다. 하지만 올해는 모두가 복잡한 해산물 요리를 주문합니다.
현실: 로봇 셰프는 여전히 "오, 이건 그냥 버거야"라고 생각하며 요리 시간이 빠를 것이라고 예측합니다. 하지만 메뉴가 바뀌었기 때문에 로봇은 틀리게 됩니다.
논문의 주장: 현재의 AI 모델은 "정적(static)"입니다. 한 번 훈련되면 업데이트되지 않습니다. 만약 요청의 유형이 바뀌면(예: 새로운 AI 모델이 추가되거나 주문 수가 변하면), 오래된 모델은 부정확해집니다.
- 결과: 변화하는 세상에 대해 낡은 지도를 사용하고 있기 때문에 시스템은 계속해서 잘못된 추측을 반복하게 됩니다.
저자들이 수행한 작업 (실험)
저자들은 이 두 가지 문제가 실제로 얼마나 심각한지 확인하기 위해 테스트 주방(NVIDIA GPU 사용)을 설정했습니다.
- "스냅샷" 이슈 테스트: 그들은 배치가 서로 다른 시간에 도착하고 떠나는 시뮬레이션을 실행했습니다. 그 결과, 이러한 변화를 무시하면 작업이 완료되는 데 걸리는 시간 예측이 엄청난 오차를 보일 수 있다는 것을 발견했습니다(때로는 60% 이상의 오차). 이는 신호등이 곧 빨간불로 바뀔 것을 몰라서 10분 걸릴 주행이 16분 걸릴 것이라고 잘못 예측하는 것과 같습니다.
- "오래된 지도" 이슈 테스트: 그들은 한 세트의 요리로 모델을 훈련시킨 후, 완전히 다른 세트의 요리에 대한 시간을 예측하도록 했습니다. 기존 모델은 처참하게 실패했습니다. 그러나 모델이 "실시간 학습(Online Learning)"을 통해 새로운 데이터를 보면서 예측을 업데이트하도록 허용하자, 변화에 훨씬 더 잘 대응하게 되었습니다.
결론
이 논문은 효율적인 AI 주방을 운영하면서 배달 지연을 방지하려면, 다음과 같은 "멍청한" 스케줄러를 사용해서는 안 된다고 결론짓습니다:
- 주방의 인원이 매 초마다 변한다는 사실을 무시하는 스케줄러.
- 새로운 유형의 주문으로부터 배우기를 거부하는 스케줄러.
대신, 우리는 다음과 같은 스마트한 스케줄러가 필요합니다:
- 주방을 동적으로 관찰하는 것 (누가 도착하고 떠나는지 추적).
- 워크로드가 변함에 따라 실시간으로 학습하고 예측을 업데이트하는 것.
이를 통해 우리는 모든 주문(모든 AI 요청)에 대해 제시간에 답변을 보장하면서도, GPU(주방)를 바쁘고 효율적으로 유지할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.