← 최신 논문
🤖 AI

Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads

이 논문은 첫 번째 토큰 생성 시간(time-to-first-token)을 위한 경량 추정기를 정확도, 비용 및 지연 시간에 대한 공동 최적화 전략과 통합한 지연 시간 인지형 쿼리 라우팅 시스템을 제안하며, 이를 통해 표준 부하 분산 방식과 비교하여 응답 시간을 늘리지 않으면서도 정확도-비용 효용을 최대 40% 개선하였습니다.

원저자: Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

각기 다른 숙련도와 가격표를 가진 요리사 팀이 있는 세상을 상상해 보세요. 어떤 이들은 미슐랭 스타급 식사를 뚝딱 만들어내지만 엄청난 비용을 요구하고 시간도 오래 걸리는 마스터 셰프입니다. 또 다른 이들은 빠르고 저렴하게 괜찮은 버거를 순식간에 만들어내는 숙련된 라인 쿡(line cook)입니다. 인공지능의 세계에서 이 "요리사들"은 이야기를 쓰거나, 수학 문제를 풀거나, 뉴스를 요약하는 챗봇의 두뇌인 거대 언어 모델(LLM)입니다. 당신이 질문을 던지면, "라우터(router)"가 어떤 요리사에게 일을 맡길지 결정합니다. 목표는 간단합니다. 가장 낮은 비용으로 최고의 답변을 얻는 것입니다.

하지만 대부분의 라우터가 지금까지 간과해 온 함정이 하나 있습니다. 바로 "줄(the line)"입니다. 완벽한 요리사를 선택하더라도, 그 요리사가 이미 다른 주문들로 정신없이 바쁘다면 당신의 음식은 주방에서 한참 동안 방치될 수 있습니다. AI 세계에서 이 대기 시간을 "지연 시간(latency)"이라고 부릅니다. 만약 챗봇이 바쁜 와중에 질문을 던진다면, 당신은 몇 분 동안 회전하는 커서만 바라보게 될지도 모릅니다. 이는 문제가 됩니다. 때로는 단순히 좋은 답변이 아니라, '지금 당장' 답변이 필요할 때가 있기 때문입니다. 연구자들이 해결하려고 노력 중인 핵심 질문은 이것입니다: "주방이 혼란스러운 상황에서도, 어떻게 하면 돈을 너무 많이 쓰지 않으면서도 훌고 훌륭한 답변을 빠르게 얻을 수 있는 적절한 요리사를 고를 것인가?"

여기 이 정확한 문제를 해결하고자 하는 카네기 멜론 대학교와 마이크로소프트 연구진의 새로운 연구가 있습니다. 그들은 기존 시스템들이 품질과 비용의 균형은 잘 맞추지만, "지연 시간에 무관심(latency-agnostic)"하다는 점, 즉 실제 줄이 얼마나 긴지에 대해서는 눈을 감고 있다는 사실을 깨달았습니다. 이를 해결하기 위해 연구팀은 디지털 수정구슬처럼 작동하는 영리하고 가벼운 "시뮬레이터(simulator)"를 구축했습니다. 이 시뮬레이터는 단순히 서버가 얼마나 바쁜지 추측하는 대신, 실시간으로 주방을 관찰합니다. 대기 중인 주문이 몇 개인지, 현재 요리 중인 음식은 얼마나 걸리는지, 심지어 주방 직원들이 업무를 어떻게 배치(batching)하는지까지 살펴봅 점. 그런 다음 당신의 특정 주문이 첫 입을 떼기까지(연구진이 "첫 토큰 생성 시간(Time-to-First-Token)"이라 부르는 지표) 정확히 얼마나 걸릴지 예측합니다.

이 예측치를 라우팅 시스템에 입력함으로써, 연구진은 단순히 메뉴 가격이나 요리사의 명성만을 보는 것이 아니라 "대기 시간"까지 고려하는 똑똑한 배차 시스템을 만들었습니다. 그들은 다양한 유형의 질문과 변화하는 주방의 혼란도를 가지고 이 시스템을 테스트했습니다. 결과는 유망했습니다. 그들의 새로운 방식은 기존의 최선책들과 비교했을 때, 대기 시간을 동일하게 낮게 유지하면서도 답변의 전반적인 "가치"(품질, 비용, 속도의 균형)를 최대 40%까지 향상시켰습니다. 요컨대, 그들은 줄의 길이에 마침내 주목함으로써 AI 챗봇을 더 빠르고, 저렴하며, 똑똑하게 만드는 방법을 찾아냈습니다.

그들 혁신의 핵심은 "서빙 프레임워크 시뮬레이션(Serving Framework Simulation, SFS)"이라 불리는 도구입니다. 이것을 번잡한 고속도로의 교통 관제사라고 생각해보세요. 기존 방식은 단순히 도로 위에 차가 몇 대 있는지 세고 예상 이동 시간을 추측할 뿐입니다. 하지만 SFS는 더 똑똑합니다. 실제 운전 조건을 시뮬레이션합니다. 어떤 차들은 빠르지만 무겁고(긴 복잡한 질문처럼), 어떤 차들은 가볍지만 수가 많다는 것을 알고 있습니다. 또한 고속도로에는 차들이 합류하고 달릴 수 있는 특정 규칙이 있다는 것도 알고 있습니다. 이러한 규칙들을 시뮬레이션함으로써, SFS는 새로운 차량이 정확히 언제 출구 램프에 도착할지 예측할 수 있습니다.

연구진은 단순히 도로 위의 차량 수를 기반으로 추측하는 방식(그들이 "처리량 기반 추정(throughput-based estimation)"이라 부르는 방법)이 종종 나쁜 예측으로 이어진다는 것을 발견했습니다. 만약 고속도로가 느리고 무거운 트럭들로 막혀 있다면, 전체 차량 수가 아주 많지 않더라도 새로운 승용차는 갇힐 수 있습니다. 그러나 그들의 시뮬레이션은 이러한 "교통 체증" 효과를 고려합니다. 그들은 짧은 이야기를 쓰는 것부터 긴 보고서를 요약하는 것까지 다양한 작업에 대해 시스템을 테스트했으며, 기존 방식보다 일관되게 우수한 성능을 보였습니다. 시뮬레이션 결과, 그들의 접근 방식은 기존의 가장 뛰어난 기준점(baseline)보다 "온타임 유틸리티(OnTimeUtility)"—답변이 얼마나 좋은지, 비용이 얼마인지, 그리고 제때 도착했는지를 측정하는 점수—를 33%에서 40%까지 개선했습니다.

가장 흥거로운 발견 중 하나는 이 시스템이 "폭발적인(bursty)" 트래픽을 처리하는 방식입니다. 점심시간 손님처럼 주문이 한꺼번에 몰려오는 상황을 상상해 보세요. 기존 시스템은 종종 과부하가 걸려 모든 사람을 가장 저렴하지만 느린 요리사에게 보내어 엄청난 지연을 초래합니다. 그러나 새로운 시스템은 동적으로 부하를 조절합니다. 예를 들어, 줄이 짧다면 간단한 질문을 빠르고 저렴한 모델에게 보내고, 복잡하고 긴급한 질문은 줄이 조금 더 길더라도 전체적으로 작업을 더 빨리 끝낼 수 있는 강력한 모델에게 보냅니다. 이러한 유연성 덕분에 수요가 급증할 때도 높은 성능을 유지할 수 있습니다.

또한 연구팀은 이 시뮬레이터 자체가 매우 빠르다는 것을 보여주었습니다. 시뮬레이션을 실행하고 결정을 내리는 데 1밀리초(ms)도 걸리지 않으므로, 시스템을 돕기 위해 만든 도구가 오히려 시스템을 느리게 만드는 일은 없습니다. 이는 매우 중요한데, 라우터가 결정하는 데 너무 오래 걸린다면 시간을 아끼려는 목적 자체가 무색해지기 때문입니다. 그들은 예측이 정확하다는 것을 검증했으며, 테스트에서 오차율 5% 미만을 기록했습니다. 이는 기존의 더 단순한 추측 방식에서 나타난 85%의 오차율에 비해 상당한 개선입니다.

궁극적으로 이 논문은 효율적인 AI의 미래가 단순히 더 큰 모델을 만들거나 더 저렴한 모델을 찾는 것에 있지 않다는 점을 시사합니다. 그것은 바로 더 나은 "교통 관리자"가 되는 것에 있습니다. "어떤 모델이 가장 좋은가"라는 지혜와 "줄이 얼마나 긴가"라는 현실을 결합함으로써, 우리는 부하가 높은 상황에서도 즉각적이고 반응성이 뛰어난 시스템을 만들 수 있습니다. 비록 결과는 시뮬레이션과 통제된 실험을 통해 나온 것이지만, 저자들은 이 접근 방식이 현실 세계에서 AI 서비스를 더 신뢰할 수 있고 사용자 친화적으로 만드는 실질적인 경로를 제공한다고 믿고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →