HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
HeraSys는 구조적 노드 병합을 통해 워크플로 간의 계산 중복을 제거하고 부하 인지형 공동 스케줄링 정책을 채택함으로써, 테일 레이턴시를 크게 줄이는 동시에 처리량을 높여 동시 다발적인 멀티 테넌트 워크플로의 엔드 투 엔드 성능을 최적화하는 LLM 서빙 시스템입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
수백 가지의 복잡한 요리를 동시에 만들어내려는 요리사 팀이 있는 북적이는 주방을 상상해 보세요. 인공지능의 세계에서 이 '요리'들은 거대 언어 모델(LLM)—이야기를 쓰고, 질문에 답하며, 문제를 해결하는 초지능적인 컴퓨터 뇌—이 수행하는 작업들입니다. 보통 여러분이 AI에게 무언가를 요청하면, 그것은 하나의 독립된 주문처럼 취급됩니다. 하지만 현실 세계에서 애플리케이션은 점점 더 정교한 연회와 같아지고 있습니다. 단 하나의 요청이 정보를 검색하고, 데이터베이스를 확인한 다음, 그 결과를 요약하는 과정을 모두 포함할 수 있기 때문입니다. 이것들을 '워크플로(workflows)'라고 부릅니다.
문제는 많은 사람이 이러한 복잡한 연회를 동시에 주문할 때 주방이 혼란에 빠진다는 점입니다. 만약 두 명의 고객이 같은 재료를 손질해 달라고 요청한다면, 주방은 그 재료를 두 번 손질하게 되어 시간과 에너지를 낭비할 수 있습니다. 설상가가, 한 고객이 아주 오래 걸리는 대형 스튜를 주문하면 요리사들이 그 작업에 매달려 있게 되어, 다른 모든 사람이 주문한 간단한 샐러드가 서빙되는 것을 기다리게 만들 수도 있습니다. 이것이 바로 AI를 '서빙'하는 문제, 즉 어떻게 하면 시스템이 멈추거나 누군가를 영원히 기다리게 만들지 않고도 쏟아지는 복잡하고 중첩된 요청들을 관리할 것인가에 대한 과제입니다.
여기에서 HeraSys라는 새로운 시스템이 등장합니다. HeraSys를 개별 주문 하나하나만 보는 것이 아니라, 서로 다른 주문들이 어떻게 서로를 도울 수 있는지 주방 전체를 관찰하는 혁신적인 주방 매니저라고 생각해보세요. HeraSys는 모든 요청을 별개의 섬처럼 취급하는 대신, 중첩되는 부분을 찾아냅니다. 만약 두 명의 서로 다른 고객이 동일한 문서를 분석하거나 동일한 도구를 사용해야 한다면, HeraSys는 "잠깐, 그 작업은 한 번만 수행하고 그 결과를 공유합시다!"라고 말합니다. 또한 교통 경찰처럼 행동하여, 빠르고 간단한 주문이 느리고 무거운 주문 뒤에 갇히지 않도록 하며, 동시에 느린 주문들이 관심을 받지 못해 굶주리는 일도 없도록 보장합니다.
HeraSys를 개발한 연구진은 이 복잡한 AI 작업들을 아주 작고 세밀한 조각들로 나누는 시스템을 구축했습니다. 그들은 중복되는 단계를 병합하고 컴퓨터 칩과 같은 주방 자원을 누구에게 할당할지 스마트하게 스케줄링함으로써 전체 시스템을 훨씬 더 빠르게 만들 수 있다는 것을 발견했습니다. 테스트 결과, HeraSys는 기존의 가장 우수한 시스템들과 비교했을 때 가장 느린 요청이 완료되는 시간을 최대 2.17배(즉, 두 배 이상 빠르게) 단축했으며, 시스템이 처리할 수 있는 총 작업량을 최대 1.85배까지 늘렸습니다.
이 논문은 모든 요청을 독립적이고 고립된 작업으로 취급하는 기존 방식에 반론을 제기합니다. 그들은 이러한 '고립'이 불필요한 낭비와 병목 현상을 만든다는 점을 보여줍니다. 대신, 시스템이 능동적으로 공유 작업을 찾는 협력적인 접근 방식을 제안합니다. 또한, 긴 작업이 다른 모든 사람을 막아서게 만드는 '선착순(first come, first served)' 방식이나, 긴 작업이 영원히 기다리게 만드는 '최단 작업 우선(shortest job first)'과 같은 단순한 스케줄링 규칙에도 반대합니다. HeraSys는 무거운 작업을 위한 자원을 일부 예약하면서도 빠른 작업을 우선시하여 모두에게 공정함과 속도를 보장하는 균형 잡힌 '부하 인식(load-aware)' 전략을 제안합니다.
실제 하드웨어에서 광범위한 실험을 통해 측정된 결과는, 이러한 세밀하고 협력적인 접근 방식이 중요한 진전임을 시사합니다. 중복되는 단계를 융합하고 작업의 그룹화 및 실행 방식을 동적으로 조정함으로써, HeraSys는 평균 대기 시간을 낮게 유지하면서도 복잡한 AI 시스템에서 흔히 발생하는 '테일(tail)' 현상, 즉 길고 답답한 지연 문제를 방지합니다. 이는 마치 친구들에게 집 청소를 부탁할 때, 단순히 각자 방을 맡기는 것이 아니라, 두 사람이 같은 복도를 청소기로 밀고 있다면 함께 작업하도록 유도하면서, 창문을 닦는 사람이 청소기가 끝나기를 마냥 기다리게 하지 않는 법을 깨닫는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.