Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics
이 위치 논지는 LLM 추론 서비스가 일반적인 휴리스틱을 넘어서 다양한 작업 부하에 걸쳐 검증 가능한 성능 보장을 확보하기 위해 고유한 특성에 맞춘 수학적 최적화 모델과 알고리즘적 기초의 개발이 필요하다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 고속인 레스토랑 주방을 운영한다고 상상해 보세요. 이 주방은 햄버거를 요리할 뿐만 아니라, 하나씩 도착하는 주문을 바탕으로 복잡하고 다코스의 요리를 만들어냅니다. 문제는 각 요리를 요리하는 데 얼마나 걸릴지 알 수 없다는 점이며, 셰프가 더 많이 요리할수록 요리는 더 많은 조리대 공간을 차지해 다른 주문들을 밀어낸다는 것입니다.
이것은 오늘날 **대형 언어 모델 (LLM)**이 처한 상황과 정확히 일치합니다. 이들은 검색 엔진, 코딩 어시스턴트, 채팅봇을 구동하는 "주방"입니다.
이 논문은 현재 이러한 디지털 주방들이 **추측과 단순한 규칙 (휴리스틱)**에 의존하여 운영되고 있다고 주장합니다. 저자는 이들을 더 빠르고, 저렴하며, 더 신뢰할 수 있게 만들기 위해 수학적 정밀도와 견고한 알고리즘적 기초로 전환할 때라고 믿습니다.
다음은 일상적인 비유를 통해 논문의 주장을 정리한 내용입니다:
1. 문제: "충분히 좋은" 규칙들이 실패하고 있습니다
현재 vLLM 과 SGLang(이러한 모델을 구동하는 소프트웨어) 과 같은 시스템들은 일반 컴퓨팅에서 차용한 구식 규칙들을 사용합니다.
- 대기열: 고객 줄이 있다면, 주방은 도착한 순서대로 서비스를 제공합니다 (선착순).
- 라우팅: 여러 명의 셰프가 있다면, 주방은 다음 주문을 줄이 가장 짧은 셰프에게 보내거나, 단순히 무작위로 하나를 선택합니다.
- 정리: 조리대가 가득 차면, 주방은 새로운 주문을 위한 공간을 만들기 위해 조리대 위의 가장 오래된 항목을 버립니다.
논문의 주장: 이러한 규칙들은 표준 햄버거 가게에서는 잘 작동합니다. 하지만 LLM 은 다릅니다.
- "성장하는" 식사: 처음부터 끝까지 같은 공간을 차지하는 햄버거와 달리, LLM 의 식사는 요리되는 동안 성장합니다. AI 가 생성하는 모든 단어는 더 많은 메모리를 차지합니다.
- "2 단계" 요리: 주문의 첫 번째 부분 (프롬프트 읽기) 은 빠르지만 많은 연산 능력 (컴퓨팅) 을 필요로 합니다. 두 번째 부분 (답변 생성) 은 느리지만 많은 메모리 대역폭을 필요로 합니다.
- 불확실성: 주방은 식사가 완성될 때까지 그 길이를 알 수 없습니다.
이러한 기이함들 때문에 기존의 "가장 짧은 줄"이나 "가장 오래된 항목 제거" 규칙들은 종종 혼란을 초래하여, 일부 셰프는 놀라 있는 반면 다른 셰프들은 압도당하게 만들거나, 예상치 못하게 조리대 공간이 부족해지는 상황을 만듭니다.
2. 해결책: 수학자들을 데려오세요
저자는 추측을 멈추고 수학적 최적화를 시작해야 한다고 말합니다. 이는 규칙서만 따르는 것이 아니라, 주방을 운영하는 완벽한 방법을 초컴퓨터로 계산하는 수석 물류 기획자를 고용하는 것과 같습니다.
논문은 수학이 주방을 고칠 수 있는 네 가지 구체적인 영역을 강조합니다:
셰프들 균형 맞추기 (부하 분산):
- 현재 방식: 티켓이 가장 적은 셰프에게 주문을 보냅니다.
- 수학 방식: 각 주문이 성장함에 따라 얼마나 많은 "조리대 공간"과 "연산 능력"이 필요한지 정확히 계산하여, 어떤 한 셰프도 가장 느린 셰프를 기다리며 멈추지 않도록 분배합니다. 논문은 이를 완벽하게 수행하여 시간과 비용을 절약하는 선형 계획법(수학의 한 유형) 을 사용하는 실제 시스템 (DeepSeek) 을 인용합니다.
대기열 (스케줄링):
- 현재 방식: 줄의 첫 번째 사람을 서비스합니다.
- 수학 방식: 줄을 살펴보고 "저 사람은 10 페이지 에세이를 주문했지만, 다음 사람은 한 문장 농담만 원한다"는 것을 깨닫습니다. 농담을 먼저 서비스하세요! 이는 조리대를 더 빠르게 비우고 더 많은 사람들이 식사할 수 있게 합니다. 수학은 주방이 움직이도록 유지하기 위해 어떤 주문이 빠르게 완료될지 예측할 수 있습니다.
조리대 공간 (캐싱):
- 현재 방식: 조리대가 가득 차면 가장 오래된 항목을 버립니다.
- 수학 방식: "고해상도 비디오"를 버리고 "작은 썸네일"을 위한 공간을 만드는 것은 나쁜 거래임을 깨닫습니다. 비디오를 다시 만드는 데는 영원히 걸리고 천문학적인 비용이 듭니다. 수학은 무언가를 버리는 "비용"을 계산하여 값비싼 항목들을 조리대에 보관할 수 있게 합니다.
직원 계획 (용량 계획):
- 현재 방식: 줄이 너무 길어지면 셰프를 계속 추가합니다.
- 수학 방식: 예상되는 고객 수를 바탕으로 문을 열기 전에 정확히 몇 명의 셰프가 필요한지 공식으로 계산합니다. 이는 주방이 처음부터 압도당하는 것을 방지합니다.
3. 왜 규칙에 매달리지 않나요?
논문은 "현재 규칙들은 잘 작동하는데, 왜 바꾸나요?"라고 말하는 회의론자들을 다룹니다.
- "규모에서 작동한다": 저자는 현재 규칙들이 괜찮게 작동한다고 인정하지만, 그들은 취약하다고 말합니다. 바이럴 앱이 갑자기 이상한 유형의 주문을 보내면 주방이 충돌할 수 있습니다. 수학은 최악의 시나리오에서도 주방이 실패하지 않도록 보장하는 안전망(보증) 을 제공합니다.
- "하드웨어가 너무 빨리 변한다": 저자는 하드웨어 (오븐) 는 변하지만, 주방을 조직하는 방식의 논리는 동일하게 유지된다고 주장합니다. 수학은 오븐을 교체하더라도 작동하는 청사진을 제공합니다.
- "시스템 엔지니어링이 더 중요하다": 저자는 수학과 엔지니어링은 파트너라고 말합니다. 세계에서 가장 빠른 오븐을 가지고 있더라도 스케줄링이 나쁘면 오븐은 방치됩니다. 수학은 오븐을 바쁘게 유지하는 방법을 알려줍니다.
4. 큰 그림
논문은 LLM 서빙 분야가 단순한 규칙의 "유년기"를 넘어서서 성숙했다고 결론 내립니다. 이는 이제 수학자와 알고리즘 전문가들의 성인 감독을 요구하는 복잡한 시스템으로 성장했습니다.
이러한 문제들을 단순한 엔지니어링 조정으로가 아니라 수학적 퍼즐로 취급함으로써 우리는 다음을 얻을 수 있습니다:
- 예측 가능성: 시스템이 어떻게 행동할지 정확히 아는 것.
- 효율성: 막대한 에너지와 비용을 절약하는 것.
- 신뢰성: 상황이 혼란스러워질 때 시스템이 충돌하지 않도록 보장하는 것.
간단히 말해: 추측을 멈추고 계산을 시작하세요. AI 서빙의 미래는 단순히 더 큰 모델을 구축하는 것이 아니라, 이를 운영하는 더 지능적이고 수학적으로 입증된 방법을 구축하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.