Theoretically Optimal Attention/FFN Ratios in Disaggregated LLM Serving
본 논문은 확률적 워크로드 동역학과 동기화 오버헤드를 고려하여 디스래그레이트된 LLM 서빙에서 장치 유휴 시간과 단계 수준 블로킹을 최소화하기 위해 이론적으로 최적의 어텐션 대 FFN 자원 비율을 결정하는 분석적 프레임워크와 폐형 프로비저닝 규칙을 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 AI 뇌를 위해 "생각"(토큰) 을 생산하는 거대하고 고속의 공장을 운영한다고 상상해 보세요. 이 공장은 각 생각을 완성하기 위해 함께 작동하는 두 가지 주요 조립 라인을 가지고 있습니다:
- 메모리 라인 (Attention): 이 팀은 사서와 같습니다. 그들은 모든 요청에 대해 특정 페이지를 찾기 위해 거대하고 성장 중인 책장 (KV 캐시) 으로 왕복해야 합니다. 책장이 커질수록 이 팀은 더 무거운 짐을 운반해야 하므로 점점 더 느려집니다. 그들은 메모리 병목에 시달립니다.
- 계산 라인 (FFN): 이 팀은 초고속 계산기와 같습니다. 그들은 책장을 볼 필요가 없으며, 사서들이 건네주는 내용을 바탕으로 숫자를 계산하기만 합니다. 그들은 연산 병목이며, 할 일이 충분히 있다면 놀라울 정도로 빠르게 작업할 수 있습니다.
문제: "불일치 춤"
과거에는 이 두 팀이 같은 방에 갇혀 있었습니다. 사서들이 느리면 계산기들은 그들을 기다리며 빈둥거려야 했습니다. 계산기들이 빠르면 사서들이 병목 현상이 되었습니다.
이를 해결하기 위해 엔지니어들은 **AFD(Attention-FFN Disaggregation)**라는 새로운 레이아웃을 발명했습니다. 그들은 사서들과 계산기들을 별도의 방으로 옮겼습니다. 이제 여러 사서 팀이 하나의 거대한 계산기 방으로 데이터를 공급할 수 있습니다.
하지만 여기에는 함정이 있습니다: 하나의 계산기 방에 몇 개의 사서 팀이 필요할까요?
- 사서가 너무 적으면? 계산기는 데이터가 부족해 빈둥거리게 됩니다.
- 사서가 너무 많으면? 계산기가 압도당하고, 사서들은 계산기가 따라오기를 기다리며 서 있게 됩니다.
완벽한 비율 (이를 r이라고 부르겠습니다) 을 찾는 것은 한 명의 요리사를 위해 완벽한 웨이터 수를 찾는 것과 같습니다. 추측을 잘못하면 공장 전체가 느려집니다.
이 논문의 해결책: 공장 관리자를 위한 "수정구"
이 논문의 저자들은 비율을 추측하는 것이 작업이 무작위적이기 때문에 어렵다는 것을 깨달았습니다.
- 어떤 고객은 짧은 질문을 하고, 다른 고객은 긴 이야기를 합니다.
- 어떤 요청은 빠르게 끝나고, 다른 요청은 오래 걸립니다.
- "책장"(메모리) 은 요청마다 다르게 성장합니다.
이러한 무작위성 때문에 단순한 평균 기반의 수학 공식을 사용할 수 없습니다. 혼란을 예측할 수 있는 방법이 필요합니다.
그들의 "비밀 소스"는 세 가지 일을 수행하는 새로운 수학적 프레임워크입니다:
- "평균 혼란"을 측정합니다: 그들은 과거 요청 로그 (트레이스) 를 살펴보고, 더 긴 요청이 임의의 순간에 관찰될 가능성이 더 높다는 사실을 고려하여 실제 평균 작업량을 나타내는 단일 숫자 (θ) 를 계산하는 방법을 개발했습니다.
- "가장 느린 주자"를 고려합니다: 이 공장에서는 모든 사서 팀이 작업을 완료해야 계산기가 시작할 수 있습니다. 한 팀이 거대한 책에 갇히면 전체 라인이 기다려야 합니다. 저자들은 이러한 "지체자"(가장 느린 작업자) 로 인해 손실되는 추가 시간을 예측하는 공식을 만들었습니다.
- "황금 비율" 레시피를 제공합니다: 이 두 가지 통찰력을 사용하여 그들은 간단한 폐쇄형 규칙을 유도했습니다. 하드웨어 사양과 요청 로그를 입력하면 공식이 계산기 방을 최대 속도로 실행하기 위해 필요한 정확한 사서 팀 수를 알려줍니다.
결과: "작동합니다!"
팀은 이론을 테스트하기 위해 디지털 시뮬레이터 (가상 공장) 를 구축했습니다.
- 그들은 사서 팀의 수를 1 에서 32 까지 다양하게 시도했습니다.
- 시뮬레이터가 찾은 실제 최적 성능과 그들의 "황금 비율" 예측을 비교했습니다.
- 판결: 그들의 예측은 놀라울 정도로 정확하여 실제 시뮬레이션과 10% 이내로 일치했습니다.
또한 사서 팀을 더 많이 추가할수록 가장 느린 팀으로 인한 "대기 시간"이 증가한다는 것을 발견했지만, 그들의 공식은 이를 고려하여 너무 많은 팀을 추가하여 돈을 낭비하지 않도록 보장합니다.
결론
이 논문은 이러한 분리된 AI 공장을 구축하기 위한 과학적 규칙집을 제공합니다. 추측이나 시행착오 대신 시스템 설계자들은 이제 이 수학을 사용하여 메모리 및 연산 자원을 어떻게 정확히 균형 있게 배치할지 파악할 수 있으며, 작업 부하가 예측 불가능할 때도 AI 가 가능한 한 빠르고 효율적으로 실행되도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.