SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters
SAGA 는 GPU 클러스터에서 요청 수준에서 프로그램 수준으로의 스케줄링 전환을 통해 중간 KV 캐시 상태를 보존하고 피크 처리량과의 트레이드오프에도 불구하고 작업 완료 시간을 1.64 배 단축함으로써 복합 AI 에이전트 워크플로우의 효율성을 향상시키는 분산 스케줄러입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
바쁜 주방 (GPU 클러스터) 을 운영한다고 상상해 보세요. 여기서 요리사들 (AI 에이전트) 이 복잡한 다코스 요리를 준비하고 있습니다.
현재 대부분의 주방 관리자 (vLLM 과 같은 기존 스케줄러) 는 모든 주문을 완전히 별개의 일회성 사건으로 취급합니다. 만약 요리사가 채소를 다듬고, 오븐이 예열될 때까지 기다린 후, 다시 채소를 더 다듬어야 한다면, 관리자는 요리사에게 다음과 같이 하도록 강요합니다:
- 첫 번째 배치를 조리합니다.
- 오븐을 "기다리는" 동안 다듬은 채소와 더러운 칼 (KV 캐시) 을 모두 버립니다.
- 오븐이 준비되면, 요리사는 처음부터 정확히 같은 채소를 다시 다듬어야 합니다.
이 "처음부터 다시 시작"하는 사이클은 한 끼 식사 동안 수십 번 발생합니다. 이는 막대한 시간과 공간을 낭비하여 주방을 필요한 속도보다 3 배에서 8 배나 느리게 만듭니다.
SAGA는 규칙을 바꾸는 새로운 주방 관리자입니다. 개별 주문을 보는 대신, SAGA 는 전체 레시피를 하나의 단일 단위로 봅니다. 간단한 비유를 들어 작동 방식을 설명하겠습니다:
1. "레시피 책" (에이전트 실행 그래프)
요리사가 다음에 무엇을 할지 추측하는 대신, SAGA 는 레시피 책 (에이전트 실행 그래프) 을 읽습니다.
- 문제점: 요리사가 오븐을 기다리기 위해 멈춥니다 (도구 호출). 기존 관리자는 요리사가 끝났다고 가정하고 조리대를 비웁니다.
- SAGA 의 해결책: SAGA 는 레시피에 "오븐 후 양파를 다시 다듬어야 한다"고 적혀 있음을 알고 있습니다. 따라서 요리사에게 말합니다: "다듬은 양파와 칼을 조리대에 그대로 두세요. 아직 씻지 마세요."
- 결과: 오븐이 준비되면, 요리사는 멈췄던 지점부터 바로 계속합니다. 다시 다듬을 필요가 없습니다. SAGA 는 이를 매우 잘 예측하여 미래를 볼 수 있는 관리자 (이론적 "최적" 관리자) 와 거의 완벽하게 동일한 성능을 발휘합니다.
2. "VIP 테이블" 전략 (세션 애너티 배치)
요리사가 복잡한 10 코스 요리를 준비하고 있다고 상상해 보세요.
- 문제점: 기존 시스템에서는 요리사가 바빠지면, 관리자는 다음 단계를 다른 요리사의 다른 스테이션으로 보낼 수 있습니다. 새로운 요리사는 첫 번째 요리사의 메모가 없으므로 레시피를 처음부터 다시 읽고 채소를 다시 다듬어야 합니다.
- SAGA 의 해결책: SAGA 는 "이 전체 10 코스 요리는 스테이션 1의 요리사 A에게 속한다"고 말합니다. 요리사 A 가 오븐을 기다리고 있더라도 다음 단계는 그에게 예약됩니다. 스테이션 1 이 너무 붐비면 SAGA 는 전체 요리를 새로운 스테이션으로 이동시킬 수 있지만, 새로운 요리사가 처음부터 시작하지 않도록 "메모" (캐시) 를 함께 가져갑니다.
- 결과: 주방은 정리되어 있고, 요리사들은 작업을 다시 반복하는 시간을 낭비하지 않습니다.
3. "공정성" 규칙 (에이전트 공정한 분배)
두 가지 유형의 고객이 있는 레스토랑을 상상해 보세요:
- 고객 A: 간단한 버거를 주문합니다 (짧은 작업).
- 고객 B: 거대한 50 코스 연회를 주문합니다 (길고 복잡한 에이전트 작업).
- 문제점: 기존 관리자는 종종 빠르게 끝나는 버거를 우선시합니다. 연회 고객은 영원히 기다리게 되어 좌절합니다.
- SAGA 의 해결책: SAGA 는 전체 연회를 봅니다. "버거를 계속 제공하면 연회는 결코 끝날 수 없다"고 깨닫습니다. 버거가 조금 더 기다리게 되더라도 연회가 제시간에 끝날 수 있도록 충분한 주의를 기울이도록 보장합니다. 이는 모든 사람이 빠른 간식뿐만 아니라 전체 식사를 받을 수 있도록 보장합니다.
트레이드오프 ("속도 vs 품질" 균형)
SAGA 는 개별 복잡한 식사를 완료하는 속도가 매우 빠릅니다 (작업 완료 시간을 1.64 배 단축). 그러나 다음 단계를 위해 정리하고 준비하는 데 시간을 보내기 때문에, 레시피를 무시하고 모든 것을 블렌더에 던져 넣는 관리자처럼 시간당 전체 식사 수를 많이 만들어내지는 못합니다.
- 논문의 주장: SAGA 는 "썩고 태우는" 스타일에 비해 최대 원시 처리량 (throughput) 에서 약 30% 느립니다.
- 중요한 이유: 논문은 이것이 좋은 트레이드오프라고 주장합니다. 대부분의 AI 에이전트는 사용자가 서버가 이론적으로 얼마나 많은 작업을 밀어 넣을 수 있는지보다 작업이 얼마나 빠르게 완료되는지에 더 관심을 가지는 대화형 (코딩 어시스턴트나 브라우저 봇과 같은) 이기 때문입니다.
결과 요약
실제 64 GPU 슈퍼컴퓨터에서 테스트했을 때:
- 속도: 현재 최고의 표준 (프래픽스 캐싱이 적용된 vLLM) 보다 작업이 1.64 배 더 빠르게 완료되었습니다.
- 메모리: 주방은 조리대 공간 (GPU 메모리) 을 22% 더 효율적으로 사용하여 공간 부족 없이 더 복잡한 레시피를 처리할 수 있었습니다.
- 신뢰성: 주방이 혼란스럽고 붐빌 때도 **99.2%**의 작업이 약속된 시간 제한 내에 완료되었습니다.
간단히 말해, SAGA 는 AI 에이전트가 멈출 때마다 작업을 버리지 않도록 하여, 그들이 멈췄던 지점에서 정확히 계속할 수 있도록 보장함으로써 복잡한 AI 작업이 훨씬 더 빠르고 신뢰할 수 있게 만듭니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.