← 최신 논문
🤖 AI

Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs

Coral 는 다양한 클라우드 GPU 에 걸쳐 자원 할당 및 서비스 전략을 공동으로 최적화하는 적응형 이질성 인식 다중 LLM 서비스 시스템으로, 손실 없는 2 단계 분해를 통해 빠르고 근사 최적의 의사 결정을 가능하게 함으로써 최대 2.79 배의 비용 절감과 2.39 배의 높은 goodput 을 달성합니다.

원저자: Yixuan Mei, Zikun Li, Zixuan Chen, Shiqi Pan, Mengdi Wu, Xupeng Miao, Zhihao Jia, K. V. Rashmi

게시일 2026-05-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yixuan Mei, Zikun Li, Zixuan Chen, Shiqi Pan, Mengdi Wu, Xupeng Miao, Zhihao Jia, K. V. Rashmi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 고급스러운 레스토랑 주방을 운영한다고 상상해 보세요. 과거에는 모든 요리를 만들기 위해 가장 비싸고 최상급의 셰프와 가장 크고 빠른 스토브가 필요하다고 생각했습니다. 하지만 챗봇과 코드 생성기 뒤에 있는 AI 두뇌인 대규모 언어 모델 (LLM) 세계에서는 상황이 달라졌습니다. 모든 것을 가장 잘 수행하는 단일 'AI 모델'은 존재하지 않습니다. 어떤 모델은 코드 작성에 뛰어나고, 어떤 모델은 대화에 뛰어나며, 어떤 모델은 단순한 작업에만 적합합니다.

더 나아가, 이 '주방'(클라우드 서버) 은 다양한 장비로 엉망진창입니다. 초고속이지만 비싼 'H100' 스토브가 있지만, 종종 품절 상태입니다. 반면에 구식이지만 저렴한 'L4' 또는 'A100' 스토브는 구할 수 있으며, 놀랍게도 달러당 동등한 조리 능력을 제공합니다.

문제는 다음과 같습니다: 비싼 스토브와 저렴한 스토브를 섞어 46 가지 다른 레시피 (모델) 로 주장을 운영하면서 돈을 낭비하거나 손님을 기다리게 하지 않는 방법은 무엇일까요?

이것이 바로 코랄 (Coral) 이 해결하는 문제입니다.

구식 방식: "만능" 실수

이전 시스템들은 모든 요리를 블랙박스처럼 취급하여 이 문제를 해결하려 했습니다. 그들은 "코드 작성 요리를 위해서는 전체 H100 스토브가 필요하다. 대화 요리를 위해서는 A100 이 필요하다"라고 말했습니다. 그들은 스토브의 일부를 섞어 쓸 수 있는지 확인하기 위해 레시피 내부로 들여다보지 않았습니다.

이로 인해 두 가지 큰 문제가 발생했습니다:

  1. 낭비되는 비용: 더 저렴한 조합으로도 충분히 잘 작동했을 때에도 가장 비싼 장비를 구매하는 경우가 많았습니다.
  2. 병목 현상: 비싼 스토브가 품절되면, 더 저렴한 스토브들이 유휴 상태로 남아있음에도 불구하고 주방 전체가 멈췄습니다.

코랄 솔루션: "스마트한 믹스 앤 매치" 셰프

코랄은 단일 요리가 한 가지 유형의 스토브에서만 조리될 필요가 없다는 것을 깨닫는 천재 수석 셰프와 같습니다. 대신 코랄은 조리 과정을 단계별로 나누고 각 단계에 완벽한 스토브를 할당합니다.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

1. 2 단계 전략 (오프라인 vs 온라인)

코랄은 압도되지 않기 위해 사고방식을 두 부분으로 나눕니다:

  • 1 단계: 레시피 북 (오프라인)
    레스토랑이 문을 열기 전에 코랄은 거대한 '레시피 북'을 만드는 데 시간을 보냅니다. 가능한 모든 요리 (모델) 와 가능한 모든 스토브 조합 (GPU) 에 대해, 그것을 조리하는 절대적인 최선의 방법을 계산합니다.

    • 예시: "Qwen-3 235B"요리를 위해 첫 번째 부분 (프리필) 을 조리하는 최선의 방법은 세 개의 저렴한 L40S 스토브와 두 개의 비싼 H100 스토브를 특정 순서로 배치하는 것이라고 파악합니다.
    • 코랄은 이러한 완벽한 '레시피'를 서빙 템플릿 (Serving Templates) 으로 기록합니다. 이는 시간이 많이 걸리지만 한 번만 수행하면 됩니다.
  • 2 단계: 일상적인 교대 근무 (온라인)
    레스토랑이 문을 열고 주문이 들어오기 시작하면 코랄은 처음부터 조리 방법을 figuring out 하느라 멈추지 않습니다. 그저 자신의 레시피 북을 볼 뿐입니다.

    • 확인합니다: "지금 당장 5 개의 L40 과 2 개의 H100 을 사용할 수 있습니다. Qwen-3 요리 100 개를 조리해야 합니다."
    • 즉시 해당 특정 스토브에 맞고 고객의 속도 요구 사항을 충족하는 사전 계산된 레시피를 선택합니다.
    • 어려운 수학 계산은 미리 완료되었기 때문에 코랄은 이러한 결정을 시간이 아닌 단위로 내릴 수 있습니다. 이로 인해 주방은 스토브가 고장 나거나 새로운 주문이 쇄도하더라도 즉시 적응할 수 있습니다.

2. "팀워크" 비유

두 팀의 근로자 (두 가지 다른 AI 모델) 와 제한된 도구 (GPU) 가 있다고 상상해 보세요.

  • 구식 방식: 팀 A 가 '최고' 팀이기 때문에 최고의 도구를 모두 차지합니다. 팀 B 는 고장 난 도구만 남게 되어 작업을 완료할 수 없습니다.
  • 코랄 방식: 코랄은 전체 그림을 봅니다. 팀 A 가 워크플로우를 재배치한다면 좋은 도구와 평범한 도구를 섞어 사용해도 작업을 잘 수행할 수 있음을 깨닫습니다. 이는 팀 B 를 위해 최고의 도구를 자유롭게 만듭니다. 두 팀 모두 제시간에 작업을 완료하고, 어떤 도구도 낭비되지 않습니다.

이것이 중요한 이유

이 논문은 6 가지 다른 AI 모델과 20 가지 다른 유형의 컴퓨터 칩 (GPU) 으로 코랄을 테스트했습니다. 결과는 인상적이었습니다:

  • 더 저렴함: 코랄은 기존 최선 방법 대비 AI 모델 실행 비용을 최대 2.79 배 절감했습니다. 이는 100에식사를한것과같은품질을100 에 식사를 한 것과 같은 품질을 36 만으로 지불하는 것과 같습니다.
  • 더 빠름 (자원이 희소할 때): "주방"이 붐비고 도구를 찾기 어려울 때, 코랄은 속도를 늦추지 않고 경쟁사보다 2.39 배 더 많은 고객을 응대했습니다.

결론

코랄은 AI 모델을 경직된 단일 블록 기계로 취급하는 것을 중단하는 시스템입니다. 대신 구식 및 신식 장비를 섞어 조리할 수 있는 유연한 레시피처럼 취급합니다. 미리 '완벽한 혼합'을 계획한 후 실시간으로 빠르게 적용함으로써 막대한 비용을 절약하고 하드웨어 공급이 불안정할 때도 AI 가 원활하게 작동하도록 유지합니다.

간단히 말해: 코랄은 비싸고 저렴한 도구를 섞어 사용하여 누구보다 빠르고 저렴하게 일을 처리하는 방법을 아는 스마트한 관리자입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →