M*: A Modular, Extensible, Serving System for Multimodal Models
이 논문은 복합 멀티모달 모델을 데이터플로우 그래프로 표현하여 유연한 구성 요소 결합과 분산 최적화를 가능하게 하는 모듈형 및 확장형 서빙 시스템인 M*을 소개하며, 이를 통해 텍스트-이미지 생성, 텍스트-음성 합성, 로봇 계획과 같은 다양한 작업에 걸쳐 기존 프레임워크 대비 상당한 지연 시간 및 처리량 개선을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 첨단 기술을 갖춘 주방을 운영하고 있다고 상상해 보십시오.
과거의 방식 (기존 시스템):
오랫동안 AI 모델은 단순한 단선형 조립 라인과 같았습니다. 케이크를 굽고 싶다면(텍스트 생성), 모든 재료는 동일한 경로를 따라가야 했습니다: 혼합, 굽기, 프로스팅, 서빙. vLLM과 같은 시스템은 바로 이 "텍스트 전용" 조립 라인을 위해 구축되었습니다. 이들은 케이크를 굽는 데 있어 믿을 수 없을 정도로 빨랐습니다.
하지만 이제 AI는 새로운 시대에 진입하고 있습니다. 우리는 더 이상 케이크만 굽는 것이 아닙니다. 우리는 **복합 주방(composite kitchen)**을 운영하고 있습니다. 우리는 다음과 같은 모델들을 보유하게 되었습니다:
- 사진을 보고 그것을 설명하기 (시각/Vision).
- 목소리를 듣고 다른 목소리로 답하기 (음성/Speech).
- 영상을 보고 다음에 일어날 일 예측하기 (월드 모델/World Models).
- 명령에 따라 로봇 팔 제어하기 (로보틱스/Robotics).
이 새로운 "복합" 모델들은 복잡합니다. 이들은 단순히 하나의 직선을 따르지 않습니다. 때로는 작업을 정교화하기 위해(이미지를 다듬는 확산 모델처럼) 다시 루프를 돌며 검토해야 합니다. 때로는 세 가지 다른 각도에서 사진을 확인하는 것처럼 동시에 세 갈래의 병렬 경로로 나뉘어야 합니다. 때로는 실시간으로 오디오를 한 단어씩 스트리밍해야 합니다.
과거의 주방 시스템(vLLM, SGLang)은 이러한 복잡한 다중 작업 모델을 단순하고 직선적인 조립 라인에 억지로 끼워 맞추려 했습니다. 이는 마치 저글링 공연을 컨베이어 벨트에 맞추려는 것과 같았습니다. 작동은 했지만, 느리고 투박했으며, 이 조각들을 서로 붙이기 위해 많은 양의 커스텀 "접착제" 코드가 필요했습니다.
새로운 솔루션: M*
이 논문은 이러한 복잡한 AI 주방을 위한 새로운 운영 체제인 M을 소개합니다. M은 모델을 직선 형태로 강요하는 대신, 이를 동적인 지도(dynamic map) 또는 플로우차트로 취급합니다.
M*이 작동하는 방식은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다.
1. "워크 그래프(Walk Graph)" (지도)
과거에는 주방 매니저가 모든 요리의 정확한 레시피를 알고 있어야 했습니다. 하지만 M*에서는 모델 제작자가 주방의 **지도(그래프)**를 그리기만 하면 됩니다.
- 노드(Nodes): 이들은 각 스테이션입니다 (예: "시각 스테이션", "언어 스테이션", "오디오 스테이션").
- 워크(Walks): 이는 고객의 주문이 이동하는 구체적인 경로입니다.
- 주문 A (Text-to-Image): 언어 스테이션에서 출발 → 아트 스테이션에서 50번 루프 반복 → 프린터에서 종료.
- 주문 B (Speech-to-Speech): 마이크 스테이션에서 출발 → 두 갈래로 분리 → 다시 합쳐짐 → 스피커로 이동.
M*은 이를 워크 그래프라고 부릅니다. 이를 통해 시스템은 매번 주방의 레이아웃을 새로 작성하지 않고도, 서로 다른 작업들이 동일한 주방 내에서 각기 다른 경로를 거친다는 것을 이해할 수 있습니다.
2. "컨덕터(Conductor)" (교통 관제사)
지도가 그려지면, M*에는 컨덕터가 있습니다. 이 스마트한 교통 관제사는 음식이 무엇인지에는 관심이 없으며, 오직 음식이 어디로 가야 하는지에만 집중합니다.
- 만약 요청이 루프를 돌아야 한다면(이미지를 정교화하는 경우처럼), 컨덕터는 해당 요청을 루프의 시작점으로 다시 보냅니다.
- 만약 요청이 세 갈래로 나뉘어야 한다면(안전성, 스타일, 콘텐츠를 동시에 확인하는 것처럼), 컨독터는 세 개의 복사본을 세 명의 셰프에게 동시에 보냅니다.
- 만약 오디오를 스트리밍 중이라면, 컨덕터는 셰프가 문장 전체가 끝날 때까지 기다리는 대신 첫 단어를 즉시 전달하도록 보장합니다.
3. 유연한 좌석 배치 (Placement)
과거의 시스템에서는 큰 셰프(대규모 AI 모델)가 있다면 그들을 하나의 거대한 테이블(하나의 GPU)에 앉혀야 했습니다. 작은 조수(작은 인코더)가 있다면 그들은 작은 테이블에 앉아야 했습니다.
M*은 주방을 **분리(disaggregate)**할 수 있게 해줍니다. 여러분은 "시각 셰프"를 다른 컴퓨터에, "언어 셰프"를 또 다른 컴퓨터에, "오디오 셰프"를 세 번째 컴퓨터에 배치할 수 있습니다. 이들은 서로 즉각적으로 소통할 수 있습니다. 즉, 빠른 부분 때문에 돈을 낭비하지 않으면서, 느린 부분만을 골라 확장할 수 있습니다.
무엇을 증명했는가? (결과)
저자들은 다섯 가지 유형의 복잡한 모델을 대상으로 M*을 기존 시스템(vLLM-Omni, SGLang-Omni, VoxServe)과 비교 테스트했습니다. 결과는 다음과 같습니다.
- 이미지 생성 (BAGEL): 텍스트를 이미지로 변럴할 때, M은 기존 시스템보다 20%에서 50% 더 빨랐습니다. M은 이미지를 정교화하는 데 필요한 복잡한 "루프"를 훨씬 더 효율적으로 처리했습니다.
- 음성 (Qwen3-Omni & Orpheus): 음성을 생성할 때, M*은 실시간 성능 면에서 최대 2.9배 더 빨랐으며, 동시에 2.7배 더 많은 요청을 처리했습니다. 이는 마치 버벅거리는 라디오에서 선명한 라이브 방송으로 전환한 것과 같았습니다.
- 로보틱스 (V-JEPA 2): 로봇 계획을 위한 미래 비디오 프레임 예측 시, M은 최대 12.5배 더 빨랐습니다. 기존 시스템은 매 단계마다 모든 것을 처음부터 다시 계산해야 했지만, M은 이전 단계들을 기억하고 새로운 부분만을 업데이트했습니다.
핵심 요약
M*은 모든 AI 모델을 단일하고 경직된 형태에 맞추려고 하지 않는 범용 시스템입니다. 대신, 모델이 스스로 자신의 형태(그래프)를 정의하게 하고, 그 형태를 실행할 수 있는 유연하고 고속인 엔진을 구축합니다.
이는 토스터를 만드는 대신 자동차를 만들려고 할 때 부서져 버리는 경직된 조립 라인과, 토스터부터 로켓까지 무엇이든 동일한 속도와 효율성으로 만들어낼 수 있는 스마트하고 적응력 있는 작업장의 차이와 같습니다. 이 논문은 이를 통해 개발자들이 최소한의 노력으로 이러한 복잡한 멀티모달 모델을 배포하면서도 훨씬 더 나은 성능을 얻을 수 있다고 주장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.