← 最新论文
🤖 AI

M*: A Modular, Extensible, Serving System for Multimodal Models

本文介绍了 M*,这是一个模块化且可扩展的推理服务系统,它将复合多模态模型表示为数据流图,以实现灵活的组件组合和分布式优化,在文本生成图像、文本生成语音以及机器人规划等多种任务中,相比现有框架实现了显著的延迟降低和吞吐量提升。

原作者: Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营着一家规模宏大、高科技的厨房。

旧方式(现有系统):
长期以来,AI 模型就像是简单的、单车道的组装线。如果你想烤一个蛋糕(生成文本),每种原料都要走同样的路径:混合、烘焙、抹霜、上菜。像 vLLM 这样的系统就是专门为这种“仅限文本”的组装线而构建的。它们在烤蛋糕方面速度极快。

但现在,AI 正在进入一个新时代。我们不再仅仅是烤蛋糕了;我们正在运行一个复合型厨房。我们的模型可以:

  • 观察一张照片并描述它(视觉)。
  • 聆听一段声音并以另一种声音回复(语音)。
  • 观看一段视频并预测接下来的发展(世界模型)。
  • 根据指令控制机械臂(机器人技术)。

这些新的“复合型”模型非常杂乱。它们并不遵循单一的直线。有时它们需要循环回溯来检查自己的工作(比如扩散模型通过多次迭代优化图像)。有时它们需要同时分裂成三条并行路径(比如从三个不同的角度检查一张图片)。有时它们需要实时流式传输音频,一次只传一个词。

旧的厨房系统(vLLM、SGLang)试图将这些复杂的、多任务的模型强行塞进它们简单的、直线型的组装线中。这就像是试图把一场杂耍表演塞进传送带里。这样做虽然可行,但既缓慢又笨拙,并且需要大量的自定义“胶水”代码来让各个部分粘合在一起。

新解决方案:M*
这篇论文介绍了一种全新的、用于这些复杂 AI 厨房的操作系统。M* 不再强迫模型走直线,而是将它们视为一个动态地图流程图

以下是 M* 的工作原理,使用简单的类比说明:

1. “行走图”(地图)

在过去,厨房经理必须知道每道菜的精确食谱。而在 M* 中,模型创建者只需绘制一张厨房的地图(图/Graph)。

  • 节点(Nodes): 这些是工作站(例如:“视觉站”、“语言站”、“音频站”)。
  • 行走(Walks): 这是客户订单所经过的具体路线。
    • 订单 A(文生图): 从语言站出发 \rightarrow 在艺术站循环 50 次 \rightarrow 最后到达打印机。
    • 订单 B(语音对语音): 从麦克风站出发 \rightarrow 分裂成两条路径 \rightarrow 重新合并 \rightarrow 到达扬声器。

M* 将其称为行走图(Walk Graph)。它让系统能够理解不同的任务会通过同一个厨房走不同的路径,而无需每次都重写厨房的布局。

2. “指挥家”(交通控制器)

地图绘制完成后,M* 有一位指挥家。这位聪明的交通控制器并不关心食物是什么,只关心食物该去哪里。

  • 如果一个请求需要循环回溯(比如优化图像),指挥家会将它送回循环的起点。
  • 如果一个请求需要分裂成三份(比如同时检查安全性、风格和内容),指挥家会同时向三位不同的厨师发送三份副本。
  • 如果一个请求正在进行音频流式传输,指挥家会确保厨师在整句话结束之前,立即递出第一个词。

3. 灵活的座位(放置/部署)

在旧系统中,如果你有一个大厨(大型 AI 模型),你必须把他们放在一张大桌子(单个 GPU)上。如果你有一个小助手(小型编码器),他们就必须坐在一张小桌子上。
M* 允许你将厨房进行解耦(Disaggregate)。你可以把“视觉厨师”放在一台电脑上,把“语言厨师”放在另一台,把“音频厨师”放在第三台。他们可以实现即时通信。这意味着你可以只针对模型中较慢的部分进行扩容,而不必在那些快速的部分上浪费资金。

他们证明了什么?(结果)
作者将 M* 与旧系统(vLLM-Omni、SGLang-Omni、VoxServe)在五种不同类型的复杂模型上进行了对比测试。结果如下:

  • 图像生成 (BAGEL): 在将文本转化为图像时,M* 比旧系统快了 20% 到 50%。它更高效地处理了优化图像所需的复杂“循环”。
  • 语音 (Qwen3-Omni & Orpheus): 在生成语音时,M* 的实时性能提升了高达 2.9 倍,并且能同时处理 2.7 倍的请求量。这就像是从缓慢、卡顿的无线电切换到了清晰的现场直播。
  • 机器人技术 (V-JEPA 2): 在预测未来视频帧以进行机器人规划时,M* 的速度提升了高达 12.5 倍。旧系统必须在每一步都从头开始重新计算;而 M* 记住了之前的步骤,并仅更新新的部分。

核心结论
M* 是一个通用的系统,它不再试图将每个 AI 模型都强行塑造成单一、僵化的形状。相反,它让模型定义自己的形状(图),然后构建一个灵活、高速的引擎来运行这个形状。

这就像是从一个一旦尝试制造汽车而非烤面包机就会崩溃的刚性组装线,转变为一个智能、可适应的工作坊,它可以以同等的速度和效率制造从烤面包机到火箭飞船的一切事物。论文声称,这使得开发者能够以极低的成本部署这些复杂的、多模态的模型,同时获得显著提升的性能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →