← Últimos artigos
🤖 AI

M*: A Modular, Extensible, Serving System for Multimodal Models

Este artigo apresenta o M*, um sistema de serviço modular e extensível que representa modelos multimodais compostos como grafos de fluxo de dados para permitir a composição flexível de componentes e a otimização distribuída, alcançando melhorias significativas de latência e vazão em relação aos frameworks existentes em diversas tarefas, como texto-para-imagem, texto-para-fala e planejamento robótico.

Autores originais: Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

Publicado 2026-06-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma cozinha tecnológica de grande escala.

O Jeito Antigo (Sistemas Existentes):
Por muito tempo, os modelos de IA eram como linhas de montagem simples e de pista única. Se você quisesse assar um bolo (gerar texto), todos os ingredientes seguiam o mesmo caminho: misturar, assar, cobrir, servir. Sistemas como o vLLM foram construídos especificamente para essa linha de montagem "apenas de texto". Eles eram incrivelmente rápidos em assar bolos.

Mas agora, a IA está entrando em uma nova era. Não estamos mais apenas assando bolos; estamos administrando uma cozinha composta. Temos modelos que podem:

  • Olhar para uma foto e descrevê-la (Visão).
  • Ouvir uma voz e responder com uma voz diferente (Fala).
  • Assistir a um vídeo e prever o que acontece a seguir (Modelos de Mundo).
  • Controlar um braço robótico com base em um comando (Robótica).

Esses novos modelos "compostos" são bagunçados. Eles não seguem uma única linha reta. Às vezes, precisam voltar em um loop para verificar seu trabalho (como um modelo de difusão refinando uma imagem). Às vezes, precisam se dividir em três caminhos paralelos ao mesmo tempo (como verificar uma imagem de três ângulos diferentes). Às vezes, precisam transmitir áudio em tempo real, uma palavra por vez.

Os antigos sistemas de cozinha (vLLM, SGLang) tentavam forçar esses modelos complexos e multitarefa em suas linhas de montagem simples e retas. Era como tentar encaixar um ato de malabarismo em uma esteira de transporte. Funcionava, mas era lento, desajeitado e exigia muito código de "cola" personalizado para fazer as peças colarem.

A Nova Solução: M*
O artigo apresenta o M, um novo sistema operacional para essas cozinhas de IA complexas. Em vez de forçar os modelos a seguir uma linha reta, o M os trata como um mapa dinâmico ou um fluxograma.

Veja como o M* funciona, usando analogias simples:

1. O "Gráfico de Caminhada" (O Mapa)

Nos velhos tempos, o gerente da cozinha tinha que conhecer a receita exata de cada prato. No M*, o criador do modelo apenas desenha um mapa (um grafo) da cozinha.

  • Nós (Nodes): Estas são as estações (ex: "A Estação de Visão", "A Estação de Linguagem", "A Estação de Áudio").
  • Caminhadas (Walks): Estes são os trajetos específicos que o pedido de um cliente percorre.
    • Pedido A (Texto para Imagem): Caminha da Estação de Linguagem → faz um loop 50 vezes na Estação de Arte → termina na Impressora.
    • Pedido B (Fala para Fala): Caminha da Estação do Microfone → se divide em dois caminhos → se funde novamente → vai para o Alto-falante.

O M* chama isso de Gráfico de Caminhada (Walk Graph). Ele permite que o sistema entenda que diferentes tarefas seguem caminhos diferentes através da mesma cozinha, sem precisar reescrever o layout da cozinha toda vez.

2. O "Condutor" (O Controlador de Tráfego)

Uma vez desenhado o mapa, o M* tem um Condutor. Este é o controlador de tráfego inteligente que não se importa com o que é a comida, apenas para onde ela deve ir.

  • Se um pedido precisa retornar a um loop (como refinar uma imagem), o Condutor o envia de volta ao início do loop.
  • Se um pedido precisa se dividir em três (como verificar segurança, estilo e conteúdo), o Condutor envia três cópias para três chefs simultaneamente.
  • Se um pedido está transmitindo áudio, o Condutor garante que o chef entregue a primeira palavra imediatamente, em vez de esperar que a frase inteira termine.

3. Assentos Flexíveis (Posicionamento)

Nos sistemas antigos, se você tivesse um chef grande (um modelo de IA grande), você tinha que colocá-lo em uma mesa gigante (uma GPU). Se você tivesse um ajudante pequeno (um codificador pequeno), eles tinham que sentar em uma mesa minúscula.
O M* permite que você desagregue a cozinha. Você pode colocar o "Chef de Visão" em um computador, o "Chef de Linguagem" em outro e o "Chef de Áudio" em um terceiro. Eles podem conversar entre si instantaneamente. Isso significa que você pode escalar apenas a parte do modelo que é lenta, sem desperdiçar dinheiro nas partes que são rápidas.

O Que Eles Provaram? (Os Resultados)

Os autores testaram o M* contra os sistemas antigos (vLLM-Omni, SGLang-Omni, VoxServe) em cinco tipos diferentes de modelos complexos. Veja o que aconteceu:

  • Geração de Imagem (BAGEL): Ao transformar texto em imagens, o M* foi de 20% a 50% mais rápido que os sistemas antigos. Ele lidou com os "loops" complexos necessários para refinar a imagem de forma muito mais eficiente.
  • Fala (Qwen3-Omni & Orpheus): Ao gerar fala, o M* foi até 2,9 vezes mais rápido em desempenho de tempo real e lidou com 2,7 vezes mais pedidos ao mesmo tempo. Foi como trocar um rádio lento e travado por uma transmissão ao vivo nítida.
  • Robótica (V-JEPA 2): Ao prever quadros de vídeo futuros para planejamento de robôs, o M* foi até 12,5 vezes mais rápido. O sistema antigo tinha que recalcular tudo do zero a cada passo; o M* lembrava dos passos anteriores e apenas atualizava os novos.

A Conclusão

M* é um sistema universal que deixa de tentar forçar cada modelo de IA em uma forma única e rígida. Em vez disso, ele permite que o modelo defina sua própria forma (um grafo) e então constrói um motor flexível e de alta velocidade para executar essa forma.

É a diferença entre uma linha de montagem rígida que quebra quando você tenta construir um carro em vez de uma torradeira, e uma oficina inteligente e adaptável que pode construir desde uma torradeira até um foguete com a mesma velocidade e eficiência. O artigo afirma que isso permite que desenvolvedores implantem esses modelos multimodais complexos com o mínimo de esforço, obtendo um desempenho significativamente melhor.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →