BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal
O artigo apresenta o BaseRT, um tempo de execução de inferência Metal nativo para Apple Silicon que aproveita otimizações específicas do chip para alcançar uma taxa de transferência recorde para grandes modelos de linguagem, superando frameworks existentes como llama.cpp e MLX em até 1,56x.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A Grande Ideia: Construindo um Carro de Corrida Customizado
Imagine que você quer dirigir um carro de corrida (um Grande Modelo de Linguagem, ou LLM) em uma pista muito específica (chips Apple Silicon como o M3 ou M4).
Atualmente, a maioria das pessoas dirige esses carros usando um "adaptador universal" ou um "kit de carro alugado" (softwares existentes como llama.cpp ou MLX). Esses kits são ótimos porque funcionam em muitas pistas diferentes, mas não são perfeitamente ajustados para esta pista específica da Apple. Eles têm peso extra, etapas desnecessárias e um motorista que não conhece os atalhos.
BaseRT é um novo carro de corrida construído sob medida, projetado apenas para a pista da Apple. A equipe da Base Compute removeu os adaptadores pesados e construiu um veículo do zero para combinar com as curvas e regras únicas da pista. O resultado? Ele dirige significativamente mais rápido.
O Problema: Por que o Software Atual é "Lento"
O artigo argumenta que o software existente para rodar IA em Macs é como um caminhão de entrega fazendo paradas demais.
- O Problema do "Intermediário": A maioria dos softwares usa um "framework" (como um intermediário) para falar com o chip gráfico (GPU) do computador. Esse intermediário adiciona etapas extras, como um gerente checando uma prancheta antes de cada tarefa.
- O Problema da "Memória": Computadores Apple têm um recurso especial chamado "Memória Unificada", onde a CPU e a GPU compartilham o mesmo grande reservatório de RAM. O software existente muitas vezes os trata como se estivessem em salas separadas, forçando os dados a caminhar de um lado para o outro desnecessariamente.
A Solução: Como o BaseRT Funciona
O BaseRT elimina o intermediário e constrói uma rodovia direta entre o cérebro e o músculo. Aqui estão os quatro truques principais que eles usaram:
O Projeto "Orientado a Dados":
Em vez de escrever um novo conjunto de instruções para cada modelo de IA diferente (como Qwen, Llama ou Gemma), o BaseRT usa um projeto único e flexível. Pense nisso como um controle remoto universal que detecta automaticamente para qual TV você está apontando e muda seus botões instantaneamente, em vez de precisar de um controle diferente para cada marca. Isso mantém o motor funcionando suavemente sem parar para reconfigurar.O Loop de "Parada Zero":
Quando você pede para uma IA escrever uma frase, ela gera uma palavra de cada vez. No software antigo, o computador tem que encontrar uma vaga de estacionamento (alocação de memória) para cada nova palavra que cria. O BaseRT pré-estaciona todos os lugares antes da corrida começar. Uma vez que a IA começa a falar, ela nunca para para procurar uma vaga; ela apenas continua dirigindo. Isso elimina os "engarrafamentos" causados pelo gerenciamento de memória.A Cozinha de "Fusão":
Normalmente, uma IA tem que cozinhar ingredientes em panelas separadas (Multiplicação de Matrizes, Atenção, Normalização) e mover a comida entre elas. O BaseRT funde essas etapas em uma única panela gigante. Ele cozinha os ingredientes juntos em um único movimento, economizando o tempo gasto para mover a comida de um lado para o outro.O "Motorista Customizado":
O software sabe exatamente em qual chip Apple está rodando (M1, M2, M3, etc.). Ele ajusta seu estilo de condução com base no tamanho específico do motor, garantindo que obtenha o máximo de potência de cada gota de combustível.
Os Resultados: Quem Ganhou a Corrida?
A equipe testou o BaseRT contra os dois maiores concorrentes: llama.cpp (o executor de código aberto mais popular) e MLX (o próprio framework oficial da Apple).
- Velocidade: O BaseRT foi o mais rápido em quase todos os testes.
- Em modelos pequenos, foi até 1,56 vezes mais rápido que o
llama.cpp. - Em modelos de grande escala "Mixture-of-Experts" (cérebros de IA complexos), foi até 1,78 vezes mais rápido ao processar o prompt inicial.
- Em modelos pequenos, foi até 1,56 vezes mais rápido que o
- O Ponto Ideal do "Modelo Pequeno": As maiores vitórias ocorreram em modelos menores. Isso ocorre porque, em modelos pequenos, o "overhead" (o tempo perdido em tarefas administrativas) representa uma grande parte do tempo total. Ao cortar esse desperdício, o BaseRT fez uma diferença massiva.
- A Realidade do "Modelo Grande": Em modelos muito grandes, a velocidade é limitada principalmente pela rapidez com que os dados podem se mover através da memória (largura de banda). Mesmo com um motor perfeito, você não pode ultrapassar o limite de velocidade da estrada. No entanto, o BaseRT ainda conseguiu extrair velocidade extra aqui, provando que o software anterior não estava usando a estrada de forma eficiente.
Por Que Isso Importa? (A Mudança para a "Borda")
O artigo sugere que estamos nos movendo em direção a um futuro onde a IA roda no seu próprio dispositivo (seu laptop ou celular) em vez de em um servidor remoto na nuvem.
- Privacidade: Seus dados nunca saem do seu computador.
- Velocza: Sem esperar que a internet envie sua solicitação de volta e para frente.
- Custo: Você não paga uma taxa mensal por palavra; você apenas paga pelo hardware uma única vez.
O BaseRT prova que o Apple Silicon é muito mais poderoso para rodar IA localmente do que pensávamos, se você usar um software construído especificamente para ele.
O Que o BaseRT Não Faz (As Limitações)
O artigo é honesto sobre o que esta ferramenta ainda não é:
- Usuário Único Apenas: É projetado para uma pessoa usando a IA por vez. Não lida com centenas de pessoas fazendo perguntas simultaneamente (carga de servidor).
- Apenas Apple: Só funciona em Macs e iPads. Ainda não funciona em Windows, Android ou placas gráficas NVIDIA.
- Sem "Visão" Ainda: Atualmente lida com modelos de texto, não modelos que podem "ver" imagens.
O Resumo Final
Os autores construíram um motor customizado (BaseRT) que remove todo o peso desnecessário de rodar IA em computadores Apple. Ao fazer isso, eles desbloquearam o potencial total de velocidade do hardware, tornando a IA local mais rápida, privada e eficiente do que nunca. Você pode testá-lo você mesmo no GitHub.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.