← Últimos artigos
🤖 machine learning

Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes

Este artigo revela que o backend MPS da Apple exibe picos de latência não monotônicos inesperados durante a inferência autoregressiva, onde o desempenho de decodificação pode degradar abruptamente em até 21 vezes para configurações específicas devido à dinâmica de execução do backend, contrastando com a escalabilidade suave observada em sistemas CPU e NVIDIA CUDA.

Autores originais: Willy Fitra Hendria

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Willy Fitra Hendria

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está dirigindo um carro em uma rodovia que deveria ficar cada vez mais lenta à medida que você adiciona mais passageiros (tokens) ao veículo. No mundo da IA, é assim que geralmente esperamos que as coisas funcionem: quanto mais longa a conversa, mais tempo leva para gerar a próxima palavra, mas esse aumento deve ser suave e previsível.

No entanto, este artigo descobriu que nos computadores da Apple (especificamente aqueles com chips da série M), a "rodovia" comporta-se de forma estranha. Em vez de uma inclinação suave, a viagem encontra lombadas súbitas e massivas que aparecem do nada e desaparecem com a mesma rapidez.

Aqui está uma análise das descobertas do artigo usando analogias do cotidiano:

1. A "Lombada Fantasma"

Os pesquisadores descobriram que, ao usar o sistema gráfico da Apple (chamado MPS) para gerar texto, o tempo necessário para produzir palavras nem sempre aumenta de forma constante.

  • A Expectativa Normal: Se você pedir à IA para escrever 100 palavras, leva 1 segundo. Se pedir 200, leva 2 segundos. Se pedir 300, leva 3 segundos. Isso é escalabilidade monótona (uma linha suave e previsível).
  • A Realidade da Apple: A IA pode escrever 496 palavras em 9 segundos. Mas, se você pedir apenas 16 palavras a mais (512 no total), subitamente leva 89 segundos. Então, se você pedir apenas 16 palavras a mais (528 no total), ela volta instantaneamente a ser rápida novamente.
  • A Analogia: Imagine dirigir por uma estrada onde, sem motivo aparente, você atinge um trecho de lama que reduz sua velocidade a um rastejar por exatamente 100 pés, mas no momento em que você passa por esse trecho, você volta à velocidade máxima. O artigo descobriu que esses "trechos de lama" ocorrem em contagens de palavras muito específicas (como 512 ou 384), e podem tornar a IA 21 vezes mais lenta do que o habitual.

2. A "Caixa Mágica de Memória" (KV Cache)

Para tornar a IA mais rápida, os engenheiros usam um truque chamado KV Caching. Pense nisso como uma "Caixa Mágica de Memória" onde a IA armazena o contexto da conversa para não ter que reler toda a história toda vez que escreve uma nova palavra.

  • Normalmente: Essa caixa faz o carro andar muito mais rápido.
  • O Problema: O artigo descobriu que, quando a IA atinge uma dessas "Lombadas Fantasma" (a marca de 512 palavras), a Caixa Mágica de Memória deixa de funcionar tão bem quanto deveria.
  • O Resultado: Normalmente, usar a caixa torna a IA 20 vezes mais rápida do que não usá-la. Mas nas contagens de palavras "ruins", essa vantagem encolhe para quase nada (apenas 1,9 vezes mais rápida). A caixa ainda está lá, mas está presa no trânsito.

3. Não É Sobre Ficar Sem Combustível (Memória)

Quando a IA fica lenta, você pode pensar: "Ah, o computador está ficando sem memória".

  • O Teste: Os pesquisadores verificaram o uso de memória do computador. Eles viram que o uso de memória aumentou de forma suave e constante, como um balão inflando. Não houve um pico súbito ou uma queda no momento em que a IA ficou lenta.
  • A Conclusão: A lentidão não ocorre porque o computador ficou sem espaço. É porque o "motor" (o backend de software) subitamente decidiu trocar de marcha de uma forma muito ineficiente em momentos específicos. É como se o motor de um carro decidisse subitamente funcionar com uma mistura de combustível diferente e terrível por alguns segundos, mesmo que o tanque de gasolina esteja cheio.

4. Acontece Em Todo Lugar (Não Apenas Em Um Carro)

Os pesquisadores testaram isso com diferentes tipos de modelos de IA (GPT-2, BLOOM, OPT) e diferentes computadores Apple (M3 Max e M3 Pro).

  • A Descoberta: As "Lombadas Fantasma" apareceram em todos eles. A localização exata da lombada mudou ligeiramente dependendo do modelo do carro e do tamanho do motor, mas o fenômeno foi o mesmo.
  • A Comparação: Quando testaram a mesma IA em um computador padrão (CPU) ou em uma placa gráfica NVIDIA (CUDA), a viagem foi suave. A "estrada irregular" é uma peculiaridade específica do software gráfico atual da Apple.

5. Por Que Isso Importa Para Você

O artigo alerta que, se você testar uma IA apenas em um ou dois comprimentos específicos (por exemplo, "Vamos ver quão rápida é em 100 palavras"), você pode perder completamente essas lentidões massivas.

  • A Armadilha: Se você fizer um benchmark de uma IA e ela parecer rápida em 500 palavras, mas você não verificar 512 palavras, você pode achar que o sistema é perfeito. Mas, na vida real, se a conversa de um usuário atingir esse comprimento específico, o sistema pode congelar por um momento.
  • A Lição: Você não pode olhar apenas para a velocidade "média". Você precisa verificar cada passo do caminho, porque nos chips da Apple, a velocidade pode mudar abrupta e imprevisivelmente com base exatamente em quantas palavras estão sendo geradas.

Em resumo: Os chips de IA da Apple são poderosos, mas seu software tem uma peculiaridade oculta onde, em momentos muito específicos, o sistema torna-se subitamente incrivelmente lento por um breve período antes de voltar ao normal. Isso ocorre mesmo quando há muita memória disponível, e faz com que os usuais "truques de aceleração" (como o KV caching) sejam muito menos eficazes durante esses momentos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →