← Últimos artículos
🤖 machine learning

Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes

Este documento revela que el backend MPS de Apple presenta picos de latencia no monótonos e inesperados durante la inferencia autoregresiva, donde el rendimiento de decodificación puede degradarse abruptamente hasta en 21 veces para configuraciones específicas debido a la dinámica de ejecución del backend, en contraste con la escalabilidad suave observada en sistemas CPU y NVIDIA CUDA.

Autores originales: Willy Fitra Hendria

Publicado 2026-05-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Willy Fitra Hendria

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que conduces un coche por una autopista que debería ir frenando a medida que añades más pasajeros (tokens) al vehículo. En el mundo de la IA, así es como normalmente esperamos que funcionen las cosas: cuanto más larga sea la conversación, más tiempo tardará en generar la siguiente palabra, pero debería ser un aumento suave y predecible.

Sin embargo, este artículo descubrió que en los ordenadores de Apple (específicamente aquellos con chips de la serie M), la "autopista" se comporta de manera extraña. En lugar de una pendiente suave, la conducción choca contra baches repentinos y masivos que aparecen de la nada y desaparecen tan rápido como llegaron.

Aquí tienes un desglose de los hallazgos del artículo utilizando analogías cotidianas:

1. El "Bache Fantasma"

Los investigadores descubrieron que, al utilizar el sistema gráfico de Apple (llamado MPS) para generar texto, el tiempo que tarda en producir palabras no siempre aumenta de forma constante.

  • La Expectativa Normal: Si pides a la IA que escriba 100 palabras, tarda 1 segundo. Si pides 200, tarda 2 segundos. Si pides 300, tarda 3 segundos. Esto es escalado monótono (una línea suave y predecible).
  • La Realidad de Apple: La IA podría escribir 496 palabras en 9 segundos. Pero si le pides que escriba solo 16 palabras más (512 en total), de repente tarda 89 segundos. Luego, si pides solo 16 palabras más (528 en total), vuelve a ser rápida de nuevo.
  • La Analogía: Imagina conducir por una carretera donde, sin razón aparente, chocas contra un parche de barro que te ralentiza hasta un arrastre durante exactamente 100 pies, pero en el momento en que pasas ese parche, vuelves a tu velocidad máxima. El artículo descubrió que estos "parches de barro" ocurren en conteos de palabras muy específicos (como 512 o 384), y pueden hacer que la IA sea 21 veces más lenta de lo habitual.

2. La "Caja Mágica de Memoria" (KV Cache)

Para hacer que la IA sea más rápida, los ingenieros utilizan un truco llamado KV Caching. Piensa en esto como una "Caja Mágica de Memoria" donde la IA almacena el contexto de la conversación para no tener que volver a leer toda la historia cada vez que escribe una palabra nueva.

  • Normalmente: Esta caja hace que el coche conduzca mucho más rápido.
  • El Problema: El artículo descubrió que cuando la IA choca contra uno de esos "Baches Fantasmas" (la marca de 512 palabras), la Caja Mágica de Memoria deja de funcionar tan bien como debería.
  • El Resultado: Normalmente, usar la caja hace que la IA sea 20 veces más rápida que no usarla. Pero en los "malos" conteos de palabras, esa ventaja se reduce a casi nada (solo 1,9 veces más rápida). La caja sigue ahí, pero está atrapada en el tráfico.

3. No Se Trata de Quedarse Sin Gas (Memoria)

Cuando la IA se ralentiza, podrías pensar: "Oh, el ordenador se está quedando sin memoria".

  • La Prueba: Los investigadores verificaron el uso de memoria del ordenador. Vieron que el uso de memoria aumentó de forma suave y constante, como un globo inflándose. No hubo un pico repentino ni un colapso en el momento en que la IA se volvió lenta.
  • La Conclusión: La ralentización no se debe a que el ordenador se quede sin espacio. Se debe a que el "motor" (el backend de software) de repente decide cambiar de marcha de una manera muy ineficiente en momentos específicos. Es como si un motor de coche de repente decidiera funcionar con una mezcla de combustible diferente y terrible durante unos segundos, incluso aunque el tanque de gasolina esté lleno.

4. Ocurre En Todas Partes (No Solo en un Coche)

Los investigadores probaron esto con diferentes tipos de modelos de IA (GPT-2, BLOOM, OPT) y diferentes ordenadores Apple (M3 Max y M3 Pro).

  • El Hallazgo: Los "Baches Fantasmas" aparecieron en todos ellos. La ubicación exacta del bache cambió ligeramente dependiendo del modelo del coche y del tamaño del motor, pero el fenómeno fue el mismo.
  • La Comparación: Cuando probaron la misma IA en un ordenador estándar (CPU) o en una tarjeta gráfica NVIDIA (CUDA), la conducción fue suave. El "camino lleno de baches" es una peculiaridad específica del software gráfico actual de Apple.

5. Por Qué Esto Importa para Ti

El artículo advierte que si solo pruebas una IA en una o dos longitudes específicas (por ejemplo, "Veamos qué tan rápido es a 100 palabras"), podrías pasar por alto estas ralentizaciones masivas por completo.

  • La Trampa: Si haces una prueba de rendimiento a una IA y parece rápida a 500 palabras, pero no verificas las 512 palabras, podrías pensar que el sistema es perfecto. Pero en la vida real, si la conversación de un usuario alcanza esa longitud específica, el sistema podría congelarse por un momento.
  • La Lección: No puedes mirar solo la velocidad "promedio". Tienes que verificar cada paso del camino, porque en los chips de Apple, la velocidad puede cambiar abrupta e impredeciblemente según exactamente cuántas palabras se están generando.

En resumen: Los chips de IA de Apple son potentes, pero su software tiene una peculiaridad oculta donde, en momentos muy específicos, el sistema se vuelve repentinamente increíblemente lento durante un breve período antes de volver a la normalidad. Esto ocurre incluso cuando hay mucha memoria disponible, y hace que los habituales "trucos de aceleración" (como el KV caching) sean mucho menos efectivos durante esos momentos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →