← Nieuwste papers
🤖 machine learning

Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes

Dit artikel onthult dat Apple's MPS-backend onverwachte niet-monotoone latentiepieken vertoont tijdens autoregressieve inferentie, waarbij de decoderprestaties voor specifieke configuraties abrupt met tot 21x kunnen verslechteren door backend-uitvoeringsdynamica, in tegenstelling tot de gladde schaling die op CPU- en NVIDIA CUDA-systemen wordt waargenomen.

Oorspronkelijke auteurs: Willy Fitra Hendria

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Willy Fitra Hendria

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een auto bestuurt op een snelweg die langzamer en langzamer moet worden naarmate je meer passagiers (tokens) aan het voertuig toevoegt. In de wereld van AI verwachten we doorgaans dat dingen zo werken: hoe langer het gesprek, hoe meer tijd het kost om het volgende woord te genereren, maar het zou een soepele, voorspelbare toename moeten zijn.

Echter, dit paper ontdekte dat op Apple-computers (specifiek die met M-serie chips) de "snelweg" zich vreemd gedraagt. In plaats van een soepele helling, stuit de rit op plotselinge, enorme snelheidsdrempels die uit het niets verschijnen en net zo snel weer verdwijnen.

Hier is een uiteenzetting van de bevindingen van het paper met behulp van alledaagse analogieën:

1. De "Spook-snelheidsdrempel"

De onderzoekers ontdekten dat bij het gebruik van Apples graphicsysteem (genaamd MPS) om tekst te genereren, de tijd die nodig is om woorden te produceren niet altijd gestaag toeneemt.

  • De Normale Verwachting: Als je de AI vraagt 100 woorden te schrijven, duurt het 1 seconde. Als je 200 vraagt, duurt het 2 seconden. Als je 300 vraagt, duurt het 3 seconden. Dit is monotone schaling (een gladde, voorspelbare lijn).
  • De Apple Realiteit: De AI kan 496 woorden in 9 seconden schrijven. Maar als je vraagt om er slechts 16 meer (512 in totaal), duurt het plotseling 89 seconden. Vervolgens, als je nog maar 16 meer vraagt (528 in totaal), schiet het weer terug naar de normale snelheid.
  • De Analogie: Stel je voor dat je over een weg rijdt waar je, zonder duidelijke reden, een modderplek tegenkomt die je precies 100 voet lang vertraagt tot een kruiptempo, maar zodra je die plek voorbij bent, ben je weer op volle snelheid. Het paper ontdekte dat deze "modderplekken" voorkomen bij zeer specifieke woordtellingen (zoals 512 of 384), en dat ze de AI 21 keer trager kunnen maken dan normaal.

2. De "Magische Geheugendoos" (KV Cache)

Om AI sneller te maken, gebruiken ingenieurs een truc genaamd KV Caching. Denk hierbij aan een "Magische Geheugendoos" waarin de AI de context van het gesprek opslaat, zodat het niet elke keer het hele verhaal hoeft te herlezen wanneer het een nieuw woord schrijft.

  • Normaal: Deze doos zorgt ervoor dat de auto veel sneller rijdt.
  • Het Probleem: Het paper ontdekte dat wanneer de AI een van die "Spook-snelheidsdrempels" raakt (het 512-woordsteken), de Magische Geheugendoos niet meer zo goed werkt als hij zou moeten.
  • Het Resultaat: Normaal gesproken maakt het gebruik van de doos de AI 20 keer sneller dan het niet gebruiken ervan. Maar bij de "slechte" woordtellingen krimpt dat voordeel tot bijna niets (slechts 1,9 keer sneller). De doos is er nog steeds, maar hij zit vast in de file.

3. Het Gaat Niet Om Brandstoftekort (Geheugen)

Wanneer de AI vertraagt, zou je kunnen denken: "Oh, de computer raakt zijn geheugen op."

  • De Test: De onderzoekers controleerden het geheugengebruik van de computer. Ze zagen dat het geheugengebruik glad en gestaag omhoog ging, zoals een ballon die wordt opgeblazen. Het piekte niet plotseling en crashte niet op het moment dat de AI traag werd.
  • De Conclusie: De vertraging komt niet doordat de computer zijn ruimte op heeft. Het komt doordat de "motor" (de software-backend) plotseling beslist om op zeer inefficiënte wijze van versnelling te wisselen op specifieke momenten. Het is alsof een automotor plotseling beslist om een paar seconden te draaien op een ander, vreselijk brandstofmengsel, terwijl de tank vol is.

4. Het Gebeurt Overal (Niet Slechts Eén Auto)

De onderzoekers testten dit met verschillende soorten AI-modellen (GPT-2, BLOOM, OPT) en verschillende Apple-computers (M3 Max en M3 Pro).

  • De Bevinding: De "Spook-snelheidsdrempels" verschenen in allemaal. De exacte locatie van de drempel veranderde licht afhankelijk van het automodel en de motorgrootte, maar het fenomeen was hetzelfde.
  • De Vergelijking: Toen ze dezelfde AI testten op een standaardcomputer (CPU) of een NVIDIA-graphicskaart (CUDA), was de rit soepel. De "bultige weg" is een specifieke eigenaardigheid van Apples huidige graphicsoftware.

5. Waarom Dit Voor Jou Belangrijk Is

Het paper waarschuwt dat als je een AI slechts test op één of twee specifieke lengtes (bijvoorbeeld: "Laten we eens kijken hoe snel het is bij 100 woorden"), je deze enorme vertragingen volledig kunt missen.

  • De Valstrik: Als je een AI benchmarkt en het lijkt snel bij 500 woorden, maar je controleert niet 512 woorden, zou je kunnen denken dat het systeem perfect is. Maar in het echte leven, als een gesprek van een gebruiker die specifieke lengte bereikt, kan het systeem voor een moment bevriezen.
  • De Les: Je kunt niet alleen kijken naar de "gemiddelde" snelheid. Je moet elke stap onderweg controleren, want op Apple-chips kan de snelheid abrupt en onvoorspelbaar veranderen, afhankelijk van precies hoeveel woorden er worden gegenereerd.

Samenvattend: Apples AI-chips zijn krachtig, maar hun software heeft een verborgen eigenaardigheid waarbij het systeem op zeer specifieke momenten plotseling extreem traag wordt voor een korte periode, voordat het weer terugkeert naar normaal. Dit gebeurt zelfs wanneer er voldoende geheugen beschikbaar is, en het maakt de gebruikelijke "snelheidsverhogende trucs" (zoals KV caching) tijdens die momenten veel minder effectief.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →